Pular para conteúdo

Runbook — Coleta de telemetria (Alloy Down)

Severidade: P1 · Impacto: host invisível para o monitoramento (métricas/logs/traces não coletados). Os serviços do host podem estar normais.

Verificação

  1. Confirmar que o host em si está de pé (SSH). Se não: seguir host-down.
  2. Na VM: docker ps | grep alloy e docker logs --tail 100 alloy-agent.
  3. Conectividade com o gateway: curl -sv telnet://192.168.100.21:4317 de dentro da VM.
  4. No Prometheus, confirmar up{job="integrations/node_exporter"} e verificar se instance == host_name e deployment_environment_name está preenchido.
  5. No Loki, consultar por service_namespace, service_name e deployment_environment_name; trace_id, span_id e IDs devem aparecer somente como structured metadata. Confirmar que o body não está vazio e que ambiente e nível aparecem nos labels globais. Filtrar diretamente com {deployment_environment_name="production", level="error"}.
  6. No Tempo, confirmar deployment.environment.name, host.name e service.* nos recursos e testar o link de trace para logs.

Causas prováveis

  • Container Alloy parado ou em crash (config inválida após atualização).
  • Gateway (alloy-gateway na VM de monitoramento prd-infra-mon-01) fora do ar — nesse caso TODOS os hosts somem juntos.
  • Aplicação enviando atributos antigos, que não recebem alias ou fallback no Gateway.
  • monitoring.logs.format divergente do formato emitido pelo container.
  • monitoring.logs.level configurado acima da severidade esperada.
  • OTEL_RESOURCE_ATTRIBUTES ausente no ambiente privado do Alloy.

Ação

  1. Agente: docker compose up -d em /opt/services/alloy; se crash de config, ver logs e corrigir no repositório antes de reprovisionar.
  2. Todos os hosts sumiram ao mesmo tempo: verificar o gateway e a stack na VM de monitoramento prd-infra-mon-01 (docker ps em /opt/services/grafana).
  3. Rejeição de métricas ou logs OTLP: validar respectivamente /api/v1/otlp/v1/metrics no Prometheus e /otlp/v1/logs no Loki.

Escalonamento

Persistindo > 30 min, registrar janela de cegueira de monitoramento no canal de incidentes.