Runbook — Coleta de telemetria (Alloy Down)¶
Severidade: P1 · Impacto: host invisível para o monitoramento (métricas/logs/traces não coletados). Os serviços do host podem estar normais.
Verificação¶
- Confirmar que o host em si está de pé (SSH). Se não: seguir host-down.
- Na VM:
docker ps | grep alloyedocker logs --tail 100 alloy-agent. - Conectividade com o gateway:
curl -sv telnet://192.168.100.21:4317de dentro da VM. - No Prometheus, confirmar
up{job="integrations/node_exporter"}e verificar seinstance == host_nameedeployment_environment_nameestá preenchido. - No Loki, consultar por
service_namespace,service_nameedeployment_environment_name;trace_id,span_ide IDs devem aparecer somente como structured metadata. Confirmar que o body não está vazio e que ambiente e nível aparecem nos labels globais. Filtrar diretamente com{deployment_environment_name="production", level="error"}. - No Tempo, confirmar
deployment.environment.name,host.nameeservice.*nos recursos e testar o link de trace para logs.
Causas prováveis¶
- Container Alloy parado ou em crash (config inválida após atualização).
- Gateway (alloy-gateway na VM de monitoramento
prd-infra-mon-01) fora do ar — nesse caso TODOS os hosts somem juntos. - Aplicação enviando atributos antigos, que não recebem alias ou fallback no Gateway.
monitoring.logs.formatdivergente do formato emitido pelo container.monitoring.logs.levelconfigurado acima da severidade esperada.OTEL_RESOURCE_ATTRIBUTESausente no ambiente privado do Alloy.
Ação¶
- Agente:
docker compose up -dem/opt/services/alloy; se crash de config, ver logs e corrigir no repositório antes de reprovisionar. - Todos os hosts sumiram ao mesmo tempo: verificar o gateway e a stack na VM de monitoramento
prd-infra-mon-01(docker psem/opt/services/grafana). - Rejeição de métricas ou logs OTLP: validar respectivamente
/api/v1/otlp/v1/metricsno Prometheus e/otlp/v1/logsno Loki.
Escalonamento¶
Persistindo > 30 min, registrar janela de cegueira de monitoramento no canal de incidentes.