Pular para conteúdo

Runbooks

Procedimentos operacionais associados aos alertas Grafana-managed. Todo alerta referencia uma destas páginas na annotation runbook.

Runbook Alertas
host-down Host Down
cpu Host CPU Saturation
memoria-swap Host Memory Running Low, Host OOM Killer Triggered, Host Swap Usage High
disco Host Disk Space Critical, Host Disk Space Running Low, Host Inodes Running Low, Filesystem Read-Only
containers Docker Container Crash Loop, Docker Container Down, Docker Container Killed by OOM, Docker Container CPU Throttling High
telemetria Alloy Agent Down
postgres PostgreSQL Down, PostgreSQL Connections Near Limit, PostgreSQL Deadlocks Detected
redis Redis Down, Redis Memory Near Limit, Redis Connections Near Limit, Redis Command Latency High
http-erros HTTP Requests Failing, HTTP Error Rate High
latencia HTTP P95 Latency High
error-budget SLO Error Budget Exhausted, SLO Error Budget Critical, Infrastructure Availability SLO Fast Burn, Infrastructure Availability SLO Slow Burn, HTTP Availability SLO Fast Burn, HTTP Availability SLO Slow Burn, HTTP Latency SLO Fast Burn, HTTP Latency SLO Slow Burn

Convenções:

  • Acesso às VMs: SSH conforme inventário em ansible/inventory/.
  • Dashboards citados estão no Grafana da stack de operações.
  • Após resolver, registrar causa e ação no canal de incidentes.