Runbooks¶
Procedimentos operacionais associados aos alertas Grafana-managed. Todo alerta referencia uma destas páginas na annotation runbook.
| Runbook | Alertas |
|---|---|
| host-down | Host Down |
| cpu | Host CPU Saturation |
| memoria-swap | Host Memory Running Low, Host OOM Killer Triggered, Host Swap Usage High |
| disco | Host Disk Space Critical, Host Disk Space Running Low, Host Inodes Running Low, Filesystem Read-Only |
| containers | Docker Container Crash Loop, Docker Container Down, Docker Container Killed by OOM, Docker Container CPU Throttling High |
| telemetria | Alloy Agent Down |
| postgres | PostgreSQL Down, PostgreSQL Connections Near Limit, PostgreSQL Deadlocks Detected |
| redis | Redis Down, Redis Memory Near Limit, Redis Connections Near Limit, Redis Command Latency High |
| http-erros | HTTP Requests Failing, HTTP Error Rate High |
| latencia | HTTP P95 Latency High |
| error-budget | SLO Error Budget Exhausted, SLO Error Budget Critical, Infrastructure Availability SLO Fast Burn, Infrastructure Availability SLO Slow Burn, HTTP Availability SLO Fast Burn, HTTP Availability SLO Slow Burn, HTTP Latency SLO Fast Burn, HTTP Latency SLO Slow Burn |
Convenções:
- Acesso às VMs: SSH conforme inventário em
ansible/inventory/. - Dashboards citados estão no Grafana da stack de operações.
- Após resolver, registrar causa e ação no canal de incidentes.