Runbook — SLO e Error Budget (FastBurn, SlowBurn, ErrorBudget*)¶
Severidade: P0–P2 · Impacto: compromisso de confiabilidade em risco ou rompido.
Contexto¶
SLOs ativos (definidos em services/observability/stack/config/prometheus/slo_rules.yml):
| SLO | Alvo | Janela |
|---|---|---|
| Disponibilidade de infraestrutura | 99.9% | 30 dias |
| Disponibilidade HTTP | 99.9% | 30 dias |
| Latência HTTP (P95 < 1s) | 99.0% | 30 dias |
Fast burn = queimando budget 14x mais rápido que o sustentável (esgota em ~2 dias). Slow burn = 6x (esgota em ~5 dias).
Verificação¶
- Dashboard Error Budget: qual SLO está queimando e quanto resta.
- Fast burn é sempre reflexo de um problema ativo agora → identificar o alerta/sintoma primário (erros HTTP, host down, latência) e seguir o runbook dele.
- Slow burn: procurar padrão recorrente (horário de pico, job noturno, instabilidade intermitente) nos gráficos de SLI.
Ação¶
- Tratar a causa primária (este runbook não substitui o do sintoma).
- Budget < 10% ou esgotado: congelar mudanças não urgentes em produção até recuperar margem; priorizar correções de confiabilidade.
- Registrar no canal de incidentes o consumo e a causa para o review mensal.
Escalonamento¶
Budget esgotado (P0): comunicar produto/gestão — o SLO do mês foi rompido e o plano de ação precisa ser combinado.