Pular para conteúdo

Runbook — SLO e Error Budget (FastBurn, SlowBurn, ErrorBudget*)

Severidade: P0–P2 · Impacto: compromisso de confiabilidade em risco ou rompido.

Contexto

SLOs ativos (definidos em services/observability/stack/config/prometheus/slo_rules.yml):

SLO Alvo Janela
Disponibilidade de infraestrutura 99.9% 30 dias
Disponibilidade HTTP 99.9% 30 dias
Latência HTTP (P95 < 1s) 99.0% 30 dias

Fast burn = queimando budget 14x mais rápido que o sustentável (esgota em ~2 dias). Slow burn = 6x (esgota em ~5 dias).

Verificação

  1. Dashboard Error Budget: qual SLO está queimando e quanto resta.
  2. Fast burn é sempre reflexo de um problema ativo agora → identificar o alerta/sintoma primário (erros HTTP, host down, latência) e seguir o runbook dele.
  3. Slow burn: procurar padrão recorrente (horário de pico, job noturno, instabilidade intermitente) nos gráficos de SLI.

Ação

  1. Tratar a causa primária (este runbook não substitui o do sintoma).
  2. Budget < 10% ou esgotado: congelar mudanças não urgentes em produção até recuperar margem; priorizar correções de confiabilidade.
  3. Registrar no canal de incidentes o consumo e a causa para o review mensal.

Escalonamento

Budget esgotado (P0): comunicar produto/gestão — o SLO do mês foi rompido e o plano de ação precisa ser combinado.