Runbook — Redis (Down, Memory Near Limit, Connections Near Limit, Command Latency High)¶
Severidade: P0/P1 · Impacto: cache/sessões indisponíveis; aplicações degradadas.
Verificação¶
docker ps | grep redis;docker logs --tail 100 redis.- Memória:
docker exec -it redis redis-cli --askpass info memory | grep -E 'used_memory_human|maxmemory_human|maxmemory_policy'. - Conexões e latência:
docker exec -it redis redis-cli --askpass info clients commandstats.
Causas prováveis¶
- Down: container parado; OOM do host; disco cheio impedindo persistência.
- Memória: chaves sem TTL acumulando; maxmemory subdimensionado.
- Conexões: pool sem reaproveitamento; clientes presos;
maxclientsbaixo. - Latência: comandos caros; CPU ou rede saturadas; volume de chaves elevado.
Ação¶
- Down: subir via compose em
/opt/services/redis. - Memória: verificar
maxmemory_policy; senoeviction, escritas falharão — identificar chaves grandes (docker exec -it redis redis-cli --askpass --bigkeys) e aplicar TTL/limpeza com o time da aplicação; ajustar maxmemory no compose se subdimensionado. - Conexões/latência: identificar clientes e comandos predominantes; corrigir pool/consulta antes de aumentar limites.
Escalonamento¶
Aplicações tratam falha de cache como fatal? Se sim e Redis não voltar em 10 min, incidente de aplicação em paralelo.