Veinte minutos de HTTP 500, y la alerta que nunca llegó
La instancia de Redis que guardaba las sesiones de usuario se quedó sin memoria y todas las páginas empezaron a devolver un 500. Lo que vale la pena dejar por escrito es por qué nada avisó a nadie.
01El problema
Todas las páginas devolvían un 500, el inicio de sesión incluido, así que el sistema no se pudo usar durante veinte minutos. La instancia de Redis que guardaba las sesiones de usuario se había quedado sin memoria: su tarea de volcado a disco bifurcaba el proceso cada cinco minutos, y una bifurcación duplica brevemente lo que el proceso necesita.
02Lo que hice
Limité la memoria de Redis con una política de expulsión, quité los mecanismos de persistencia que no necesitaba en ese rol y le puse una política de reinicio para que la próxima vez la misma falla se resolviera sola. Después fui a buscar el segundo problema: que ninguna alerta se había disparado en ningún momento.
03En qué terminó
No ha vuelto a pasar. La razón por la que nada avisó es que el monitoreo corría en el mismo servidor que vigilaba, así que cayó junto con todo lo demás. Dónde corre el monitoreo es ahora lo primero que reviso en cualquier sistema que asumo.
04Evidencia
Registros del sistema con marcas de tiempo de toda la ventana del incidente.
Pídala en una llamada y abro el panel.