Description
El teléfono sonó otra vez a las 3 de la mañana, y era el mismo tipo de incidente que el mes pasado, y lo arreglaste de la misma manera cansada de siempre, y ya sabés que va a volver a pasar. Tu equipo se pasa las semanas apagando incendios y no entrega casi nada, porque cada sprint se lo come la caída anterior. Nadie puede decir qué tan confiable se supone que tiene que ser el sistema, así que cada alerta se siente igual de urgente y te estás ahogando en llamados que no necesitaban un humano. Cuando algo se rompe, el postmortem sale a cazar a quién culpar en vez de qué arreglar, así que la misma falla vuelve con otro sombrero. Mantener el software corriendo bajo tráfico real, a propósito, para que no te corra a vos, es una de las habilidades mejor pagas y menos enseñadas del rubro. Apagar incendios no es eso. Apagar incendios es lo que hacés cuando nadie te enseñó la ingeniería que previene el fuego.
Este libro convierte el apagar incendios en ingeniería de confiabilidad: mantener los sistemas arriba a propósito para que producción deje de manejarte la vida. Sigue un solo servicio, Atlas, una plataforma de pagos que vive prendida fuego, y lo vuelve calmo, enseñando las movidas que separan a un equipo que duerme de uno que no. Vas a aprender a decidir qué tan confiable es suficiente con SLOs y presupuestos de error para que no toda alerta sea una crisis, a automatizar el trabajo repetitivo que se come tu guardia, a ver qué está haciendo producción de verdad en vez de adivinar, y a manejar un incidente con un runbook y la cabeza fría a las 3 de la mañana. Se apoya en el canon del rubro, el Site Reliability Engineering de Google, el Accelerate de Forsgren, Humble y Kim, y The Phoenix Project de Gene Kim, y lo convierte en práctica: postmortems sin culpa que arreglan el sistema en vez de la persona, las cuatro métricas DORA que prueban que estás mejorando, deploys que no necesitan un rezo, quedar arriba cuando el tráfico se duplica, y la lección de flujo que explica por qué el trabajo se sigue acumulando. Para el ingeniero cansado de que lo llamen por lo mismo de siempre, que quiere que producción aguante, y dormir.
Quién debería leerlo
Este libro es para: desarrolladores e ingenieros de ops cuyos sistemas los llaman a las 3 de la mañana, que se pasan las semanas apagando incendios en vez de prevenir los mismos incidentes de siempre, y que quieren la habilidad de ingeniería de confiabilidad que mantiene producción arriba, se gana la confianza de los seniors y les devuelve el sueño.
El sistema que vas a aprender
Los 6 pasos para sistemas que no te despiertan a las 3 de la mañana. El método de confiabilidad que convierte el apagar incendios sin fin en sistemas que quedan arriba a propósito, para que producción deje de manejarte la vida y vos te vuelvas el ingeniero al que se lo confían. Mantener el software vivo bajo tráfico real es una de las habilidades mejor pagas y menos enseñadas de la ingeniería; apagar incendios es lo que hacés sin ella. Aprendé a fijar el objetivo, automatizar el trabajo repetitivo, manejar el incidente y probar que estás mejorando, y recuperá tus noches.
- Decidí qué tan confiable es suficiente (SLOs)
- Automatizá el trabajo repetitivo que se come tu guardia
- Vé qué está haciendo producción de verdad
- Manejá el incidente, después un postmortem sin culpa
- Probá que mejora con las cuatro métricas DORA
- Desplegá sin rezar, escalá sin caerte
Lo que vas a encontrar adentro
- Capítulo 1: El trimestre que pasamos apagando incendios y no entregamos nada
- Capítulo 2: Decidir qué tan confiable es suficiente
- Capítulo 3: Automatizar el trabajo repetitivo que se come tu guardia
- Capítulo 4: Ver qué está haciendo producción de verdad
- Capítulo 5: El llamado de las 3 de la mañana, y una manera más calma de atravesarlo
- Capítulo 6: El postmortem sin culpa que arregla el sistema, no la persona
- Capítulo 7: Los cuatro números que prueban que estás mejorando
- Capítulo 8: Deploys que no necesitan un rezo
- Capítulo 9: Quedar arriba cuando el tráfico se duplica
- Capítulo 10: Por qué el trabajo se sigue acumulando, y el flujo que lo arregla
- Capítulo 11: La cultura que evita que los sistemas y las personas se quemen
- Capítulo 12: El equipo que entrega rápido y aun así duerme


