Description
Mover datos parece simple hasta que es tu trabajo: el esquema de origen cambia de un día para el otro, un job se completa a medias y deja el warehouse inconsistente, una coerción de tipos silenciosa corrompe una columna, y nadie se entera hasta que un dashboard está mal en una reunión. ETL es menos sobre los verbos extraer, transformar y cargar y más sobre hacerlos de forma idempotente, programada y con las fallas manejadas, para que los datos que un negocio usa para decidir sean de verdad correctos.
Esta guía te muestra cómo construir pipelines de datos en los que un negocio puede confiar, los que corren cada noche, sobreviven a un origen roto y dejan el warehouse correcto en vez de a medio actualizar. Arranca desde la forma del problema (extraer de algún lado, reformatear, cargar en algo consultable) y construye las prácticas que separan una pila de scripts de cron de un pipeline real: cómo extraer de forma incremental en vez de recargar todo, cómo transformar de una manera que puedas testear y que falle fuerte ante datos malos, la elección entre ELT y ETL y cuándo empujar el trabajo al warehouse, idempotencia y backfills para que un rerun sea seguro y un hueco se pueda rellenar, orquestación con Airflow (DAGs, schedules, reintentos, dependencias y sus trampas), chequeos de calidad de datos que atrapan la carga rota antes que el dashboard, y el monitoreo que te avisa que un pipeline paró en silencio. El libro no recorre cada herramienta. Te enseña a diseñar un pipeline incremental, idempotente, testeado y observable, para que los números aguas abajo sean confiables y una falla a las 2 de la mañana sea un reintento, no una caída. Para ingenieros y analistas que mueven datos y quieren que lleguen correctos, a tiempo, todas las veces.
Quién debería leerlo
Esta guía es para: ingenieros y analistas que mueven datos entre sistemas con scripts frágiles y cron jobs, y quieren construir pipelines que corran programados, se recuperen de las fallas y produzcan números en los que la gente puede confiar.
Qué incluye este libro
- Capítulo 1: Mi dashboard estaba mal en la reunión y lo vio todo el mundo
- Capítulo 2: Todos dicen “armá un pipeline”. ¿Qué estoy armando en realidad?
- Capítulo 3: ¿Tengo que releer la base entera todas las noches?
- Capítulo 4: El pipeline da verde, pero mis números salen mal
- Capítulo 5: ¿Limpio los datos antes de que aterricen, o después?
- Capítulo 6: Volví a correr el job y ahora cada fila está dos veces
- Capítulo 7: Alguien consultó mi tabla a mitad de carga y le dio un número mal
- Capítulo 8: Corro cada paso a mano, y una noche me voy a olvidar
- Capítulo 9: Un equipo cambió una columna y mi pipeline ni se enteró
- Capítulo 10: Todas las tareas pasaron. ¿Por qué los números siguen mal?
- Capítulo 11: ¿Cómo me enteraría si mi pipeline se frena sin avisar?
- Capítulo 12: La factura de la nube no para de subir y finanzas me pregunta por qué
- Capítulo 13: La noche que mi pipeline sobrevivió sin mí y me di cuenta de lo lejos que había llegado


