Ingeniero de Datos: Aprendé a construir los pipelines sobre los que se apoya toda una empresa. Ese trabajo te vuelve clave, difícil de reemplazar y bien pago.

$ 269.943,00

Construís los pipelines de datos de los que depende una empresa entera. Es de las habilidades que más se contratan, bien pagas y muchas veces remotas.

Description

Aprendé a construir los pipelines sobre los que se apoya toda una empresa. Ese trabajo te vuelve clave, difícil de reemplazar y bien pago.

Construís los pipelines de datos de los que depende una empresa entera. Es de las habilidades que más se contratan, bien pagas y muchas veces remotas.

What’s inside

  • Python — El lenguaje detrás del trabajo backend mejor pago. Dominalo y te volvés esa persona que se pelean por no dejar ir.
  • SQL — Volvete la persona a la que la dirección le pide respuestas, y la que recuerdan a la hora del aumento.
  • AWS — La habilidad en la nube que pide casi cualquier puesto bien pago. Con eso llegás a roles que la mayoría ni toca.
  • GCP — Otra nube por la que pagan los mejores empleadores. Sumala y se te abren más puertas.
  • ETL — Construí los pipelines sobre los que de verdad corre una empresa. Es lo que te convierte de programador en ingeniero de datos que contratan.
  • Visualización — Hacé que los datos hablen solos. Convertí una pila de filas en la imagen con la que la dirección decide y se mueve.
  • Spark — Procesá datos de cualquier tamaño repartidos en un cluster. Es de lo que los equipos de big data más pagan por contratar.
  • Snowflake — Construí el warehouse en el que confía toda la empresa. Esa habilidad de plataforma aparece en las mejores búsquedas de data engineer.
  • dbt — Convertí datos crudos en números confiables. Los equipos ya buscan esa habilidad de analytics engineering por su nombre.
  • Kafka — Mové los datos en el momento en que pasan. Es la habilidad de streaming que hay detrás de los roles de datos mejor pagos.
  • Metabase — Armá dashboards que toda la empresa usa de verdad. Volvete al que la dirección le pregunta cuando necesita respuestas.
  • Hadoop — Manejá datos a una escala que una sola máquina no aguanta. Es la base de big data que las empresas grandes todavía pagan bien.

Bonuses

  • Analista de Datos con IA ($99.99 value) — Convertí datos en decisiones. Justo las que te hacen notar ante los que deciden los aumentos.
  • Vibe Coding ($99.99 value) — Usá la IA para construir software de verdad, no demos. Volvete el desarrollador que un equipo se pelea por retener.
  • Claude ($99.99 value) — Sacá en una hora lo que te llevaba un día con Claude Code, la herramienta con la que los mejores hoy vuelan.
  • Responsabilidad ($99.99 value) — Volvete el ingeniero al que le confían lo que no puede fallar, y que cobra como tal.

Más cerca de tu carrera o te devolvemos la plata

Agarrá cualquier guía y aplicala a un proyecto real. Si no te sentís más cerca de hacer esto de forma profesional, escribinos antes de los 30 días y te devolvemos todo.

PYTHON: Volvete el revisor que la IA no puede reemplazar, el que caza los bugs que corren pero están mal y firma lo que va a producción

Este libro te entrena para ser el revisor de Python vibe-codeado, no para memorizar el lenguaje. Arranca desde una premisa distinta a la de cualquier otro libro de Python: el agente escribe el código, y tu palanca es entender qué hace ese código en realidad para poder revisarlo con el criterio que el intérprete no tiene. Vas a aprender a qué se liga en realidad un nombre y por qué el aliasing y la mutabilidad causan los bugs que causan, qué verifica y qué no verifica un type hint, qué está haciendo en realidad el event loop detrás de async y await, por qué el global interpreter lock hace que tus threads no sean el paralelismo que creés, qué hacen realmente un ORM y un pool de conexiones, y cómo las piezas se integran en un servicio que corre, y vas a aprender todo eso como lo necesita un revisor: leyendo código real que el agente generaría y decidiendo qué está bien, qué es plausible pero peligroso y qué hay que devolver. La progresión va de revisar un solo objeto y un solo nombre, a revisar un componente como la capa de datos o el pipeline de requests, a revisar cómo encaja todo el sistema y dónde se va a romper bajo carga real. Acá casi no hay ejercicios de sintaxis y sí mucho sobre el modelo de objetos, concurrencia, fallas y las formas específicas en que el Python de un agente sale mal. Para ingenieros que van a vibe-codear en Python de todas formas y quieren ser los que cazan lo que se le escapó al modelo.

SQL: Volvete el revisor que la IA no puede reemplazar, el que detecta el SQL que corre limpio pero devuelve la respuesta equivocada

Este libro te entrena para ser el revisor de SQL vibe-codeado, no para memorizar la sintaxis. Arranca desde una premisa distinta a la de cualquier otro libro de SQL: el agente escribe las queries, y tu palanca es entender qué hace en realidad la base de datos para poder revisarlo con el criterio que el motor no tiene. Vas a aprender por qué una tabla relacional es un conjunto y por qué pensar en conjuntos es todo el juego, el orden en que el motor evalúa de verdad una query, cómo se ejecutan realmente los joins y los índices y cuándo un índice es inútil, la lógica de tres valores que hace del NULL el bug de resultado-silenciosamente-incorrecto más común en SQL, cómo leer un plan de ejecución como la verdad de fondo que la query esconde, y cómo se comportan las transacciones, el aislamiento y las migraciones bajo concurrencia y escala reales, y vas a aprender todo eso como lo necesita un revisor: leyendo queries reales que el agente generaría y decidiendo qué está bien, qué es plausible pero peligroso y qué hay que devolver. La progresión va de revisar una sola query y un solo índice, a revisar un esquema y sus restricciones, a revisar cómo se comporta toda la carga de trabajo bajo presión y dónde se va a romper. Acá casi no hay ejercicios de sintaxis y sí mucho sobre el modelo relacional, la ejecución de queries, la integridad de los datos y las formas específicas en que el SQL de un agente sale mal. Para ingenieros que van a vibe-codear SQL de todas formas y quieren ser los que cazan lo que se le escapó al modelo.

AWS: Pasá del ingeniero que despliega nubes al que las aprueba, cazando las fallas de seguridad y costo que un agente de IA deja pasar

Este libro te entrena para ser el revisor de AWS vibe-codeado, no para memorizar la consola. Arranca desde una premisa distinta a la de cualquier otro libro de AWS: el agente escribe la infraestructura, y tu palanca es entender los servicios lo suficiente como para juzgar la arquitectura, el costo y el blast radius con las tres preguntas que el agente nunca hace. Vas a aprender qué son en realidad los servicios centrales y cuándo cada uno es la herramienta correcta, EC2 y Lambda y las opciones de contenedores para cómputo, S3 y RDS y DynamoDB y ElastiCache y Redshift para almacenamiento y datos, Athena y OpenSearch para analítica y búsqueda, SQS y SNS y SES para desacoplar y mandar correo, y Bedrock para IA, y vas a aprender las bases que deciden si algo de eso es seguro y barato, el least privilege de IAM, la VPC y dónde va cada capa, cómo se arma un endpoint HTTPS de verdad con Route 53 y un certificado y un balanceador, y cómo leer una factura antes de que llegue. Cada capítulo diseña una pieza real de un sistema que funciona, da una estimación de costo ilustrativa y muestra la arquitectura buena-contra-mala que un agente produciría, construyendo desde un solo servicio hasta un diseño completo expresado como infraestructura como código revisable con el CDK. Acá casi no hay clicks en la consola y sí mucho sobre costo, seguridad, datos y las formas específicas en que el cloud de un agente sale mal. Para ingenieros que van a vibe-codear en AWS de todas formas y quieren ser los que cazan el diseño que los iba a filtrar, romper o fundir.

GCP: Volvete el que lee la nube que armó un agente de IA y sabe qué es seguro, qué te va a fundir la cuenta y qué hay que devolver.

Este libro te entrena para ser el revisor de Google Cloud vibe-codeado, no para memorizar la consola. Arranca desde una premisa distinta a la de cualquier otro libro de nube: el agente escribe la infraestructura, y tu palanca es entender qué hace en realidad la plataforma para poder revisarlo con el criterio que la nube no tiene. Vas a aprender qué evalúa en realidad IAM y por qué el mínimo privilegio es todo el juego, qué significan de verdad el plan y el state de Terraform y por qué revisar el plan no es negociable, cómo Cloud Run escala, hace cold start y factura, qué te obliga a manejar la entrega at-least-once de Pub/Sub, cómo elegir entre Cloud SQL, Firestore y un cache Redis según el patrón de acceso, por qué BigQuery factura por byte escaneado, y qué son en realidad los embeddings, un índice vectorial y la memoria de un agente, y vas a aprender todo eso como lo necesita un revisor: leyendo el Terraform, la política de IAM y la config de servicios reales que generaría un agente, con una aplicación de ejemplo diseñada a lo largo de los capítulos y un modelo de costos para cada servicio, decidiendo qué está bien, qué es plausible pero peligroso y qué hay que devolver. La progresión va de revisar un solo recurso y sus permisos, a revisar un servicio y sus capas de datos y de IA, a revisar toda la arquitectura por seguridad, costo y falla bajo carga. Acá casi no hay click por click y sí mucho sobre identidad, redes, costo y las formas específicas en que la nube de un agente sale mal. Para ingenieros que van a vibe-codear en Google Cloud de todas formas y quieren ser los que cazan lo que se le escapó al modelo.

ANALISTA DE DATOS CON IA: SQL, estadística y decisiones basadas en datos, en plena era de la IA

Este libro te entrena para ser el revisor y el que decide sobre los datos, no para memorizar otra herramienta. Arranca desde una premisa distinta a la de cualquier otro libro de analítica: el agente escribe las queries, el pandas y el primer borrador del gráfico, y tu valor es el criterio que la herramienta no tiene. Vas a aprender a encontrar la pregunta detrás de la pregunta que el stakeholder realmente hizo, a interrogar si se puede confiar en los datos antes de citarlos, a seguir un número hacia atrás por el pipeline y el warehouse hasta donde se pudo romper, a definir una métrica para que signifique lo que vos creés, y a usar solo la estadística que un analista de verdad necesita. Vas a aprender a diseñar un experimento que se pueda creer, a leer un p-value por lo que sí y lo que no te permite afirmar, a cazar el sesgo, el confounding y la paradoja de Simpson que dan vuelta un resultado, y a bajarle el verbo a una correlación hasta la afirmación que su diseño realmente sostiene. Después vas a aprender a elegir el gráfico que dice la verdad en lugar del que la maquilla, a convertir un hallazgo en una decisión que un ejecutivo ocupado va a tomar, y a manejar datos de usuarios dentro de la ley de privacidad y sin dejar que un modelo sesgado lave un daño viejo y lo meta en una decisión nueva. La progresión va de revisar un solo número, a revisar un experimento y una inferencia, a revisar cómo toda la historia llega a una decisión y si esa decisión es justa. Acá casi no hay sintaxis de herramientas y sí mucho sobre preguntas, confianza, inferencia, comunicación y las formas específicas en que el análisis de un agente sale mal. Para el analista que va a vibe-analizar de todas formas y quiere ser el que caza lo que se le escapó al modelo.

ETL: Construí pipelines de datos que funcionan: extraé, transformá, cargá, orquestá con Airflow y confiá en lo que sale

Esta guía te muestra cómo construir pipelines de datos en los que un negocio puede confiar, los que corren cada noche, sobreviven a un origen roto y dejan el warehouse correcto en vez de a medio actualizar. Arranca desde la forma del problema (extraer de algún lado, reformatear, cargar en algo consultable) y construye las prácticas que separan una pila de scripts de cron de un pipeline real: cómo extraer de forma incremental en vez de recargar todo, cómo transformar de una manera que puedas testear y que falle fuerte ante datos malos, la elección entre ELT y ETL y cuándo empujar el trabajo al warehouse, idempotencia y backfills para que un rerun sea seguro y un hueco se pueda rellenar, orquestación con Airflow (DAGs, schedules, reintentos, dependencias y sus trampas), chequeos de calidad de datos que atrapan la carga rota antes que el dashboard, y el monitoreo que te avisa que un pipeline paró en silencio. El libro no recorre cada herramienta. Te enseña a diseñar un pipeline incremental, idempotente, testeado y observable, para que los números aguas abajo sean confiables y una falla a las 2 de la mañana sea un reintento, no una caída. Para ingenieros y analistas que mueven datos y quieren que lleguen correctos, a tiempo, todas las veces.

VISUALIZATION: Aprendé a visualizar datos: elegí el gráfico correcto y armá dashboards que la gente de verdad lee y usa para decidir

Esta guía te muestra cómo convertir datos en una imagen que deja su punto en segundos, para que tu análisis de verdad cambie una decisión en vez de que lo asientan con la cabeza y lo ignoren. Arranca desde la idea de que cada gráfico es un argumento y construye el criterio para ganarlo: cómo elegir el gráfico correcto para la pregunta (comparación, tendencia, distribución, parte-todo, correlación) en vez de caer siempre en el gráfico de barras, cómo usar la posición, la longitud y el color como funciona de verdad la percepción, cómo despojar al gráfico hasta su mensaje cortando la basura que lo esconde, cómo usar el color con intención y mantenerlo legible para todos, y cómo evitar las distorsiones (ejes truncados, ejes dobles, áreas engañosas) que hacen que un gráfico mienta sin querer. Después construye: diseñar un dashboard con una jerarquía que la gente pueda escanear, contar una historia con una secuencia de gráficos, y la línea honesta entre una simplificación clara y una engañosa. El libro es agnóstico de herramienta a propósito, con ejemplos que aplicás en cualquier librería o herramienta de BI. Te enseña a hacer el gráfico correcto, sacar lo que no sirve al mensaje, y diseñar para quien lee con poco tiempo, para que a tus datos les crean y actúen sobre ellos. Para analistas e ingenieros que quieren que sus gráficos convenzan, no solo que existan.

VIBE CODING: Volvete el programador que la IA multiplica en vez de reemplazar, el que aporta el juicio que a la máquina todavía le falta

Esta guía revela el secreto que separa al programador que la IA reemplaza del que vuelve imprescindible: el vibe coding no es una colección de prompts, es ingeniería de software con la IA adentro del loop. Sobre esa premisa, el libro dedica un capítulo a cada una de las ocho disciplinas que tenés que traer a la mesa (fundamentos sólidos, programación asistida por IA, visión de diseño de sistemas, profundidad para depurar, disciplina de testing, criterio de code review, entendimiento del producto y responsabilidad sobre los resultados) y muestra, en cada una, dónde la IA falla sola y qué aporta tu juicio para que no falle. No es teoría: cada disciplina baja a tierra con escenarios concretos, y al final tenés un kit operativo (los errores más caros con su versión corregida, plantillas de prompts, checklists para antes de promptear y antes de mergear, casos reales de antes y después, y un manual de una página) para tener al lado mientras trabajás. Para ingenieros que están empezando y quieren que la IA les multiplique el valor en lugar de volverlos prescindibles.

SPARK: Procesá datos que no entran en una sola máquina con Apache Spark: entendé el cluster, los DataFrames lazy, los shuffles, joins, skew y memoria, y hacé correr un job que termina en un cluster de verdad

Este libro te da el modelo mental que convierte a Spark de una caja negra que a veces termina en una máquina sobre la que podés razonar. Arranca donde arranca el dolor: un job que corre en segundos sobre una muestra y nunca termina sobre los datos reales, y por qué tirarle hardware no ayuda. De ahí construye, en el orden en que un job real te fuerza las preguntas, la imagen de qué hace Spark en realidad cuando apretás correr: cómo parte tus datos y tu trabajo por un cluster de máquinas para que las piezas corran en paralelo, por qué tus transformaciones no hacen nada hasta que una action las fuerza y cómo leer eso a tu favor, qué es un shuffle y por qué la etapa que debería ser rápida es la que se arrastra, por qué una sola clave popular puede hacer que una tarea corra una hora mientras el resto está de brazos cruzados, cuándo conviene tener los datos en memoria y qué pasa cuando no entran, y cómo escribir la salida que el próximo job y el próximo analista de verdad puedan usar, para después correr todo en un cluster que no tenés que cuidar. Cada idea aterriza sobre un mismo dataset de ejemplo, un servicio de música que convierte mil millones de eventos de reproducción por día en los números que le pagan a los artistas, así ves cada concepto arreglar una falla real y cara. El libro no recorre la superficie de la API. Te enseña a mirar un job lento y saber a dónde se va el tiempo, que es la diferencia entre un ingeniero que escribe Spark y uno al que los jobs le terminan a tiempo y le cuestan la mitad. Para el ingeniero que quiere que big data deje de ser un misterio y pase a ser algo que puede dimensionar, tunear y en lo que puede confiar.

SNOWFLAKE: Meté todos los datos de la empresa en un solo warehouse que cualquiera pueda consultar, cuidá que una query descuidada no te dispare la factura, y volvete la persona a la que todos le creen los números

Este libro te lleva de alguien que sabe consultar un warehouse a alguien que puede administrar uno del que depende la empresa entera. Arranca donde arranca la ansiedad, con la primera factura y el primer número mal, y construye el modelo mental que hace que ambos desaparezcan: compute y storage están separados, y una vez que ves por qué, la forma en que un warehouse escala, cuesta y se mantiene fresco encaja de golpe. Vas a construir un warehouse a lo largo de todo el libro, uno real para un retailer de plantas online que se llama Aster, y lo vas a llevar de vacío a confiable. Vas a cargar datos crudos en stages y a mantenerlos fluyendo con COPY y Snowpipe, a modelarlos para que las queries que la gente corre todos los días salgan rápidas y baratas a la vez trabajando con las micro-particiones y el clustering en vez de contra ellos, y a desarmar la factura línea por línea para entender warehouses, credits, autosuspend, y exactamente cómo una sola query descuidada se convierte en una factura de cinco cifras, y cómo frenarla. Después lo hacés seguro y compartido: roles y grants para que la gente correcta vea los datos correctos y nadie vea la tabla de sueldos de casualidad, y sharing seguro para que otro equipo reciba datos en vivo sin una copia. Al final lo hacés confiable, con chequeos de calidad de datos, time travel para deshacer el error que tarde o temprano vas a cometer, y streams y tasks para que el warehouse se mantenga fresco solo, sin nadie cuidándolo. Para el final los números cierran, la factura es predecible, el acceso está cerrado, y cuando alguien pregunta por qué el reporte dice lo que dice, sabés responder. Para el ingeniero o analista que tiene que hacer de un warehouse algo en lo que la empresa entera confíe, y quiere ser el motivo por el que puede.

DBT: Convertí las tablas crudas del warehouse en números que la gente se cree. Escribí tus transformaciones como modelos SQL versionados, ordená el staging en marts, testeá los datos antes de que salgan y desplegá todo en CI como software de verdad

Este libro te muestra cómo convertir un warehouse lleno de tablas crudas en un conjunto de números que una empresa decide con confianza. Arranca desde el quilombo en el que vive la mayoría de la analítica: SQL correcto desparramado en scripts y notebooks, sin orden, sin tests, y sin forma de reproducirlo. Después construye la disciplina que separa esa pila de un codebase de analítica de verdad. Vas a aprender a escribir cada transformación como un model, un SELECT de SQL plano que dbt convierte en una tabla o una vista, y dejar que la herramienta arme el grafo de dependencias para que tus models siempre corran en el orden correcto. Vas a ordenar las fuentes crudas en models de staging finitos que limpian y renombran, y de ahí en marts que guardan las definiciones de negocio que comparte toda la empresa, así “revenue” y “usuario activo” significan una cosa en un solo lugar. Vas a escribir tests que rompen el build cuando una clave no es única o un valor se va a null, y a declarar contracts para que una columna que cambia de forma arriba rompa el pipeline en vez del dashboard. Vas a tener lineage y documentación gratis desde el mismo código, y a hacer incrementales los models pesados para que una corrida nocturna cueste minutos en vez de un rebuild entero. Cierra con cómo entregar esto como software: control de versiones, un pull request, una corrida de CI que buildea y testea cada model sobre una muestra antes de que llegue a producción, y el rol de analytics engineering que es dueño de la costura entre los datos crudos y el número en el que la gente confía. El libro no hace un tour por cada feature de dbt. Te enseña a construir una capa de transformación ordenada, testeada, documentada y desplegada, así la cifra del dashboard es reproducible y defendible en vez de una query que alguien corrió una vez y rezó que estuviera bien. Para el analista o ingeniero que quiere dejar de ser la persona de la que depende el número y volverse la que construyó el sistema del que sale.

KAFKA: Mové los datos apenas pasan, sin esperar al batch de la noche, dejá de perder eventos y de procesarlos dos veces, y volvete el dueño del pipeline que toda la empresa usa en tiempo real

Este libro te lleva de alguien que sabe escribir un servicio contra una base de datos a alguien que administra el pipeline que toda la empresa corre en tiempo real. Arranca donde arranca el miedo, con el mensaje perdido y el cobro doble, y construye el único modelo mental que hace que ambos desaparezcan: Kafka es un log, una secuencia de eventos a la que solo se agrega al final y que muchos lectores comparten guardando cada uno su propio lugar, y una vez que sentís eso, la entrega, el orden, el paralelismo y los duplicados se reordenan en tu cabeza. Vas a construir un pipeline en tiempo real a lo largo de todo el libro, uno real para una plataforma de viajes y delivery que se llama Loom, y lo vas a llevar de un solo evento perdido a un stream en el que el negocio se apoya. Vas a acomodar topics, partitions y offsets para que muchos servicios lean los mismos eventos sin pisarse, hacer un producer que no pierde un mensaje aunque se muera un broker, repartir un stream entre un consumer group para que el trabajo se paralelice y sobreviva a un servidor que se cae en plena guardia, entender exactamente cuándo se conserva el orden y cuándo un rebalance lo baraja de vuelta en silencio, y lograr procesamiento exactly-once para que un reintento deje de convertir un viaje en dos cobros. Después lo llevás a donde viven los analistas, streameando eventos a un warehouse con Kafka Connect y reformándolos en el camino con Kafka Streams, y aprendés a operar la cosa cuando son las 3 de la mañana y estás durmiendo: leer el lag de los consumers antes de que sea una caída, poner retention para que el log no llene el disco ni tire datos que todavía necesitás, y saber qué número te dice que el pipeline está sano. Para el final los eventos llegan una vez, en orden donde importa, lo bastante rápido como para que el dashboard esté de verdad en vivo, y cuando algo se atrasa lo ves antes que el negocio. Para el ingeniero que tiene que hacer que los datos se muevan en el momento en que pasan, y quiere ser el motivo por el que se puede.

METABASE: Convertí una base de datos que solo vos sabés leer en dashboards que toda la empresa abre sola, dejá de ser el que todos buscan para que corra otra vez el mismo reporte, y volvete esa persona cuyos números el negocio usa de verdad para decidir

Este libro te lleva de alguien que sabe armar un gráfico a alguien que construye los dashboards que una empresa entera usa sola y en los que confía. Arranca donde arranca la frustración, con el dashboard que nadie usó y el reporte que te seguían pidiendo re-correr, y le pone nombre a lo que ningún tutorial de Metabase nombra: la parte difícil nunca fueron los gráficos, fue lograr que la gente no técnica pudiera responder sus propias preguntas y creer la respuesta. Vas a construir un Metabase real a lo largo del libro, para un retailer de artículos para el hogar que se llama Fernwood, y lo vas a llevar de una base cruda que solo vos sabés leer a un conjunto de dashboards que el equipo de ventas, el de operaciones y la CEO abren solos cada mañana. Vas a conectar la base de Fernwood y modelar una capa semántica encima, para que la gente haga clic en nombres amigables y columnas limpias en vez de adivinar sobre tablas crudas, y aprender dónde el query builder es la herramienta correcta y dónde bajás a SQL. Vas a armar preguntas y convertirlas en dashboards con filtros y drill-through que respondan lo que alguien de verdad vino a preguntar, así ‘mostrame el mes pasado’ o ‘por qué bajó este número’ es un clic, no un mensaje de Slack para vos. Vas a definir métricas una sola vez, para que revenue signifique una sola cosa en toda la empresa, y armar subscriptions y alerts para que el dashboard vaya hacia la gente en vez de esperar a que la visiten. Y lo vas a hacer autoservicio y confiable: permisos para que la gente correcta vea los datos correctos, embedding para que un dashboard viva adentro de otra herramienta, y el trabajo de performance que mantiene un dashboard compartido rápido cuando cincuenta personas lo cargan a las nueve de la mañana. Para el final nadie te escribe para que vuelvas a correr un reporte, los números cierran, y los dashboards son eso que la gente usa para decidir. Para el analista o ingeniero que tiene que hacer que una empresa se sirva sola, y quiere ser el motivo por el que puede.

HADOOP: Procesá volúmenes de datos que no entran en un solo servidor, entendé cómo funcionan el almacenamiento y el cómputo distribuido que Hadoop le heredó a todas las herramientas de hoy, y volvete el ingeniero al que una empresa grande le confía la infraestructura que nadie más se anima a tocar

Este libro te lleva de alguien que solo corrió programas en una sola máquina a alguien que entiende, en el cuerpo, cómo se guardan y se procesan los datos a una escala que ningún servidor solo puede aguantar. Es honesto sobre dónde está Hadoop en 2026: es un stack maduro, pasó su pico, y para un proyecto nuevo casi siempre irías por Spark o un cloud warehouse en su lugar. Pero las ideas de storage distribuido y compute distribuido que Hadoop inventó no desaparecieron; Spark, BigQuery, Snowflake y todos los lakehouse las heredaron, y no vas a entender de verdad esas herramientas hasta que hayas visto los originales sin vueltas. Y hay una segunda razón para aprenderlo: estates enormes y viejos siguen corriendo sobre Hadoop, en bancos, telcos y gobiernos, guardando los datos de los que esos negocios dependen, y el ingeniero que de verdad puede operar uno es raro y bien pago justamente porque a todos los demás les da miedo. Vas a trabajar un problema real a lo largo de todo el libro, una operadora de celulares que se llama Meridian y que tiene que convertir una manguera de registros de llamadas y clickstream en los números con los que anda el negocio, a un volumen que rompió la base de datos única con la que arrancaron. Vas a ver por qué una máquina deja de alcanzar y dónde está de verdad la pared, cómo HDFS guarda un archivo a lo largo de un cluster y sobrevive a discos que se mueren cada semana manteniendo copias, cómo MapReduce expresa un cómputo como trabajo que corre al lado de los datos y dónde ese modelo choca contra sus límites, cómo YARN decide quién se queda con qué máquina cuando todos quieren el cluster a la vez, cómo Hive te deja escribir SQL sobre archivos que no son una base de datos y por qué esa query es lenta, y cómo los formatos de archivo, el particionado y el storage columnar convierten en silencio a un cluster de Hadoop en el lakehouse moderno que Spark y la nube consultan hoy. Para el final no solo vas a poder mantener vivo el estate de Meridian; vas a entender los fundamentos de los datos distribuidos que sobreviven al propio Hadoop, así la próxima herramienta que aprendas es una variación de ideas que ya tenés. Para el ingeniero que tiene que laburar a una escala que un solo servidor no aguanta, y quiere ser la persona a la que el negocio le confía hacerlo.

CLAUDE: Dejá de usar Claude Code como un chat que de paso escribe código. Manejalo como el ingeniero agéntico que es, en la terminal, tu editor, el escritorio y el CI, y va a entregarte un día de laburo en una hora sin dejarte un despelote atrás

Esta guía enseña la habilidad duradera detrás de Claude Code: no una lista de features que para el trimestre que viene ya cambiaron, sino cómo manejar una herramienta agéntica de programación para que haga trabajo real en el que podés confiar. Arranca donde está el dolor (el día que te salvó y el día que te quemó) y después recorre los siete movimientos que separan al que opera del que la herramienta pasa por arriba. Vas a configurarla en todos los entornos y saber cuándo ir a la terminal, cuándo a tu editor, cuándo al escritorio y cuándo al navegador. Vas a darle el contexto una vez (un archivo de memoria del proyecto, el repo, un plan acordado antes de que toque el código) para que deje de repreguntar y de adivinar. Vas a manejar una sola tarea como corresponde, leyendo el diff y guiando, para que un buen cambio nunca se vuelva un desparramo malo. Vas a poner los permisos para que vuele en lo seguro y frene en lo peligroso, y decidir qué autoaprobar y qué frenar. Vas a correr trabajo en paralelo (subagentes, varias sesiones, worktrees aislados) sin que las piezas choquen. Vas a extenderla con los conectores, los hooks y los comandos que la hacen encajar en tu stack. Y vas a meterla en el CI para que revise, arregle y responda issues sola mientras no la mirás. Cierra con en quién te convertís cuando todo esto es automático: el ingeniero que entrega más, confía en lo que sale y vale más porque la máquina le multiplica el criterio en vez del despelote. Para el ingeniero que quiere que Claude Code se sienta una palanca, no una tragamonedas.

RESPONSABILIDAD: Volvete el ingeniero al que le confían eso que no puede fallar: te hacés cargo del resultado y no solo de tu ticket, llevás cada problema hasta la causa de fondo y hasta cerrarlo, y no dejás que nada se pierda mientras estás vos a cargo

Este libro trata sobre el único rasgo que decide si te dan el trabajo que importa: la responsabilidad, el hábito de tomar un problema como tuyo y llevarlo hasta un resultado real, no solo hacer tu parte asignada y cruzar los dedos para que el resto salga bien. Arranca desde una verdad incómoda. No tener la culpa no es lo mismo que ser útil, y cerrar tu ticket no es lo mismo que resolver el problema, y toda la industria asciende en silencio por lo segundo mientras le pone nota a los juniors por lo primero. Después te da los hábitos, uno por uno, que separan al ingeniero al que le confían lo importante del que siempre está técnicamente sin culpa. Vas a aprender a decir yo me encargo y referirte al resultado entero, a perseguir una falla hasta su causa real en vez de parchar el síntoma, a arreglar el problema en vez de salir a cazar a quién echarle la culpa, a llevar un tema hasta el final en vez de tirarlo por encima de la pared, a cerrar el círculo para que la gente sepa que de verdad quedó, y a hacerte cargo del seguimiento aburrido y de la grieta que no es trabajo de nadie, incluida la falla que es tuya para arreglar y aprender. Cada hábito viene con un ejercicio que podés hacer esta semana y una imagen clara de cómo se ve cuando está bien, contado a través del arco de un ingeniero que va del que señalaba culpables al que le entregan lo que no puede fallar. Cierra con lo que cambia cuando los problemas dejan de escaparse por las grietas porque son tuyos: te volvés la persona que ascienden, a la que le pagan más, y a la que le confían el trabajo que decide todo. Para el ingeniero cansado de hacer su parte y ver a otro llevarse el crédito por ser dueño del resultado.