Description
Un modelo de visión es fácil de empujar al 95% en un test set y durísimo de dejar bien en la cola larga. La notebook corre, la demo anda con tus cinco fotos, la métrica se ve hermosa, y después se cae con el ticket borroso de un usuario, con mala luz, en un teléfono de hace tres años. La parte difícil nunca fue entrenar un modelo; es saber si la arquitectura le sirve a los datos que de verdad tenés, si ese número significa lo que dice, y si la cosa va a sobrevivir cuando salga de tu GPU. Los tutoriales que te pasean por las llamadas de una librería no te sirven acá, porque no sos vos quien escribe esas llamadas; lo que te falta es el modelo mental del revisor sobre cómo funciona la visión en serio, para poder mirar un pipeline y saber si va a producción o vuelve para atrás.
Este libro te entrena para ser el revisor de un pipeline de computer vision vibe-codeado, no para memorizar una librería. Arranca desde una premisa distinta a la de casi cualquier libro de visión: un backbone preentrenado y un agente van a escribir el modelo y el training loop, y tu palanca es entender cómo funciona la visión lo suficiente como para juzgar la arquitectura, la evaluación y el despliegue con tres preguntas que el agente nunca hace. Vas a aprender cómo una máquina convierte pixeles en features, qué calcula de verdad una convolución, y por qué las CNN, los Vision Transformers y los modelos de difusión le sirven cada uno a un problema distinto, para que puedas darte cuenta de cuándo la arquitectura más hypeada es la equivocada. Vas a recorrer las tres tareas centrales, clasificación, detección y segmentación, y a leer qué significa de verdad la salida de cada modelo y qué métrica esconde la falla que tus usuarios sí van a sentir. Y como el puente de la investigación a producción es donde se traban casi todos los proyectos, la mitad del libro es datos y despliegue: armar un dataset y un split que no mienta, augmentation y anotación que escalen, y la compresión, la inferencia en el dispositivo y el monitoreo de drift que deciden si la cosa sobrevive el contacto con imágenes reales. Cada capítulo diseña una pieza real de un sistema que funciona, muestra la versión buena contra la mala que produciría un agente, y es honesto sobre lo que cuesta en latencia, tamaño y etiquetado. Para ingenieros que van a construir con modelos de visión de todas formas y quieren ser los que cazan el diseño que estaba por salir roto a producción.
Escrito para vos si
Este libro es para: ingenieros que usan modelos preentrenados y dejan que un agente escriba el training loop, y ahora necesitan el criterio para revisar un pipeline de visión de punta a punta: elegir la arquitectura correcta, confiar en la evaluación y entregar un modelo que aguante imágenes reales.
El atajo que nadie te regala
Las 3 claves para la habilidad en visión que los equipos pagan más caro. El modelo del revisor para juzgar cualquier pipeline de computer vision que un agente escribió por vos. En vez de creerle a la demo que anduvo con cinco fotos, corrés tres preguntas que el agente nunca hace y sabés si el modelo aguanta la cola larga o vuelve para atrás antes de que se caiga con imágenes reales. Pasás del ingeniero que reza para que el pipeline aguante al que caza el diseño que estaba por salir roto.
Todo lo que hay adentro
- Capítulo 1: La demo que funcionó con cinco fotos y falló con cinco millones
- Capítulo 2: Qué ve en realidad tu modelo cuando le pasás una foto
- Capítulo 3: Todo modelo de visión descansa sobre una sola operación pequeña
- Capítulo 4: Qué reemplazó de verdad el deep learning cuando se quedó con la visión
- Capítulo 5: Tu agente nunca hace este chequeo de arquitectura
- Capítulo 6: Tu agente tira a la basura una ventaja gratis
- Capítulo 7: El modelo más de moda, y la cuenta de datos que esconde
- Capítulo 8: Cuándo las imágenes generadas ayudan a tu modelo y cuándo lo envenenan
- Capítulo 9: Un modelo puede acertar el 99% y no servir para nada
- Capítulo 10: Cuando las cajas prolijas del demo caen sobre la taza de café
- Capítulo 11: Una máscara puede verse perfecta y aun así cortar la esquina que importaba
- Capítulo 12: Mirá los datos antes de creerle al número
- Capítulo 13: El augmentation que convierte un 6 en un 9 y le deja la etiqueta
- Capítulo 14: El techo que nadie presupuesta: tus etiquetas
- Capítulo 15: El modelo cuatro veces más chico y la precisión que nadie midió
- Capítulo 16: Qué se rompe cuando tu modelo deja la notebook por el teléfono
- Capítulo 17: ¿Cómo te darías cuenta de que el modelo dejó de funcionar?
- Capítulo 18: Convertir cada pieza en un producto en el que un usuario confía


