Description
La suite está en verde, así que sale a producción. Una hora después un usuario postea una captura: tu IA respondió una consulta de soporte con una política inventada, fluida y segurísima, y citó un documento que no existe. Todos los tests pasaron porque cada test que aprendiste asume un sistema determinista: misma entrada, misma salida, afirmás que coinciden. Un modelo de lenguaje rompe eso en la primera corrida. Responde distinto cada vez, suena más seguro justo cuando está equivocado, y su calidad se desvía el día que alguien te cambia el modelo abajo. Así que la suite de siempre o no existe y la alucinación sale igual, o chequea strings exactos y queda en rojo en cada corrida hasta que el equipo la silencia. Testear un sistema de IA es una disciplina de verdad distinta, y las búsquedas que la piden se multiplican mientras casi nadie la sabe hacer.
Este libro te enseña a testear sistemas de IA como lo exige la nueva ola de roles de QA, construyendo la suite de evaluación que decide si un sistema LLM o RAG es lo bastante bueno para salir. Arranca desde la ruptura central: un modelo es no determinista y probabilístico, así que testearlo es medir una distribución de calidad, no afirmar una salida exacta, y muestra qué medir en cambio. Va a fondo en RAG, la arquitectura detrás de la mayoría de la IA en producción, y qué significa correcto para ella: precisión de recuperación (volvió el contexto correcto, medido contra un set etiquetado), fidelidad o grounding (la respuesta está de verdad respaldada por el texto recuperado, no inventada), relevancia de la respuesta, y la falla de la cita alucinada donde un modelo cita una fuente que no dice lo que afirma. Cubre las técnicas que hacen testeable un sistema probabilístico, un set de evaluación armado con preguntas reales y respuestas de referencia, scoring con LLM-as-judge (y cómo mantener honesto al juez), evaluación humana basada en rúbricas, y los frameworks que usa el campo (RAGAS, TruLens, y suites custom). Después construye el resto de la superficie de validación que estos sistemas necesitan: regression testing para que un cambio de prompt o de modelo no pueda bajar la calidad en silencio, calibración del score de confianza y drift del peso de fuentes, testing de inyección de prompts y seguridad, y chequeos de RBAC y control de acceso para que un tenant no pueda recuperar los datos de otro. Cierra con la decisión de go/no-go: convertir la evaluación en un reporte de precisión y evidencia de test sobre la que un equipo puede salir, y enganchar las evals en CI para que la calidad se controle, no se espere. Los ejemplos son un asistente RAG real, mostrado pasando un test ingenuo mientras alucina en silencio, y después puesto a prueba contra una eval que lo ataja. Para ingenieros que quieren ser los que de verdad pueden probar que un sistema de IA funciona.
Quién debería leerlo
Este libro es para: QA automation e ingenieros de IA que tienen que probar que un sistema LLM o RAG es preciso, anclado y seguro, y que saben que afirmar igualdad sobre un modelo que responde distinto cada vez no funciona, y necesitan una forma de verdad de testear un sistema probabilístico.
El atajo que nadie te regala
Los 5 pasos para la habilidad de testing de IA que todos buscan y casi nadie tiene. El método que convierte la salida inestable y distinta-en-cada-corrida de un modelo de lenguaje en una sola nota de calidad con la que decidís el lanzamiento. Vas a construir la suite de evaluación que ataja una respuesta fluida, segura y alucinada justo antes de que salga, y a entrar a cualquier reunión de release con evidencia en vez de una esperanza. Los ingenieros que dominan esto son pocos, y los puestos que los necesitan se multiplican.
Lo que vas a encontrar adentro
- Capítulo 1: La barra verde que dejó salir una mentira
- Capítulo 2: Tres suposiciones que se rompen apenas testeás un LLM
- Capítulo 3: Por qué “mal” es una palabra inútil para una respuesta de RAG
- Capítulo 4: Una respuesta equivocada que nunca fue culpa del modelo
- Capítulo 5: Fluida, segura y en parte inventada
- Capítulo 6: La cita que parecía real y terminó cerrando un producto
- Capítulo 7: La planilla que decide si tu IA sirve
- Capítulo 8: Un juez tan defectuoso como lo que juzga
- Capítulo 9: Lo que RAGAS y TruLens no van a hacer por vos
- Capítulo 10: La calidad bajó y el diff está vacío
- Capítulo 11: Cuando un documento guardado se convierte en un atacante
- Capítulo 12: Decir que sí a deployar sin adivinar
- Capítulo 13: Convertirte en la persona que puede probar que una IA funciona


