La pirámide de testing se rompió, ya no alcanza: cómo evaluar agentes de IA
TESTING
🌎 Mexico 2026
En esta charla hablaremos del por qué las estrategias tradicionales ya no son suficientes. Más que reemplazar la pirámide clásica, veremos cómo evolucionarla para el desarrollo de agentes inteligentes…
En esta charla hablaremos del por qué las estrategias tradicionales ya no son suficientes. Más que reemplazar la pirámide clásica, veremos cómo evolucionarla para el desarrollo de agentes inteligentes.
El testing tradicional asume que la misma entrada siempre produce la misma salida. Los agentes de IA rompen esa regla: la misma pregunta puede generar respuestas distintas cada vez, esto se convierte en un problema real alrededor de 57% de las organizaciones tienen agentes en producción, y 32% señala la calidad como su principal barrera para escalar (LangChain, 2026).
Un estudio encontró que los prompts —la parte más impredecible del sistema— se testean en apenas 1% de los casos.
Esta charla presenta un framework de 4 niveles para corregir ese desbalance, hablaremos sobre pruebas determinísticas, replay de sesiones, LLM-as-Judge y métricas que permiten generar confianza en sistemas de IA.
Sobre Diandra Sánchez: QA Lead passionate about software quality and building a culture where quality is a shared responsibility throughout the entire product development lifecycle. I currently lead Quality Engineering initiatives at Yape, Peru’s leading digital wallet, focusing on delivering reliable, scalable, and high-quality digital experiences for millions of users. With experience in software testing, test automation, performance testing, and AI testing, I enjoy sharing knowledge through tech communities and speaking at conferences.