La evaluación de modelos de lenguaje de gran escala (LLM) se ha apoyado tradicionalmente en métricas agregadas como la precisión media sobre un conjunto de pruebas. Sin embargo, esta visión simplificada oculta una realidad más compleja: el rendimiento global puede permanecer estable incluso cuando numerosos ítems individuales experimentan cambios significativos en direcciones opuestas. Esta dinámica, conocida como churn o volatilidad interna, es crucial para entender si una nueva versión de un modelo realmente mejora o simplemente reordena sus aciertos y errores. Para abordarlo, resulta útil adaptar conceptos de otras disciplinas, como el índice de cambio confiable (RCI) de la psicología clínica, que permite identificar modificaciones estadísticamente significativas a nivel de ítem en lugar de conformarse con un promedio que puede enmascarar comportamientos divergentes. En la práctica, al comparar dos versiones de un mismo LLM, se observa que solo una fracción de los casos presenta cambios fiables; el resto permanece igual o se sitúa en los extremos de la escala (suelo o techo). Entre los ítems analizables, las mejoras y los deterioros coexisten con tamaños de efecto considerables, lo que sugiere que la evolución de un modelo no es monolítica. Además, la dirección del cambio suele estar correlacionada con la dificultad inicial: los ítems con baja precisión tienden a mejorar, mientras que aquellos ya acertados con frecuencia empeoran. Este comportamiento introduce un sesgo que las métricas agregadas no capturan. Para las empresas que integran inteligencia artificial en sus procesos, comprender esta volatilidad es vital. No basta con saber que una nueva versión sube un punto porcentual; es necesario discernir qué casos concretos se benefician y cuáles se perjudican, especialmente cuando se despliegan soluciones críticas. En Q2BSTUDIO, como empresa de desarrollo de software y tecnología, abordamos estos desafíos con un enfoque multidisciplinario que combina ia para empresas con análisis detallado de rendimiento. Nuestros servicios de software a medida permiten construir pipelines de evaluación que detectan cambios confiables a nivel de ítem, integrando además capacidades de servicios cloud aws y azure para escalar las pruebas y almacenar resultados históricos. También aplicamos ciberseguridad para proteger los datos de entrenamiento y las interacciones, y utilizamos power bi para visualizar la evolución de los modelos, revelando patrones que las medias ocultan. Asimismo, trabajamos con agentes IA que, al estar basados en análisis de churn, toman decisiones más robustas en entornos dinámicos. Esta perspectiva técnica no solo mejora la fiabilidad de los sistemas, sino que aporta transparencia a la hora de seleccionar la versión de un modelo para tareas específicas. En definitiva, reportar la tasa de cambio confiable junto con la precisión agregada es un paso necesario para ir más allá de la media y construir aplicaciones a medida que realmente se comporten como se espera en producción.




