AgentLens: Evaluación de Trayectorias para Agentes de Código es un benchmark concebido para medir lo que las pruebas tradicionales ignoran. En los últimos años, la industria del software ha adoptado agentes IA capaces de escribir, revisar y depurar código de forma autónoma. Pero la mayoría de las evaluaciones existentes se limitan a comprobar si el agente completa una tarea en un entorno aislado. Esa visión simplista resulta engañosa en proyectos reales, donde la ruta que sigue el agente, los errores que comete y la manera de recuperarse determinan su utilidad en producción. AgentLens no se conforma con el resultado: examina toda la trayectoria.
La propuesta combina verificación formal con revisiones narrativas generadas por modelos de lenguaje. Primero, utiliza comprobaciones objetivas cuando la tarea tiene una respuesta correcta verificable. Segundo, incorpora análisis de la interacción del agente con sus herramientas, su adherencia a las instrucciones y su capacidad de autoevaluación. Por último, plantea comparativas lado a lado entre diferentes versiones o modelos, de modo que cada ejecución produce una explicación legible del motivo por el cual se obtiene una puntuación concreta. Esto transforma la evaluación en una fuente de diagnóstico, no en un simple ranking.
Para una empresa de desarrollo de software como Q2BSTUDIO, este enfoque es especialmente valioso. Cuando construimos aplicaciones a medida, no podemos permitir que un agente de IA sea una caja negra. Necesitamos saber qué decisión tomó en cada paso, por qué descartó una alternativa y cómo reaccionó ante un fallo inesperado. La trazabilidad que ofrece AgentLens se parece a la que exigimos en cualquier otro componente crítico: registros detallados, contexto y capacidad de auditoría. Sin esa visibilidad, es imposible confiar en la automatización.
El benchmark también conecta con una realidad cotidiana en los equipos de ingeniería: la regresión silenciosa. Un agente puede aprobar todas las pruebas sintéticas hoy y fallar mañana en una tarea similar porque un cambio en su modelo subyacente alteró su comportamiento. Al ejecutar AgentLens de forma periódica, es posible detectar esas regresiones antes de que afecten a los usuarios. En Q2BSTUDIO integramos esta lógica en nuestros pipelines de calidad, junto con prácticas de integración continua y despliegue en cloud AWS/Azure. La nube facilita la instrumentación y el almacenamiento de trayectorias completas, lo que convierte cada ejecución en un activo de información para el equipo.
La ciberseguridad también se beneficia de esta metodología. Cuando un agente de IA interactúa con sistemas internos, cada acción representa una superficie de riesgo. Las revisiones de trayectoria permiten identificar comportamientos anómalos, accesos innecesarios o usos indebidos de credenciales. AgentLens no es una herramienta de pentesting, pero su filosofía de observabilidad encaja con los requisitos de seguridad de las organizaciones modernas. En proyectos que requieren auditoría continua, disponer de un registro interpretable de lo que hizo un agente y por qué lo hizo resulta tan importante como las propias pruebas funcionales.
Otro ámbito donde la evaluación por trayectoria marca la diferencia es la inteligencia de negocio. Los agentes de código no solo programan; también preparan datos, crean consultas y generan visualizaciones. Un sistema de BI/Power BI puede ser asistido por un agente que construye informes bajo demanda. La calidad de ese agente no se mide únicamente por si el informe final cumple con un esquema, sino por cómo explora los datos, qué supuestos aplica y cómo comunica sus hallazgos al usuario. La revisión narrativa que propone AgentLens ofrece exactamente ese nivel de detalle.
La comparación lado a lado es uno de los componentes más potentes. En lugar de depender de una métrica agregada, los equipos pueden presentar a dos agentes la misma tarea y comparar sus estrategias. Esto es muy útil durante el desarrollo de un agente de IA propio, cuando se quiere validar una nueva versión antes de lanzarla. La evaluación no se limita a decir qué modelo gana; explica por qué gana. Esa explicación permite a los ingenieros ajustar prompts, herramientas o criterios de decisión con un nivel de precisión que antes era inalcanzable.
El concepto de trayectoria no solo aplica a la ejecución de un agente durante unas horas. También debería abarcar todo el ciclo de vida del software: desde la definición del requisito hasta el mantenimiento evolutivo. Un agente que trabaja sobre una base de código heredada necesita entender el contexto, no limitarse a generar parches. La evaluación debe incluir la calidad del mensaje que devuelve al desarrollador, la claridad de sus preguntas y su capacidad para solicitar ayuda cuando no tiene suficiente información. AgentLens recoge estos comportamientos y los convierte en datos accionables.
La publicación de AgentLens como proyecto de código abierto abre un campo de experimentación enorme. Cualquier equipo puede descargarlo, adaptarlo a su stack tecnológico y contribuir con nuevos casos de uso. Esto es muy relevante para la comunidad de desarrollo de software en español, que necesitamos más herramientas de evaluación con explicaciones claras y no solo números. La transparencia del benchmark permite que las decisiones sobre qué agente contratar o configurar se tomen con criterio, y no por el simple resultado de una prueba automatizada.
Otro punto que conviene resaltar es la diferencia entre medir el rendimiento y medir el comportamiento. Las métricas clásicas, como el porcentaje de tareas completadas o el tiempo medio de resolución, ofrecen una foto superficial. La evaluación por trayectoria, en cambio, captura el razonamiento práctico del agente: cómo organiza las subtareas, cuándo decide preguntar al usuario, si documenta sus cambios o si deja efectos colaterales. Estas variables son las que separan a un asistente experimental de una herramienta fiable para producción. En Q2BSTUDIO, cuando aplicamos esta perspectiva a proyectos de aplicaciones a medida (custom software), conseguimos una visión mucho más realista del valor que la IA puede aportar al negocio.
El futuro de los agentes de código pasa por la confianza. Y la confianza no se construye con una nota de aprobado o suspendido, sino con la capacidad de inspeccionar cada paso del proceso. AgentLens contribuye a esta visión al unir la verificación formal con la narrativa generada por IA. En una empresa como Q2BSTUDIO, donde desarrollamos aplicaciones a medida, servicios cloud y soluciones de inteligencia artificial, la evaluación por trayectorias se está convirtiendo en un estándar interno de calidad. No queremos saber solo si algo funciona; queremos saber por qué funciona, cómo se comporta ante el error y de qué manera puede mejorar.



