L'avaluació d'agents de codi ha estat dominada durant anys per una mètrica simple: el resultat final. Un agent és bo si supera una bateria de proves i dolent si no ho aconsegueix. Aquesta visió binària, útil per comparar models ràpidament, deixa fora l'experiència real de qui treballa amb aquestes eines en un entorn de desenvolupament. Cada execució és un procés format per decisions, intents, errors i correccions, i tot aquest recorregut determina si un agent resulta realment productiu o no. AgentLens aborda precisament aquesta mancança, proposant una avaluació per trajectòries en lloc d'una avaluació per resultat.
La proposta combina verificació formal, revisions de trajectòria generades per models de llenguatge i comparacions cara a cara. La verificació formal aporta un criteri objectiu quan existeix una comprovació clara, com el resultat de proves automatitzades o la validesa d'una transformació de codi. Les revisions de trajectòria, per la seva banda, interpreten el comportament de l'agent durant l'execució: com segueix les instruccions, com selecciona i fa servir les seves eines, com verifica la seva pròpia feina, com es recupera dels errors i com es comunica amb la persona que el supervisa. Les comparacions cara a cara permeten situar dues execucions front a front i raonar sobre quina és més segura, eficient o comprensible. El resultat no és una nota opaca, sinó una explicació llegible de per què s'ha obtingut una puntuació concreta.
Per a una empresa de desenvolupament de programari com Q2BSTUDIO, l'avaluació per trajectòries té implicacions pràctiques molt valuoses. Quan construïm aplicacions a mida que incorporen agents d'IA, necessitem saber no només si l'agent acaba la tasca, sinó si ho fa d'una manera que pugui auditar-se, mantenir-se i explicar-se al client. Un agent que supera una prova però ha sobreescrit dades sense avisar, o que ha treballat en una branca de codi equivocada, seria un risc en un projecte real. L'avaluació per trajectòries permet detectar aquests comportaments abans que arribin a producció.
A més, encaixa amb la nostra visió de intel·ligència artificial aplicada a processos de negoci. No es tracta de substituir les persones, sinó de crear assistents que sàpiguen quan actuar i quan preguntar. Perquè aquests assistents siguin fiables, el mesurament ha d'incloure la qualitat de la interacció, la claredat de les explicacions i la capacitat de rectificar. AgentLens permet monitorar tots aquests aspectes en un pipeline nocturn, de manera que una nova versió de l'agent pugui comparar-se amb l'anterior abans de desplegar-se. És una eina de diagnòstic i de control de regressions, no només de classificació.
En termes d'infraestructura, un sistema d'avaluació d'aquest tipus requereix certa maduresa tècnica. Les execucions d'agents poden consumir recursos significatius, per la qual cosa convé disposar d'entorns en cloud AWS/Azure que permetin llançar proves en paral·lel i aïllar cada experiment. Des de Q2BSTUDIO treballem habitualment amb aquestes plataformes per construir entorns d'integració contínua, i l'avaluació d'agents segueix el mateix patró: cada execució ha de ser reproduïble, traçable i destruïble. El núvol facilita també la gestió de credencials, un aspecte crític perquè un agent amb accés a un repositori ha de tenir permisos mínims i no exposar mai secrets.
La ciberseguretat també hi té un paper rellevant. Un agent de codi mal avaluat pot convertir-se en una porta d'entrada per a atacs d'injecció d'instruccions o per a la filtració d'informació sensible. Per això, en els nostres projectes de ciberseguretat apliquem una capa addicional de control a qualsevol automatització basada en IA. La trajectòria d'un agent és un registre d'auditoria: permet reconstruir què va fer, amb quines dades i amb quines conseqüències. Avaluar aquesta trajectòria és, en el fons, una mesura de seguretat.
D'altra banda, els resultats d'AgentLens poden integrar-se en panells de Business Intelligence. Les organitzacions que inverteixen en agents de codi volen veure tendències: com evoluciona la taxa d'èxit, quin tipus de tasques generen més errors, si les revisions de trajectòria mostren patrons de comunicació deficients. Amb eines de BI/Power BI és possible transformar aquestes dades en quadres de comandament que ajudin a decidir on centrar la millora. A Q2BSTUDIO ajudem els nostres clients a dissenyar aquesta capa d'observabilitat, connectant l'avaluació dels agents amb les mètriques de negoci.
La filosofia d'AgentLens no és exclusiva de l'àmbit acadèmic. Com a benchmark de codi obert, permet que qualsevol equip l'adopti, l'adapti i l'executi en el seu propi pipeline. Això el fa especialment atractiu per a empreses que volen prendre decisions basades en evidències i no en impressions. En lloc de preguntar-se únicament si la prova ha passat, l'equip pot preguntar-se si l'agent ha treballat com s'esperava. La diferència sembla subtil, però a la pràctica canvia completament la conversa.
L'èmfasi en la trajectòria té també una conseqüència directa en la confiança. Els desenvolupadors que fan servir assistents d'IA necessiten entendre què ha fet l'agent abans d'acceptar el seu resultat. Una puntuació binària no ajuda a generar confiança; una explicació detallada, sí. Quan un agent pot demostrar que ha executat les proves, que ha corregit els errors trobats i que ha comunicat les seves decisions amb claredat, la seva feina esdevé molt més fàcil de revisar. Aquesta capacitat de revisió és la base per integrar agents en fluxos de treball seriosos.
En definitiva, AgentLens representa un avenç necessari en la maduresa dels agents de codi. A mesura que més empreses confien en assistents d'IA per escriure, revisar i desplegar programari, necessitem millors instruments per entendre el seu comportament. L'avaluació per trajectòria, amb les seves explicacions llegibles i les seves comparacions contextuals, és probablement el camí més sensat. A Q2BSTUDIO seguim de prop aquestes propostes per aplicar-les en projectes de programari a mida, cloud, ciberseguretat i business intelligence, perquè sabem que un agent útil no és només el que encerta, sinó el que encerta per les raons correctes.





