La investigació recent sobre la variabilitat en el comportament dels agents basats en models de llenguatge de gran escala (LLM) ha revelat una troballa fascinant: en executar el mateix agent sobre entrades idèntiques, s'obtenen entre 2.3 i 4.2 seqüències d'acció diferents per cada 10 execucions. Aquesta inconsistència, lluny de ser un defecte, constitueix un senyal d'incertesa lliure d'entrenament i de caixa negra que permet la classificació selectiva i la calibració lliure de distribució per a sistemes d'agents. Per a les empreses que busquen integrar intel·ligència artificial en els seus processos, comprendre i explotar aquesta variabilitat és clau per construir solucions robustes i fiables.
En experiments amb més de 8.000 execucions de quatre models sobre 200 preguntes de HotpotQA, es va observar que les tasques consistents (amb un màxim de 2 rutes úniques) assolien una precisió del 82-87%, mentre que les tasques inconsistents (4 o més rutes) amb prou feines aconseguien un 41-65% d'encert, una bretxa que es manté fins i tot controlant la dificultat de la tasca. La divergència es concentra en el pas 2 (50,5% de les tasques amb Llama), i les mètriques de consistència detecten fallades amb un AUROC de 0,62-0,78. Aquest patró revela que la variabilitat no és aleatòria, sinó que assenyala àrees on l'agent manca de certesa.
Aprofitant aquest senyal, la predicció selectiva (respondre només quan k=3 execucions coincideixen) aconsegueix una precisió del 87-88% amb una cobertura del 54-62%, un guany de 6-14 punts percentuals sobre les línies base d'una sola execució, equiparant-se a un enfocament de conformitat dividida sense necessitat d'un conjunt de calibració separat. Aquest enfocament té implicacions directes per al desenvolupament d'aplicacions basades en IA en entorns empresarials, on la confiança en les decisions automatitzades és fonamental.
La validació creuada a SWE-bench (50 tasques, 1.000 execucions) preserva la jerarquia de consistència, però revela una dispersió d'aproximadament 8x en la llargada mitjana de les trajectòries entre models, i l'anàlisi bootstrap mostra que les avaluacions d'una sola execució classifiquen malament els models un 29,3% de les vegades. Això subratlla la necessitat d'incorporar múltiples execucions i mètriques de consistència en els pipelines d'avaluació d'agents LLM.
Per a les organitzacions que desenvolupen aplicacions a mida, aquesta investigació ofereix una metodologia pràctica per calibrar agents sense dependre de conjunts de dades de validació externs. Q2BSTUDIO, com a empresa especialitzada en desenvolupament de programari i tecnologia, aplica aquests principis per dissenyar sistemes d'agents que no només executen tasques amb alta precisió, sinó que també comuniquen el seu nivell d'incertesa, permetent als usuaris prendre decisions informades. La integració d'aquest senyal d'inconsistència en plataformes cloud com AWS o Azure permet escalar les execucions paral·leles necessàries per a la predicció selectiva, mentre que les solucions de ciberseguretat asseguren que les rutes divergents no exposin vulnerabilitats.
En l'àmbit de Business Intelligence, la variabilitat dels agents pot incorporar-se com una mètrica addicional en panells de Power BI, oferint als analistes una visió de la fiabilitat de les recomanacions generades per IA. La combinació d'agents LLM amb serveis cloud i eines de BI permet a les empreses optimitzar els seus fluxos de decisió, reduint el risc d'errors costosos. Q2BSTUDIO ofereix serveis de consultoria i desenvolupament que abasten des de la implementació d'infraestructura cloud fins a la creació de sistemes d'agents amb mecanismes d'incertesa integrats.
La ciberseguretat també es beneficia d'aquest enfocament: en identificar patrons d'inconsistència, es poden detectar comportaments anòmals que podrien indicar atacs o fallades. Els serveis de pentesting de Q2BSTUDIO analitzen com la variabilitat dels agents pot ser explotada per actors maliciosos, i proposen contramesures basades en la calibració selectiva. En definitiva, la inconsistència dels agents LLM no és un problema a eliminar, sinó un senyal valuós que, correctament interpretat, millora la robustesa i la confiança en els sistemes d'intel·ligència artificial. Q2BSTUDIO ajuda les empreses a transformar aquesta variabilitat en un avantatge competitiu, integrant solucions d'IA, cloud, BI i ciberseguretat per construir el futur de l'automatització intel·ligent.





