STOCKTAKE: bretxa entre percepció i acció en agents LLM

Descobreix com STOCKTAKE mesura la bretxa entre el que els agents LLM perceben i el que fan, usant un oracle just per avaluar errors en decisions complexes.

lunes, 27 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Evaluando fallos ocultos de agentes con un oráculo justo

En el món de la intel·ligència artificial aplicada a processos empresarials, els agents LLM (Large Language Models) estan assumint tasques cada cop més complexes que requereixen decisions seqüencials al llarg de setmanes o mesos. Un problema recurrent és que l'estat real de l'entorn —aquell factor ocult que realment impulsa els costos— mai no s'observa directament. Quan un agent falla, no sabem si no va saber interpretar correctament la informació disponible (fallada de percepció) o si, tot i saber què passava, no va actuar a temps (la coneguda bretxa entre saber i fer, o knowing-doing gap).

Per abordar aquesta dualitat, el recent estudi acadèmic que introdueix STOCKTAKE proposa un benchmark de 26 setmanes en la cadena de subministrament, modelat com un procés de decisió de Markov parcialment observable i amb sis factors ocults. La seva principal innovació és que permet calcular una política de referència justa: un filtre de Bayes exacte per factor que, alimentat amb la mateixa seqüència d'observacions que rep l'agent, genera una línia base contra la qual mesurar el rendiment real. D'aquesta manera, es pot calcular un skill score entre 0 (política cega que ignora símptomes) i 1 (oracle perfecte), i a més, analitzant les justificacions setmanals de l'agent, es detecta el retard en la identificació d'estats ocults i la taxa de knowing-doing.

Els resultats inicials, obtinguts amb models tan avançats com Claude Sonnet 5, GPT-5.4, DeepSeek-V4-Pro i Grok 4.5, revelen una paradoxa: tots detecten entre el 84% i el 88% de les fallades ocultes, normalment a la mateixa setmana d'inici, però les seves puntuacions d'habilitat oscil·len entre 0,62 i -0,23. És a dir, dos dels quatre models acaben per sota del llindar de la política cega, tot i identificar els factors gairebé igual de ràpid que els que el superen. Què està fallant?

L'estudi identifica dues cares de la mateixa moneda. D'una banda, quan l'estrès persisteix, entre el 34% i el 43% de les setmanes en què l'agent diagnostica correctament l'estat ocult acaben en desabastiment (stockout). Això indica una subresposta: l'agent sap que alguna cosa va malament però no ajusta la seva acció prou. No obstant, la paradoxa s'accentua: els dos models que queden per sota del sòl són els que menys desabastiments pateixen en les setmanes diagnosticades. El seu problema no és la inacció, sinó l'excés de reacció: ajusten la cadena de subministrament de manera tan agressiva que el cost de les seves accions supera el benefici d'evitar la ruptura d'estoc. En altres paraules, la knowing-doing gap té dues direccions: no fer prou, i fer massa.

Per a una empresa que desitgi implementar agents d'IA en les seves operacions d'aprovisionament, logística o planificació financera, aquesta troballa és crucial. No n'hi ha prou que l'agent sigui capaç de llegir l'entorn; ha de calibrar també les seves respostes per optimitzar l'equilibri entre risc i cost. Aquí és on entra la capacitat de personalització i monitorització que oferim a Q2BSTUDIO, una companyia especialitzada en el desenvolupament d'aplicacions a mida que integren intel·ligència artificial, automatització de processos i anàlisi de negoci.

La nostra metodologia consisteix a construir agents LLM que no només perceben i decideixen, sinó que també generen explicacions traçables. Gràcies a la combinació d'IA amb solucions de cloud AWS/Azure i ciberseguretat, podem desplegar entorns d'entrenament i avaluació similars a STOCKTAKE per a cada cas d'ús empresarial. A més, la integració amb BI/Power BI permet visualitzar en temps real tant la taxa d'encert en la percepció com l'eficiència de les accions, tancant el cicle de millora contínua.

El benchmark STOCKTAKE ens recorda que, en l'àmbit dels agents IA, la precisió en l'estimació de l'estat no és suficient. La bretxa entre percepció i acció pot manifestar-se de formes oposades: subactuació o sobreactuació. A Q2BSTUDIO ajudem les empreses a dissenyar sistemes que mesurin ambdues dimensions i ajustin les seves polítiques de control amb algorismes d'optimització dinàmica. Per exemple, per a un client del sector retail vam implementar un agent de reposició que, després de detectar un patró de demanda anòmal, no només llançava comandes d'emergència, sinó que també avaluava si el cost d'aquestes comandes superava el possible lucre cessant, reduint l'excés d'inventari en un 18%.

En definitiva, la lliçó de STOCKTAKE és que avaluar un agent LLM només pel seu resultat final és enganyós. Necessitem eines que descomponguin la fallada en els seus components de percepció i acció. Aquestes eines, combinades amb plataformes flexibles d'automatització i aplicacions a mida, permeten a les organitzacions no només desplegar agents més intel·ligents, sinó també entendre per què encerten o fallen. A Q2BSTUDIO estem compromesos a tancar aquesta bretxa, oferint solucions que van des de la consultoria en IA fins a la implementació completa de sistemes multiagent en entorns cloud híbrids.

Si la seva empresa està explorant l'ús d'agents autònoms per a la presa de decisions en cadena de subministrament, finances o atenció al client, el convidem a contactar-nos. Junts podem dissenyar un marc d'avaluació que mesuri tant la percepció com l'acció, i evitar així que el seu agent —per molt intel·ligent que sembli— acabi caient en el parany de la bretxa entre saber i fer.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.