CIGPO: optimització de polítiques amb guany d'informació contextual

CIGPO supera el col·lapse de GRPO i millora un 105% el F1 a HotpotQA gràcies a recompenses per torn basades en guany d'informació. Descobreix-ho.

sábado, 25 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Cómo evitar el colapso de recompensas en GRPO

En el camp de l'aprenentatge per reforç aplicat a models de llenguatge, l'optimització de polítiques per a agents que llegeixen i raonen a través de múltiples torns d'evidència és un repte conegut. El problema central rau en que, quan s'utilitza únicament la recompensa final (outcome-only), els passos intermedis no reben crèdit directe, provocant inestabilitat en l'entrenament. Un estudi recent sobre HotpotQA amb el model Qwen2.5-3B-Instruct revela que GRPO (Group Relative Policy Optimization) millora inicialment la mètrica F1 estàndard fins a 0.430, però després col·lapsa produint sortides que violen el format en un 100%. Aquest fenomen, identificat com a 'bloqueig d'avantatge zero' (zero-advantage lock-in), ocorre quan totes les trajectòries mostrejades reben la penalització mínima de format, els avantatges relatius al grup s'anul·len i el gradient de la política es torna zero, generant un punt mort d'optimització.

Per superar aquest bloqueig, els investigadors proposen una estratègia d'injecció de variància: assignar recompenses per torn als passos intermedis de lectura d'evidència. Això evita que la distribució de recompenses del grup col·lapsi a un únic valor, preservant la variació que GRPO necessita per calcular avantatges relatius. D'aquesta estratègia neix CIGPO (Contextual Information-Gain Policy Optimization), que utilitza l'increment marginal en la log-versemblança del model de referència congelat respecte a la resposta correcta com a senyal per torn. Amb una normalització separada de les recompenses de guany d'informació (IG) i F1, a més d'un pla d'estudis ponderat per IG, CIGPO assoleix un F1 estàndard de 0.518 a HotpotQA a escala 3B (des de 0.252 base; +105%), superant el millor checkpoint de GRPO (0.430) i evitant el col·lapse total.

Les implicacions tècniques d'aquesta troballa són profundes per al desenvolupament d'agents d'IA que han de raonar sobre múltiples fonts d'informació. En entorns empresarials, on l'automatització de processos complexos requereix interaccions llargues i precises —com la lectura de documents legals, la consolidació de dades financeres o l'atenció al client multicanal—, el col·lapse de la variància de recompensa és un risc real. Els models entrenats amb només recompensa final tendeixen a ignorar passos intermedis valuosos o a produir respostes que compleixen el format però manquen de substància. CIGPO ofereix un mecanisme robust per mantenir senyals d'aprenentatge significatius a cada etapa.

Des de la perspectiva d'una empresa tecnològica com Q2BSTUDIO, especialitzada en desenvolupament d'aplicacions a mida, la incorporació de tècniques avançades d'optimització de polítiques en models de llenguatge és un habilitador clau per a projectes de transformació digital. Imaginem un sistema de ciberseguretat que analitza logs de xarxa en temps real: cada esdeveniment ha de ser avaluat contextualment abans d'emetre una alerta. Un agent entrenat amb CIGPO podria assignar recompenses a cada pas d'anàlisi intermedi, evitant falsos positius gràcies a una comprensió més granular. De la mateixa manera, en un projecte de Business Intelligence amb Power BI, on es consulten múltiples fonts de dades per generar informes, un assistent d'IA que llegeixi i raoni torn per torn pot oferir insights més precisos que un que només optimitza la resposta final.

La infraestructura cloud també juga un paper crucial. En desplegar aquests models en entorns AWS o Azure, l'eficiència computacional i l'escalabilitat determinen l'èxit de la implementació. Q2BSTUDIO ofereix serveis cloud a AWS/Azure que permeten executar entrenaments amb GRPO o CIGPO en clústers escalables, gestionant l'orquestració de contenidors i l'emmagatzematge de grans volums de dades. A més, la monitorització de la variància de recompensa durant l'entrenament es converteix en una mètrica operativa essencial, similar a la monitorització d'errors en aplicacions crítiques.

En l'àmbit de l'automatització intel·ligent, els agents que processen tasques de diversos passos —com l'extracció de dades de factures i la seva posterior classificació comptable— es beneficien directament de la injecció de variància per torn. Sense ella, el model podria convergir a una política que simplement repeteix un format sense extreure informació rellevant. CIGPO garanteix que cada pas d'extracció rebi un senyal d'aprenentatge, millorant la precisió global del flux automatitzat.

Més enllà del cas concret d'HotpotQA, la lliçó fonamental és que l'estabilitat de l'entrenament en reforç no depèn només de la funció de recompensa, sinó també de com es distribueix aquesta recompensa al llarg de la seqüència de decisions. Els enginyers d'aprenentatge automàtic que treballen amb intel·ligència artificial han de considerar la variància de recompensa com una variable de disseny, no com un accident. La normalització separada de senyals de diferents naturaleses (com IG i F1) i l'ús de plans d'estudis (curriculum learning) són pràctiques transferibles a altres dominis, com la robòtica o els jocs d'estratègia.

Per a una consultora de programari com Q2BSTUDIO, oferir solucions basades en models de llenguatge avançats implica no només entrenar models, sinó també dissenyar l'arquitectura de recompenses que guiï el seu aprenentatge. La integració de tècniques com CIGPO en plataformes de desenvolupament permet als clients obtenir models més fiables i menys propensos a col·lapses. Per exemple, en un sistema d'atenció al client automatitzat, cada torn de diàleg pot rebre una recompensa basada en el guany d'informació contextual, assegurant que l'assistent no es desviï cap a respostes genèriques.

En conclusió, CIGPO representa un avenç significatiu en l'optimització de polítiques per a agents multitud d'evidència, en resoldre el bloqueig d'avantatge zero mitjançant l'assignació de recompenses per torn. Aquest enfocament no només millora el rendiment en benchmarks com HotpotQA, sinó que ofereix un marc conceptual aplicable a qualsevol sistema que requereixi raonament seqüencial. Les empreses que busquen implementar automatització de processos amb agents intel·ligents han de considerar la variància de recompensa com un pilar de la seva estratègia d'entrenament. Amb el suport adequat en infraestructura cloud i desenvolupament a mida, Q2BSTUDIO està en una posició òptima per ajudar els seus clients a aprofitar aquestes tècniques, garantint solucions d'IA robustes, escalables i alineades amb els objectius de negoci.

La investigació sobre CIGPO també obre preguntes interessants: com afecta l'elecció del model de referència congelat a la qualitat del senyal de guany d'informació? És possible combinar recompenses per torn amb funcions d'avantatge basades en el grup sense normalització addicional? Futures treballs hauran d'explorar aquests aspectes, però per ara, la injecció de variància es consolida com una eina essencial per evitar el col·lapse en l'entrenament d'agents de llenguatge.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.