Instrucció multimodal reorganitza la codificació geomètrica d'identitat

Estudi mostra que la instrucció multimodal reorganitza la codificació d'identitat en transformers: de direcció a magnitud, amb canvis significatius en la

martes, 28 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Cómo cambia la dirección a la magnitud en transformers

Un estudi recent publicat a arXiv (2607.09842) revela una troballa fascinant sobre com els models de llenguatge de gran escala (LLMs) codifiquen la identitat en les seves representacions internes. La investigació mostra que l'ajust fi per instruccions multimodals provoca una reorganització fonamental en la geometria dels estats ocults: la codificació de la identitat passa d'estar basada en la direcció dels vectors a dependre de la seva magnitud. Aquest canvi, detectat mitjançant mètriques com la distància de Wasserstein entre distribucions de curvatura d'Ollivier-Ricci en grafs de trajectòries, té implicacions profundes per al desenvolupament d'aplicacions d'intel·ligència artificial que requereixen un comportament consistent i alineat amb la identitat d'una marca o sistema.

L'experiment va analitzar quatre models de llenguatge de pes obert sota diferents règims de post-entrenament: un model base sense entrenament addicional (Gemma-4-E4B base), un model amb RLHF multimodal (Gemma-4-E4B-it), un amb destil·lació per reforç (DeepSeek-R1-Distill-Qwen-7B) i un amb ajust fi supervisat (Qwen2.5-7B-Instruct). Es van comparar tres condicions de prompt: un prompt que especificava una identitat, un prompt genèric d'assistent i una línia base de 26 tokens. La mètrica principal va ser la distància 1-Wasserstein entre les distribucions de curvatura d'Ollivier-Ricci en les arestes d'un graf k-NN construït a partir de les trajectòries d'estats ocults. Els resultats van mostrar que en el model base la identitat es codifica en la direcció de les trajectòries (separació angular significativa, p=0.002), mentre que en el model amb instrucció multimodal aquesta codificació migra a la magnitud (la separació angular deixa de ser significativa, p=0.439, però la magnitud mostra diferències, p=0.042, i la norma mitjana del primer estat generat s'inverteix, sent menor per al prompt d'identitat). Aquest patró és exclusiu del règim d'instrucció multimodal i no apareix sota destil·lació ni SFT.

Per què hauria d'importar-li això a una empresa de desenvolupament de programari? Perquè la forma en què un model d'intel·ligència artificial representa la seva identitat afecta directament la confiança de l'usuari, la consistència de les respostes i la capacitat de personalització. Quan es construeixen aplicacions a mida que integren assistents virtuals, agents d'IA o sistemes de recomanació, és crucial que el model mantingui una identitat coherent al llarg de les interaccions. Aquest estudi suggereix que l'ajust fi per instruccions multimodals, com el que es realitza en sistemes que combinen text i imatges, pot alterar aquesta codificació de manera previsible. Per a empreses com Q2BSTUDIO, especialitzades en programari a mida, aquesta informació és invaluable per dissenyar pipelines d'ajust fi que preservin o modifiquin intencionadament la identitat del model segons els requisits del client.

Des de la perspectiva tècnica, l'ús de la curvatura d'Ollivier-Ricci com a eina de diagnòstic per a xarxes neuronals obre noves possibilitats per al monitoratge de qualitat en sistemes d'IA. En lloc de dependre únicament de mètriques de rendiment com la precisió o el recall, els desenvolupadors poden inspeccionar la geometria interna de les representacions per detectar desviacions en la codificació de la identitat. Això és particularment rellevant en l'àmbit de la ciberseguretat, on un agent d'IA que canvia la seva identitat de manera inadvertida podria ser explotat per a atacs de suplantació o manipulació. Q2BSTUDIO incorpora aquests coneixements en els seus serveis de ciberseguretat, oferint avaluacions de robustesa de models d'IA.

A més, la reorganització de la codificació de la identitat té implicacions per al desplegament en entorns cloud, com AWS o Azure. En aplicacions multicapa on el model d'IA actua com a interfície amb l'usuari, la consistència de la identitat és clau per a l'experiència del client. Els serveis cloud de Q2BSTUDIO garanteixen que els models es despleguin amb configuracions que mantinguin la coherència de la identitat, ja sigui mitjançant ajustos en el prompt o arquitectures de xarxa específiques. Així mateix, en l'àmbit del Business Intelligence (Power BI), la integració d'assistents de llenguatge natural que mantinguin una identitat corporativa consistent pot millorar l'adopció d'eines analítiques.

Un altre aspecte destacat de l'estudi és el mètode de control mitjançant teacher-forcing, que va atribuir aproximadament un 30% del senyal cosinus en mode lliure a efectes del prompt. Això subratlla la importància del disseny acurat dels prompts en producció, especialment per a agents d'IA que han d'interactuar en contextos multimodals. Les empreses que desenvolupen aplicacions amb models de llenguatge han de considerar no només el contingut, sinó també la forma en què el model internalitza la identitat. Per exemple, un agent d'IA per a atenció al client entrenat amb instruccions multimodals pot necessitar un enfocament d'ajust fi diferent per preservar la personalitat de la marca.

En conclusió, aquest estudi representa un avenç significatiu en la comprensió de com els models de llenguatge codifiquen la identitat i com l'ajust fi per instruccions multimodals reorganitza aquesta representació geomètrica. Per a Q2BSTUDIO, com a empresa pionera en desenvolupament de programari i tecnologia, aquest coneixement s'integra directament en la metodologia de creació de solucions d'intel·ligència artificial, ciberseguretat, cloud i BI. La capacitat de mesurar i controlar la codificació de la identitat mitjançant mètriques geomètriques ofereix un avantatge competitiu en la construcció de sistemes d'IA robustos, fiables i alineats amb les necessitats de cada client. La investigació continua, però una cosa és clara: la identitat ja no és només una qüestió de contingut, sinó de geometria.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.