Posicions relatives generalitzen, absolutes memoritzen: biaix implícit en atenció

Descobreix com el biaix implícit del descens de gradient explica per què les codificacions rotatòries generalitzen a seqüències llargues mentre que les

jueves, 23 de julio de 2026 • 3 min de lectura • Equip Q2BSTUDIO

Sesgo implícito del gradiente en atención y extrapolación

En el desenvolupament de models de llenguatge basats en transformers, l'elecció del codificat posicional determina si un sistema pot generalitzar a seqüències més llargues de les que ha vist durant l'entrenament. Mentre que els codificats relatius (com Rotary Position Embedding, RoPE) extrapolen de manera natural, els absoluts tendeixen a memoritzar posicions concretes i fallen en sortir d'aquest rang. Aquest fenomen no és només una curiositat acadèmica: afecta directament el rendiment d'aplicacions reals d'intel·ligència artificial, des d'assistents conversacionals fins a sistemes d'anàlisi de dades al núvol.

Investigacions recents han aportat una explicació basada en el biaix implícit de l'optimització. En tasques mínimes de recuperació amb un desplaçament fix, el gradient descendent selecciona, entre les infinites solucions que ajusten correctament les seqüències curtes, aquella que minimitza la norma o que explota la simetria del problema. Amb codificats rotatoris, el logit d'atenció depèn exclusivament de la distància relativa entre tokens, una equivariança exacta que fa que la regla apresa es repliqui sense canvis a qualsevol longitud major. Per contra, els codificats absoluts deixen sense restringir les posicions fora del rang d'entrenament, i el model fixa la seva atenció en una posició absoluta coneguda, quedant cec en extrapolar.

L'estudi demostra que aquesta conducta no és un accident de l'arquitectura, sinó una conseqüència matemàtica de la normalització softmax i la dinàmica de gradient. Quan se substitueix softmax per atenció lineal, el biaix desapareix: l'entrenament selecciona un interpolant de mínima norma que no generalitza. Aquest resultat connecta directament amb la pràctica empresarial: per construir sistemes robusts de programari a mida que processin documents extensos, xats llargs o fluxos de dades temporals, és crític escollir el codificat posicional adequat.

Des del punt de vista tècnic, RoPE aprèn un nucli portador de baix rang alineat amb el desplaçament objectiu, produint una llei de dilució d'atenció previsible: la precisió decau de forma suau i controlada a mesura que creix la longitud de la seqüència. Aquest comportament contrasta amb el col·lapse abrupte dels codificats absoluts, que simplement deixen de funcionar més enllà de la finestra d'entrenament.

Per a una empresa com Q2BSTUDIO, especialitzada en el desenvolupament d'aplicacions amb intel·ligència artificial, aquestes diferències tenen implicacions directes. Per exemple, en integrar models de llenguatge en solucions de cloud AWS/Azure, la capacitat d'escalar a contextos més llargs sense reentrenar estalvia costos computacionals i millora l'experiència d'usuari. De la mateixa manera, en sistemes de ciberseguretat que analitzen logs de gran volum, o en panells de Business Intelligence amb Power BI que processen sèries temporals extenses, la generalització posicional evita el retraining constant.

A més, la connexió amb el biaix implícit de models recurrents obre la porta a arquitectures híbrides. Els agents IA actuals necessiten gestionar diàlegs prolongats i memòries de context; comprendre com es propaga l'atenció en presència de diferents codificats permet dissenyar sistemes més eficients i fiables. L'automatització de processos de programari, un altre dels serveis clau de Q2BSTUDIO, es beneficia directament de models que no requereixen ajustaments continus quan canvien els volums de dades.

En resum, l'elecció entre codificats relatius i absoluts no és un detall tècnic menor: reflecteix un biaix d'optimització fonamental. Mentre els relatius generalitzen, els absoluts memoritzen. Per a qualsevol projecte d'IA que aspiri a escalar de forma robusta, des d'aplicacions web fins a assistents corporatius, comprendre aquest mecanisme és tan important com triar l'algoritme d'entrenament correcte. A Q2BSTUDIO integrem aquest coneixement en cada solució que desenvolupem, garantint que els nostres models es comportin de forma previsible fins i tot més enllà de les dades vistes durant l'entrenament.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.