La magnitud i la direcció dels pesos tenen rols disociables en grokking

Descobreix com la magnitud i la direcció dels pesos influeixen en el grokking i revelen mecanismes ocults de l'aprenentatge.

viernes, 31 de julio de 2026 • 6 min de lectura • Equip Q2BSTUDIO

Qué revelan los experimentos quimera sobre el grokking

La magnitud i la direcció dels pesos tenen rols dissociables en grokking

El comportament d'una xarxa neuronal no s'explica només per les seves mètriques globals. La recerca recent en interpretabilitat ha començat a separar els factors que fan que una solució apresa sigui generalitzable, estable o transferible. Un dels resultats més suggerents és que, dins d'un mateix procés d'entrenament, no tots els components dels pesos tenen el mateix paper. En descompondre cada vector de pesos en dues parts, magnitud i direcció, s'observen funcions complementàries. Per a una empresa tecnològica, entendre aquesta distinció no és una curiositat acadèmica: és una palanca per construir sistemes d'IA més predictibles, auditables i mantenibles. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, seguim de prop aquestes evidències per aplicar-les en projectes reals d'intel·ligència artificial, automatització i dades.

El fenomen conegut com a grokking descriu una transició curiosa en l'aprenentatge automàtic. Un model sembla primer memoritzar els exemples d'entrenament i, en aparença, no generalitza. De sobte, després de moltes èpoques, alguna cosa canvia i el model adquireix la capacitat de respondre correctament a casos nous. Durant molt de temps es va tractar aquest salt com un efecte global: la xarxa, en madurar, reorganitzava completament les seves representacions. La mirada actual és més precisa. Els vectors de pesos poden separar-se en dos components amb rols diferents: la magnitud, que defineix l'escala del vector, i la direcció, que defineix la seva orientació en l'espai de paràmetres. La hipòtesi central és que la direcció guarda la identitat del circuit après, mentre que la magnitud modula la facilitat amb què aquesta identitat pot imposar-se o ser reemplaçada.

Per comprovar aquesta idea s'han dissenyat experiments d'intervenció creuada entre dues xarxes independents. En lloc de treballar amb una sola trajectòria d'entrenament, es combinen parts de dues execucions que parteixen de llavors diferents. Es pren la magnitud d'una xarxa i la direcció d'una altra, es forma un model intermedi i es continua entrenant. El resultat és cridaner: la direcció sembla portar una signatura del circuit que la xarxa va desenvolupar. Si s'implanta la direcció d'un donant en un receptor, el receptor acaba adoptant el circuit del donant en una gran majoria de casos. Un control amb una orientació aleatòria però amb la mateixa distància angular no produeix aquest desplaçament. Això indica que la direcció no és un mer subproducte de l'entrenament; és la part del model que transporta la solució.

La magnitud, en canvi, té un paper més subtil. No defineix quin circuit s'adopta, sinó quan i amb quina facilitat s'adopta. Els experiments mostren que l'efecte d'implantar una direcció aliena depèn del nivell de magnitud del receptor. Per sota d'un cert llindar, el receptor sembla resistir-se al canvi; per sobre, la nova direcció s'imposa ràpidament. El rellevant és que aquest llindar és molt nítid. No es tracta d'un gradient suau on la influència augmenta a poc a poc, sinó d'un comportament gairebé digital: hi ha un punt a partir del qual el sistema canvia de règim. A més, aquesta frontera es pot localitzar amb precisió mitjançant mètodes de cerca adaptativa, cosa que confirma que magnitud i direcció són variables relativament independents.

Les implicacions d'aquesta troballa van més enllà de la ciència bàsica. En el desenvolupament de programari empresarial, els models d'IA no viuen aïllats: s'integren en aplicacions de missió crítica, s'actualitzen, es combinen amb altres algorismes i es despleguen al núvol. Si una part concreta del model és la que transporta la identitat del comportament, les organitzacions necessiten eines per identificar i controlar aquesta part. En cas contrari, una actualització aparentment menor podria canviar la conducta del sistema sense que les mètriques habituals ho reflecteixin.

Q2BSTUDIO aplica aquesta perspectiva en el disseny d'aplicacions a mida. Quan un client necessita un programari que incorpori intel·ligència artificial, no n'hi ha prou a connectar un model preentrenat. Cal definir com es comporta l'aplicació davant de contextos canviants, com s'actualitza el model i com se n'audita la decisió. Entendre que la magnitud i la direcció tenen rols separats ajuda a construir sistemes amb arquitectures més modulars. Per exemple, separar la lògica de negoci de la lògica d'inferència permet canviar el model sense reescriure tota l'aplicació, sempre que es respecti la identitat funcional que el sistema ha de conservar.

En el camp dels agents d'IA, aquesta distinció també és útil. Un agent no és un sol model; és una composició de models, instruccions, memòria i eines. El seu comportament estable depèn d'una mena d'orientació interna, una identitat que s'ha de mantenir fins i tot quan les dades d'entrada canvien. La recerca sobre grokking suggereix que aquesta identitat es pot transferir o modificar de manera selectiva. En la pràctica, això significa que podem dissenyar agents amb una base comuna i després ajustar només l'escala o el context, en lloc de reentrenar cada vegada tot el sistema. Aquesta manera de treballar encaixa amb els desenvolupaments d'automatització i agents d'IA que realitzem a Q2BSTUDIO.

La ciberseguretat és un altre dels àmbits on aquest coneixement té aplicació directa. Si la identitat d'un model es concentra en la direcció dels seus pesos, un atac podria intentar modificar aquesta orientació de manera subtil, sense alterar les mètriques globals de rendiment. Per això, les auditories de sistemes d'IA han d'anar més enllà de la precisió i el biaix. Cal inspeccionar els components interns que determinen el comportament. En els nostres serveis de ciberseguretat incorporem proves específiques per a models en producció, incloent anàlisi de robustesa davant de petites pertorbacions en els pesos. Aquesta visió permet detectar vulnerabilitats que els tests convencionals no veuen.

La infraestructura també importa. Plataformes com AWS i Azure ofereixen un entorn adequat per executar, versionar i monitorar models. Però el núvol per si sol no aporta comprensió. Cal decidir quines mètriques observar i com interpretar-les. La recerca sobre magnitud i direcció suggereix que l'observabilitat d'un model no s'hauria de limitar a l'error o a l'exactitud. Variables com l'orientació interna, la distància respecte a versions anteriors o la sensibilitat a canvis d'escala poden ser més predictives del comportament futur. Amb eines de BI/Power BI és possible construir quadres de comandament que integrin aquests senyals i ajudin els equips tècnics i de negoci a prendre decisions amb criteri.

A Q2BSTUDIO combinem visió tècnica i perspectiva empresarial. El coneixement de com aprenen els models no es queda en un laboratori; es tradueix en pràctiques d'enginyeria concretes. Per exemple, abans de desplegar un nou model, mesurem no només la seva precisió, sinó també la seva compatibilitat amb la identitat funcional del sistema existent. Això redueix riscos i evita comportaments inesperats. Pensar en termes de components de pes, en lloc de tractar el model com una caixa opaca, permet establir protocols de reentrenament, versionat i transferència molt més segurs.

La conclusió és clara: la interpretabilitat està deixant de ser un tema exclusivament acadèmic per convertir-se en un avantatge competitiu. Les organitzacions que entenen què hi ha dins dels seus models poden gestionar-los millor, explicar-los amb més confiança i adaptar-los amb menys fricció. La dissociació entre magnitud i direcció en grokking és un exemple de com un resultat científic pot il·luminar el disseny de programari real. A Q2BSTUDIO ajudem les empreses a incorporar aquestes idees, integrant IA, ciberseguretat, núvol i BI en solucions de programari a mida que són intel·ligents, transparents i sostenibles.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.