Un estudi recent sobre arquitectures de transformers ha posat sobre la taula una pregunta clau: les capes feed-forward són realment necessàries en els models de llenguatge? Els investigadors van entrenar models d'atenció pura —anomenats Simple Attention Networks (SAN)— i els van comparar amb transformers convencionals, ajustant paràmetres, cost computacional i profunditat. Els resultats mostren que, en reassignar el pressupost de les capes feed-forward cap a una major profunditat en atenció, la bretxa de rendiment es redueix a només 0,006 nats, una diferència pràcticament insignificant. No obstant això, aquest avantatge ve amb un matís important: els models només d'atenció són excel·lents en tasques que depenen del context immediat, però flaquegen quan necessiten recuperar coneixement emmagatzemat als pesos de la xarxa. Això té implicacions directes per al desenvolupament de sistemes d'intel·ligència artificial en entorns empresarials, on sovint es requereix combinar raonament contextual amb memòria paramètrica.
La investigació, publicada a arXiv, va analitzar models des de 2 fins a 48 capes i pressupostos d'entrenament de fins a 105 mil milions de tokens. Van descobrir que les matrius d'enrutament (Q/K) es cristal·litzen d'hora, mentre que les matrius de contingut acumulen rang lentament. En eliminar les capes feed-forward, aquesta acumulació es trasllada a la projecció de sortida d'atenció. A més, la normalització QK manté entrenables els stacks només d'atenció fins i tot amb 48 capes, mentre que les capes feed-forward o el gating residual no són determinants. El dèficit de rendiment es concentra en prediccions amb poc context, i en el pressupost més gran desapareix completament en aquests casos. Una prova preregistrada a FineWeb-edu va confirmar una bretxa de 0,04 nats en text dens en coneixement, validant la hipòtesi.
Què significa això per a les empreses que busquen implementar solucions d'intel·ligència artificial eficients i escalables? Que l'arquitectura d'atenció pura pot ser una opció viable quan el context és ric i el cost computacional és crític. En escenaris de chatbots, assistents virtuals o sistemes de recomanació basats en context immediat, un model només d'atenció podria oferir un rendiment comparable amb una despesa energètica i de maquinari molt menor. D'altra banda, per a aplicacions que requereixen coneixement factual emmagatzemat —com recerca empresarial o compliment normatiu—, continua sent recomanable mantenir les capes feed-forward o hibridar amb mecanismes de recuperació externa.
A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entenem que no hi ha una talla única per a la IA. Per això oferim serveis de consultoria i desenvolupament d'aplicacions a mida, adaptant l'arquitectura de models a les necessitats específiques de cada negoci. Per exemple, si una empresa necessita un sistema d'anàlisi de dades en temps real amb Power BI, podem integrar agents d'IA que processin llenguatge natural i generin informes contextuals sense dependre de grans models genèrics. Per a entorns regulats, la nostra branca de ciberseguretat garanteix que els models només d'atenció, en tenir una superfície d'atac paramètrica més petita, es puguin desplegar de forma segura al núvol (AWS o Azure) amb controls d'accés i auditoria.
La flexibilitat és clau: mentre que els transformers convencionals requereixen una inversió significativa en GPU i emmagatzematge, els models d'atenció pura poden executar-se en maquinari més modest, reduint el cost total de propietat. Això és especialment rellevant per a pimes que volen adoptar IA sense comprometre el seu pressupost. A més, en eliminar capes feed-forward, es simplifica la interpretabilitat del model, un factor cada cop més demandat en sectors com finances o salut.
En l'àmbit de l'automatització de processos, els agents d'IA basats en atenció pura poden gestionar fluxos de treball complexos amb dependències contextuals —per exemple, en la gestió d'incidències IT o en l'orquestració de pipelines de dades—. Combinats amb serveis al núvol com AWS Lambda o Azure Functions, aquests agents escalen de forma elàstica i només consumeixen recursos quan s'activen. El nostre equip a Q2BSTUDIO ha implementat solucions híbrides que utilitzen atenció pura per al raonament en temps real i capes feed-forward per al coneixement estàtic, aconseguint un equilibri òptim entre precisió i eficiència.
Finalment, la investigació també obre la porta a nous paradigmes d'entrenament. Si les matrius d'enrutament es cristal·litzen aviat, es podria congelar part del model d'hora i centrar l'esforç computacional en les capes de contingut. Això podria accelerar el fine-tuning de models preentrenats per a casos d'ús empresarials, reduint el temps de desenvolupament de setmanes a dies. Imagina un sistema de BI que aprèn els patrons de la teva empresa amb només uns quants exemples, o un assistent de ciberseguretat que detecta anomalies basant-se en el context de la xarxa sense necessitar un dataset massiu d'atacs.
En conclusió, l'estudi controlat de transformers només d'atenció demostra que l'arquitectura d'atenció pura és molt més potent del que es creia, especialment quan s'optimitza la profunditat i es reassigna el pressupost de paràmetres. Per a les empreses, això es tradueix en una oportunitat per construir sistemes d'IA més lleugers, ràpids i econòmics, sense sacrificar rendiment en tasques contextuals. A Q2BSTUDIO estem preparats per guiar aquesta transformació, oferint des del disseny de models personalitzats fins al seu desplegament segur al núvol, passant per la integració amb eines de BI i l'automatització de processos. La investigació ens recorda que, de vegades, menys és més: amb l'arquitectura adequada, l'atenció pot fer la resta.




