La intel·ligència artificial avança a passos de gegant, però un dels colls d'ampolla més persistents continua sent la gestió de la memòria. Tradicionalment, els models de llenguatge i sistemes d'IA han tractat cada token —cada paraula, caràcter o fragment— com una unitat de memòria, independentment de si aquest token aporta informació nova o és redundant. Aquest enfocament funciona bé en contextos curts, però es torna ineficient a mesura que les seqüències s'allarguen: el cost computacional creix de forma lineal o fins i tot quadràtica amb la longitud del context, mentre que la informació realment útil sol ser molt més compacta. Una línia d'investigació emergent proposa un canvi de paradigma: que la memòria de l'IA escali amb la quantitat d'informació distinta, no amb el nombre de tokens. Aquest principi, que alguns anomenen 'cau de novetat', permet que el model retingui només allò que realment importa, obrint la porta a sistemes més eficients, auditables i escalables.
El concepte és senzill però poderós. En lloc d'emmagatzemar una entrada per a cada token en una clau-valor o comprimir-ho tot en un estat recurrent, s'obre una ranura al cau únicament quan una clau entrant és nova. Així, la memòria no se satura amb repeticions, sinó que reflecteix la diversitat real del flux d'informació. Els experiments amb control a nivell de caràcter mostren que una atenció basada en novetat pot assolir el rendiment d'una atenció completa atenent només a la meitat dels tokens, i l'avantatge creix com més llarg és el context. Això té implicacions profundes per a aplicacions empresarials on les dades són extenses, redundants o contenen patrons repetitius, com registres mèdics, logs de sistemes o transaccions financeres.
Des d'una perspectiva tècnica, aquest enfocament permet organitzar el context segons la naturalesa de la tasca. La informació que ha de ser recuperada mitjançant associació directa (recall) s'allotja en un cau de novetat direccionable per contingut. La informació que necessita ser resumida o promediada es gestiona mitjançant un estat recurrent. I la informació que depèn de la proximitat temporal es maneja amb una finestra de recència. Aquesta arquitectura de memòria de treball, on cada component compleix un rol específic, és especialment rellevant per a sistemes que han d'equilibrar cost, precisió i transparència. Per exemple, en la predicció de codis de Medicare sintètics, el component acoblat (cau de novetat + resum d'estat) va superar tant l'atenció completa com totes les polítiques d'expulsió de pressupost fix en un horitzó de mil esdeveniments. En canvi, quan la tasca era de previsió de costos, que depèn més del resum, el cau va resultar neutre. Això demostra que no existeix una solució única: la clau està en combinar els tipus de memòria adequats per a cada context.
A Q2BSTUDIO entenem que l'eficiència de la IA no només és qüestió d'algoritmes, sinó de com s'integren en solucions reals. Per això, en desenvolupar aplicacions a mida, apliquem aquest principi de memòria selectiva per optimitzar el rendiment en entorns amb grans volums de dades. El nostre equip dissenya arquitectures on els models d'IA no processen cada token cegament, sinó que aprenen a identificar i retenir només la informació distintiva. Això es tradueix en sistemes més ràpids, amb menor consum de recursos i —el que és igualment important— amb una memòria interpretable. A diferència d'un estat recurrent opac, el cau de novetat és una taula inspeccionable de plantilles, codis, medicaments o llocs. Per a un client del sector salut, això significa poder auditar quins registres van influir en una recomanació, complint amb normatives de transparència i privacitat.
La implementació pràctica d'aquest paradigma es recolza en infraestructures cloud modernes. En escalar amb informació distinta, el cost de còmput i emmagatzematge es redueix dràsticament en comparació amb els models que tracten cada token per igual. Això permet desplegar agents d'IA més lleugers i ràpids, capaços d'operar en temps real fins i tot amb contextos llargs. A Q2BSTUDIO oferim serveis cloud AWS/Azure que faciliten la implementació d'aquestes arquitectures optimitzades, tant en entorns d'entrenament com d'inferència. A més, la capacitat d'auditar la memòria és un habilitador clau per a la ciberseguretat: poder inspeccionar quins tokens o patrons van ser retinguts permet detectar biaixos, fuites d'informació o comportaments anòmals en els models. Integrem solucions de ciberseguretat que aprofiten aquesta transparència per validar la integritat dels sistemes d'IA.
L'analítica de negoci també es beneficia. Amb un enfocament de memòria selectiva, els panells de Business Intelligence basats en Power BI poden accedir a resums de dades més precisos i ràpids, ja que el model subjacent no s'ofega en la redundància. A Q2BSTUDIO desenvolupem solucions de BI/Power BI que integren aquests principis, oferint als decisionals informació rellevant sense el soroll de les dades repetitives. I quan parlem d'automatització, els agents d'IA que gestionen processos complexos —des d'atenció al client fins a monitorització d'infraestructures— es tornen més eficients al recordar només allò que realment canvia a cada interacció. El nostre equip implementa automatització de processos i agents IA que apliquen aquesta lògica de memòria nova per reduir costos operatius i millorar l'experiència d'usuari.
Els experiments que donen suport a aquesta aproximació són encara a petita escala i amb dades públiques, però estableixen un primitiu prometedor: el context pot escalar amb informació distinta en lloc de amb tokens, en una memòria de treball direccionable per contingut i auditable. A Q2BSTUDIO creiem que aquesta serà una de les bases de la propera generació de sistemes intel·ligents. Convidem empreses i organitzacions a explorar com aquestes idees poden transformar els seus fluxos de dades, reduint costos i augmentant la transparència. El futur de la IA no està en processar més tokens, sinó en processar millor la informació que realment importa.





