NVIDIA llança Nemotron-Labs-TwoTower: model de difusió amb pesos oberts

NVIDIA llança TwoTower: model de difusió amb pesos oberts que genera text 2.42x més ràpid amb mínima pèrdua de qualitat. Coneix com funciona!

miércoles, 1 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

TwoTower: generació de text 2.42x més ràpida amb 98.7% de qualitat

El llançament del model Nemotron-Labs-TwoTower per part de NVIDIA marca una fita en l'evolució de la generació de text mitjançant intel·ligència artificial. Aquest model de difusió, construït sobre un backbone autorregressiu preentrenat, aborda un dels colls d'ampolla més persistents en la generació de llenguatge: la velocitat de processament seqüencial. Mentre que els models autorregressius tradicionals generen un token alhora —cosa que limita el rendiment en producció—, TwoTower adopta una arquitectura de dues torres que separa la representació del context net de la tasca de refinament de tokens sorollosos. Això permet una generació en paral·lel per blocs, aconseguint un increment de fins a 2.42 vegades en el rendiment de generació amb una pèrdua mínima de qualitat (98.7% del baseline).

Des d'una perspectiva tècnica, l'arquitectura de dues torres resulta particularment interessant. La torre de context, congelada durant l'entrenament, manté les capacitats autorregressives del model base —en aquest cas, el Nemotron-3-Nano-30B-A3B, que combina capes Mamba-2, atenció pròpia i mescla d'experts. La torre denoising, entrenada amb aproximadament 2.1 bilions de tokens —una fracció dels 25 bilions usats per al backbone—, refina blocs de tokens emmascarats mitjançant atenció bidireccional intra-bloc i atenció creuada capa per capa amb la torre de context. Aquest disseny evita el coll d'ampolla de difondre només l'últim estat ocult, com passa en enfocaments previs, i permet un accés multiescala a les representacions del backbone. El resultat és un model que pot operar en tres modes de descodificació: difusió emmascarada, autorregressiu simulat i autorregressiu pur, tot des d'un únic checkpoint de pesos oberts sota la llicència Nemotron Open Model.

Les implicacions pràctiques són enormes per a equips que necessiten generar grans volums de text sintètic, com en la creació de dades d'entrenament, assistents conversacionals o automatització de continguts. La possibilitat d'ajustar el llindar de confiança permet intercanviar qualitat per velocitat segons l'aplicació: amb un llindar de 0.8 s'obté un increment de 2.42× en rendiment amb només un 1.3% de pèrdua en qualitat agregada. A més, el model manté la capacitat de realitzar verificació especulativa o scoring autorregressiu perquè la torre de context conserva el seu cap de llenguatge original.

No obstant, el desplegament en producció requereix planificació. L'execució completa de les dues torres necessita dues GPUs H100 amb aproximadament 59 GB de memòria cadascuna en BF16. Les àrees de codi i matemàtiques mostren una degradació major que el coneixement general, cosa que suggereix que certs casos d'ús tècnic podrien beneficiar-se d'un afinament addicional. Aquest és un camp on la intel·ligència artificial per a empreses pot marcar la diferència, aplicant tècniques de fine-tuning supervisat o instrucció tuning per adaptar el model a dominis específics.

L'arribada de models com TwoTower també obre la porta a noves estratègies en l'arquitectura de sistemes de aplicacions a mida que requereixen processament massiu de llenguatge natural. Per exemple, una plataforma d'anàlisi de documents legals podria beneficiar-se de l'alta velocitat de generació per resumir contractes en lots, mentre que un sistema d'atenció al client podria usar el mode autorregressiu pur per a interaccions que exigeixen precisió absoluta. La flexibilitat de tenir tres modes de descodificació en un sol model simplifica l'arquitectura de programari i redueix la complexitat operativa.

Per a les empreses que busquen integrar aquestes capacitats sense incrementar la càrrega tècnica, els serveis cloud com els que oferim a serveis cloud AWS i Azure permeten desplegar models de difusió a escala, gestionant la infraestructura de GPUs, l'emmagatzematge de models i l'orquestració d'inferència. A més, la combinació d'aquests models amb eines d'intel·ligència de negoci potencia l'anàlisi de dades no estructurades: imagineu un sistema que genera informes automàtics en llenguatge natural a partir de panells de Power BI, o que extreu conclusions de text lliure usant agents IA especialitzats.

La ciberseguretat també es beneficia d'aquesta arquitectura. La capacitat de generar text sintètic d'alta qualitat permet crear conjunts de dades adversarials per entrenar models de detecció de phishing o desinformació. Un equip de seguretat podria usar TwoTower per generar milers de variants de correus fraudulents i provar la robustesa dels seus filtres, tot amb un rendiment que abans requeria clústers molt més grans. A Q2BSTUDIO combinem aquestes tecnologies amb serveis de ciberseguretat i pentesting per oferir solucions integrals als nostres clients.

Un altre aspecte rellevant és l'eficiència en l'entrenament. En congelar la torre de context —que representa la major part dels paràmetres— i entrenar només la torre denoising amb una fracció de les dades, es redueix dràsticament el cost computacional. Això democratitza l'accés a models de llenguatge de frontera per a equips petits que no disposen dels recursos de les grans tecnològiques. Per a una startup que necessita un model de generació d'informes financers, el punt de partida pot ser TwoTower i després refinar-lo amb dades pròpies usant les eines d'automatització de processos que oferim.

En l'horitzó, la separació de funcions en dues torres podria estendre's a altres modalitats: models de difusió per a imatges, àudio o vídeo podrien adoptar arquitectures similars per millorar la velocitat de generació mantenint fidelitat. La investigació de NVIDIA suggereix que l'atenció creuada per capes és clau, i probablement veurem variants que incorporin mecanismes d'atenció dispersa o memòria externa per gestionar seqüències més llargues sense créixer la memòria cau de manera lineal.

Per a les empreses que desenvolupen programari a mida, aquest model representa una oportunitat d'oferir solucions de generació de text amb un equilibri òptim entre velocitat i qualitat. A Q2BSTUDIO ajudem els nostres clients a avaluar si TwoTower és adequat per al seu cas d'ús, realitzem proves de concepte i despleguem la infraestructura necessària, ja sigui on-premise o al núvol. La integració amb serveis cloud AWS i Azure és natural, i els nostres equips tenen experiència en optimitzar la inferència amb tècniques com fusió de kernels, quantització o paral·lelisme de models.

En definitiva, Nemotron-Labs-TwoTower no és només un model més: és un canvi de paradigma en com concebem la generació de text. En separar les responsabilitats de representació i refinament, aconsegueix el que abans semblava contradictori —més velocitat sense sacrificar qualitat— i ho fa amb un enfocament modular que facilita l'adaptació a entorns empresarials. La conversa sobre models de llenguatge està passant de 'com de gran' a 'com d'eficient', i TwoTower marca el camí.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.