FactorDiff: Composició Experta per Factors en Difusió Discreta

FactorDiff: composició per factors en difusió discreta supera mètodes globals a ARC-AGI. L'encaminament espacial millora la consistència lògica.

martes, 28 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Cómo la Composición por Factores Supera a los Métodos Globales

La intel·ligència artificial ha evolucionat cap a models generatius capaços de resoldre tasques complexes de raonament. Dins d’aquest paradigma, els models de difusió discreta han demostrat un potencial extraordinari, especialment quan es combinen múltiples experts preentrenats per aconseguir una composició que supera les capacitats individuals. No obstant, els enfocaments tradicionals de composició operen a nivell de mostra completa, tractant cada estat generat com un bloc monolític i desaprofitant les especialitzacions espacials o funcionals dels experts. Aquí sorgeix FactorDiff, un marc innovador que proposa una composició per factors, descomponent les mostres en elements més petits i enrutant dinàmicament cada factor a l’expert més rellevant. Aquest article analitza en profunditat aquesta tècnica, les seves implicacions tècniques i com empreses com Q2BSTUDIO poden integrar aquests avenços en solucions de programari a mida, IA, ciberseguretat, núvol i automatització.

Els models de difusió discreta, com D3PM o els basats en processos de salt, han guanyat terreny en tasques de raonament estructurat gràcies a la seva capacitat per modelar distribucions sobre espais discrets. La composició d’experts —combinar models entrenats en diferents dominis— permet generalitzar més enllà de les dades d’entrenament individuals. Malgrat això, els mètodes previs, com les ponderacions temporals dependents del temps, ajusten la mescla a escala global per mostra, sense distingir com diferents regions o components d’un mateix estat es podrien beneficiar d’experts diferents. FactorDiff aborda aquesta limitació suggerint que cada mostra es pot descompondre en factors —com píxels en una imatge o tokens en una seqüència— i que el procés de difusió ha d’assignar cada factor a l’expert que millor el gestioni a cada pas temporal.

La implementació de FactorDiff es basa en un mecanisme d’enrutament dinàmic. Durant la generació, l’estat actual es segmenta en factors (per exemple, parxes espacials). Una funció d’assignació avalua, per a cada factor, quin expert ofereix la major reducció de la divergència cap a la distribució objectiu. Aquesta avaluació pot utilitzar mètriques com la versemblança condicional o l’entropia creuada. El resultat és un procés de difusió on cada factor segueix una trajectòria guiada per l’expert més adequat, permetent una composició veritablement granular. Els autors validen el marc al benchmark ARC-AGI, un conjunt de problemes que exigeix consistència lògica i descomposició espacial, mostrant que l’enrutament simple per factors supera consistentment els esquemes de ponderació global complexos.

Des d’una perspectiva tècnica, FactorDiff introdueix diverses millores clau. Primer, la descomposició en factors permet una paral·lelització més eficient, ja que cada factor es pot processar de forma independent si els experts són independents. Segon, l’enrutament dinàmic s’adapta a l’evolució temporal, cosa que és crucial perquè la rellevància d’un expert per a un factor pot canviar durant el procés de difusió. Tercer, treballar a nivell de factor redueix el cost computacional en comparació amb mètodes que requereixen recalcular ponderacions globals. Aquestes propietats fan que FactorDiff sigui especialment atractiu per a aplicacions que requereixen alta precisió en dominis estructurats, com la generació d’imatges amb lògica espacial, la planificació de rutes en robòtica o la síntesi de seqüències genòmiques.

Per a una empresa de desenvolupament de programari i tecnologia com Q2BSTUDIO, l’adopció de marcs com FactorDiff representa una oportunitat estratègica. La capacitat de crear models generatius que combinen experts especialitzats encaixa perfectament amb el desenvolupament de solucions d’intel·ligència artificial a mida. Per exemple, en l’àmbit dels agents IA, FactorDiff podria utilitzar-se perquè un agent modular combini un expert en visió, un altre en llenguatge i un altre en raonament lògic, assignant cada part d’una tasca complexa al mòdul més competent. Això comportaria sistemes més robustos i adaptatius capaços de manejar escenaris del món real amb múltiples requisits.

A més, l’arquitectura de FactorDiff es presta a ser implementada sobre plataformes de núvol com AWS o Azure. Q2BSTUDIO ofereix serveis de núvol que permeten desplegar models de difusió a gran escala, gestionant la infraestructura necessària per entrenar i servir múltiples experts de manera eficient. La descomposició en factors facilita la distribució de càrrega en clústers de GPU, reduint costos i millorant la latència. En entorns on la ciberseguretat és crítica —com el processament de dades sensibles—, l’enrutament per factors pot dissenyar-se per garantir que certs factors crítics siguin gestionats exclusivament per experts certificats o en entorns segurs, minimitzant riscos de fuga d’informació.

Un altre camp d’aplicació és l’automatització de processos. FactorDiff permet construir sistemes de raonament que integrin múltiples fonts de coneixement —per exemple, un expert en dades financeres i un altre en normatives— per generar informes o prendre decisions automatitzades. En combinació amb eines de Business Intelligence com Power BI, els resultats es podrien visualitzar de manera desagregada, mostrant com cada factor contribueix a la decisió final. Q2BSTUDIO desenvolupa solucions de BI que poden consumir les sortides d’aquests models i presentar-les de manera intuïtiva als usuaris.

La validació a ARC-AGI demostra que aquest enfocament no és només teòric. ARC-AGI presenta problemes que requereixen completar patrons visuals amb regles lògiques subjacents, un tipus de tasca on la composició per factors brilla. Els mètodes globals fallen perquè apliquen la mateixa estratègia a tota la imatge, mentre que FactorDiff pot aplicar un expert per analitzar formes i un altre per colors, combinant-los harmònicament. Aquest resultat suggereix que la tècnica es podria aplicar a altres dominis com la generació de codi, la resolució de problemes matemàtics o la simulació d’escenaris físics.

No obstant, queden desafiaments. La identificació de factors adequats no és trivial; en alguns casos, la descomposició òptima pot no ser òbvia. A més, l’enrutament dinàmic introdueix un cost de decisió addicional, tot i que els experiments mostren que és compensat per la qualitat. La recerca futura podria explorar factors apresos end-to-end o mecanismes d’atenció per a l’assignació. També queda oberta la qüestió de com escalar a un nombre molt gran d’experts, on la cerca del millor expert podria convertir-se en un coll d’ampolla.

En conclusió, FactorDiff representa un pas endavant en la composició de models de difusió discreta, substituint les ponderacions globals per un enrutament granular per factors. Per a empreses com Q2BSTUDIO, que ofereixen serveis de desenvolupament d’aplicacions a mida, aquesta tècnica obre noves possibilitats per construir sistemes modulars, eficients i altament especialitzats. La combinació d’IA, núvol i automatització pot beneficiar-se directament d’aquest enfocament, permetent solucions més intel·ligents i adaptables. Amb l’evolució constant dels models generatius, FactorDiff marca una direcció prometedora per a la propera generació d’agents i sistemes de raonament.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.