D2PO: Optimitzant samplers de difusió amb preferències dinàmiques

Descobreix D2PO, el marc que optimitza samplers de difusió amb preferències dinàmiques per a una qualitat perceptual superior.

viernes, 31 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Alineación de samplers por preferencias dinámicas

D2PO: Optimització de samplers de difusió amb preferències dinàmiques

Els models de difusió s'han convertit en una de les tecnologies més potents per generar imatges, àudio i altres tipus de dades. La seva capacitat per produir resultats realistes, però, depèn en gran mesura de l'estratègia de mostreig utilitzada durant la inferència. En entorns de producció, on la latència i el cost computacional són determinants, el nombre d'avaluacions de la xarxa (NFE) s'ha de mantenir baix. Reduir aquest nombre sense sacrificar qualitat és un repte tècnic important, i aquí és on propostes com D2PO, Dynamic Direct Preference Optimization, estan cridant l'atenció de desenvolupadors i arquitectes d'IA.

Els enfocaments clàssics per accelerar el mostreig solen recórrer a una regressió estudiant-professor. Un sampler ràpid s'entrena per imitar els resultats d'un sampler lent amb molts passos. Aquesta estratègia funciona bé per preservar l'estructura global de la imatge, però tendeix a perdre textures d'alta freqüència. El resultat és una imatge reconeixible, però plana o excessivament suavitzada. Per a aplicacions reals, aquesta pèrdua de detall redueix la qualitat percebuda i limita l'adopció dels models en sectors com el disseny, la medicina o el màrqueting.

El problema no és menor. Els objectius de regressió fan una mitjana de molts resultats possibles; això condueix a solucions conservadores que eviten errors greus però també eliminen la variabilitat responsable de la textura realista. La qualitat perceptual és intrínsecament subjectiva, i una mètrica com l'error quadràtic mitjà no captura la diferència entre una imatge nítida i una de desenfocada. Per això, un marc basat en preferències té més sentit: aprèn de comparacions, no de restes.

D2PO planteja un canvi de paradigma. En lloc de reproduir pas a pas les decisions d'un professor, formula l'optimització del sampler com un problema d'alineació per preferències. És a dir, el sistema aprèn quins resultats prefereixen els usuaris o les mètriques de qualitat, i ajusta la política de mostreig per maximitzar aquestes preferències. Aquesta idea prové del camp de Direct Preference Optimization (DPO), que originalment es va aplicar a models de llenguatge i que ara s'adapta al mostreig de difusió.

DPO permet substituir la costosa etapa d'aprenentatge per reforç amb una funció de pèrdua directa. En el cas de D2PO, aquesta idea s'adapta a l'espai de mostreig de difusió. En lloc de recompensar una acció concreta, es comparen dues trajectòries possibles de mostreig i s'actualitza la política per afavorir la que genera una imatge amb més qualitat percebuda. La política no és un simple scheduler; és una distribució sobre quan avançar i quant pes donar a la guia.

Per aconseguir-ho, el sampler es modela com un model basat en energia (EBM). Aquesta representació permet transformar comparacions de preferència en diferències d'energia calculables. L'energia es deriva directament de la xarxa de puntuació preentrenada, la qual cosa és especialment elegant. En lloc d'entrenar un mòdul addicional per avaluar la qualitat, es reutilitza la informació que ja conté el model generatiu. A més, l'avaluació es realitza en espais pertorbats, de manera que la preferència no depèn només de l'estructura gruixuda, sinó també dels detalls fins.

Un dels aspectes més interessants és el caràcter dinàmic de les preferències. En un entrenament convencional, el professor és fix i pot convertir-se en un coll d'ampolla. Aquí, els exemples preferits s'actualitzen a mesura que el sampler millora. Aquest mecanisme d'auto-millora elimina la rigidesa de la supervisió estàtica i proporciona senyals d'alineació cada vegada més fortes. És un enfocament iteratiu, gairebé evolutiu, en què la política de mostreig i el conjunt de preferències coevolucionen.

El mecanisme de preferències dinàmiques té una conseqüència pràctica: el model deixa d'estar limitat pel millor professor disponible en el moment inicial. A mesura que la política millora, les comparacions es converteixen en contrastos més subtils, la qual cosa refina el criteri d'alineació. Aquest cicle continu és comparable al funcionament dels agents d'IA moderns, que milloren amb retroalimentació humana i automatitzada.

Els experiments descrits en el context d'aquesta proposta mostren que l'enfocament basat en preferències aconsegueix alinear el sampler amb la qualitat perceptual de manera més fidel que els schedulers basats en regressió, especialment quan el nombre de passos és reduït. Això té implicacions directes: les empreses poden desplegar models generatius en producció amb menys recursos, mantenint una experiència visual rica i detallada. L'optimització dels programes de passos temporals i dels pesos de guia sense classificador és especialment difícil d'ajustar manualment; D2PO ofereix una via per automatitzar aquesta decisió.

Un altre aspecte rellevant és la compatibilitat amb tècniques ja existents de destil·lació i quantificació. D2PO no pretén substituir-les, sinó complementar-les. El resultat és un pipeline en què la reducció de cost no implica renunciar a la qualitat. Això és especialment útil en aplicacions mòbils, dispositius edge o arquitectures serverless.

Des d'una perspectiva empresarial, aquesta línia de recerca connecta amb la necessitat de construir sistemes d'IA eficients i sostenibles. Reduir la càrrega computacional de la inferència no només fa que el producte sigui més ràpid, sinó que també disminueix el consum energètic i el cost en infraestructura. En aquest context, és fonamental comptar amb una estratègia integral que combini algoritmes avançats amb una base tecnològica sòlida. A Q2BSTUDIO treballem perquè les organitzacions aprofitin aquestes oportunitats. Acompanyem els nostres clients en el disseny d'aplicacions a mida que integren IA generativa, així com en la implantació d'infraestructures escalables en núvol AWS/Azure.

A més, un sistema d'IA responsable necessita capes de ciberseguretat i observabilitat. Les eines de BI/Power BI permeten monitoritzar el rendiment del model i el retorn de la inversió, mentre que els equips de desenvolupament garanteixen que la solució s'integra correctament en el flux de treball. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, ajudem a crear agents d'IA i solucions d'automatització que incorporen aquestes tècniques d'optimització. El nostre objectiu és transformar la recerca més avançada en productes tangibles i robustos.

En definitiva, D2PO representa un pas important en l'optimització de samplers de difusió. En canviar la imitació per preferències, la regressió per alineació i el professor estàtic per una referència dinàmica, s'aconsegueix un mostreig d'alta qualitat amb menys computació. Aquesta filosofia encaixa amb una tendència més àmplia en el desenvolupament de programari: crear sistemes que aprenguin de manera contínua, s'adaptin al context i respectin els recursos de l'organització. Qui integri aquestes idees en els seus productes tindrà un avantatge competitiu clar en la propera onada de la IA generativa.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.