Un estudiant, molts mestres: destil·lació multi-tasca amb prompts suaus

Descobreix com un sol model de llenguatge pot aprendre de múltiples mestres mitjançant soft prompts, superant el fine-tuning tradicional en rendiment i

jueves, 23 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Optimización de modelos con destilación on-policy y contexto privilegiado

En el vertiginós món del desenvolupament de la intel·ligència artificial, un dels desafiaments més persistents és com ensenyar a un model de llenguatge (LLM) múltiples habilitats sense que perdi les que ja havia après. L'enfocament tradicional, conegut com a fine-tuning seqüencial, sovint provoca oblit catastròfic: el model s'especialitza en l'última tasca i degrada el rendiment en les anteriors. Davant d'aquesta limitació, sorgeix una proposta elegant i eficient: la destil·lació multi-tasca amb soft prompts, una tècnica que permet que un únic model 'estudiant' aprengui de diversos 'mestres' representats per prompts suaus, tot sense modificar els pesos del model base.

La idea central és senzilla però poderosa. En lloc d'ajustar els pesos del model per a cada tasca (cosa costosa i que provoca deriva), s'entrena un petit prompt aprenible que actua com a mestre especialitzat. Aquest prompt, en afegir-se a l'entrada del model, condiciona el seu comportament per a una tasca concreta, mentre que el model base roman congelat. Així, un únic estudiant pot atendre múltiples tasques simplement seleccionant el prompt adequat per a cada exemple. A la pràctica, això significa que una empresa pot tenir un únic LLM que sap de ciència, eines, biologia i matemàtiques, sense necessitat de mantenir quatre models separats ni de fer fine-tuning recurrent.

Des d'una perspectiva tècnica, aquesta aproximació s'emmarca dins la destil·lació on-policy (OPSD), però amb una innovació clau: el mestre no és una versió fine-tuneada del model, sinó un soft prompt entrenat sobre parells (x, y_gold) mantenint el backbone congelat. Això preserva la geometria representacional exacta de l'estudiant, evitant les racionalitzacions post-hoc que ocorren quan el mestre injecta context privilegiat a l'entrada. A més, l'extensió multi-tasca és natural: s'enruta cada exemple d'un corpus fusionat cap al seu corresponent mestre de soft prompt, permetent que l'estudiant absorbeixi coneixement de K mestres en paral·lel. Durant la inferència, tots els prompts es descarten, i el model torna al seu estat base.

Què implica això per a les empreses que desenvolupen aplicacions basades en IA? Que és possible construir sistemes versàtils i robustos sense incórrer en els costos d'entrenar i mantenir múltiples models. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, veiem en aquesta tècnica una oportunitat per oferir solucions de aplicacions a mida que integrin capacitats d'IA de forma modular. Per exemple, un assistent virtual corporatiu podria gestionar consultes d'atenció al client, suport tècnic i anàlisi de dades empresarials, tot des d'un únic model base, però amb prompts especialitzats que s'activen segons el context.

L'eficiència en l'entrenament és un altre punt a favor. Mentre que un fine-tuning complet pot requerir milions de paràmetres i hores de GPU, entrenar un soft prompt amb prou feines modifica uns milers de paràmetres, reduint dràsticament el temps i el cost. Això és especialment rellevant per a empreses que necessiten actualitzar els seus models amb freqüència o afegir noves habilitats sense interrompre el servei. A més, en mantenir el backbone congelat, es preserven les capacitats generals del model, cosa que el fine-tuning seqüencial no aconsegueix. En benchmarks recents, la variant multi-tasca d'aquesta tècnica va aconseguir un promig superior (56.2 a Qwen3-1.7B-Base) mentre mantenia el rendiment en tasques generals, a diferència del fine-tuning seqüencial que degrada ambdues.

Des de la perspectiva de negoci, aquesta tècnica encaixa perfectament amb estratègies d'integració d'IA al núvol. A Q2BSTUDIO oferim serveis cloud a AWS i Azure, on podem desplegar models base juntament amb els seus soft prompts com a microserveis lleugers. Cada tasca pot tenir el seu propi prompt, i l'orquestrador s'encarrega d'enrutar les peticions al prompt correcte. Això permet una escalabilitat horitzontal i un manteniment independent de cada habilitat. A més, la ciberseguretat és un aspecte crític: en no modificar els pesos del model base, es redueix la superfície d'atac i es facilita l'auditoria de comportaments. El nostre equip de ciberseguretat pot ajudar a garantir que els prompts no introdueixin vulnerabilitats.

Un altre camp d'aplicació és la intel·ligència de negoci (BI). Els models de llenguatge poden potenciar dashboards de Power BI o Tableau, oferint respostes en llenguatge natural a preguntes sobre dades. Amb la destil·lació multi-tasca, un sol model pot ser expert en diferents dominis de negoci (vendes, finances, logística) simplement intercanviant el soft prompt. A Q2BSTUDIO desenvolupem solucions de BI a mida que integren aquestes capacitats, permetent als usuaris interactuar amb les seves dades de forma conversacional i precisa.

No podem oblidar el paper dels agents d'IA. Un agent autònom necessita executar múltiples habilitats (planificació, ús d'eines, raonament) en resposta a un objectiu. La destil·lació amb soft prompts permet que l'agent tingui un únic model base i activi diferents prompts segons la fase de la tasca. Això simplifica enormement l'arquitectura i l'entrenament. A Q2BSTUDIO estem explorant com aplicar aquesta tècnica per crear agents d'IA més robustos i adaptables, combinant-la amb automatització de processos.

En resum, la destil·lació multi-tasca amb soft prompts representa un avenç significatiu en la forma d'entrenar i desplegar models de llenguatge. Permet que un únic estudiant aprengui de molts mestres sense sacrificar rendiment, amb costos reduïts i mantenint la flexibilitat. Per a empreses que busquen incorporar IA de manera eficient i modular, aquesta tècnica obre noves possibilitats. A Q2BSTUDIO estem preparats per guiar els nostres clients en la implementació d'aquestes estratègies, ja sigui mitjançant automatització de processos o solucions d'IA a mida. El futur de la intel·ligència artificial no és tenir un model per a cada tasca, sinó un model que pugui ser tot el que necessiti, simplement afegint un mestre virtual.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.