La compressió de models de llenguatge de gran escala (LLMs) mitjançant poda estructurada ha estat aclamada com una via eficient per reduir costos computacionals i facilitar el desplegament en producció. Tanmateix, els benchmarks de múltiple opció amaguen una realitat crítica: els mateixos checkpoints comprimits sovint col·lapsen en tasques de generació lliure, que és exactament el que les aplicacions empresarials requereixen. Aquesta bretxa entre rendiment acadèmic i utilitat pràctica ha motivat investigacions profundes, donant lloc a tècniques com ShortOPD (Short-to-Long On-Policy Distillation), un enfocament que promet recuperar la qualitat de generació d'LLMs podats amb una eficiència sense precedents.
Què causa aquest fall? Les anàlisis revelen que la taxa d'encert directe (pass@1) pràcticament desapareix després de la poda, però el mostreig repetit (pass@k) mostra una recuperació substancial: les generacions útils no s'esborren, sinó que es desordenen. El veritable obstacle és la repetició de sufixos: el model tendeix a generar cadenes repetitives sense sentit, especialment en seqüències llargues. Els mètodes tradicionals de destil·lació, com la destil·lació de coneixement (KD) o la seqüència-KD, entrenen sobre distribucions estàtiques o fora de la política del model comprimit, per tant no aconsegueixen corregir aquest comportament. La solució requereix una supervisió densa a nivell de token sobre els propis estats generats pel model comprimit, és a dir, destil·lació on-policy.
ShortOPD implementa aquesta idea amb un esquema de curt a llarg. Utilitza el model original (precompressió) com a professor congelat que proporciona supervisió token a token. Però els rollouts llargs inicials malgasten el pressupost de recuperació en sufixos repetitius de baixa informació, retardant la convergència. Per mitigar-ho, ShortOPD detecta els sufixos repetitius confirmats pel professor, tracta el prefix supervivent com la longitud efectiva de cada rollout, i assigna els pressupostos futurs a les longituds que l'estudiant pot manejar en aquell moment. Aquest procés accelera dràsticament el descens de la pèrdua.
Els resultats són contundents. En tasques de matemàtiques, codi i generació oberta, ShortOPD eleva la puntuació del model comprimit a aproximadament 9 vegades el seu valor sense recuperació, i supera entre 1,6 i 4,4 vegades les receptes estàndard (SFT sense KD, KD i SeqKD). A més, iguala el rendiment d'un horitzó fix de 8192 tokens utilitzant només un quart del temps d'entrenament (8,5 hores enfront de 35,9) i un 71% menys de tokens de rollout. Aquests nombres indiquen que la poda estructurada pot finalment fer el salt a la generació de producció, més enllà de les millores marginals en perplexitat.
Des d'una perspectiva empresarial, aquesta tècnica obre la porta a desplegar assistents conversacionals, sistemes de generació d'informes automatitzats i xatbots d'atenció al client amb models més lleugers i ràpids, sense comprometre la coherència. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, integrem aquests avenços en solucions personalitzades. Oferim desenvolupament d'aplicacions a mida que incorporen models d'IA optimitzats mitjançant destil·lació on-policy, garantint respostes fluides i evitant els bucles repetitius que caracteritzen els models no recuperats.
A més, combinem ShortOPD amb altres tecnologies clau. Els nostres serveis d'intel·ligència artificial inclouen la implementació d'agents IA que aprofiten aquestes optimitzacions per a tasques complexes. També apliquem ciberseguretat per protegir les dades sensibles durant l'entrenament i la inferència, i utilitzem infraestructura cloud AWS/Azure per escalar els processos de forma eficient. La monitorització de la qualitat de les generacions es realitza mitjançant eines de BI/Power BI, permetent ajustos continus. Tot dins d'un marc d'aplicacions a mida que s'adapten a les necessitats específiques de cada client.
El camí cap a l'adopció massiva de la IA generativa passa per fer que els models siguin més lleugers sense perdre funcionalitat. ShortOPD demostra que la recuperació on-policy, amb una planificació intel·ligent de la longitud dels rollouts, és la clau. A Q2BSTUDIO estem compromesos a portar aquestes innovacions a entorns reals, ajudant les empreses a transformar els seus processos mitjançant programari personalitzat, IA eficient i una infraestructura robusta. Si desitges explorar com aplicar aquestes tècniques a la teva organització, no dubtis a contactar-nos per a una consultoria inicial.




