La compressió de models de llenguatge de gran escala (LLMs) és una prioritat estratègica per a empreses que busquen implementar intel·ligència artificial de manera eficient. La poda estructural elimina unitats senceres, com caps d'atenció i grups de canals en la capa feed-forward (FFN), per reduir la mida del model sense comprometre la funcionalitat. No obstant això, els mètodes tradicionals que no requereixen entrenament solen avaluar aquestes unitats de forma independent, assumint incorrectament que la pèrdua en eliminar un conjunt és la suma de pèrdues individuals. En els transformadors, les subcapes estan acoblades a través d'un flux residual compartit, cosa que significa que dues unitats febles per separat poden ser conjuntament indispensables. Ignorar aquesta interdependència porta a eliminar-les juntes, degradant el rendiment.
Aquí és on entra CoCurve, un enfocament innovador de poda conjunta que supera aquesta limitació. CoCurve és un mètode que només requereix calibratge, sense ajust fi, i que poda simultàniament unitats d'atenció i FFN. Utilitza una expansió de Taylor de segon ordre sobre la divergència KL entre el model congelat i la seva còpia emmascarada, obtenint una única matriu de Fisher. Els elements diagonals d'aquesta matriu representen la rellevància clàssica de cada node (saliencia), mentre que els elements fora de la diagonal són les arestes de curvatura de co-poda: el dany addicional d'eliminar dues unitats juntes. Sota una aproximació d'additivitat d'ablació única, aquesta matriu es redueix a un producte de Gram de característiques d'ablació unitària, de manera que la interacció completa M x M es recupera amb M passos cap endavant, sense necessitat de barreres per parells ni gradients. Després, la poda es converteix en un problema quadràtic pressupostat, resolt d'una sola vegada sota un pressupost compartit entre atenció i FFN, sense etiquetes, ajust ni recuperació.
Des d'una perspectiva tècnica, la bellesa de CoCurve rau en la seva eficiència computacional. Mentre que els mètodes convencionals requereixen avaluar parells d'unitats per capturar interaccions, CoCurve modela totes les relacions amb un nombre lineal de passos. Això és crucial per a LLMs moderns amb centenars de milers de paràmetres, on el cost d'una exploració exhaustiva seria prohibitiva. La matriu de Fisher resultant captura la curvatura conjunta, permetent a l'algorisme decidir quines combinacions d'unitats preservar per minimitzar la pèrdua d'informació. A la pràctica, això es tradueix en models més petits que mantenen un rendiment proper a l'original, accelerant la inferència i reduint els requisits de maquinari.
Per a les empreses que desenvolupen solucions basades en IA, l'adopció de tècniques com CoCurve pot suposar un avantatge competitiu. A Q2BSTUDIO, entenem que l'eficiència no és només un luxe tècnic, sinó una necessitat operativa. Per això, oferim serveis d'IA i automatització de processos que integren mètodes de compressió avançats, garantint que els vostres models siguin lleugers, ràpids i precisos. No es tracta només de podar, sinó de fer-ho de manera intel·ligent, conservant el coneixement crític i eliminant redundàncies. Aquest enfocament encaixa perfectament amb la nostra filosofia de desenvolupament de aplicacions a mida, on cada solució s'adapta a les necessitats específiques del client.
A més, CoCurve encaixa en un ecosistema més ampli d'optimització de models. Les empreses que operen al núvol, ja sigui amb AWS o Azure, poden beneficiar-se de models més petits que redueixen el consum de recursos i els costos d'inferència. A Q2BSTUDIO, oferim consultoria en cloud AWS/Azure per ajudar els nostres clients a desplegar aquests models comprimits de manera eficient. De la mateixa manera, la ciberseguretat es veu reforçada: models més petits impliquen menys superfície d'atac i una auditoria més senzilla. I en l'àmbit de l'anàlisi de dades, la combinació de models comprimits amb eines de Business Intelligence (BI) com Power BI permet processar grans volums d'informació en temps real, sense saturar els sistemes.
En definitiva, CoCurve representa un avenç significatiu en la poda de LLMs. En tenir en compte les interdependències entre mòduls, aconsegueix compressions més agressives sense sacrificar la qualitat. Per a empreses que desenvolupen agents d'IA, assistents conversacionals o sistemes de recomanació, adoptar aquesta tècnica pot marcar la diferència entre un producte viable i un que consumeix massa recursos. A Q2BSTUDIO, estem compromesos amb la innovació en aplicacions a mida, intel·ligència artificial i automatització, ajudant els nostres clients a aprofitar al màxim tecnologies punteres com CoCurve.





