En el camp dels models de llenguatge a gran escala (LLM), la poda o pruning s'ha convertit en una tècnica essencial per reduir costos computacionals i d'emmagatzematge sense sacrificar rendiment. Mètodes com Wanda i SparseGPT han demostrat ser efectius, però pateixen d'un enfocament uniforme: apliquen la mateixa taxa d'escassetat a totes les capes del transformer, ignorant que no totes les capes contribueixen igual a la qualitat final del model. Aquesta limitació ha motivat l'aparició de PALS (Percentile-Aware Layerwise Sparsity), un mètode que ajusta dinàmicament l'escassetat per capa basant-se en el percentil 99 de les magnituds d'activació, amb un marge de ±5% respecte a la taxa objectiu. Els resultats són prometedors: en LLaMA-2-7B al 50% d'escassetat, PALS assoleix una perplexitat de 10.96 a WikiText-2 enfront de 12.92 del Wanda uniforme, amb significació estadística. Tanmateix, la millora depèn de l'arquitectura: LLaMA-3-8B mostra guanys marginals i Mistral-7B cap. Fins i tot s'observa que l'assignació basada en gradients —aparentment més fonamentada— produeix resultats pitjors que l'atzar, suggerint que la magnitud del gradient no prediu bé l'impacte de l'eliminació discreta de pesos.
Des d'una perspectiva empresarial, aquestes troballes són crucials per a empreses que integren LLM en els seus productes. La poda intel·ligent no només redueix costos d'inferència al núvol (AWS, Azure), sinó que també permet desplegar models més lleugers en dispositius edge, millorant la latència i la privadesa. A Q2BSTUDIO, entenem que cada projecte requereix un enfocament a mida. Per això, oferim serveis de desenvolupament de programari a mida que incorporen tècniques de compressió de models com PALS per optimitzar el rendiment de sistemes basats en IA. A més, la nostra experiència en núvol AWS i Azure permet escalar aquestes solucions de manera eficient, mentre que les nostres capacitats en ciberseguretat garanteixen que els models podats no introdueixin vulnerabilitats. La combinació de poda per capes amb agents d'IA, per exemple, pot reduir dràsticament el consum de recursos en assistents virtuals o sistemes de recomanació, una àrea on el Business Intelligence (Power BI) també es beneficia de models més ràpids i precisos.
El fet que PALS sigui un mètode pràcticament sense cost addicional —no requereix ajust fi— el converteix en una opció atractiva per a pipelines de producció. Tanmateix, la seva dependència de l'arquitectura subratlla la necessitat de proves empíriques en cada cas. A Q2BSTUDIO, apliquem un rigorós anàlisi de capes per determinar la millor estratègia de poda, integrant eines com Wanda o PALS segons les característiques del model i els requisits del client. La lliçó més valuosa de l'estudi és que la simplicitat, quan està ben informada per dades —com els percentils d'activació—, pot superar enfocaments teòricament més complexos. Per a les empreses que busquen rendibilitzar les seves inversions en IA, aquesta és un avantatge competitiu tangible: menys recursos computacionals, menor latència i una experiència d'usuari millorada.




