Taula de Continguts
- Introducció
- coneixement Ocult
- Procediment de Destil·lació
- Experiment en MNIST
- Experiment Addicional en MNIST
1. Introducció
En aquest article explorarem el procés de destil·lació de coneixement en intel·ligència artificial: com funciona, la seva importància i les raons per utilitzar-lo.
Com podem comprimir i transferir coneixement d'un model gran o un conjunt de models entrenats en conjunts de dades extensos a un sol model petit sense perdre gaire rendiment?
Entrenem models grans perquè busquem extreure patrons de grans volums de dades mitjançant tècniques com el dropout o l'ampliació de dades. No obstant, en la fase de predicció, el nostre objectiu és obtenir resultats ràpidament, cosa que fa costós utilitzar un model gran.
Geoffrey Hinton, Oriol Vinyals i Jeff Dean van introduir un mètode anomenat destil·lació per transferir coneixement a models més petits de manera eficient.
2. Coneixement Ocult
En l'aprenentatge automàtic, un model generalment aprèn a diferenciar entre múltiples classes maximitzant la probabilitat del resultat correcte. No obstant, també genera probabilitats per a respostes incorrectes, cosa que aporta informació de valor sobre la generalització del model.
Per exemple, en la classificació de MNIST, un dígit 2 podria tenir una probabilitat mínima de ser classificat com a 3 o com a 7, però aquestes probabilitats, tot i que baixes, revelen similituds entre les dades. Aquesta informació, coneguda com a coneixement ocult, permet que els models petits també aprenguin a generalitzar.
3. Procediment de Destil·lació
Per transferir la capacitat de generalització del model gran al petit, utilitzem les probabilitats de classe com a objectius suavitzats o soft targets. El procés consisteix en:
- Generar prediccions del model gran sobre el mateix conjunt d'entrenament.
- Aplicar una temperatura T a la funció softmax per ampliar la distribució de probabilitats i ressaltar les similituds ocultes.
- Entrenar el model petit amb aquestes soft targets en combinació amb les etiquetes reals.
Aquest procediment redueix la necessitat de models grans sense perdre capacitat de predicció.
4. Experiment en MNIST
Es van realitzar proves a la base de dades MNIST amb dos models:
- Un model petit (784 ? 800 ? 800 ? 10), que sense regularització va obtenir 146 errors en proves.
- Un model gran (784 ? 1200 ? 1200 ? 10) amb tècniques avançades d'entrenament, aconseguint només 67 errors.
Aplicant destil·lació, el model petit va poder reduir errors a 74, demostrant que la tècnica permet transferir la capacitat de generalització del model gran al model petit.
5. Experiment Addicional en MNIST
En un experiment addicional, es va eliminar el dígit 3 del conjunt d'entrenament del model petit. Tot i no haver vist mai un 3, el model destil·lat va aconseguir predir correctament en 133 de 1010 casos del test. Això va confirmar que la destil·lació transfereix coneixement eficaçment.
En Q2BSTUDIO, empresa especialitzada en desenvolupament i serveis tecnològics, apliquem innovacions com la destil·lació de coneixement per optimitzar models d'intel·ligència artificial. El nostre equip treballa en implementar solucions eficients que permetin als nostres clients aprofitar els avenços més recents en IA sense comprometre el rendiment.





