L'aprenentatge automàtic ha arribat a un punt on els models poden 'oblidar' informació específica sota demanda, una capacitat coneguda com a machine unlearning. No obstant això, investigacions recents revelen una vulnerabilitat crítica: la geometria subjacent de les classes pot filtrar informació sobre les dades oblidades. Aquest article analitza aquest problema i presenta una estratègia innovadora de reequilibri que mitiga la fuita d'informació, mantenint alhora el rendiment del model.
Quan una empresa necessita eliminar dades sensibles d'un model entrenat —per exemple, per regulacions de privacitat com el GDPR—, l'enfocament ideal seria reentrenar des de zero, però això és costós i consumeix temps. Les tècniques d'oblit selectiu ofereixen una alternativa eficient, però han d'assegurar que no quedi cap rastre de la classe oblidada. L'estudi recent (arXiv:2506.20893v5) identifica una fallada comuna en les avaluacions: ignorar la geometria de classes permet atacs d'inferència de pertinença a classe (CMIA) que detecten mostres oblidades amb alta precisió.
La vulnerabilitat rau en el fet que els models retenen relacions entre classes properes. Per exemple, si un model es va entrenar per classificar imatges de gats i gossos, i després se li demana oblidar la classe 'gat', les probabilitats que assigna a la classe 'gos' per a imatges que abans eren gats poden revelar informació sobre la classe oblidada. Aquest atac demostra que els mètodes actuals d'oblit —com el fine-tuning amb dades de retenció o la poda de pesos— no són suficients per garantir privacitat real.
Per abordar això, els investigadors proposen TREW (Tilted REWeighting), un objectiu de fine-tuning que aproxima la distribució que produiria un model reentrenat des de zero per a les entrades de la classe oblidada. TREW estima la similitud entre classes —usant una matriu de similitud basada en les prediccions del model original sobre dades de retenció— i inclina la distribució del model objectiu en conseqüència. El resultat és una distribució 'reequilibrada' que redueix la fuita d'informació sense sacrificar precisió en les classes restants.
Els experiments en CIFAR-10 mostren que TREW redueix la bretxa amb models reentrenats en un 19% per a la mètrica U-LiRA i un 46% per a CMIA, superant els mètodes de l'estat de l'art com el fine-tuning amb destil·lació o l'eliminació d'influència. Això té implicacions directes per a aplicacions empresarials que gestionen dades sensibles, com ara sistemes de recomanació, diagnòstic mèdic o classificació de documents.
A Q2BSTUDIO, entenem que la privacitat i l'eficiència són pilars en el desenvolupament d'aplicacions a mida. Incorporar tècniques d'oblit selectiu robustes permet als nostres clients complir normatives sense necessitat de reentrenar costosament. La nostra experiència en IA ens permet integrar solucions de machine unlearning en fluxos de treball existents, ja sigui en entorns cloud (AWS, Azure) o sistemes on-premise.
La ciberseguretat també es beneficia d'aquests avenços. Un model que filtra informació sobre dades oblidades pot ser explotat per atacants mitjançant atacs de pertinença. En implementar TREW, les organitzacions reforcen la seva postura de seguretat, evitant que un adversari infereixi pertinença a classes sensibles. A Q2BSTUDIO oferim serveis de ciberseguretat que inclouen auditories de models d'IA per detectar fuites d'informació i aplicar les correccions necessàries.
A més, la capacitat de reequilibrar distribucions té aplicacions en sistemes de Business Intelligence. Per exemple, en eliminar temporalment una categoria de producte d'un model de recomanació, el sistema no ha de revelar l'existència d'aquesta categoria. Amb TREW, es manté la integritat de l'anàlisi. Per a això, combinem tècniques d'BI/Power BI amb models d'IA que respecten la privacitat, oferint informes precisos sense comprometre dades sensibles.
Una altra àrea prometedora són els agents IA autònoms, que han de gestionar dades d'usuaris sense exposar informació sensible. Integrar estratègies d'oblit selectiu com TREW en aquests agents assegura que el comportament après no comprometi la privacitat d'individus o classes completes. A Q2BSTUDIO desenvolupem agents IA adaptats a les necessitats específiques de cada empresa, garantint transparència i compliment normatiu, i els despleguem en infraestructures cloud com AWS o Azure per garantir escalabilitat.
La infraestructura cloud (AWS, Azure) és ideal per implementar aquests processos de fine-tuning i reequilibri a escala. Els nostres serveis cloud permeten als clients entrenar i ajustar models amb recursos elàstics, mentre que la integració de TREW es realitza sense interrompre el servei. Oferim automatització de processos mitjançant programari d'automatització que facilita l'aplicació d'aquestes tècniques en pipelines de MLOps, reduint el risc d'error humà i accelerant el cicle de desenvolupament.
En resum, l'oblit de classes en IA no ha de ser superficial. La geometria de classes és un factor crític que, si s'ignora, pot exposar informació privada. TREW proporciona una solució elegant i efectiva, i la seva adopció representa un avenç significatiu per a la privacitat en machine learning. A Q2BSTUDIO, ajudem les organitzacions a implementar aquestes tècniques perquè els seus models siguin tan segurs com precisos. Per saber més sobre com podem transformar la seva infraestructura d'IA, contacti'ns.




