El concepte de Data Shapley ha emergit com l'estàndard més rigorós per assignar un valor just a cada punt d'entrenament en models de machine learning. La seva especialització per a k-NN (k-nearest neighbors) és la versió més utilitzada a la pràctica, implementada en llibreries com pyDVL i OpenDataVal. No obstant això, fins ara existia una bretxa significativa: els algoritmes exactes només funcionaven per a k-NN no ponderat o ponderat en classificació, mentre que la regressió ponderada i les etiquetes toves quedaven fora d'abast, limitant-se a un costós mètode de força bruta O(N^K). Aquest article analitza el recent avenç que tanca aquesta bretxa, presentant el primer algoritme pseudo-polinomial exacte i un FPTAS certificat per a la regressió k-NN ponderada, i el connecta amb les oportunitats que això obre per a empreses que busquen integrar intel·ligència artificial fiable i transparent en els seus processos.
La dificultat central de la regressió ponderada rau en el fet que la predicció es calcula com un quocient de dues sumes dependents de la coalició de veïns: la suma dels pesos i la suma dels pesos pels valors objectiu. Aquest denominador trenca les estructures additives, de llindar i de duplicació en què es basaven els mètodes polinomials anteriors. El nou enfocament, basat en un programa dinàmic de recompte sobre estats enters conjunts (suma de pesos, suma de pesos per y), aconsegueix una complexitat pseudo-polinomial O(N * K * precisió) i ha estat verificat contra enumeració exhaustiva en més de 12.700 instàncies adversarial sense cap discrepància. A més, ofereix un FPTAS (esquema d'aproximació completament polinomial) amb certificats d'error verificables, validat en més de 86.400 comprovacions. Això no només proporciona una referència exacta per auditar estimadors, sinó que demostra que els mètodes Monte Carlo, tot i que estadísticament equivalents a nivell agregat, no reprodueixen el rànquing exacte del 10% superior ni amb 3.000 permutacions (1,28 milions d'avaluacions d'utilitat).
Des d'una perspectiva empresarial, la capacitat d'assignar valor exacte a les dades d'entrenament té implicacions profundes. En aplicacions d'IA on les dades són un actiu crític —com diagnòstic mèdic, detecció de frau o personalització de recomanacions— saber quines mostres contribueixen realment al rendiment del model permet optimitzar la recollida de dades, detectar errors d'etiquetatge i justificar inversions en infraestructura de dades. La versió ponderada de k-NN és especialment rellevant quan els veïns no tenen la mateixa influència, cosa habitual en sèries temporals, dades espacials o contextos amb soroll heterogeni. Per exemple, en un sistema de ciberseguretat que analitza patrons de trànsit, un atac pot estar representat per punts amb pesos variables segons la seva antiguitat o fiabilitat; un Shapley exacte permet identificar els registres més determinants per a la detecció primerenca.
La publicació d'aquest algoritme com a codi obert (llibreria CPU-only) facilita la seva adopció en entorns corporatius. Empreses com Q2BSTUDIO, especialitzades en el desenvolupament d'aplicacions a mida, poden integrar aquests mètodes en solucions d'IA per a clients que requereixen traçabilitat i certificació dels seus models. La combinació d'algoritmes exactes amb cloud AWS/Azure permet escalar el càlcul a grans conjunts de dades sense perdre precisió, mentre que les capacitats de BI/Power BI faciliten la visualització dels valors Shapley per a parts interessades no tècniques. A més, els agents IA que prenen decisions autònomes poden beneficiar-se d'una valoració de dades més fiable per ajustar el seu comportament en temps real.
Un altre aspecte clau és la gestió de la qualitat de dades. La detecció d'etiquetes incorrectes és una aplicació directa: amb els valors exactes de Shapley es poden identificar punts anòmals que afecten negativament el model. En un estudi de downstream mislabel detection, els autors van demostrar que els valors Monte Carlo no aconsegueixen reproduir el rànquing exacte del 10% superior, la qual cosa subratlla la necessitat de mètodes exactes quan la precisió és crítica. Per a una empresa que gestiona dades sensibles, com en entorns de ciberseguretat o compliment normatiu, comptar amb certificats d'error verificables (com els del FPTAS) aporta un nivell de transparència que pot ser exigit per auditories o regulacions.
La complexitat teòrica del problema també mereix atenció. S'ha demostrat una cota inferior incondicional d'Omega(D_w) en la mida de la sortida, i resultats de duresa en certs models d'accés. Això significa que, tot i que el nou algoritme és eficient en termes pràctics, no es pot eliminar completament la dependència de la precisió o del nombre de veïns. No obstant això, per a la majoria d'aplicacions empresarials (K de l'ordre de desenes i N de milers a milions), l'enfocament pseudo-polinomial resulta viable. A més, l'extensió a classificació multi-classe amb etiquetes toves (soft-label) amplia la seva utilitat a problemes com anàlisi de sentiment o diagnòstic diferencial.
En resum, l'avanç en el càlcul exacte del Shapley de Dades per a regressió k-NN ponderada representa una fita tant teòrica com pràctica. Permet a empreses i investigadors confiar en una valoració de dades lliure d'aproximacions no controlades, facilitant la presa de decisions basada en la contribució real de cada mostra. A Q2BSTUDIO entenem que l'IA no només ha de ser potent, sinó també comprovable. Per això, oferim serveis de desenvolupament de programari a mida que integren aquests algoritmes d'avantguarda en plataformes cloud, garantint escalabilitat, seguretat i certificació. Si la teva organització busca implementar models de machine learning amb transparència total, el Shapley exacte és el camí, i estem preparats per ajudar-te a recórrer-lo.





