Atributs des d'imatges, no noms de classe: selecció condicionada per distribució

Descobreix com seleccionar atributs directament de les imatges millora la classificació zero-shot amb CLIP, superant els descriptors de LLM.

jueves, 23 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Selecciona atributos de imágenes reales para mejorar CLIP

La intel·ligència artificial ha avançat fins al punt de permetre la classificació d'imatges sense necessitat d'exemples previs, un camp conegut com a zero-shot classification. No obstant, la interpretabilitat continua sent un repte crític, especialment quan s'utilitzen models de llenguatge gran (LLM) per generar descripcions de les classes. Investigacions recents revelen una debilitat fonamental: aquests descriptors solen estar condicionats per l'etiqueta mateixa, no per les imatges reals. Per exemple, un LLM insisteix que les maduixes són vermelles, però en un conjunt de dades com ImageNet-Sketch, on les maduixes apareixen com a dibuixos lineals sense color, aquest descriptor esdevé enganyós. Això provoca una caiguda dràstica en la precisió: en eliminar el nom de la classe del prompt, l'exactitud a ImageNet passa del 59,5% al 15,5%. La solució proposada és un enfocament radicalment diferent: seleccionar atributs directament de les imatges objectiu, no del llenguatge. En aquest article explorem com aquesta tècnica de selecció condicionada millora la robustesa, i com empreses com Q2BSTUDIO integren aquests conceptes en les seves solucions de programari a mida, intel·ligència artificial, ciberseguretat i cloud.

El problema central rau en què els descriptors generats per LLM descriuen el concepte en abstracte, no la manifestació visual concreta a les dades. Quan el domini canvia —per exemple, de fotografies reals a esbossos o imatges de satèl·lit— aquests atributs deixen de ser rellevants. En canvi, al puntuar un gran conjunt d'atributs contra les imatges en l'espai d'incrustació compartit de CLIP i seleccionar els millors per classe, s'aconsegueixen prompts que no depenen del nom de la classe. Els resultats parlen per si sols: amb aquesta selecció, la precisió a ImageNet puja al 23,8% (davant del 15,5% dels descriptors LLM), i la millora es manté en quatre variants desplaçades d'ImageNet. Fins i tot quan es reutilitza el mateix conjunt d'atributs del LLM, el mecanisme de selecció n'és la causa del progrés. A més, amb només una imatge per classe, aquest mètode supera en 3 punts tècniques com CoOp (prompt-tuning), i ho fa en menys d'un minut en lloc de 14 hores, sense introduir soft prompts opacs que dificultin la interpretació.

Des d'una perspectiva empresarial i tècnica, aquesta innovació té implicacions profundes. A Q2BSTUDIO, entenem que la intel·ligència artificial no només ha de ser precisa, sinó també comprensible i adaptativa. Els nostres serveis de desenvolupament d'aplicacions a mida incorporen tècniques de selecció d'atributs basades en dades per garantir que els models de classificació funcionin en condicions reals, on les dades d'entrenament rarament coincideixen perfectament amb les de producció. Per exemple, en un sistema de classificació de productes per a comerç electrònic, els atributs visuals rellevants —com ara forma, textura o color dominant— s'han d'extreure de les imatges reals del catàleg, no de descripcions genèriques. El mateix s'aplica en diagnòstics mèdics assistits per IA, on les característiques de les imatges de raigs X o ressonàncies no poden dependre d'etiquetes textuals preconcebudes.

La selecció condicionada no només millora la precisió, sinó que també ofereix un avantatge addicional: el conjunt d'atributs seleccionats actua com un resum llegible del conjunt de dades. Això permet descriure en paraules com canvia una distribució de dades entre dominis. Per a les empreses que treballen amb big data i Business Intelligence (BI) —com els informes de Power BI—, tenir una representació textual dels canvis en les dades és invaluable. Imagineu monitorar un sistema de visió artificial en una fàbrica: quan la il·luminació o l'angle de les imatges varia, els atributs seleccionats automàticament indiquen quines característiques s'han desplaçat, permetent ajustos ràpids sense reentrenar el model complet.

A més, aquest enfocament s'integra naturalment amb la infraestructura al núvol. A Q2BSTUDIO, oferim serveis de cloud AWS/Azure per desplegar pipelines de selecció d'atributs a gran escala. Emmagatzemar les incrustacions de CLIP al núvol i executar el scoring d'atributs en paral·lel redueix dràsticament els temps de còmput, permetent actualitzacions en temps real dels classificadors. La ciberseguretat també se'n beneficia: en no dependre de noms de classe humans, s'elimina el risc que un atacant manipuli les etiquetes per enganyar el model. Els agents d'IA, cada cop més utilitzats en automatització de processos, poden aprofitar aquesta tècnica per adaptar la seva percepció visual al context específic sense intervenció humana.

En resum, la selecció d'atributs des d'imatges, en lloc de des de noms de classe, representa un canvi de paradigma cap a sistemes d'intel·ligència artificial més robustos, interpretables i eficients. Per a les empreses que busquen avantatges competitius, incorporar aquestes tècniques a través de socis tecnològics com Q2BSTUDIO permet accelerar l'adopció de solucions de classificació sense biaixos textuals, millorant la presa de decisions basada en dades reals. Des d'aplicacions a mida fins a agents intel·ligents, la clau està en deixar que les pròpies dades guiïn els descriptors, no el llenguatge preconcebut.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.