Dependència visual en benchmarks de video LLM: precisió sense fonament

Descobriu com el VDG revela que la precisió en benchmarks de video LLM no garanteix comprensió visual real. Auditam 20 models i trobem resultats sorprenents.

lunes, 27 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

El gap de dependencia visual (VDG) en modelos de lenguaje de video

L'avaluació de models de llenguatge grans (LLMs) aplicats a vídeo ha aconseguit nivells de precisió notables en benchmarks com MVBench. No obstant, un estudi recent publicat a arXiv (2607.13305) introdueix un concepte revelador: la Bretxa de Dependència Visual (VDG, per les sigles en anglès). Aquesta mètrica mesura la diferència en la correcció per pregunta entre presentar el vídeo original i una pantalla negra. Els resultats indiquen que la precisió general pot emmascasar una manca de veritable comprensió visual. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entenem que aquestes investigacions són crítiques per avançar en la creació de sistemes d'intel·ligència artificial realment fonamentats.

L'estudi audita vint models que van des de 2 fins a 78 mil milions de paràmetres, abastant deu famílies d'arquitectures. Mitjançant proves aparellades de McNemar a MVBench, els investigadors van trobar que la precisió i la dependència visual són separables: els models difereixen significativament en el vídeo original (p = 0.0003), però no en pantalles negres (p = 0.53). Això suggereix que molts models aconsegueixen un alt rendiment simplement explotant biaixos lingüístics o estadístics, sense necessitat de processar realment la informació visual. Per a una empresa com Q2BSTUDIO, especialitzada en el desenvolupament d'aplicacions a mida, aquestes troballes subratllen la importància de dissenyar sistemes d'IA que validin la seva capacitat visual de forma rigorosa, més enllà dels benchmarks convencionals.

Una de les contribucions més impactants del treball és l'escala diagnòstica que va des de pantalla negra fins a un sol fotograma, fotogrames barrejats i vídeo original. Els resultats mostren que la diversitat de fotogrames proporciona la major part del benefici visual, mentre que l'ordre temporal contribueix amb una precisió gairebé nul·la en setze models de pes obert. Això implica que els models poden estar 'veient' imatges individuals sense comprendre la seqüència temporal, la qual cosa limita la seva aplicabilitat en tasques que requereixen raonament sobre esdeveniments. En l'àmbit empresarial, on utilitzem tecnologies com IA per automatitzar processos complexos, és essencial garantir que els models no només siguin precisos, sinó que realment comprenguin el context visual temporal.

A més, un experiment amb H.264 va revelar que la precisió agregada estable amaga canvis bidireccionals en les respostes a nivell de pregunta. Això significa que un model pot respondre correctament una pregunta en una condició i malament en una altra, compensant-se en la mitjana. Aquest fenomen és perillós per a aplicacions crítiques com la videovigilància o l'anàlisi de vídeo al núvol. Q2BSTUDIO ofereix solucions de cloud AWS/Azure on la integritat de les dades i la fiabilitat dels models són fonamentals; per això, la VDG podria convertir-se en una auditoria estàndard per a benchmarks de vídeo.

La investigació també es va estendre a quatre models accedits per API, els valors de VDG dels quals van oscil·lar entre 0.025 i 0.315, demostrant que fins i tot models propietaris poden dependre dèbilment de l'entrada visual. Des de la perspectiva de la ciberseguretat, un model que ignora el vídeo real podria ser vulnerable a atacs adversarials que manipulin l'entrada visual sense afectar la sortida. Q2BSTUDIO integra ciberseguretat en els seus desenvolupaments, assegurant que els sistemes d'IA siguin robustos davant d'aquestes amenaces.

Una altra troballa clau és que els rànquings per tipus de tasca són estables: la percepció d'atributs és fortament visual, mentre que el raonament temporal s'acosta a la línia base només amb llenguatge. Això té implicacions directes per al disseny d'agents IA que han d'interactuar amb entorns dinàmics. A Q2BSTUDIO, desenvolupem agents IA per a automatització, i sabem que el raonament temporal requereix una comprensió causal que va més enllà de la correlació estadística. La VDG podria ajudar a identificar quins models són adequats per a tasques que exigeixen veritable comprensió visual.

L'estudi descarta que la baixa freqüència de mostreig sigui la causa, ja que un escombrat de 0.5 a 24 FPS no va canviar els resultats. Això suggereix que la debilitat visual és intrínseca a l'arquitectura o a l'entrenament. Per a empreses que busquen implementar solucions de BI/Power BI amb anàlisi de vídeo, és crucial seleccionar models que realment processin la informació visual. Q2BSTUDIO pot ajudar a avaluar i desplegar models amb la validació adequada.

En resum, la Bretxa de Dependència Visual emergeix com una eina necessària per auditar si els benchmarks de vídeo mesuren capacitat fonamentada visualment o només precisió superficial. A Q2BSTUDIO, creiem que la transparència i la robustesa són pilars de la tecnologia responsable. Per això, incorporem aquests principis als nostres serveis d'IA, cloud, ciberseguretat i desenvolupament de programari a mida. La comunitat acadèmica i empresarial hauria d'adoptar mètriques com la VDG per garantir que els avenços en video LLMs es tradueixin en aplicacions fiables i segures.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.