ActiveVision: L'examen que els MLLMs no poden superar

Descobreix com ActiveVision demostra que els MLLMs més avançats fallen en observació visual activa, aconseguint només un 10% d'èxit contra el 96% humà.

domingo, 26 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Nuevo benchmark revela el punto ciego de la IA en percepción visual

La intel·ligència artificial ha avançat a passes de gegant en els darrers anys, però un nou estudi revela una bretxa crítica que cap model multimodal de llenguatge (MLLM) actual ha aconseguit superar. El benchmark ActiveVision, desenvolupat per un equip interdisciplinari, demostra que fins i tot els sistemes més sofisticats —com GPT-5.5 o Claude Fable 5— obtenen resultats desastrosos en tasques que requereixen observació visual activa, és a dir, la capacitat de redirigir la mirada i ajustar hipòtesis en temps real. Mentre que tres participants humans aconsegueixen un 96,1% d'encert, el millor MLLM amb prou feines supera el 10,6%. Aquesta troballa no només qüestiona la robustesa perceptiva dels models actuals, sinó que obre una oportunitat estratègica per a empreses que busquen integrar visió artificial veritablement adaptativa en els seus processos.

El concepte d''observació activa' ha estat central en la psicologia i la ciència cognitiva durant dècades. La visió humana no és una instantània estàtica, sinó un bucle continu on cada hipòtesi genera un nou moviment ocular. ActiveVision mesura precisament aquesta capacitat en màquines: tasques que obliguen a reexaminar escenes canviants, identificar objectes ocults o rastrejar trajectòries sota incertesa. Els resultats mostren que els MLLMs no tenen aquest bucle percepció-raonament; fins i tot quan se'ls permet escriure i executar el seu propi codi de visió, els errors són sistemàtics. La conclusió és clara: la propera frontera de la IA no és només generar text o imatges, sinó construir sistemes que 'vegin' com ho fan els éssers humans, iterant sobre la informació visual.

Des d'una perspectiva empresarial, aquesta limitació té conseqüències directes. Un assistent d'IA que no pot detectar un defecte en una línia de producció perquè la seva 'mirada' és fixa, o un vehicle autònom que no recalcula la seva trajectòria davant un obstacle imprevist, són exemples de com la manca d'observació activa redueix la fiabilitat. Aquí és on la intel·ligència artificial aplicada a mida pot marcar la diferència. Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entén que la veritable percepció artificial requereix un disseny arquitectònic que combini models de llenguatge, visió per computador i bucles de retroalimentació contínua. No es tracta només d'implementar una API preentrenada, sinó de crear aplicacions a mida que integrin sensors, lògica de negoci i mecanismes de correcció en temps real.

La bretxa que ActiveVision exposa també ressalta la importància de la infraestructura subjacent. Per executar tasques d'observació activa a escala industrial, es necessiten plataformes cloud robustes i segures. Els serveis de cloud AWS/Azure ofereixen l'elasticitat necessària per processar vídeo en temps real, emmagatzemar dades d'entrenament i desplegar models amb baixa latència. No obstant, el cloud per si sol no resol el problema cognitiu: cal orquestrar microserveis que permetin als agents d'IA reaccionar dinàmicament. Aquí entra en joc el concepte d'agents IA, entitats autònomes capaces de percebre, raonar i actuar. Q2BSTUDIO dissenya aquests agents amb bucles de percepció activa, aprofitant frameworks de machine learning i bases de dades vectorials perquè cada observació modifiqui el model intern del sistema.

Un altre aspecte crític és la ciberseguretat. Com més autònom és un sistema de visió, més gran és la superfície d'atac. Un adversari podria enganyar un MLLM amb patrons acuradament dissenyats (adversarials) que explotin la seva manca d'observació activa. Per això, les solucions de ciberseguretat s'han d'integrar des del disseny: proves de penetració, monitorització d'integritat de models i xifrat de dades visuals. Q2BSTUDIO implementa pràctiques de desenvolupament segur i auditoria contínua per garantir que els sistemes de percepció artificial no només siguin precisos, sinó també resilients.

L'analítica de dades també juga un paper fonamental. Un sistema que observa activament genera enormes volums d'informació temporal i espacial. BI/Power BI permet transformar aquesta informació en dashboards que revelen patrons de comportament, eficiència operativa o anomalies. Per exemple, en un magatzem automatitzat, els agents de visió que inspeccionen inventaris en temps real poden alimentar quadres de comandament que optimitzin la reposició d'estoc. La combinació d'observació activa i business intelligence converteix les dades visuals en decisions de negoci.

L'estudi ActiveVision també suggereix que els models actuals són incapaços d'aprendre dels seus propis errors perceptius. Això apunta a la necessitat de metodologies d'entrenament que incloguin cicles de reforç basats en l'acció, similars a l'aprenentatge per reforç amb realimentació visual. Q2BSTUDIO ha desenvolupat pipelines d'entrenament personalitzats que integren simulacions 3D, entorns augmentats i dades sintètiques perquè els models aprenguin a 'preguntar' visualment abans de respondre. Aquest enfocament redueix la bretxa entre la cognició artificial i la humana, i és especialment rellevant per a sectors com la robòtica, la conducció autònoma o la inspecció de qualitat.

En l'àmbit de l'automatització, els resultats d'ActiveVision reforcen la idea que no n'hi ha prou amb connectar una càmera a un LLM. Cal un ecosistema complet: des de la captura d'imatges amb maquinari especialitzat fins a la inferència a la vora (edge computing). Q2BSTUDIO ofereix solucions d'automatització que integren orquestració de fluxos de treball, processament d'esdeveniments i models de visió activa, garantint que cada pas del procés es beneficïi d'una percepció dinàmica. Per exemple, en una planta de fabricació, un sistema d'inspecció visual actiu pot adaptar l'angle de la càmera segons les peces que detecta, evitant falsos negatius.

La lliçó més important d'ActiveVision és que la intel·ligència artificial encara té un llarg camí per recórrer per igualar la percepció humana. Però lluny de ser una mala notícia, és una oportunitat per a les empreses que aposten per la innovació. En lloc d'esperar que els models comercials resolguin aquestes limitacions, les organitzacions poden treballar amb companyies com Q2BSTUDIO per dissenyar sistemes a mida que incorporin bucles d'observació activa des de la base. El futur de la IA no serà monolític, sinó col·laboratiu: models que s'especialitzen en percepció, raonament i acció, integrats en plataformes cloud segures i governades per principis de ciberseguretat. ActiveVision ens recorda que veure no és el mateix que observar, i que la veritable intel·ligència artificial requereix un diàleg constant amb l'entorn.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.