NeuroVFM: Nou model fundacional de neuroimatge amb Vol-JEPA en MRI i CT clínics

Descobreix NeuroVFM, model fundacional de neuroimatge entrenat amb Vol-JEPA en 5.24 milions de volums clínics. Supera GPT-5 en triatge i generació d'informes.

miércoles, 29 de julio de 2026 • 7 min de lectura • Equip Q2BSTUDIO

NeuroVFM: Aprendizaje sin etiquetas en neuroimagen clínica

La intel·ligència artificial aplicada a la imatge mèdica ha experimentat avenços notables en els darrers anys, però els models fonamentals generalistes han topat amb un obstacle recurrent: la manca de dades clíniques de neuroimatge de qualitat. Mentre que models com GPT s’entrenen amb vastos corpus d’Internet, les ressonàncies magnètiques (MRI) i tomografies computades (CT) rarament apareixen a la web pública perquè contenen trets facials identificables. Aquest buit de dades ha limitat el rendiment dels models de propòsit general en tasques de diagnòstic cerebral. Davant d’aquest repte, un equip de la Universitat de Michigan ha desenvolupat NeuroVFM, un model fonamental visual per a neuroimatge que aprèn directament de la pràctica clínica no curada, sense necessitat d’etiquetes humanes ni informes radiològics aparellats. La seva arquitectura central, Vol-JEPA, estén els enfocaments JEPA al volum tridimensional, predient representacions latents en lloc de píxels. Els resultats, publicats a Nature Medicine, mostren una millora significativa respecte a models previs, amb un AUROC superior al 92% tant en CT com en MRI. Aquest assoliment no només representa un avenç científic, sinó que obre la porta a noves aplicacions en triatge, generació d’informes i diagnòstic assistit per IA, tot amb un cost computacional molt inferior al de models propietaris com GPT-5.

Però més enllà del laboratori, la implementació de solucions com NeuroVFM en entorns sanitaris reals requereix una reflexió profunda sobre la infraestructura tecnològica necessària. No n’hi ha prou amb tenir un model potent: cal programari a mida que integri aquests models en els fluxos de treball clínics, garantint seguretat, escalabilitat i compliment normatiu. Empreses com Q2BSTUDIO, especialitzades en desenvolupament de programari, intel·ligència artificial i ciberseguretat, estan perfectament posicionades per ajudar hospitals i centres de recerca a desplegar aquest tipus de models de manera eficient i segura. La combinació de models fonamentals d’avantguarda amb una plataforma tecnològica robusta és la clau per transformar la promesa de la IA en un impacte real sobre la salut dels pacients.

En aquest article explorarem amb detall com funciona NeuroVFM, què el diferencia d’altres enfocaments, quins resultats ha obtingut en la pràctica clínica i com les empreses tecnològiques poden facilitar-ne l’adopció mitjançant serveis de cloud computing, agents d’IA i solucions de business intelligence.

El problema de la manca de dades clíniques en els models generalistes és ben conegut. Els models fonamentals actuals, com GPT-4o, Claude o Gemini, s’entrenen predominantment amb text i imatges extrets d’Internet. No obstant això, les imatges de neuroimatge clínica (MRI i CT) estan protegides per regulacions de privacitat com HIPAA als Estats Units o el GDPR a Europa, ja que contenen informació biomètrica identificable. Com a resultat, aquests models rarament han vist un escàner cerebral real durant l’entrenament, la qual cosa limita dràsticament la seva capacitat per interpretar patologies neurològiques.

L’equip de la Universitat de Michigan va abordar aquesta limitació mitjançant el que anomenen 'aprenentatge del sistema de salut' (health system learning). En lloc de dependre de conjunts de dades curats i etiquetats manualment, van utilitzar 5,24 milions de volums clínics de MRI i CT obtinguts al llarg de dues dècades d’atenció rutinària a Michigan Medicine. Aquestes dades no van ser netejades ni anotades; simplement es van extreure del flux de treball clínic habitual. El model va aprendre a representar l’anatomia cerebral i les anomalies sense necessitat d’informes de radiólegs ni etiquetes de diagnòstic. Aquest enfocament evita el coll d’ampolla d’haver d’aparellar cada imatge amb un informe textual i elimina el biaix de selecció de malalties específiques que afecta els classificadors estrets tradicionals.

L’arquitectura del model es basa en Vol-JEPA, una extensió tridimensional dels mètodes JEPA (Joint Embedding Predictive Architecture) prèviament desenvolupats per l’equip de Meta AI. Mentre que I-JEPA opera sobre imatges 2D i V-JEPA sobre vídeos, Vol-JEPA processa volums complets 3D. El procés comença tokenitzant cada volum en parxes no solapades de 4x16x16 vòxels. Després es divideix el volum en una petita porció visible (context) i una porció més gran emmascarada (target). Un codificador estudiant processa les parxes de context, i un predictor combina les representacions latents del context amb les codificacions de posició del target per predir les representacions latents de la regió emmascarada. Un codificador professor, que és una mitjana mòbil exponencial de l’estudiant, genera les representacions objectiu reals. La funció de pèrdua és una L1 suau entre les representacions predites i les del professor, sense gradients a través del professor.

L’emmascarament és selectiu: se centra en la regió del cap, utilitzant màscares precalculades. Per a MRI s’utilitza un 25% de context i per a CT un 20%, amb un 20% de dropout de parxes. Això força el codificador a modelar la neuroanatomia compartida en lloc d’aprendre dreceres basades en el fons de la imatge. El resultat és un model amb 85,8 milions de paràmetres en la versió base i 21,7 milions en la versió petita, que s’entrena en menys de 1.000 hores GPU, set vegades més ràpid que una línia base 3DINO i amb capacitat per processar lots 16 vegades més grans amb la mateixa memòria.

Els resultats quantitatius són impressionants. El model va aconseguir un AUROC macro-promitjat del 92,68% en CT i 92,49% en MRI sobre 156 tasques diagnòstiques (74 de MRI i 82 de CT). Va superar tots els models de referència, incloent HLIP (entrenat amb supervisió d’informes), NeuroMAE (reconstrucció de vòxels), PRIMA, DINOv3 i BiomedCLIP. La diferència amb HLIP, que comparteix les mateixes dades d’entrenament però utilitza supervisió textual, va ser de -0,98 punts percentuals, demostrant que la predicció latent és superior a la supervisió per informes. Davant de NeuroMAE, la diferència va ser de -1,55 punts, evidenciant que predir representacions latents és més efectiu que reconstruir píxels.

Més enllà del diagnòstic, NeuroVFM permet tasques avançades de generació d’informes i triatge. Els investigadors van combinar el codificador congelat de NeuroVFM amb un model de llenguatge gran, Qwen3-14B, en una arquitectura tipus LLaVA-1.5, donant lloc a NeuroVFM-LLaVA. Aquest sistema genera troballes estructurades a partir de volums de neuroimatge i, mitjançant un model de raonament, assigna nivells d’agudesa: no rellevant, rutinari o urgent. Els resultats van superar GPT-5 en precisió de triatge (92,6% de precisió balancejada davant 71,2%) i en taxa d’omissió de troballes crítiques (13,5% davant 50,3%). A més, el cost d’inferència va ser més de 24 vegades inferior i la petjada de carboni més de 23 vegades menor.

No obstant això, el model no és perfecte. En un estudi prospectiu silenciós d’una setmana amb 1.155 pacients, NeuroVFM va aconseguir una sensibilitat del 86,5%, cosa que significa que va passar per alt 21 de 155 troballes crítiques. Els autors emfatitzen que s’ha d’utilitzar com a suport a la decisió clínica, no com a cribratge autònom. A més, el model no està aprovat per la FDA i els seus pesos es distribueixen sota llicència CC-BY-NC-SA-4.0, la qual cosa limita el seu ús comercial. També existeix el risc de biaix relacionat amb l’arquitectura, el conjunt de dades i l’objectiu d’aprenentatge, ja que els resultats provenen d’un sol sistema acadèmic de salut.

Des d’una perspectiva empresarial, la implementació de models com NeuroVFM en un hospital o centre de diagnòstic requereix una infraestructura tecnològica adequada. Aquí és on empreses com Q2BSTUDIO poden marcar la diferència. Oferim serveis cloud a Azure i AWS que permeten desplegar models d’IA a gran escala amb alta disponibilitat i seguretat. La ciberseguretat és especialment crítica en l’àmbit sanitari, on les dades dels pacients estan protegides per normatives estrictes; per això disposem de serveis de pentesting i auditoria de seguretat per garantir que el desplegament sigui conforme. A més, els nostres agents d’IA poden automatitzar fluxos de treball de triatge, permetent que el model NeuroVFM s’integri sense fricció en els sistemes d’informació hospitalària.

Un altre aspecte essencial és la visualització i anàlisi dels resultats. Els models generen una gran quantitat de dades que han de ser interpretades pels radiólegs. Mitjançant serveis de Business Intelligence i Power BI, podem crear dashboards interactius que mostrin les prediccions del model, els nivells d’agudesa i les tendències temporals, facilitant la presa de decisions clíniques i la gestió de recursos. Així mateix, el desenvolupament d’aplicacions a mida permet adaptar la interfície d’usuari a les necessitats específiques de cada hospital, integrant la IA de manera natural en el flux de treball del radióleg.

En resum, NeuroVFM representa una fita en la neuroimatge clínica en demostrar que un model entrenat exclusivament amb dades no curades del món real pot superar models entrenats amb supervisió textual o reconstrucció de píxels. La seva arquitectura Vol-JEPA, eficient i escalable, obre la porta a una nova generació d’eines de diagnòstic assistit per IA. No obstant això, el camí cap a l’adopció clínica generalitzada requereix més que un bon model: necessita una plataforma tecnològica sòlida que garanteixi seguretat, escalabilitat i integració. A Q2BSTUDIO oferim precisament això: desenvolupament de programari a mida, cloud computing, ciberseguretat, agents d’IA i BI per transformar la innovació en impacte real. La IA en salut no és el futur, és el present, i estem preparats per acompanyar les organitzacions en aquest viatge.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.