La intel·ligència artificial ha demostrat una capacitat sorprenent per analitzar imatges mèdiques, especialment en cardiologia. Els models actuals de vídeo profund estimen la fracció d'ejacció del ventricle esquerre (FEVE) a partir d'ecocardiogrames amb una precisió propera a la d'experts humans. No obstant, una auditoria recent revela una paradoxa inquietant: aquests models són fidels anatòmicament, però cecs temporalment. És a dir, localitzen correctament el ventricle esquerre a l'espai, però ignoren els fotogrames clau (sístole final i diàstole final) que defineixen clínicament la FEVE. Aquesta troballa qüestiona la validesa de les explicacions post-hoc —com Grad-CAM per a CNN o Chefer relevance per a transformers— utilitzades per certificar que el model 'mira el lloc correcte'.
La investigació, basada en el conjunt de dades EchoNet-Dynamic, va ajustar dues arquitectures diferents: un transformer VideoMAE amb aprenentatge auto-supervisat i un CNN R(2+1)D pre-entrenat en Kinetics. Ambdós van ser auditats amb mètriques com IoR (intersecció sobre rellevància) davant màscares del ventricle esquerre, AUC d'eliminació i un índex de localització temporal sobre els fotogrames ES/ED. Els resultats van ser clars: ambdós models van superar significativament l'atzar en precisió espacial (IoR 2.91x per a VideoMAE i 1.98x per a R(2+1)D), però la localització temporal va ser indistinguible de l'atzar (0.97–1.00). Fins i tot en realitzar occlusiones amb tublets per separar fallades d'atribució del comportament real del model, es va confirmar que els models no depenen preferentment dels fotogrames ES/ED (0.90x respecte a l'atzar).
Això implica que la fidelitat espacial no garanteix fidelitat temporal. Les tècniques d'intel·ligència artificial explicable (XAI) poden certificar que un model atén al ventricle esquerre, però oculten que ignora els instants decisius del cicle cardíac. Per a aplicacions clíniques, aquesta ceguesa temporal podria traduir-se en diagnòstics erronis, especialment en pacients amb arrítmies o contraccions irregulars on el pic sistòlic o diastòlic es desvia del patró esperat.
En aquest context, Q2BSTUDIO emergeix com un soci estratègic per a empreses que busquen desenvolupar solucions d'IA robustes i auditables. La nostra experiència en el desenvolupament de aplicacions a mida ens permet dissenyar models que incorporen explícitament restriccions temporals, ja sigui mitjançant pèrdues ponderades per fotogrames clau, mecanismes d'atenció temporal explícita o validació basada en sèries temporals completes. A més, integrem capacitats de ciberseguretat i cloud computing (AWS/Azure) per garantir que les dades mèdiques sensibles es processin de forma segura i escalable.
L'auditoria de models de FEVE és només un exemple d'un problema més ampli: molts sistemes d'IA en diagnòstic per imatge són avaluats únicament per la seva precisió global, sense desglossar la contribució temporal. A Q2BSTUDIO proposem un enfocament d'auditoria multidimensional que combini mètriques espacials, temporals i d'estabilitat, similar a com auditaríem un sistema de BI/Power BI per detectar biaixos en les dades històriques. Els nostres agents d'IA poden executar pipelines de proves automatitzades que generen mapes de rellevància espai-temporal i els comparen amb anotacions d'experts, detectant així patrons de ceguesa temporal abans de desplegar el model en producció.
La indústria de la salut necessita models que no només mirin el lloc correcte, sinó també el moment correcte. Ignorar la dimensió temporal és com un cardiòleg que examina només una imatge estática del cor, perdent la dinàmica essencial. Amb Q2BSTUDIO, les organitzacions poden construir sistemes d'IA que integren la seqüència completa de fotogrames, aprofitant arquitectures transformer temporals i tècniques d'augment de dades que preserven la cronologia. A més, la nostra infraestructura en cloud AWS/Azure permet processar grans volums d'ecocardiogrames amb baixa latència, mentre que les capes de ciberseguretat garanteixen el compliment de normatives com HIPAA o GDPR.
La combinació de visió artificial, agents intel·ligents i analítica de dades (BI / Power BI) permet a les empreses no només predir la FEVE, sinó també explicar per què s'ha assolit un valor determinat, identificant si el model va utilitzar els fotogrames correctes o si simplement es va basar en correlacions espúries. A Q2BSTUDIO hem desenvolupat metodologies pròpies per entrenar models amb pèrdues que penalitzen la falta d'atenció temporal, aconseguint que les xarxes aprenguin a distingir entre sístole i diàstole sense necessitat de supervisió explícita de fotogrames, reduint així el cost d'anotació manual.
L'estudi original subratlla que la fidelitat espacial no implica fidelitat temporal, i que les explicacions dels models s'han d'auditar en ambdues dimensions. Per a les empreses tecnològiques que treballen en diagnòstic assistit per IA, aquesta és una crida a l'acció: no n'hi ha prou que el model tingui un bon rendiment global; cal verificar que el seu raonament coincideix amb el procés clínic real. A Q2BSTUDIO oferim serveis de consultoria, desenvolupament i auditoria de models d'IA, adaptant-nos a sectors com salut, finances o manufactura, on la dimensió temporal és crítica. Contacti'ns per descobrir com podem ajudar-lo a construir models que no només siguin precisos, sinó també explicables i fiables en el temps.




