En el camp de la intel·ligència artificial aplicada a la salut, els models de llenguatge grans (LLMs) han demostrat un rendiment excel·lent en exàmens de coneixement mèdic, però un estudi recent publicat a arXiv (2607.10275v1) revela una bretxa crítica: quan s'enfronten a escenaris de raonament clínic real, on la incertesa obliga a buscar informació activament, aquests sistemes fallen de manera sistemàtica. El treball, centrat en oncologia hematològica, avalua com els LLMs decideixen quines dades sol·licitar abans d'emetre un diagnòstic i pla de tractament, i els resultats són preocupants: el millor model només va assolir un 68% de precisió global. El més revelador és que el principal obstacle no és la manca de coneixement mèdic, sinó un fracàs en la cerca d'informació sota incertesa, un fenomen que recorda els biaixos cognitius dels metges novells. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, analitzem aquestes implicacions des d'una perspectiva tècnica i empresarial, explorant com integrar agents d'IA, solucions al núvol i anàlisi de dades per superar aquestes limitacions.
L'estudi va dissenyar un marc d'avaluació agèntic on els models havien de sol·licitar dades clíniques de forma proactiva en tres rondes seqüencials abans de comprometre's amb un diagnòstic. Es van provar 32 models frontera, i l'ús de la informació —és a dir, la fracció de dades disponibles que realment es van sol·licitar— va resultar ser el predictor més fort de la precisió diagnòstica (R = 0,69, P < 0,001). No obstant, aquest ús va col·lapsar del 57% al 26% en l'última ronda, deixant sense examinar dades moleculars i citogenètiques crucials per a la selecció del tractament. Les traces de raonament obtenien puntuacions altes en una rúbrica clínica (91% per sobre del llindar), però es descorrelacionaven de la precisió, cosa que indica una bretxa entre justificacions localment coherents i conclusions globalment correctes. Les anàlisis d'error van identificar el 'satisficing' en la cerca, l'ancoratge i el tancament prematur com els modes de fracàs dominants —exactament els mateixos biaixos cognitius que caracteritzen els clínics novells segons els models de raonament diagnòstic de doble procés.
Aquesta troballa té implicacions profundes per al desenvolupament de sistemes d'IA en entorns sanitaris. No n'hi ha prou que un model tingui accés a una enciclopèdia mèdica; necessita saber quan i com buscar més dades, especialment quan la informació inicial és ambigua. A la pràctica, un assistent clínic basat en LLM que no sol·liciti proves genòmiques o perfils de mutacions pot portar a tractaments subòptims. Des de la perspectiva empresarial, això ressalta la importància de dissenyar agents d'IA amb capacitats de cerca activa i gestió de la incertesa, cosa que a Q2BSTUDIO abordem mitjançant el desenvolupament de solucions d'intel·ligència artificial que integren raonament multi-pas i loops de retroalimentació amb fonts de dades clíniques.
A més, l'estudi posa de manifest que l'arquitectura dels LLMs actuals, tot i que potent en memorització, manca de mecanismes explícits per decidir quina informació és rellevant demanar a cada pas. Això és un problema de disseny de sistema, no només de model. Per abordar-ho, calen enfocaments híbrids que combinin LLMs amb motors de regles, bases de coneixement estructurades i, sobretot, pipelines de dades que permetin accedir a la informació en temps real. Aquí és on serveis al núvol com AWS o Azure juguen un paper fonamental, ja que proporcionen la infraestructura escalable per connectar models amb bases de dades clíniques, APIs de laboratori i sistemes de registres electrònics de salut (EHR). A Q2BSTUDIO implementem desplegaments al núvol que garanteixen baixa latència i alta disponibilitat per a aplicacions mèdiques, juntament amb mesures de ciberseguretat per protegir dades sensibles.
Un altre angle rellevant és l'anàlisi de la informació no sol·licitada. L'estudi revela que els models van deixar de demanar dades moleculars a l'última ronda, cosa que suggereix un biaix cap a la confirmació d'hipòtesis inicials. En un escenari real, això podria traduir-se en diagnòstics erronis per manca d'evidència crítica. Per mitigar-ho, es poden incorporar tècniques de Business Intelligence (BI) que visualitzin l'historial de cerca del model i alertin sobre omissions significatives. Per exemple, amb Power BI i altres eines de BI, és possible construir dashboards que monitoritzin la cobertura d'informació en temps real, ajudant els desenvolupadors a identificar patrons de comportament subòptim en els agents. A Q2BSTUDIO oferim consultoria en BI per integrar aquests controls en sistemes d'IA.
La ciberseguretat també és crítica en aquest context. Els agents que sol·liciten dades clíniques han de fer-ho a través de canals segurs, complint normatives com GDPR o HIPAA. Un fracàs en la cerca d'informació no només és un problema de raonament, sinó que pot exposar vulnerabilitats si el model accedeix a dades sense la deguda autenticació. Per això, a Q2BSTUDIO incloem serveis de ciberseguretat i pentesting en el cicle de desenvolupament d'aplicacions d'IA per garantir que els fluxos de dades estiguin protegits contra accessos no autoritzats.
A més, el concepte de 'aplicacions a mida' (custom software) cobra rellevància. No existeix un LLM universal que funcioni en tots els contexts clínics; cada hospital o centre de recerca té les seves pròpies bases de dades, protocols i formes de documentar la història clínica. Desenvolupar programari a mida permet adaptar el comportament dels agents a aquestes particularitats, incloent regles específiques sobre quina informació prioritzar segons l'especialitat. A Q2BSTUDIO som especialistes en desenvolupament d'aplicacions multiplataforma que integren LLMs amb sistemes legacy, creant assistents clínics personalitzats que aprenen de les preferències dels metges i milloren amb el temps.
Finalment, l'estudi subratlla la necessitat que els models aprenguin a gestionar la incertesa de manera activa, en lloc de simplement generar respostes plausibles. Això obre la porta a noves arquitectures d''agents d'IA' que no només responguin preguntes, sinó que prenguin la iniciativa en la recollida de dades, similar a com un metge experimentat sol·licita proves addicionals abans d'emetre un diagnòstic. A Q2BSTUDIO estem explorant aquests paradigmes, combinant LLMs amb sistemes de planificació automàtica i aprenentatge per reforç per crear agents que optimitzin la seva estratègia de cerca d'informació. El futur de la IA en medicina no està només en el coneixement, sinó en la saviesa de saber què preguntar.





