La creixent adopció de sistemes d'intel·ligència artificial agencial per a la síntesi de literatura científica, com OpenScholar o PaperQA2, ha portat un repte crític: garantir que cada afirmació generada estigui recolzada per una font verificable. Aquests sistemes retornen respostes citades, i tant ells com els seus benchmarks verifiquen si aquestes cites són correctes, ja sigui mitjançant un model d'atribució fix o avaluadors humans. No obstant això, un aspecte fonamental ha quedat sense auditar: la fiabilitat del propi procés de verificació. Investigacions recents demostren que aquesta verificació no és fiable i que això té conseqüències tangibles. En sortides idèntiques d'un agent, la taxa de cites no recolzades mesurada varia entre el 3% i el 18% depenent únicament del nivell d'exigència del verificador. A més, encara que diferents verificadors coincideixen en quines cites estan recolzades, discrepen en quines senyalar com a problemàtiques, amb un acord específic negatiu de només 0,27 a 0,30. Això implica que cap conjunt únic de banderes és fiable i que qualsevol comparació entre publicacions no té validesa sense especificar el verificador i el protocol utilitzat.
Davant d'aquesta realitat, sorgeix la necessitat d'un protocol d'avaluació ancorat en estàndards d'or (gold-anchored) i un guardia desplegable que faci que aquest comportament sigui mesurable i acotat. El protocol proposat valida el verificador, mesura la re-atribució i calibra una garantia contra el judici humà, no contra el veredicte d'un altre model. El verificador es converteix en un instrument intercanviable, escollit segons el seu cost i rendiment (per exemple, un recall de 0,94 a la classe de cites recolzades, sobre dades no vistes). La re-atribució és un pas commodity on un BM25 determinista empata amb el millor generador obert. El guardia afegeix una capa de conformitat dividida (split-conformal) que situa un límit lliure de distribució i de mostra finita sobre les cites realment no recolzades que escapen a una regla de marcatge escollida; és una garantia sobre la taxa de captura, no sobre la correcció de la conclusió. Aquest límit es manté sobre dades gold no vistes, i s'identifica i quantifica la condició que governa la seva transferència al desplegament: la dificultat de calibratge negativa, amb una recepta concreta de recalibratge que no havia estat provada en treballs previs de factualitat conformal.
Aquest enfocament, validat en quatre models oberts de 27-35B i tres pipelines agencials sobre benchmarks públics com SciFact, QASA i PubMedQA, ofereix un kit obert que cap en una sola GPU. Per a una empresa com Q2BSTUDIO, especialitzada en el desenvolupament d'aplicacions a mida, la integració de sistemes de verificació robustos és una extensió natural de la seva proposta de valor. En un ecosistema on la IA generativa es desplega en entorns productius, la fiabilitat de les fonts no és un luxe, sinó un requisit de compliment i confiança. Q2BSTUDIO combina el seu coneixement en intel·ligència artificial amb capacitats en ciberseguretat per dissenyar pipelines que no només generin contingut, sinó que l'auditin de forma independent, evitant que cites falses o mal atribuïdes contaminin informes crítics, estudis de mercat o documentació tècnica.
La problemàtica descrita a la investigació sobre fidelitat de cites és directament rellevant per a qualsevol organització que utilitzi agents d'IA per sintetitzar coneixement. Moltes empreses confien en assistents basats en grans models de llenguatge (LLM) per resumir papers, normatives o informes interns, i després utilitzen aquests resums per prendre decisions. Si el sistema de verificació de cites és inconsistent, el risc de basar una decisió en informació no recolzada és alt. Q2BSTUDIO aborda aquest risc mitjançant el desenvolupament d'agents IA que incorporen un mòdul de verificació calibrat, seguint principis similars al protocol gold-anchored. A més, la seva experiència en entorns cloud AWS/Azure permet desplegar aquests sistemes amb escalabilitat i control de costos, mentre que les seves solucions de BI/Power BI faciliten la monitorització de mètriques de qualitat, com la taxa de cites recolzades o la taxa de falsos positius a la verificació.
Un aspecte clau del protocol és la seva capacitat de mesurar la re-atribució: quan un model cita un paper, però el verificador assigna aquesta cita a una altra font, el sistema detecta aquesta inconsistència. Això és especialment útil en entorns on s'utilitzen múltiples fonts de dades i és necessari traçar l'origen de cada afirmació. Q2BSTUDIO implementa aquestes lògiques en els seus desenvolupaments d'aplicacions a mida, personalitzant el motor de cerca i comparació (com BM25 o versions semàntiques) per a cada domini, ja sigui biomèdic, legal o financer. La flexibilitat d'intercanviar el verificador segons el pressupost i la precisió desitjada és un avantatge que Q2BSTUDIO ofereix als seus clients, permetent-los triar entre models open-source lleugers o models propietaris més costosos, amb la garantia que el protocol d'avaluació es manté constant.
La capa de conformitat dividida és particularment innovadora perquè proporciona un límit estadístic sobre les cites no recolzades que passen desapercebudes. En lloc de confiar en llindars arbitraris, s'obté una garantia amb validesa en mostres finites, cosa que és crucial en aplicacions on el volum de dades és alt i la tolerància a l'error és baixa. Q2BSTUDIO integra aquest tipus de tècniques d'inferència conformal a les seves solucions d'IA per oferir als seus clients un nivell de certesa quantificable. En l'àmbit de la ciberseguretat, per exemple, la capacitat de garantir que un agent no ha inventat una cita sobre una vulnerabilitat pot marcar la diferència entre un pegat correcte i una fallada de seguretat. El recalibratge davant de canvis en la dificultat del domini és un altre aspecte que Q2BSTUDIO automatitza mitjançant dashboards de Power BI que mostren l'evolució de la taxa de cites no recolzades i recomanen quan cal reentrenar el verificador.
Més enllà de la investigació acadèmica, la lliçó per al sector empresarial és clara: la verificació de fonts en sistemes agencials no es pot donar per feta. Les empreses que despleguen assistents d'IA per a la síntesi de coneixement han d'implementar processos d'auditoria independents, preferiblement amb protocols oberts i verificables. Q2BSTUDIO ofereix consultoria i desenvolupament per construir aquests sistemes a mida, des de la selecció del model base fins a la integració amb infraestructures cloud AWS/Azure, passant per la creació de pipelines de verificació amb garanties conformals. A més, el seu equip de ciberseguretat s'assegura que les dades sensibles utilitzades a les síntesis estiguin protegides, i que els propis agents no siguin vectors d'atac.
En resum, l'avaluació de la fidelitat de cites en síntesi científica agencial és un camp emergent que exposa la fragilitat dels mecanismes actuals. El protocol gold-anchored i el guardia conformal descrits a la literatura ofereixen un camí cap a sistemes més fiables. Q2BSTUDIO està posicionat per ajudar les organitzacions a adoptar aquestes pràctiques, combinant la seva expertesa en IA, aplicacions a mida, cloud i BI per construir solucions que no només generin coneixement, sinó que el validin amb rigor. En un món on la informació és poder, assegurar que les cites siguin reals no és només una qüestió tècnica, sinó de responsabilitat corporativa.





