L'estimació de porcions en imatges d'aliments segueix sent un dels reptes més persistents en l'avaluació dietètica automatitzada. Tot i que els models multimodals de llenguatge gran (MLLMs) han demostrat una capacitat impressionant per reconèixer una àmplia varietat d'aliments en entorns no controlats, el seu rendiment en la quantificació de volums i masses continua sent deficient. Aquest buit entre reconeixement i mesurament limita l'adopció de solucions veritablement autònomes en nutrició clínica, investigació epidemiològica i aplicacions comercials de salut digital. Un enfocament innovador proposa enfortir aquests sistemes amb un mòdul d'estimació de porcions basat en geometria, que opera sobre un backbone DINOv2 congelat i una xarxa lleugera de volum de pertinença softmax estructurada. Aquest mòdul s'integra amb el MLLM sense necessitat d'ajustar el model gran ni de sensors de profunditat externs, aconseguint reduir l'error relatiu d'estimació de porcions entre un 33% i un 41% en comparació amb les prediccions directes del MLLM.
L'arquitectura es recolza en tres pilars tècnics. Primer, el MLLM proporciona per a cada aliment detectat el seu nom, una caixa delimitadora (bounding box) i un rang de densitat esperat. Segon, un extractor de característiques visuals basat en DINOv2, un model de visió autosupervisat que roman congelat, extreu descriptors geomètrics i de textura de la regió d'interès. Tercer, una xarxa de volum de pertinença softmax, entrenada específicament per a la tasca d'estimació volumètrica, assigna a cada píxel una probabilitat de pertinença a l'aliment i modela la forma tridimensional implícita. El resultat és una estimació de porció que no depèn d'informació de profunditat explícita ni d'un ajust fi costós del MLLM. Aquest enfocament ha estat avaluat en tres benchmarks reals amb vocabulari obert, superant els principals models comercials (Gemini, GPT, Claude) en precisió de porcions i també als models específics publicats originalment per a cada conjunt de dades.
Des d'una perspectiva empresarial, aquesta innovació obre oportunitats concretes per a empreses de desenvolupament de programari com Q2BSTUDIO, especialitzada en solucions d'intel·ligència artificial i aplicacions a mida. Imagineu un sistema de nutrició personalitzada que, integrat en una aplicació mòbil, permeti als usuaris fotografiar els seus àpats i obtenir automàticament no només els aliments presents sinó també les quantitats exactes. Això requereix una infraestructura robusta al núvol per servir models d'IA amb baixa latència, així com mesures de ciberseguretat per protegir les dades sensibles de salut dels usuaris. Q2BSTUDIO ofereix serveis clau en mà d'IA i cloud AWS/Azure, combinats amb la seva experiència en desenvolupament d'aplicacions multiplataforma, per implementar solucions d'aquest tipus sense que el client hagi de gestionar la complexitat tècnica subjacent.
El mòdul d'estimació de porcions basat en geometria és un clar exemple de com un component especialitzat pot potenciar les capacitats generalistes dels MLLMs. En lloc d'intentar que un sol model ho faci tot, aquesta arquitectura híbrida separa preocupacions: el MLLM s'encarrega del reconeixement semàntic i contextual, mentre que el cap de porcions s'ocupa de la quantificació física. Aquesta modularitat no només millora la precisió sinó que facilita el manteniment i l'actualització de cada component de manera independent. Per a una empresa que busca incorporar aquesta tecnologia, l'arquitectura permet adaptacions ràpides a diferents dominis alimentaris o requisits regulatoris, especialment rellevant en sectors com la salut, la nutrició esportiva o la restauració col·lectiva.
La integració amb serveis cloud d'AWS o Azure permet escalar el processament de milers d'imatges concurrents, fonamental en aplicacions de consum massiu. A més, la gestió de dades anonimitzades i el compliment de normatives com GDPR o HIPAA requereixen un enfocament sòlid de ciberseguretat, que Q2BSTUDIO pot proporcionar mitjançant auditories de seguretat, pentesting i disseny d'infraestructures segures. L'explotació posterior de les dades d'estimació de porcions, juntament amb altres indicadors de salut, alimenta quadres de comandament de Business Intelligence (BI) com Power BI, permetent a nutricionistes o investigadors visualitzar tendències i patrons alimentaris a nivell poblacional o individual. D'aquesta manera, la tecnologia no només millora la precisió de l'estimació, sinó que genera un ecosistema de dades valuós per a la presa de decisions clíniques i comercials.
Els agents d'IA també troben un camp d'aplicació natural en aquest context. Un agent intel·ligent podria, per exemple, interactuar amb l'usuari a través d'un xat per aclarir dubtes sobre la foto presa (il·luminació, angle, aliments superposats) i després combinar l'estimació de porcions amb bases de dades nutricionals per oferir recomanacions personalitzades. Q2BSTUDIO desenvolupa agents d'IA conversacionals que s'integren amb models de llenguatge i visió, i que es poden desplegar tant en entorns cloud com en dispositius edge per preservar la privacitat. La combinació d'un mòdul de porcions precís amb un agent d'IA capaç de raonar sobre el context de l'àpat obre la porta a assistents dietètics molt més fiables que els actuals.
Des d'un punt de vista tècnic, l'elecció de DINOv2 com a backbone congelat és estratègica. DINOv2 extreu representacions visuals riques sense necessitat de supervisió explícita, reduint la dependència de grans conjunts de dades etiquetades per al mòdul de porcions. La xarxa de volum de pertinença softmax, per la seva banda, és lleugera i es pot entrenar amb dades sintètiques o reals de poques mostres, mantenint baixos els costos de còmput i emmagatzematge. Aquesta eficiència és clau per a empreses que desitgen desplegar solucions en producció sense incórrer en despeses excessives d'infraestructura. Un model entrenat pot executar-se en instàncies GPU estàndard a AWS o Azure, amb temps d'inferència per sota dels 100 mil·lisegons per imatge, permetent experiències d'usuari fluides en aplicacions mòbils.
Els resultats experimentals reportats als benchmarks reforcen la viabilitat comercial de l'enfocament. En reduir l'error de porcions en més d'un terç respecte a les estimacions directes de MLLMs com Gemini o GPT, s'elimina una de les principals barreres d'adopció de l'avaluació dietètica basada en imatge. Empreses que ofereixen plataformes de seguiment nutricional, coaching de salut o anàlisi de menús poden ara oferir una funcionalitat que abans requeria costosos estudis de laboratori o la intervenció de dietistes humans. La possibilitat d'integrar aquest mòdul amb sistemes existents de reconeixement d'aliments, molts dels quals ja estan basats en MLLMs, accelera el time-to-market i redueix el risc tècnic.
Q2BSTUDIO, com a partner tecnològic, pot acompanyar els seus clients durant tot el cicle de vida del projecte: des de la definició de requisits funcionals i la selecció del MLLM base adequat, fins a la implementació del cap de porcions personalitzat, l'entrenament amb dades del domini específic, el desplegament al núvol, la integració amb dashboards de BI i la garantia de ciberseguretat. L'empresa també ofereix serveis de desenvolupament d'aplicacions a mida, permetent construir interfícies d'usuari que s'adaptin a les necessitats particulars de cada client, ja sigui una app per a consumidors finals o un panell clínic per a professionals.
En conclusió, l'estimació de porcions millorada amb geometria representa un avenç significatiu en el camp de la visió per computador aplicada a la nutrició. En combinar la potència semàntica dels MLLMs amb un mòdul geomètric especialitzat, s'aconsegueix una precisió que abans semblava inabastable sense sensors addicionals. Aquest enfocament modular, eficient i escalable està ara a l'abast de les empreses que volen liderar la transformació digital en salut i alimentació. Amb el suport adequat en IA, cloud, ciberseguretat i BI, qualsevol organització pot integrar aquesta tecnologia als seus productes i serveis, oferint als seus usuaris una eina fiable per entendre i millorar la seva alimentació diària.





