La robòtica ha avançat enormement en els últims anys, però un dels reptes més complexos continua sent la manipulació d'objectes en entorns desordenats i no estructurats. Els sistemes tradicionals basats en visió per computador sovint fallen quan els objectes no s'assemblen visualment als de la seva base de dades, o quan les condicions d'apilament i oclusió impedeixen una subjecció fiable. En aquest context, l'enfocament conegut com a Agentic RAG-VLM (Retrieval-Augmented Generation amb models de visió-llenguatge i planificació autoreflexiva) proposa una solució innovadora que integra raonament semàntic amb capacitats físiques de subjecció.
La clau d'aquesta arquitectura resideix en tres components interconnectats. Primer, un sistema jeràrquic de recuperació d'affordances (HAA-RAG) que, en lloc de comparar imatges, avalua atributs com el tipus d'objecte, material, fragilitat i regions aptes per a la subjecció. Això permet seleccionar estratègies de manipulació basades en la funcionalitat real de l'objecte, no només en la seva aparença. Segon, un raonador de restriccions espacials que construeix un graf d'escena a partir de la percepció del model de visió-llenguatge, traduint relacions de proximitat, oclusió i suport en ajustos concrets de paràmetres de subjecció. Tercer, un pipeline autoreflexiu que classifica les fallades en 14 categories i aplica reintents adaptatius en tres nivells, tancant el bucle de control per aconseguir una millora contínua.
Els resultats obtinguts en un banc de proves de 12 tasques mostren una taxa d'èxit global del 78,3 %, superant en més de 53 punts percentuals els mètodes que només utilitzen models de visió-llenguatge sense raonament físic. Això demostra que la combinació de recuperació basada en affordances, raonament espacial i recuperació agentiva és essencial per a una manipulació robòtica robusta.
Per a les empreses que busquen portar la intel·ligència artificial als seus processos industrials o logístics, aquest tipus de solucions representa un salt qualitatiu. No es tracta només de reconèixer objectes, sinó d'entendre com interactuar amb ells de manera segura i eficient. A Q2BSTUDIO desenvolupem ia per a empreses que integren raonament contextual i aprenentatge autònom, adaptant-se a entorns canviants. El nostre equip combina aplicacions a mida amb capacitats de visió artificial i automatització, i podem desplegar aquests sistemes sobre serveis cloud aws i azure per garantir escalabilitat i baixa latència.
A més, l'arquitectura autoreflexiva d'Agentic RAG-VLM encaixa perfectament amb el concepte d'agents IA que aprenen dels seus errors i milloren amb l'experiència. A les nostres implementacions, combinem programari a mida amb models de llenguatge i visió, i apliquem tècniques de ciberseguretat per protegir les dades sensibles que es processen a la vora o al núvol. Per a les àrees de negoci, oferim serveis intel·ligència de negoci amb power bi per visualitzar mètriques de rendiment dels robots i optimitzar la seva operació.
En definitiva, la planificació autoreflexiva en subjecció robòtica no és només una línia de recerca puntera, sinó una necessitat pràctica per a l'automatització intel·ligent. A Q2BSTUDIO estem preparats per ajudar les empreses a integrar aquestes capacitats en els seus fluxos de treball, aportant coneixement tècnic i solucions robustes.





