L'avenç dels assistents digitals i els agents automatitzats ha posat sobre la taula un repte recurrent: com aconseguir que una màquina no només executi tasques en una interfície web, sinó que també sigui capaç d'explicar pas a pas què està fent, tal com ho faria un humà expert davant d'un usuari novell. Fins ara, la investigació en agents web s'ha dividit en dos fronts separats: per una banda, sistemes que executen accions sobre el DOM o l'arbre d'accessibilitat; per l'altra, models que generen text de guia o tutorials. Ambdós enfocaments ignoren la realitat que els usuaris interactuen amb pantalles renderitzades, no amb codi font, i que una tasca complexa rarament consisteix en un sol clic, sinó en una seqüència d'accions que es desplega a través de múltiples estats de pàgina. És aquí on sorgeix MAG (Multimodal Action and Guide), el primer benchmark unificat que avalua simultàniament la capacitat d'un agent per completar una tasca web i per redactar una guia textual que descrigui el procés, tot això sobre captures de pantalla reals. Aquest enfocament no només representa un salt qualitatiu en la mesura d'intel·ligència artificial aplicada a interfícies, sinó que també obre oportunitats concretes per a empreses que desenvolupen solucions digitals, com aplicacions a mida o sistemes d'automatització intel·ligent.
MAG proposa dos esquemes d'ancoratge sobre les captures de pantalla: Set-of-Mark, que selecciona elements visuals mitjançant marcadors, i coordenades de píxel en brut. D'aquesta manera, l'agent ha d'interpretar la imatge tal com la veu un ésser humà, sense dependre de metadades ocultes del DOM. El benchmark inclou un harness complet que abasta des de l'anotació assistida per LLM i verificació humana, fins a l'entrenament, l'avaluació en entorns vius i mètriques conjuntes per a accions i guies. Els resultats inicials són reveladors: fins i tot el model més potent actualment disponible completa menys del 40% de les tasques, cosa que deixa un marge enorme per a la innovació. Per exemple, un model supervisat de 9B paràmetres amb prou feines assoleix un 6,9% d'èxit, que s'eleva al 13,2% després d'aplicar un mètode d'entrenament GRPO augmentat amb trajectòries d'experts. Aquesta millora, tot i que significativa, continua sent insuficient per a entorns productius, cosa que indica que la investigació en agents multimodals encara es troba en una fase primerenca.
La rellevància empresarial de MAG és immediata. Les companyies que inverteixen en IA i automatització necessiten eines que no només executin tasques, sinó que també generin documentació clara per al onboarding d'usuaris, compliment normatiu o formació interna. Un agent que pugui realitzar una seqüència d'accions en una plataforma cloud i, alhora, redactar una guia visual pas a pas, reduiria dràsticament els costos de suport i acceleraria l'adopció de noves funcionalitats. Des de Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, observem aquest avenç amb gran interès. El nostre equip treballa habitualment en projectes que integren cloud AWS/Azure, ciberseguretat i BI/Power BI, i sabem que la capacitat d'un sistema per auto-documentar-se és un factor diferencial. Per exemple, imaginem un agent que desplega una infraestructura a AWS, configura polítiques de seguretat i, a més, genera una guia per a l'equip d'operacions: això és exactament el que MAG pretén avaluar i millorar.
El benchmark també posa de manifest la necessitat de models multimodals més robustos. Els agents actuals, basats principalment en text (DOM, arbre d'accessibilitat), fallen en enfrontar-se a interfícies gràfiques complexes amb elements dinàmics, pop-ups o canvis d'estat que no es reflecteixen al codi subjacent. MAG força el model a processar la imatge completa, incloent-hi colors, icones, disposició espacial i contingut visual, cosa que els humans fem de manera natural. Això té implicacions directes per al desenvolupament de automatització de processos: les tasques que abans requerien scripts fràgils sobre selectors HTML podrien ser reemplaçades per agents que entenen la interfície com una imatge, fent-los molt més resistents a canvis de disseny. A més, la generació de guies en llenguatge natural permet que els resultats siguin comprensibles per a qualsevol stakeholder, no només per a desenvolupadors.
Des d'una perspectiva tècnica, MAG introdueix una metodologia d'anotació innovadora que combina la potència dels grans models de llenguatge (LLMs) amb la precisió humana. En lloc d'etiquetar manualment cada pas, un LLM proposa anotacions inicials que després són verificades i corregides per humans, reduint el cost i el temps de preparació de dades. El harness inclou també un entorn d'avaluació en viu, on l'agent interactua amb pàgines web reals i es mesura tant l'èxit de la tasca (per exemple, completar una compra) com la qualitat de la guia generada (claredat, completitud, ordre de passos). Les mètriques conjuntes són un avenç important, perquè un agent pot completar una tasca però generar una guia confusa, o viceversa. MAG pondera ambdós aspectes, reflectint millor el valor real per a un usuari final.
Una altra troballa rellevant de l'estudi és que l'entrenament amb GRPO (Group Relative Policy Optimization) i trajectòries d'experts gairebé duplica la taxa d'èxit d'un model petit (del 6,9% al 13,2%). Això suggereix que la qualitat de les dades d'entrenament —específicament, les demostracions d'humans realitzant tasques— és més crítica que la mida del model. Per a empreses com Q2BSTUDIO, que desenvolupen programari a mida amb components d'IA, aquesta lliçó és clau: invertir en la recollida de trajectòries d'usuaris reals pot ser més efectiu que simplement escalar models. De fet, molts dels nostres projectes d'automatització inclouen fases d'observació on capturem com els empleats realitzen tasques repetitives, per després entrenar agents que les repliquin. MAG ofereix un marc per validar formalment aquest tipus d'enfocaments.
El futur dels agents web multimodals passa per la integració de visió i llenguatge en un sol flux, i MAG és el primer banc de proves seriós per mesurar aquest progrés. A mesura que models com GPT-4o, Gemini o Claude milloren en comprensió visual, veurem agents capaços de navegar interfícies complexes amb major autonomia. No obstant, el benchmark revela que encara queda un llarg camí: el millor model actual no arriba al 40% d'èxit, i la qualitat de les guies també és millorable. Això obre un espai d'oportunitat per a startups i empreses tecnològiques que vulguin especialitzar-se en la capa d''agents explicatius', combinant visió per computador, processament de llenguatge natural i raonament seqüencial. A Q2BSTUDIO, seguim de prop aquestes tendències per integrar-les a les nostres solucions d'IA, cloud i ciberseguretat, sempre amb l'objectiu d'oferir als nostres clients eines que no només funcionin, sinó que també formin i empoderin els seus equips.
En resum, MAG no és només un benchmark acadèmic: és un reflex de cap a on es dirigeix la interacció humà-màquina. Les empreses que adoptin aviat aquest paradigma —agents que actuen i expliquen— tindran un avantatge competitiu en termes d'eficiència operativa, satisfacció de l'usuari i compliment normatiu. Des del desenvolupament d'aplicacions a mida fins a la implantació de dashboards de BI, passant per l'automatització de processos al núvol, la capacitat de generar guies automàtiques a partir d'accions reals transformarà la forma en què dissenyem i mantenim el programari. A Q2BSTUDIO estem preparats per acompanyar els nostres clients en aquesta transformació, aportant experiència tècnica i visió estratègica.




