Agents d'IA rendibles per al raonament abstracte en ARC-AGI-1

Descobreix com agents d'IA DeepSeek sense fine-tuning específic assoleixen un 67,25% en ARC-AGI-1 per només 0,62 $ la tasca.

viernes, 31 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Arquitecturas DeepSeek económicas: +52 puntos en ARC-AGI-1

El raonament abstracte s'ha convertit en una de les fronteres més exigents de la intel·ligència artificial. Avaluacions com ARC-AGI-1 presenten problemes visuals i lògics on el sistema ha de deduir regles ocultes, generalitzar-les i aplicar-les a casos nous. Durant molt de temps, les estratègies dominants van ser dues: utilitzar models de frontera amb enormes dosis de còmput en inferència, mitjançant cerques exhaustives o cadenes de pensament ampliades; o entrenar models petits sobre dades específiques del benchmark. Totes dues opcions funcionen, però a costa de l'eficiència i amb poca transferència a entorns reals.

A Q2BSTUDIO veiem una tercera alternativa amb gran potencial empresarial: agents d'IA que treballen sobre models oberts, sense ajust específic per al benchmark i amb pressupostos acotats. La clau no és la mida del model, sinó el disseny de l'agent. L'arquitectura separa el descobriment de patrons i la construcció de solucions, i afegeix un mecanisme de reflexió que permet reintentar quan les hipòtesis fallen. Aquesta filosofia encaixa amb el desenvolupament d'aplicacions a mida, on els recursos disponibles i la interpretabilitat són tan importants com la precisió.

La primera etapa, que podem anomenar explorador, se centra a identificar regularitats en els exemples d'entrenament. No busca una resposta final, sinó un conjunt d'hipòtesis sobre la regla subjacent. La segona etapa, definidora, converteix aquestes hipòtesis en transformacions concretes i verificables. Aquesta separació evita que el model hagi de resoldre dos problemes molt diferents al mateix temps: entendre el patró i construir una funció que el representi.

Sobre aquesta base, l'orquestrador reflexiu afegeix una capa de control. Quan les transformacions proposades no aconsegueixen reproduir els exemples, l'orquestrador decideix explorar altres famílies de patrons, modificar la representació de les dades o reconsiderar l'abast de la regla. És a dir, no es limita a executar el mateix procés amb més intents; introdueix noves direccions de recerca a partir del diagnòstic d'errors. La inclusió d'una eina de pensament explícita és important: eliminar-la redueix l'encert amb dos intents en 5,75 punts percentuals.

Els resultats sobre l'avaluació pública d'ARC-AGI-1 demostren el valor d'aquesta estratègia. Un model que respon directament sense arquitectura agèntica amb prou feines arriba a un 15,50 per cent d'èxit. El pipeline explorador-definidor aconsegueix un 57,50 per cent amb dos intents per tasca, amb un cost estimat de 0,25 dòlars per tasca. L'orquestrador reflexiu puja al 67,25 per cent amb un cost de 0,62 dòlars per tasca. Són xifres sorprenents si tenim en compte que no s'ha realitzat entrenament específic amb dades del benchmark ni grans desplegaments de còmput.

Una de les troballes més interessants és que el coll d'ampolla principal no està en la selecció de candidats, sinó en la generació dels mateixos candidats. Quan es mesura de manera imparcial la taxa d'èxit, s'observa que un selector basat en la precisió sobre els parells d'entrenament captura al voltant del 95 per cent del rendiment màxim possible donat el conjunt generat. Això implica que afegir un millor classificador o un rànquing més complex produiria millores marginals. En canvi, ampliar la diversitat de transformacions generades tindria un impacte real. L'orquestrador reflexiu confirma aquesta hipòtesi: la seva reexploració adaptativa produeix una millora de 9,81 punts percentuals en l'encert amb un sol intent, un resultat que coincideix amb el guany mediat per la selecció en el mode amb dos intents.

Aquesta lliçó és directament aplicable al món empresarial. En projectes d'IA no sempre convé invertir en models més grans o en més còmput. Sovint, el veritable avenç consisteix a dissenyar processos capaços de generar hipòtesis diverses, validar-les amb dades reals i decidir quan cal explorar una línia diferent. Aquest enfocament resulta especialment útil en sectors on les dades són escasses, les decisions tenen conseqüències o el cost per operació s'ha de controlar. La mateixa lògica pot aplicar-se a la ciberseguretat: un agent que observi logs, detecti patrons anòmals i generi explicacions accionables pot comportar-se com un explorador-definidor d'amenaces.

A les organitzacions, la infraestructura tecnològica també té un paper decisiu. Desplegar aquest tipus d'agents sobre cloud AWS/Azure permet escalar el processament sense comprometre el pressupost, mantenir la traçabilitat de cada intent i gestionar l'accés a les dades amb polítiques de seguretat. A més, els resultats d'aquests agents poden integrar-se en plataformes de BI/Power BI per oferir als equips de negoci una visió clara de quins patrons es descobreixen, com evolucionen i quines decisions se'n deriven. La combinació d'agents d'IA i business intelligence converteix l'experimentació tècnica en avantatge competitiu.

Des de Q2BSTUDIO entenem la IA com una disciplina d'enginyeria, no com una caixa negra. Portem anys desenvolupant programari i tecnologia per a empreses que necessiten automatitzar processos, protegir les seves dades i prendre millors decisions. La nostra proposta combina aplicacions a mida amb arquitectures d'agents, cloud, ciberseguretat i analítica. Un orquestrador d'IA no ha de ser un projecte de recerca reservat a grans corporacions; ben dissenyat, pot oferir resultats mesurables amb costos raonables en qualsevol sector.

L'experiment d'ARC-AGI-1 ens deixa una conclusió clara: el raonament abstracte és assolible sense dependre de models de frontera ni d'entrenament específic. L'arquitectura agèntica, la reflexió acotada i una bona gestió del pressupost poden compensar la manca d'escala. Per a una empresa, això és un recordatori que les solucions d'IA s'han d'avaluar pel seu impacte, no per la seva complexitat. En intel·ligència artificial i en desenvolupament de programari, l'objectiu no és imitar el que tothom fa, sinó construir sistemes que resolguin problemes reals amb eficiència.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.