L'avanç dels agents d'intel·ligència artificial capaços d'interactuar de manera autònoma amb entorns informàtics ha fet un salt qualitatiu amb l'arribada d'EvoCUA-1.5, un sistema d'aprenentatge per reforç en línia dissenyat específicament per a tasques multitorn en escriptoris virtuals. A diferència d'enfocaments anteriors que es basaven en la imitació de trajectòries estàtiques, aquest model introdueix un cicle de millora contínua on l'agent aprèn directament de la interacció amb entorns executables, rebent recompenses verificables en completar objectius. Aquest paradigma no només supera les limitacions de les dades offline, sinó que planteja desafiaments tècnics únics: observacions que canvien amb cada pas, recompenses escasses i retards en la retroalimentació de l'entorn. Per abordar-los, EvoCUA-1.5 incorpora tres innovacions clau: l'optimització per passos (STEPO), un filtratge basat en polítiques amb calibració de taxa d'èxit, i el currículum adaptatiu dinàmic (DTAC). Tot això es recolza en una infraestructura totalment asíncrona que gestiona la latència i el desfasament de dades.
Des d'una perspectiva empresarial, entendre com funcionen aquests mecanismes és crucial per a qualsevol companyia que busqui automatitzar processos complexos —com la gestió de sistemes, el suport tècnic o la navegació per aplicacions legacy— mitjançant agents intel·ligents. A Q2BSTUDIO, desenvolupem solucions d'IA a mida que integren tècniques d'aprenentatge per reforç per a entorns dinàmics. La capacitat d'un agent per operar sobre múltiples passos, recordar el context i recuperar-se d'errors és exactament el que diferencia un assistent útil d'un de fràgil. El nostre equip aplica principis similars als d'EvoCUA-1.5 quan dissenyem fluxos de treball automatitzats que requereixen interacció amb múltiples finestres, formularis web o consoles d'administració.
La primera peça, STEPO (Step-Level Policy Optimization), resol un problema fonamental en l'aprenentatge per reforç multitorn: com descompondre una trajectòria llarga en passos individuals sense perdre la noció de l'avantatge acumulat. En lloc de tractar cada episodi com un bloc monolític, STEPO assigna a cada pas un avantatge calculat a partir del valor dels estats futurs, preservant l'equilibri entre exploració i explotació. Això permet que l'agent aprengui de cada acció, fins i tot quan la recompensa final triga a arribar. Per a una empresa que implementi un agent d'atenció al client, això es tradueix en una millora gradual de les respostes, sense necessitat de supervisió constant.
El segon component és un mecanisme de filtratge i calibració sobre tasques sintètiques verificables. El sistema genera milers d'escenaris de prova —com obrir un fitxer, canviar una configuració o extreure dades d'una aplicació— i només reté aquelles trajectòries que superen un llindar de probabilitat d'èxit. Posteriorment, es calibra la taxa d'encerts per evitar que l'agent se sobreespecialitzi en tasques fàcils. Aquesta estratègia és anàloga a les proves de regressió en el desenvolupament de programari a mida: cada funcionalitat es verifica de forma aïllada abans d'integrar-se en el flux principal. En el nostre treball d'aplicacions a mida, apliquem un enfocament similar al validar comportaments d'agents en entorns controlats abans de desplegar-los en producció.
El tercer pilar és DTAC (Dynamic Tri-Adaptive Curriculum), un currículum adaptatiu que combina tres estratègies: tasques aprendibles (aquelles en què l'agent encara pot millorar), repetició positiva de tasques difícils (per consolidar habilitats), i exposició controlada a tasques inviables (per evitar que l'agent malgasti recursos en objectius impossibles). Aquest equilibri dinàmic recorda la manera com els enginyers de cloud a AWS i Azure dissenyen pipelines de CI/CD: es prioritzen els canvis que aporten més valor sense saturar el sistema. Per a un agent de ciberseguretat, per exemple, DTAC permet que s'enfronti primer a amenaces simulades moderades abans d'exposar-lo a atacs reals, millorant la seva robustesa sense comprometre la seguretat de l'entorn.
La infraestructura que sustenta tot el procés és una arquitectura asíncrona amb control d'obsolescència i mini-grups de lots. En un entorn empresarial, això és equivalent a tenir un sistema distribuït que gestiona múltiples instàncies d'agents en paral·lel, recollint experiències i actualitzant la política sense colls d'ampolla. Les empreses que integren Business Intelligence amb Power BI o solucions d'automatització de processos necessiten precisament aquesta escalabilitat: poder llançar centenars de proves simultànies, processar els resultats en temps real i ajustar els models sense interrompre el servei.
Els resultats experimentals d'EvoCUA-1.5 són eloqüents: assoleix un 63,2% d'èxit al benchmark OSWorld-Verified, superant models oberts de 32B-35B paràmetres i acostant-se a models molt més grans. Això demostra que l'eficiència de l'aprenentatge en línia pot compensar la manca de mida del model, una troballa rellevant per a empreses que busquen implementar agents sense incórrer en costos desorbitats de computació. A Q2BSTUDIO, considerem que la clau no està només en el volum de paràmetres, sinó en la qualitat del procés d'entrenament i en la capacitat d'adaptar-se a entorns canviants.
Finalment, cal destacar que aquest tipus de tecnologies no només són aplicables a escriptoris virtuals. Qualsevol sistema que requereixi interaccions seqüencials —des d'un CRM fins a un panell de control industrial— pot beneficiar-se dels principis d'EvoCUA-1.5. La combinació d'aprenentatge per reforç en línia amb currículums adaptatius obre la porta a assistents que realment aprenen de l'experiència, millorant amb cada tasca completada. La nostra experiència en ciberseguretat i pentesting ens ha ensenyat que els agents d'IA han de ser entrenats en condicions realistes per ser efectius; aquest enfocament multitorn és el camí correcte.
En conclusió, EvoCUA-1.5 representa una fita en l'aprenentatge per reforç per a agents multitorn, oferint un marc pràctic que combina teoria i eficiència computacional. Per a les empreses que desitgen adoptar aquestes capacitats, comptar amb un soci tecnològic que entengui tant la part algorítmica com la integració en infraestructures cloud i on-premise és essencial. A Q2BSTUDIO, oferim serveis de desenvolupament de programari a mida, intel·ligència artificial, ciberseguretat, cloud computing i business intelligence per ajudar les organitzacions a construir agents que no només executin tasques, sinó que aprenguin i s'adaptin com ho faria un col·laborador humà.




