Durant anys, el Product Requirements Document (PRD) va ser la brúixola de tot desenvolupament digital. Però en l'era dels agents intel·ligents, aquesta brúixola s'està reescrivint. Xavi Amatriain, primer chief AI and data officer d'Expedia Group, ho va expressar clarament al VB Transform 2026: 'Els nous PRD són els evals'. És a dir, l'especificació tradicional de producte es desplaça cap a una definició exhaustiva d'avaluacions —incloent red teaming, proves de seguretat i mètriques de comportament— que es codifiquen abans d'escriure una sola línia de codi. Aquest canvi de paradigma no només afecta gegants com Expedia: redefineix com qualsevol empresa hauria d'abordar el desenvolupament de software avui, especialment quan s'integren components d'intel·ligència artificial.
La tesi d'Amatriain és provocadora i pràctica alhora. En lloc de redactar documents estàtics que descriuen funcionalitats, proposa que els equips inverteixin tot l'esforç a dissenyar els tests que validaran que el sistema es comporta correctament. 'Tot el teu pensament es concentrarà en els evals', va afirmar. Aquest enfocament converteix l'avaluació contínua en el motor del desenvolupament, un concepte que ressona amb força en un moment on el 66% de les empreses enquestades per VentureBeat ja permeten desplegaments en producció sense revisió humana o planegen fer-ho en els pròxims dotze mesos. Tanmateix, només el 5% confia plenament en les avaluacions automatitzades que prenen aquesta decisió. La bretxa és evident: necessitem millors evals, no només més.
Per a Amatriain, el problema no se soluciona apilant barreres. 'Com més regles de negoci artificials i guardrails posis al sistema, pitjor', va advertir. Els guardrails, tot i que necessaris, introdueixen biaixos en el bucle de retroalimentació, distorsionant el que aprenem de l'usuari. La solució no és eliminar-los sinó minimitzar el seu impacte mitjançant un disseny intel·ligent. Expedia ha optat per tres capes de governança: principis generals (cultura i valors), processos i eines que els reforcen, i automatització que els executa. Aquest model es materialitza en els 'toll gates' de llançament d'agents, uns punts de control calibrats segons el risc. Si un agent és de baix risc, amb prou feines necessita supervisió; si implica decisions crítiques (com recomanar un vol), requereix rondes d'avaluació, red teaming i revisió de seguretat.
L'arquitectura també canvia. Amatriain descarta la intel·ligència artificial general com un monòlit únic i aposta per la composició d'agents especialitzats. A Expedia, les eines formen habilitats, aquestes s'assemblen en subagents, i un orquestrador els coordina. Cada agent està acotat, cosa que facilita la seva avaluació i bloqueig de forma aïllada abans d'integrar-lo. 'No és qüestió del model, sinó de com dissenyes el sistema', va insistir. Aquest disseny sistèmic permet, per exemple, que un agent de recomanació d'hotels combini recuperació augmentada generativa (RAG) amb trucades directes a APIs, triant entre respostes ràpides (preus mitjans a Chicago) o processos més llargs (comparar ressenyes reals de viatgers amb el que declara un hotel). I sempre, la decisió final queda en mans de l'usuari: 'L'agent pot recomanar, suggerir, discutir amb tu, però tu has de fer clic. Això és innegociable', va afirmar Amatriain, convertint aquesta norma en una decisió de seguretat nativa.
La seguretat, precisament, s'ha d'integrar des del principi. 'Quan necessites un guardrail és perquè no ho vas pensar abans', va dir. En la seva visió, els principis de disseny han d'incloure la seguretat com un requisit tan bàsic com la funcionalitat. I el cicle no s'acaba en el llançament: els senyals de monitorització en producció han de retroalimentar el conjunt d'evals, creant un bucle gairebé automàtic de detecció i correcció. La urgència és real: el 54% de les empreses ja ha patit un incident de seguretat amb agents o un quasi accident, segons VentureBeat. A més, els atacants ja no seran només humans. 'Rebràs amenaces d'altres sistemes agèntics externs, molt poderosos, que sondaran tot el que fas', va alertar Amatriain.
Aquest panorama exigeix una transformació profunda en la forma de construir software. Les empreses que vulguin adoptar aquest model —evals com a PRD, governança per risc, agents especialitzats i seguretat des del disseny— necessiten socis tecnològics que entenguin tant la teoria com la pràctica. Aquí és on aplicacions a mida es converteixen en un habilitador clau. Q2BSTUDIO, amb la seva experiència en desenvolupament de software personalitzat, ajuda les organitzacions a integrar aquestes lliçons en els seus propis sistemes, ja sigui creant microserveis, implementant pipelines d'avaluació o dissenyant dashboards de monitorització amb BI. La IA no és un producte que es compri, sinó un ecosistema que es construeix, i cada peça —des del núvol a AWS o Azure fins a la ciberseguretat— s'ha d'orquestrar amb precisió.
Q2BSTUDIO ofereix serveis que van més enllà del codi: assessorament en arquitectures d'agents, implantació de sistemes d'avaluació contínua i blindatge d'infraestructures cloud. En un món on els evals són el nou PRD, disposar d'una plataforma robusta de testing i monitorització és tan crític com tenir un bon model. L'automatització de processos, l'anàlisi de dades amb Power BI i la governança al núvol s'integren en un enfocament holístic que permet a les empreses no només reaccionar als errors, sinó anticipar-s'hi. La lliçó d'Expedia és clara: no esperis que un agent falli amb un client real per ajustar les teves avaluacions. Dissenya, avalua, monitoritza i repeteix. I fes-ho amb aliats que dominin cada capa de la cadena tecnològica.





