En els últims anys, els models de llenguatge de gran escala (LLM, per les seves sigles en anglès) han passat de ser curiositats acadèmiques a eines fonamentals en l'operativa empresarial. Tanmateix, a mesura que assumeixen tasques crítiques —des d'atenció al client fins a anàlisi de riscos—, sorgeix una pregunta inevitable: com garantir que les seves respostes s'alineïn amb els valors humans i organitzacionals? Aquesta qüestió, coneguda com a alineament de valors, ha estat tradicionalment avaluada en models ja entrenats, però un creixent cos de recerca assenyala que la clau està en el procés mateix de post-entrenament. Un estudi recent (arXiv:2510.26707) analitza les derives de valor durant les fases de supervisió fina (SFT) i optimització per preferències, revelant que la major part de l'alineament es consolida primerencament, en l'etapa de SFT, i que els algoritmes de preferència posteriors rara vegada aconsegueixen reorientar aquests valors de forma significativa.
Per a les empreses que adopten intel·ligència artificial, aquesta troballa té implicacions profundes. Si la fase de SFT estableix la brúixola ètica del model, llavors la selecció i curació del conjunt de dades d' entrenament esdevé un acte estratègic. No n'hi ha prou amb aplicar algoritmes d'optimització per preferències com el DPO o RLHF al final del procés; cal dissenyar des de l' inici una estratègia d' alineació que consideri quins valors es volen inculcar. En aquest context, comptar amb un soci tecnològic que entengui tant la teoria de l' aprenentatge automàtic com les necessitats del negoci resulta determinant.
Aquí és on Q2BSTUDIO marca la diferència. Com a empresa de desenvolupament de programari i tecnologia, oferim solucions integrals que van des de la implementació d'agents IA fins a la creació de sistemes de ciberseguretat que protegeixen les dades sensibles utilitzades en l'entrenament. La nostra experiència en intel·ligència artificial per a empreses ens permet acompanyar organitzacions en cada etapa del cicle de vida d'un model: des de la definició de les dades d'entrenament fins a l'ajust fi i l'avaluació contínua de l'alineació. Entenem que la deriva de valors no és un accident, sinó un fenomen que es pot mesurar i gestionar si es compta amb les eines adequades.
Una de les troballes més reveladores de l'estudi és que els algoritmes d'optimització per preferències no són intercanviables: fins i tot mantenint fix el conjunt de dades de preferències, diferents algoritmes produeixen resultats diferents en termes d'alineació. Això suggereix que no hi ha una solució única per a tots els casos. Per a una empresa que necessita, per exemple, un assistent virtual que reflecteixi una ètica corporativa específica, l' elecció de l' algoritme de post-entrenament s' ha de fer després d' una anàlisi detallada del context i els riscos. Aquí, el coneixement tècnic es combina amb la visió de negoci, i Q2BSTUDIO ofereix precisament aquesta convergència a través dels seus serveis de consultoria i desenvolupament d'aplicacions a mesura que integren els últims avenços en IA.
A més, l'estudi destaca que l'etapa de SFT és la que realment estableix els valors del model. Això significa que les organitzacions han de prestar especial atenció a les dades amb què alimenten aquesta fase. Si aquestes dades contenen biaixos o valors no desitjats, serà molt difícil corregir-les després. Per això, recomanem implementar pipelins de dades robustes, recolzades en serveis cloud aws i azure que garanteixin escalabilitat i traçabilitat. En Q2BSTUDIO ajudem els nostres clients a dissenyar aquestes infraestructures, assegurant que els conjunts de dades siguin representatius, diversos i alineats amb els principis ètics de l' organització.
Un altre aspecte rellevant és el monitoratge constant de les derives de valor un cop el model està en producció. L' alineació no és un fet puntual, sinó un procés dinàmic. Els usuaris interactuen amb el model i poden generar noves preferències que el sistema ha d' aprendre. Aquí entren en joc els agents IA que, dotats de capacitats d' aprenentatge continu, poden adaptar-se sense perdre la coherència amb els valors fundacionals. Q2BSTUDIO desenvolupa aquest tipus d'agents utilitzant metodologies àgils i eines com Power BI per visualitzar mètriques d'alineació, permetent als equips de negoci prendre decisions informades.
No podem oblidar la seguretat. La ciberseguretat és un pilar fonamental quan es treballa amb models de llenguatge que processen informació confidencial. Un model mal alineat podria filtrar dades o generar respostes perjudicials. Per això, des de Q2BSTUDIO integrem pràctiques de pentesting i auditoria en cada projecte d'IA, assegurant que tant les dades d'entrenament com el model en si estiguin protegides. Els nostres serveis intel·ligència de negoci complementen aquest enfocament, proporcionant dashboards que correlacionen el rendiment del model amb indicadors de valor.
En conclusió, la investigació sobre les derives de valor en el post-entrenament de LLM ens recorda que l'alineació ètica no és un afegit opcional, sinó un requisit de disseny. Per a les empreses que volen implementar IA de manera responsable, la clau està en combinar una base teòrica sòlida amb solucions pràctiques de programari a mesura que permetin controlar cada etapa del procés. En Q2BSTUDIO estem preparats per acompanyar aquest camí, oferint des d'infraestructura cloud fins a desenvolupament d'agents IA, passant per anàlisi de dades amb Power BI i estratègies de ciberseguretat. Perquè la tecnologia més poderosa és aquella que respecta els valors que la sostenen.





