La investigació recent publicada a arXiv (2607.18476v1) revela un fenomen que sacseja els fonaments de com entenem els models de llenguatge: quan se'ls demana que responguin en format estructurat, com JSON, la diversitat de les seves respostes s'enfonsa. En un experiment que va replicar el 'One-Word Census' sobre 44 models, es va observar que la simple instrucció 'Reply with JSON only' és suficient perquè les respostes es tornin molt més homogènies. La resposta modal passa del 41% al 64% del conjunt, les respostes diferents cauen de 52 a 36, i la sorpresa mitjana d'elecció es redueix d'1.80 a 1.58 bits. Aquest efecte no és marginal: sis models es desplacen individualment cap a la moda, mentre que els models més conformistes romanen immòbils. És un afilador, no un reindexador: la resposta modal del xat pla sobreviu en 28 de 31 categories.
L'estudi revela a més que l'enfonsament no prové del decodificador que imposa un esquema (com response_format), sinó de la resposta del model al propi registre lingüístic. És a dir, els models aprenen a comportar-se de manera diferent segons el format de sortida que se'ls demana. Quan se'ls sol·licita JSON, el seu comportament es torna més previsible i menys divers, com si haguessin estat entrenats per parlar un dialecte més estandarditzat. Això té conseqüències pràctiques immenses per a empreses que integren models de llenguatge en els seus sistemes: la superfície de consum de programari (sortida estructurada) és significativament més homogènia que la superfície de xat on s'avaluen i comparen els models.
Per a les organitzacions que desenvolupen aplicacions a mida amb intel·ligència artificial, aquesta troballa implica que han de considerar acuradament quin format de sortida utilitzen. Si busquen respostes creatives o diverses, el JSON pot estar suprimint precisament la varietat que necessiten. Per contra, si el que es desitja és consistència i estandardització, el JSON és el millor aliat. A Q2BSTUDIO, com a empresa especialitzada en desenvolupament de programari i tecnologia, sabem que l'elecció del format de resposta és una decisió tècnica crucial que afecta el rendiment dels sistemes d'IA. Per això, en dissenyar solucions d'IA per als nostres clients, avaluem el context d'ús: des d'agents conversacionals fins a assistents virtuals que requereixen respostes estructurades per alimentar processos automatitzats.
La investigació també mostra un gradient de registre: la compressió és significativa i específica per als formats de lliurament de respostes que els models han estat entrenats per parlar (JSON -0.22 bits, XML -0.19 bits), absent per a YAML i CSV, i s'inverteix per a un embolcall arbitrari de claudàtors (+0.13 bits). Això suggereix que el fenomen està lligat al post-entrenament d'eines (tool-use). Quan una empresa integra models de llenguatge en la seva infraestructura al núvol, ja sigui a cloud AWS/Azure, ha de tenir en compte que la sortida estructurada no és només un requisit tècnic, sinó que modifica el comportament del model. Si es necessita diversitat per a generació d'idees o brainstorming, potser és millor usar un format més lliure i estructurar la resposta posteriorment.
Un altre aspecte rellevant és la seguretat. En l'àmbit de la ciberseguretat, on sovint s'usen models de llenguatge per detectar patrons anòmals o generar informes, l'homogeneïtat induïda pel JSON podria reduir la capacitat de detectar valors atípics o respostes inesperades. Un model que sempre respon de manera similar podria passar per alt senyals d'alerta rares. Per això, a Q2BSTUDIO dissenyem sistemes que combinen intel·ligència artificial amb regles de negoci específiques, assegurant que la diversitat natural del model no es perdi quan és necessària.
La investigació també té implicacions per a les eines de Business Intelligence. Quan s'usen models per generar consultes SQL o informes a BI/Power BI, la sortida estructurada és essencial. No obstant, l'estudi mostra que forçar un esquema (response_format) no comprimeix més enllà de la simple petició (-0.03 bits), cosa que indica que l'enfonsament resideix en la resposta del model al registre, no al decodificador. Això suggereix que les empreses poden obtenir respostes consistents simplement demanant JSON, sense necessitat d'imposar esquemes rígids, cosa que simplifica la integració.
En el context dels agents IA, on la capacitat d'escollir entre múltiples respostes vàlides és crucial, aquest fenomen pot ser una arma de doble tall. D'una banda, l'homogeneïtat pot fer que els agents prenguin decisions més previsibles i segures. De l'altra, pot limitar la seva capacitat d'explorar opcions noves. A Q2BSTUDIO desenvolupem agents d'IA que equilibren l'exploració i l'explotació, utilitzant tècniques com el mostreig de temperatura i la diversificació de prompts per contrarestar l'efecte homogeneïtzador del JSON quan és necessari.
L'article original d'arXiv destaca que l'efecte és progressiu: els models més distintius es mouen cap a la moda, mentre que el sòl conformista roman immòbil. Això recorda la 'paradoxa de la diversitat' en els sistemes d'aprenentatge automàtic: com més s'estandarditzen les interfícies, més es perd la riquesa dels models. Per a les empreses que busquen aplicacions a mida amb IA, la lliçó és clara: no tots els formats de sortida són equivalents. L'elecció del format s'ha de fer amb coneixement de causa, considerant tant els requisits tècnics com l'impacte en el comportament del model.
En conclusió, la investigació sobre l'enfonsament de la diversitat amb sortida estructurada és un recordatori que els models de llenguatge són sensibles al context d'interacció. La superfície de consum de programari no és neutral; modela les respostes del model. Per a les empreses que integren IA en els seus processos, entendre aquest fenomen és clau per dissenyar sistemes robustos, versàtils i adaptats a les seves necessitats. A Q2BSTUDIO, com a partner tecnològic, ajudem els nostres clients a navegar aquestes complexitats, oferint solucions que van des de la implementació al núvol fins a la creació d'agents intel·ligents, sempre amb un enfocament centrat en el valor del negoci.




