El desplegament d'aplicacions basades en models de llenguatge de gran escala (LLM) a milions d'usuaris s'enfronta a un coll d'ampolla crític: el cost i la latència d'inferència. Mentre els avenços en maquinari i optimització de models continuen, una estratègia complementària que ha guanyat tracció és l'ús de clustering intel·ligent de les consultes d'entrada. La idea és simple però poderosa: agrupar sol·licituds similars, processar només un representant per grup i reutilitzar la resposta per a la resta. No obstant, aquesta aproximació només és segura si podem garantir que cada element del clúster és realment a prop del seu representant, tant en termes semàntics com d'atributs categòrics. Els mètodes tradicionals de clustering no ofereixen aquestes garanties a escala: no verifiquen una similitud mínima intra-clúster, no asseguren la coincidència exacta d'atributs categòrics i, sovint, es tornen intractables amb desenes de milions de mostres. En aquest article explorem una solució de dues etapes que combina Mini-batch K-Means amb una selecció goluda de representants inspirada en la heurística de Johnson-Chvátal per a Set Cover. Aquest enfocament no només escala linealment en el nombre de mostres quan el nombre de clústers inicials creix proporcionalment, sinó que també ofereix garanties de qualitat per mostra, reduint dràsticament el cost i la latència en producció. Des d'una perspectiva empresarial, aquest tipus de tècniques permet llançar sistemes de recomanació personalitzats, assistents conversacionals o agents d'IA que abans eren inviables pels alts costos d'inferència. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, integrem aquestes estratègies en aplicacions a mida per als nostres clients, combinant clustering eficient amb infraestructura cloud i mesures de ciberseguretat.
El problema fonamental d'escalar LLM no és només el cost de còmput, sinó també la latència quan cada sol·licitud ha de passar per un model gran. Suposem un sistema de recomanació basat en perfils d'usuari (persones). Cada usuari genera una consulta textual que descriu la seva situació o preferència. Si haguéssim d'enviar totes les consultes individualment al LLM, el cost setmanal podria disparar-se a milions de dòlars i els temps de resposta serien inacceptables. La solució natural és clusteritzar les consultes. Però un clustering ingenu pot agrupar consultes que semblen similars però tenen diferències subtils que alteren la resposta desitjada. Per exemple, dos usuaris poden preguntar 'recomana'm una pel·lícula de ciència ficció', però un vol estrenos recents i l'altre clàssics. Si el representant només captura la part genèrica, la resposta pot ser incorrecta per a una part del grup. Per això necessitem garanties que cada element està dins d'un radi alfa (en l'espai d'embeddings) del representant, i a més que coincideixin exactament en atributs categòrics com gènere, edat o ubicació.
L'algorisme que proposem, basat en les idees de l'article de referència (arXiv:2607.19704v1) però adaptat a un context empresarial, opera en dues fases. En la primera fase, s'aplica Mini-batch K-Means sobre els embeddings de les consultes amb un nombre K de clústers inicials. Això proporciona una agrupació gruixuda que escala a milions de mostres gràcies al processament per lots. En la segona fase, dins de cada clúster inicial, es selecciona un subconjunt de representants de forma goluda, de manera que cada punt del clúster estigui a una distància màxima alfa d'almenys un representant, i que tots els representants comparteixin els mateixos valors dels atributs categòrics amb els seus membres. Aquest pas és equivalent a resoldre un problema de Set Cover sobre boles de radi alfa en l'espai d'embeddings, utilitzant l'heurística de Johnson-Chvátal, que proporciona una aproximació en temps polinòmic. El resultat és un conjunt de representants amb garanties de cobertura: cada consulta assignada a un representant és similar a ell en un marge mesurable, i els atributs categòrics coincideixen exactament.
Des del punt de vista de la complexitat, l'algorisme té un cost temporal de O(nd + n^2 d / K) i un cost de memòria de O(nd + n^2 / K^2), on n és el nombre de mostres, d la dimensió dels embeddings i K el nombre de clústers inicials. Quan K creix proporcionalment a n, el terme quadràtic es linealitza, permetent escalar a 38 milions de clients com es va demostrar en un cas real. En aquell desplegament, el mètode va reduir el cost i la latència d'inferència en un factor de 50, mantenint la personalització i desbloquejant el llançament a producció. Aquest tipus de resultats no només són tècnicament impressionants, sinó que obren la porta a aplicacions que abans eren econòmicament inviables.
Per a una empresa com Q2BSTUDIO, implementar aquesta solució requereix integrar diversos components tecnològics. D'una banda, cal un sistema de generació d'embeddings eficient (per exemple, usant models lleugers o serveis d'embeddings al núvol). Després, l'algorisme de clustering i selecció de representants s'ha d'executar en un entorn escalable, típicament sobre infraestructura cloud com AWS o Azure. A Q2BSTUDIO oferim serveis cloud a AWS i Azure que poden allotjar pipelines de dades massives, orquestració de workers i emmagatzematge d'embeddings. A més, la ciberseguretat és un aspecte crític quan es manegen dades de milions d'usuaris: l'assignació a representants ha de garantir que no es filtrin dades sensibles, per la qual cosa apliquem tècniques d'anonimització i control d'accés. El nostre equip de ciberseguretat i pentesting audita aquests sistemes per complir amb regulacions com GDPR.
La intel·ligència artificial, i en particular els agents d'IA, es beneficien enormement d'aquest enfocament de clustering amb garanties. Per exemple, un agent que respon consultes de clients en un centre de suport pot processar milers de consultes en paral·lel agrupant-les per intenció i context, usant un representant per generar una resposta base que després s'ajusta lleugerament per a cada membre. Això redueix dràsticament el nombre de crides al LLM i permet que l'agent actuï en temps real. A Q2BSTUDIO desenvolupem solucions d'IA i agents intel·ligents que incorporen aquests algorismes d'optimització, juntament amb dashboards de Business Intelligence (Power BI) per monitoritzar la qualitat de les respostes i la cobertura dels clústers. La integració amb BI permet als equips de producte visualitzar quins grups d'usuaris estan rebent respostes personalitzades i on hi ha desviacions, ajustant els paràmetres alfa o la granularitat del clustering.
En resum, la combinació de clustering eficient amb garanties de qualitat per mostra resol el coll d'ampolla de la inferència de LLM a escala. No es tracta només d'una optimització tècnica, sinó d'un habilitador de negoci que permet llançar productes d'IA personalitzats a milions d'usuaris amb costos assumibles. Empreses com Q2BSTUDIO estem preparades per implementar aquestes arquitectures, des del desenvolupament d'aplicacions a mida fins a la gestió d'infraestructura cloud, ciberseguretat i analítica de dades. Si la teva organització busca escalar les seves aplicacions d'IA sense multiplicar els costos, aquest enfocament representa una via sòlida i provada.



