La irrupció dels models de llenguatge de gran escala (LLMs) en làmbit de la ciberseguretat ha obert un debat crucial: com mesurar de forma rigorosa i automatitzada el seu coneixement real sobre amenaces, vulnerabilitats i bones pràctiques? Fins ara, els enfocaments predominants es basaven en la creació manual de conjunts de preguntes o “benchmarks”, un procés que requereix un esforç considerable d’experts en seguretat i que, a més, queda desactualitzat tan aviat com sorgeixen noves tècniques d’atac. En aquest context, sorgeix una metodologia parcialment automatitzada que promet transformar l’avaluació dels LLMs: l’ús d’informació autoritzada procedent d’agències de protecció al consumidor (CPAs) per detectar inestabilitats en les respostes del model, indicatives de llacunes de coneixement.
La proposta es sustenta en un principi senzill però potent: si un LLM no posseeix un coneixement sòlid sobre un tema de seguretat concret —com el robatori d’identitat o les estafes de suplantació—, les seves respostes presentaran variacions significatives quan se li formulin preguntes equivalents formulades amb lleugeres modificacions. Aquesta inestabilitat, mesurada a través de mètriques de consistència, es converteix en un indicador fiable que el model manca de la base necessària per abordar el problema amb precisió. En lloc de dependre d’experts que redactin centenars de casos de prova, el mètode aprofita corpus públics ja existents, com els informes i guies de les CPAs, per generar de forma semiautomàtica les entrades que posen a prova el model. Això redueix dràsticament el cost i el temps d’avaluació, alhora que permet mantenir un cicle d’actualització continu conforme les agències publiquen nova informació.
Des d’una perspectiva tècnica, el procés implica seleccionar documents oficials de CPAs —per exemple, la Federal Trade Commission (FTC) o l’Agència Espanyola de Protecció de Dades—, extreure les definicions i descripcions d’amenaces, i construir variants de preguntes que explorin els mateixos conceptes des de diferents angles. A continuació, se sotmet al LLM a aquestes preguntes i s’analitza la coherència de les seves respostes mitjançant algoritmes de processament de llenguatge natural. Si el model respon de forma contradictòria o mostra patrons d’incertesa, s’identifica com una carència de coneixement en aquella àrea específica. En els experiments realitzats amb models de les famílies Gemini i GPT, el mètode va ser capaç de discriminar clarament entre aquells que posseïen un coneixement suficient i aquells que presentaven llacunes significatives sobre robatori d’identitat i estafes de suplantació.
Aquest enfocament té implicacions directes per a les empreses que integren LLMs en els seus sistemes de ciberseguretat. Quan un assistent basat en IA s’utilitza per filtrar correus de phishing o per assessorar empleats sobre pràctiques segures, la fiabilitat del seu coneixement és crítica. Un model que no comprengui bé els matisos d’un atac d’enginyeria social podria passar per alt senyals d’alerta o, pitjor encara, proporcionar recomanacions incorrectes. L’avaluació automatitzada mitjançant CPAs ofereix un mètode objectiu i escalable per certificar que el model compleix amb els estàndards de coneixement necessaris abans de la seva posada en producció.
A Q2BSTUDIO, com a empresa especialitzada en el desenvolupament de programari i tecnologia, entenem que la qualitat del coneixement incorporat en els sistemes d’IA és tan important com la pròpia arquitectura tècnica. Per això, oferim serveis que van des de la creació d’aplicacions a mida fins a la integració de solucions d’IA que requereixen avaluacions de coneixement com la descrita. La capacitat d’auditar de forma automatitzada el saber d’un LLM sobre ciberseguretat s’alinea amb la nostra visió de proporcionar eines robustes i fiables als nostres clients.
A més, la metodologia no es limita a la seguretat: és extensible a qualsevol domini on existeixin fonts autoritzades de coneixement estructurat. Per exemple, podria aplicar-se per verificar que un chatbot de suport tècnic comprèn correctament els procediments de configuració de serveis al núvol, com AWS o Azure. A Q2BSTUDIO, oferim consultoria i desenvolupament en cloud AWS/Azure, i sabem que la precisió del coneixement tècnic és fonamental per evitar configuracions errònies que comprometin la seguretat. De la mateixa manera, en làmbit de la intel·ligència de negoci, els agents d’IA entrenats per analitzar dades amb Power BI requereixen un coneixement precís dels indicadors clau per no generar informes enganyosos.
Un altre aspecte rellevant és la possibilitat d’utilitzar aquesta tècnica com a part d’un pipeline de proves contínues dins del cicle de vida del desenvolupament de programari. En integrar l’avaluació de coneixement en les pràctiques d’integració contínua, les empreses poden detectar automàticament quan un model actualitzat ha perdut competències en àrees crítiques de ciberseguretat, permetent una resposta ràpida abans que el canvi afecti els usuaris finals. En aquest sentit, l’automatització de processos de prova es converteix en un habilitador clau per mantenir la qualitat del programari basat en IA.
Naturalment, el mètode no està exempt de limitacions. La qualitat de l’avaluació depèn directament de l’exhaustivitat i actualitat dels corpus de les CPAs. Si una agència no cobreix una amenaça emergent, el model podria passar la prova sense demostrar realment la seva competència. No obstant això, l’avantatge d’utilitzar fonts oficials és que solen ser les més rigoroses i acceptades per la indústria, cosa que proporciona un punt de referència sòlid. A més, l’enfocament pot complementar-se amb altres tècniques, com la generació adversarial de preguntes o la simulació d’escenaris complexos.
De cara al futur, la indústria s’encamina cap a sistemes d’IA que no només siguin potents, sinó a més verificables i transparents. Eines com la prova automatitzada de coneixement basada en CPAs representen un pas important en aquesta direcció. A Q2BSTUDIO, estem compromesos amb la innovació en àrees com la ciberseguretat, la intel·ligència artificial i el desenvolupament de programari a mida, ajudant les organitzacions a construir solucions que siguin tan segures com intel·ligents. La combinació d’avaluacions automatitzades amb serveis avançats de ciberseguretat i BI/Power BI permet oferir un ecosistema complet on la fiabilitat del coneixement és un pilar fonamental.




