L'ecosistema dels demostradors interactius de teoremes (ITP) ha crescut notablement durant l'última dècada, impulsat per la promesa de verificació matemàtica i de programari amb garanties absolutes. No obstant això, la fragmentació entre sistemes com Lean 4, Rocq, Isabelle i HOL Light ha creat silos de coneixement i de codi que dificulten tant la portabilitat dels resultats com l'entrenament de models d'aprenentatge automàtic per a la demostració automàtica. En aquest context sorgeix ITPEval, el primer benchmark dissenyat específicament per avaluar la traducció automàtica de teoremes i proves entre aquests quatre assistents, abastant dos fonaments lògics diferents. Aquest article analitza en profunditat què suposa ITPEval, com funciona, quins reptes revela i com empreses com Q2BSTUDIO poden aplicar aquestes metodologies en el desenvolupament de solucions tecnològiques avançades.
La proposta d'ITPEval no és trivial. Amb 1.560 fitxers font i 6.848 teoremes organitzats en dos nivells (un nivell controlat amb fitxers axiomatitzats que aïllen la dificultat fonamental de la traducció, i un nivell ecològic amb biblioteques reals que exposen desajustos d'API i estils de prova), el benchmark ofereix un camp de proves rigorós. Els resultats inicials són reveladors: la traducció d'enunciats assoleix un 29,1% d'èxit en pass@1, mentre que la traducció de proves amb prou feines arriba al 10,5%. Això indica que el major coll d'ampolla no és la lògica subjacent, sinó la discrepància entre les biblioteques i els estils de cada sistema. És aquí on l'experiència en aplicacions a mida desenvolupades per Q2BSTUDIO cobra rellevància: cada ITP té les seves pròpies convencions, tipus de dades i formes de raonar, de la mateixa manera que cada projecte de programari requereix una adaptació acurada al context del client.
Una de les troballes més interessants de l'estudi és que la verificació nativa de tipus (type-checking) sobreestima la fidelitat semàntica. En les traduccions d'enunciats des de diverses fonts cap a Lean 4, una comprovació BEq (equivalència booleana determinista) va confirmar només el 54% de les que havien superat la verificació de tipus. Això subratlla la necessitat de mètodes de validació més sofisticats, similars als que s'empren en agents IA per garantir que les sortides d'un model generatiu mantenen el significat esperat. En l'àmbit empresarial, Q2BSTUDIO integra tècniques de verificació i validació en els seus desenvolupaments al núvol, tant a AWS com a Azure, per assegurar que les transformacions de dades i les automatitzacions no introdueixin errors silenciosos.
El benchmark també inclou un estudi de round-trip autoformalització/autoinformalització, on es va observar que Rocq i HOL Light resulten objectius de formalització més senzills que Lean 4 i Isabelle. A més, l'ús de context multi-ITP va millorar l'èxit pooled de Lean 4 del 4,8% al 10,6%. Aquestes dades tenen implicacions directes per al disseny de sistemes d'intel·ligència artificial que aprenguin a traduir entre llenguatges formals. Si en ciberseguretat cal verificar propietats crítiques, disposar d'eines capaces de traslladar teoremes entre sistemes redueix el risc d'incompatibilitat i permet reutilitzar verificacions en entorns heterogenis. Q2BSTUDIO, amb la seva divisió de ciberseguretat, aplica principis similars per validar protocols i configuracions en infraestructures al núvol, garantint que les polítiques de seguretat es mantinguin consistents en migrar entre proveïdors.
Des d'una perspectiva tècnica, ITPEval s'empra en una infraestructura de verificació unificada anomenada itpeval, que implementa backends càlids amb aïllament d'estat per preservar la semàntica nativa de cada artefacte. Això recorda les arquitectures de microserveis que Q2BSTUDIO desplega en projectes de núvol AWS/Azure, on cada servei manté el seu propi context i estat, però s'integra a través d'APIs ben definides. La capacitat d'aïllar el problema de traducció de la lògica de fons permet als investigadors centrar-se en les dificultats específiques de cada parell, un enfocament que també segueix la metodologia de desenvolupament de programari a mida que ofereix l'empresa.
Un altre aspecte rellevant és l'avaluació amb models de llenguatge d'última generació, tant de frontera com de pes obert, en 12 parells de traducció dirigits. Els resultats de pass@1 per a traducció de proves (10,5%) i per a enunciats (29,1%) mostren que la complexitat és alta, però el camí està obert. En el context empresarial, la capacitat de traduir automàticament regles de negoci, consultes o lògica de BI (Business Intelligence) entre diferents plataformes pot estalviar mesos de treball manual. Q2BSTUDIO ha desenvolupat solucions de BI/Power BI que precisament s'enfronten al repte d'unificar fonts heterogènies de dades; aplicant mètodes de traducció formal es podria garantir que les transformacions semàntiques no perdin significat.
El futur de la verificació formal passa per la interoperabilitat. ITPEval no és només un benchmark, sinó una crida a la comunitat per estandarditzar representacions intermèdies, compartir biblioteques i desenvolupar traductors intel·ligents. Empreses com Q2BSTUDIO, especialitzades en automatització de processos, veuen en aquesta línia una oportunitat per estendre la verificació formal a entorns industrials, on la correcció del programari no és un luxe, sinó un requisit. A més, la integració de intel·ligència artificial en aquest àmbit —agents d'IA capaços de proposar demostracions o corregir traduccions— serà un camp d'innovació contínua. Q2BSTUDIO ja col·labora amb startups i centres de recerca per pilotar solucions que combinin verificació formal amb machine learning.
En conclusió, ITPEval marca una fita en la maduresa del camp de la traducció formal entre demostradors de teoremes. Les seves mètriques revelen on són les dificultats reals i ofereixen un banc de proves per a la pròxima generació d'assistents intel·ligents. Per a una empresa de desenvolupament com Q2BSTUDIO, entendre aquests reptes i aplicar tècniques similars en els seus projectes de programari a mida i núvol (AWS/Azure) no només millora la qualitat del producte, sinó que obre la porta a serveis de valor afegit com la verificació automàtica de lògica de negoci, la ciberseguretat formal i la migració fiable de sistemes. La publicació del benchmark, la infraestructura de verificació i els pipelines d'avaluació és un gest de transparència que impulsarà la col·laboració entre acadèmia i indústria, un camí que Q2BSTUDIO ja recorre activament.





