En el mundo de la inteligencia artificial, los Transformers han surgido como una de las arquitecturas más potentes y versátiles para el procesamiento del lenguaje natural. Dentro de este campo, dos enfoques de investigación han ganado protagonismo: el descubrimiento de circuitos y la dirección de la activación. A primera vista, parecen ser dos líneas de investigación distintas, pero ¿podrían estar relacionadas de alguna manera?
Un principio geométrico subyacente, denominado hipótesis de la Huella Dactilar del Circuito, sugiere que los tokens de respuesta en un Transformer codifican su camino geométrico. Esta teoría apunta a que los tokens procesados de manera individual codifican las direcciones que los producirían. Este enfoque permitiría descubrir circuitos sin necesidad de gradientes o intervención causal, logrando estructuras comparables a métodos basados en gradientes solo a través del alineamiento geométrico.
La validación de esta hipótesis en benchmarks estándar como IOI, SVA y MCQA, a través de cuatro familias de modelos, ha demostrado un rendimiento en el descubrimiento de circuitos equiparable a los métodos basados en gradientes. Pero además, estas mismas direcciones que identifican los componentes del circuito también permiten un control preciso, como en la clasificación de emociones donde se ha alcanzado un 69.8% de precisión, superando ampliamente el 53.1% obtenido mediante preguntas de instrucción, manteniendo al mismo tiempo la precisión factual.
Este enfoque de doble lectura y escritura revela que los circuitos de los Transformers son estructuras fundamentalmente geométricas, donde la interpretabilidad y la capacidad de control son dos facetas de un mismo objeto. En el ámbito empresarial, entender y aplicar estos conceptos puede abrir nuevas puertas para el desarrollo de aplicaciones a medida, la implementación de inteligencia artificial en los procesos de negocio y la optimización de la ciberseguridad con servicios cloud de AWS y Azure, áreas en las que Q2BSTUDIO se especializa.





