Las Large Language Models (LLMs) se han convertido en herramientas fundamentales en el procesamiento del lenguaje natural, impulsando una amplia gama de aplicaciones e investigaciones en la actualidad. Estudios recientes han demostrado que las LLMs comparten similitudes significativas con el cerebro humano. La investigación neurocientífica ha identificado que un pequeño subconjunto de neuronas en el cerebro humano son cruciales para funciones cognitivas básicas, lo que plantea la siguiente interrogante: ¿las LLMs también contienen un pequeño subconjunto de neuronas críticas?
En este estudio, se propone un método de Identificación Causal de Neuronas Críticas basado en Perturbaciones para localizar sistemáticamente estas neuronas críticas en las LLMs. Los hallazgos revelan tres ideas clave: (1) las LLMs contienen conjuntos de neuronas críticas ultradispersos. La interrupción de estas neuronas puede hacer que un modelo de 72B parámetros, con más de 1.1 mil millones de neuronas, colapse por completo, con un aumento de perplejidad de hasta 20 órdenes de magnitud; (2) estas neuronas críticas no están uniformemente distribuidas, sino que tienden a concentrarse en las capas externas, especialmente dentro de los componentes de reducción de dimensionalidad de la proyección hacia abajo (MLP down_proj); (3) la degradación del rendimiento muestra transiciones de fase nítidas, en lugar de un declive gradual, cuando se interrumpen estas neuronas críticas.
A través de experimentos exhaustivos con diversas arquitecturas y escalas de modelos, se ofrece un análisis profundo de estos fenómenos y sus implicaciones para la robustez e interpretabilidad de las LLMs. Estos descubrimientos pueden guiar el desarrollo de arquitecturas de modelos más robustas y mejorar la seguridad en la implementación de aplicaciones críticas para la seguridad. Para conocer más sobre nuestros servicios de desarrollo de software a medida y aplicaciones personalizadas, visita Q2BSTUDIO.





