NVIDIA Nemotron-3-Puzzle-75B-A9B: Compressed MoE for 2x Throughput

NVIDIA's compressed Nemotron-3-Puzzle-75B-A9B delivers up to 2.14x server throughput and 8x 1M-token concurrency on a single H100. Explore benchmarks,

jueves, 30 de julio de 2026 • 5 min read • Q2BSTUDIO Team

Modelo MoE híbrido comprimido logra 2.03x throughput y 8x concurrencia

NVIDIA ha presentado Nemotron-3-Puzzle-75B-A9B, un modelo de lenguaje comprimido que mantiene la arquitectura híbrida Mamba-Transformer MoE de su predecesor Nemotron-3-Super, pero con una reducción drástica de parámetros totales (de 120,7B a 75,3B) y activos (de 12,8B a 9,3B). El objetivo es duplicar el rendimiento en servidores sin sacrificar la calidad en tareas de contexto largo. Para una empresa como Q2BSTUDIO, que desarrolla aplicaciones a medida con inteligencia artificial, este avance supone una oportunidad real de escalar servicios de IA generativa con costes controlados.

La compresión se logró mediante un proceso llamado 'Puzzle iterativo', que combina poda de canales en expertos enrutados, reducción del top-k de activaciones y recorte del estado SSM de Mamba. A diferencia de una poda uniforme, este método asigna diferentes capacidades por capa: mantiene mayor capacidad en capas intermedias y finales, mientras reduce drásticamente en otras. El resultado es un modelo que, en un nodo 8xB200 con pesos NVFP4, ofrece entre 1,60x y 2,14x más rendimiento que el modelo original, dependiendo del escenario de entrada/salida. En concreto, para cargas de trabajo con muchas tokens de salida (8K/64K) y velocidad de usuario ≥100 tok/s, se alcanza un boost de 2,03x.

Este incremento de rendimiento tiene implicaciones directas en el despliegue de soluciones empresariales. Por ejemplo, en un único H100 con 1M de contexto, el modelo original permitía una sola solicitud concurrente; el comprimido permite hasta ocho. Esto es clave para aplicaciones de RAG (Retrieval-Augmented Generation) con documentos muy extensos, donde un servicio de análisis documental puede multiplicar por cuatro el rendimiento agregado. Q2BSTUDIO integra estas capacidades en sus desarrollos de IA para empresas, combinándolas con entornos cloud AWS/Azure y medidas de ciberseguridad para garantizar escalabilidad y protección de datos.

El proceso de compresión no fue un único salto. Los investigadores de NVIDIA aplicaron tres etapas de poda intercaladas con recuperación mediante destilación de conocimiento (knowledge distillation) y entrenamiento con refuerzo (RL). En la primera etapa redujeron los pesos MoE al 75% y el estado SSM de Mamba al 75%, seguido de 24.000 millones de tokens de 'curación'. La segunda etapa llevó los pesos MoE al 60% con 43.200 millones de tokens. La tercera ajustó el presupuesto de expertos enrutados activados al 50%, asignado de forma heterogénea, con 52.800 millones de tokens. El resultado final mejora en 0,57 puntos de promedio sobre una poda directa en un solo paso, según la tabla de benchmarks presentada.

Sin embargo, la compresión no es gratuita. El modelo pierde algo de precisión en benchmarks clave: Arena-Hard-V2 cae 4,2 puntos y SWE-Bench 2,6 puntos. En tareas de razonamiento matemático (AIME25) la pérdida es de 2,5 puntos, y en MMLU-Pro de 1,4 puntos. No obstante, en benchmarks de contexto largo como RULER hasta 1M de tokens, la degradación es mínima (menos de 2 puntos), y en AA-LCR incluso mejora ligeramente. Esto significa que para aplicaciones que priorizan el contexto largo y la velocidad de generación sobre la precisión en tareas de agente o instrucción compleja, el modelo es más que adecuado.

Otro aspecto relevante es la cuantización. NVIDIA publica tres checkpoints: BF16, FP8 y NVFP4. Este último, diseñado para Blackwell, ocupa solo 44,5 GB en un H100 frente a los 70 GB del original. La reducción de memoria permite aumentar la concurrencia de 1 a 8 solicitudes simultáneas de 1M de tokens. Para empresas que necesitan desplegar agentes IA de software engineering o asistentes interactivos de codificación, este modelo ofrece un rendimiento 2,14x en el régimen decode-heavy (8K/64K) con una velocidad de usuario de al menos 125 tok/s. Q2BSTUDIO puede aprovechar esta eficiencia para construir sistemas de BI/Power BI que analicen grandes volúmenes de datos en tiempo real, o agentes IA que automaticen procesos internos con respuestas contextualmente precisas.

La investigación también aborda la predicción multitoken (MTP). El modelo hereda una cabeza MTP compartida del modelo original, pero los autores identificaron una discrepancia entre el entrenamiento forzado por profesor y la inferencia autogenerativa. Tras un entrenamiento continuado, la longitud media de aceptación en SPEED-Bench pasó de 3,45 a 4,34 en un borrador de longitud 7, una mejora del 25-30% concentrada en las posiciones más profundas. La versión NVFP4 apenas pierde respecto a BF16, manteniendo 4,31 frente a 4,34. Esto acelera aún más la generación sin coste adicional.

En términos de despliegue práctico, el modelo se beneficia de kernels optimizados para Mamba con estado SSM de 96 canales, que durante la decodificación son entre 1,2x y 1,3x más rápidos que con 128 canales, para tamaños de lote de 8 a 512. La poda de Mamba fue uniforme porque los frameworks de inferencia actuales no soportan tamaños de estado SSM variables por capa. Esta limitación puede resolverse en el futuro, pero por ahora la solución uniforme ya aporta ganancias significativas.

Para una empresa de desarrollo de software como Q2BSTUDIO, la elección de este modelo frente al original depende del caso de uso. Si el cliente requiere máxima precisión en tareas de razonamiento complejo o agentes autónomos, quizá el modelo Super siga siendo necesario. Pero para servicios de chat masivo, RAG con documentos largos, asistentes de codificación o análisis de logs, el modelo Puzzle ofrece un rendimiento por dólar muy superior. Además, al estar disponible en FP8 y NVFP4, se adapta tanto a hardware Hopper como Blackwell, facilitando la migración a la nube AWS o Azure sin cambios drásticos en la infraestructura.

La ciberseguridad también se beneficia: con mayor concurrencia, se pueden construir sistemas de detección de amenazas en tiempo real que procesen miles de tokens por segundo sin comprometer la privacidad, ya que los datos nunca abandonan el nodo. En combinación con medidas de seguridad perimetral y encriptación, las soluciones basadas en Nemotron-3-Puzzle pueden desplegarse en entornos regulados con confianza.

En conclusión, NVIDIA ha demostrado que es posible comprimir modelos MoE híbridos de gran tamaño sin perder las capacidades fundamentales de contexto largo y generación rápida. Nemotron-3-Puzzle-75B-A9B es un paso hacia la democratización de la IA generativa, permitiendo a empresas de todos los tamaños acceder a modelos de alto rendimiento con costes de infraestructura reducidos. Para Q2BSTUDIO, supone una herramienta más en su arsenal para ofrecer aplicaciones a medida, agentes IA, y soluciones de cloud y BI que resuelvan problemas reales de negocio. La tecnología avanza rápido, y quienes sepan adaptarla primero obtendrán una ventaja competitiva duradera.

A BREAK?

Play for a moment before you go

OUR SERVICES

How we can help you

Do you have a project in mind?

Tell us your vision and we'll turn it into a software solution. Whatever the scope, we make your idea real.