NVIDIA ha anunciado el lanzamiento de Nemotron-Labs-3-Puzzle-75B-A9B, una versión comprimida de su modelo previo Nemotron-3-Super, diseñado para maximizar el rendimiento en hardware especializado. Este modelo híbrido de Expertos Mixtos (MoE) logra una reducción significativa de parámetros: pasa de 120.7 mil millones de parámetros totales y 12.8 mil millones activos a 75.3 mil millones y 9.3 mil millones, respectivamente. Esta compresión se logra mediante un enfoque innovador llamado Iterative Puzzle, que combina compresión estructural consciente del hardware con fases breves de destilación de conocimiento para recuperar capacidades perdidas durante el proceso.

En pruebas en un nodo de 8xB200, el modelo alcanza un rendimiento 2.03 veces mayor que su predecesor, manteniendo una velocidad de 100 tokens por segundo por usuario. Además, en un solo chip H100, la concurrencia de tokens aumenta de 1 solicitud a 8, lo que sugiere una mejora drástica en la escalabilidad para aplicaciones en tiempo real. Estas optimizaciones son clave en un entorno donde los costos de infraestructura y la eficiencia energética son críticos para empresas de IA a nivel global.

El enfoque de Iterative Puzzle refleja una tendencia creciente en el desarrollo de modelos de lenguaje: priorizar la adaptabilidad a hardware específico sin comprometer la calidad. A diferencia de métodos tradicionales de reducción de tamaño, esta técnica no solo disminuye la huella de memoria, sino que también preserva la capacidad de razonamiento complejo, esencial para tareas como generación de texto o análisis de datos. Para los profesionales tecnológicos, esto significa que pueden desplegar modelos más potentes en servidores más pequeños, reduciendo costos operativos y permitiendo una mayor flexibilidad en proyectos de IA empresarial.

Esta innovación también subraya la estrategia de NVIDIA de acelerar el ecosistema de IA generativa. Al optimizar modelos para sus propias GPUs como la H100 y el nodo 8xB200, la empresa refuerza su posición como proveedora de infraestructura líder. Para los desarrolladores, el Nemotron-Labs-3-Puzzle-75B-A9B representa una herramienta para explorar nuevas arquitecturas de IA más eficientes, especialmente en escenarios donde la latencia y el consumo de recursos son factores determinantes. Aunque aún no se detalla su disponibilidad pública, su lanzamiento marca un hito en la carrera por la sostenibilidad y el rendimiento en modelos de lenguaje de gran escala.