El panorama de los modelos de lenguaje grandes acaba de recibir una inyección de frescura. Zyphra, la startup respaldada por AMD, ha presentado ZAYA1-8B, un modelo de razonamiento que está generando un intenso debate en la comunidad de inteligencia artificial: ¿realmente necesitamos miles de millones de parámetros activos para competir con los mejores?
La respuesta, según los resultados publicados en el technical report oficial, parece ser un rotundo no. ZAYA1-8B opera con apenas 700 millones de parámetros activos dentro de una arquitectura total de 8.000 millones, utilizando el framework MoE++ propietario de Zyphra. Esta aproximación mixture-of-experts permite activar únicamente las "expertises" necesarias para cada tarea, manteniendo el resto del modelo inactivo y reduciendo drásticamente el costo computacional.
Lo verdaderamente remarkable es lo que este modelo logra con tan pocos recursos activos. En benchmarks desafiantes de matemáticas y programación, ZAYA1-8B iguala o supera a DeepSeek-R1-0528, un modelo considerablemente más grande. También se mantiene competitivo frente a otros modelos de razonamiento de código abierto que duplican o triplican su tamaño.
La clave del éxito radica en el enfoque de entrenamiento. A diferencia de la mayoría de modelos que añaden capacidades de razonamiento en fases posteriores, ZAYA1-8B fue diseñado para razonar desde su nacimiento. Los datos de razonamiento se incorporaron desde la fase de preentrenamiento utilizando un esquema de "answer-preserving trimming" que preserva la integridad de las soluciones.
El entrenamiento posterior sigue una cascada de cuatro etapas de aprendizaje por refuerzo. Primero, un calentamiento de razonamiento con matemáticas y puzzles. Después, un currículo RLVE-Gym con 400 tareas de varying difficulty. La tercera etapa se centra en matemáticas y código utilizando rastros de compute en tiempo de prueba y entornos sintéticos de programación competitiva. Finalmente, un RL conductual para mejorar el chat y el seguimiento de instrucciones.
Pero donde el modelo realmente brilla es con Markovian RSA, un método innovador de test-time compute que permite agregar recursivamente múltiples trazas de razonamiento en paralelo. Lo revolutionary es que solo necesita mantener un "tail" de razonamiento de 4.000 tokens entre rondas, haciendo el proceso extremadamente eficiente.
Los resultados son impresionantes: 91,9% en AIME'25 y 89,6% en HMMT'25, reduciendo significativamente la brecha con modelos mucho más grandes como Gemini-2.5 Pro, DeepSeek-V3.2 y GPT-5-High.
Desde la perspectiva tecnológica, hay varios elementos值得关注. La plataforma AMD de cómputo completo (compute, networking y software) demuestra que el ecosistema alternativo a NVIDIA está madurando para cargas de trabajo de IA intensiva. El enfoque de MoE++ de Zyphra sugiere que la eficiencia computacional puede lograrse sin sacrificar capacidad.
Para los profesionales tech hispanohablantes, ZAYA1-8B envía un mensaje claro: la innovación en arquitecturas y métodos de entrenamiento puede ser tan importante como la escala bruta. En un momento donde los costos de entrenamiento de modelos masivo están bajo escrutinio, este tipo de eficiencia podría definir el futuro de la industria.
Quedan preguntas por responder, particularmente sobre la disponibilidad del modelo y las implicaciones comerciales de esta tecnología. Pero lo que es innegable es que Zyphra ha colocado una pieza importante en el tablero de la IA generativa, demostrando que hay espacio para modelos más pequeños y eficientes en el selecto grupo de capacidades de razonamiento avanzadas.