El auge de los modelos de lenguaje de gran escala (LLM) ha llevado al sector a enfrentarse a un problema de ingeniería que, hasta ahora, ha quedado relegado al segundo plano: la "pared de memoria". Según estudios académicos, la velocidad con la que un LLM genera texto se ve limitada por la rapidez con la que los datos pueden leerse desde la memoria, y este cuello de botella se agrava a medida que los modelos crecen en tamaño y complejidad.

En este contexto, Majestic Labs, una startup de hardware para IA, ha anunciado el desarrollo de Prometheus, un servidor diseñado para romper ese límite. Con 128 TB de memoria RAM, Prometheus supera en más de 60 veces la capacidad del DGX B300 de Nvidia, considerado el estándar de la industria para la inferencia de IA.

¿Por qué la memoria es tan crítica?

Los LLM dependen de dos tipos de memoria: la high‑bandwidth memory (HBM) que se usa para cargar los pesos del modelo, y la DRAM, que gestiona la lógica y los datos auxiliares. Nvidia ha construido su arquitectura alrededor de HBM por su alta velocidad, pero la DRAM sigue siendo la capa que limita el rendimiento cuando se trata de modelos de cientos de miles de millones de parámetros. Conforme los modelos se acercan a los 1 trillón de parámetros, la cantidad de datos que deben moverse entre CPU, GPU y DRAM se vuelve un factor decisivo.

Majestic Labs apuesta por un enfoque opuesto: se centra en la DRAM LPDDR6 y en una arquitectura unificada que elimina la separación tradicional entre HBM y DRAM. El CEO y cofundador, Sha Rabii, señala que "la mayoría de las interfaces de memoria están diseñadas para operar a distancias de pocos milímetros, lo que limita la cantidad de memoria que se puede colocar cerca del procesador".

La solución de Majestic: cables de cobre de un metro

Para romper ese límite físico, la empresa ha creado una interfaz de memoria propietaria basada en cables de cobre muy pequeños, capaces de transmitir datos a distancias de hasta un metro sin degradar el ancho de banda. Esto permite montar enormes bloques de DRAM a una distancia razonable del núcleo de procesamiento, evitando el sobreprovisionamiento de cómputo que suelen adoptar los sistemas Nvidia.

Además, la arquitectura unificada de Prometheus simplifica la gestión de la memoria y reduce la latencia. Al eliminar la capa intermedia de HBM, los datos pueden moverse más rápidamente entre la memoria y la lógica de inferencia, lo que se traduce en una velocidad de generación de texto superior.

¿Qué significa esto para la industria?

Si Prometheus logra sus objetivos, la barrera de memoria que ha frenado el despliegue de modelos más grandes podría romperse. Esto tendría un impacto directo en varias áreas:

  1. Velocidad de inferencia: Los modelos de IA podrían responder en tiempo real con mayor precisión, lo que abriría nuevas posibilidades en aplicaciones como asistentes virtuales y generación de contenido.
  2. Escalabilidad: Las empresas podrían entrenar y ejecutar modelos de mayor escala sin necesidad de escalar tanto la infraestructura de cómputo, reduciendo costes operativos.
  3. Innovación en arquitectura: La idea de usar cables de cobre de larga distancia podría inspirar una nueva generación de servidores de IA, alejándose del modelo HBM dominante.

Desafíos y próximos pasos

A pesar de su promesa, Prometheus enfrenta retos significativos. La fabricación de cables de cobre tan finos y de alta velocidad a gran escala puede resultar costosa y compleja. Además, la compatibilidad con los chips de IA existentes y la necesidad de adaptar el software para aprovechar la arquitectura unificada son barreras que Majestic Labs deberá superar.

La startup ha anunciado que planea lanzar prototipos en los próximos 12‑18 meses y espera que, a su vez, los proveedores de chips de IA consideren integrar su tecnología de memoria en futuras generaciones de GPUs.

En conclusión, Prometheus representa un intento audaz de reescribir las reglas del juego en la arquitectura de servidores de IA. Si logra superar la "pared de memoria", podría marcar el inicio de una nueva era donde la escala de los modelos ya no esté limitada por la velocidad de lectura de la memoria.