La Inteligencia Artificial (IA) sigue avanzando a pasos agigantados en la industria tecnológica. Una de las áreas más relevantes en este sentido es el servicio de modelos de Lenguaje de Llamadas (LLM), utilizados en aplicaciones como asistentes virtuales, traductores y generadores de contenido. Sin embargo, la complejidad de estos modelos requiere recursos de memoria y procesamiento significativos, lo que puede ser un obstáculo para su implementación en dispositivos con recursos limitados.

Para abordar este desafío, la empresa Together AI ha lanzado OSCAR, un método innovador para la cuantización de caché de memoria en modelos de LLM de larga contexto. La cuantización se refiere a la técnica de reducir el tamaño de los datos mientras se mantiene su precisión, lo que puede ayudar a reducir la cantidad de memoria utilizada y mejorar la velocidad de procesamiento.

OSCAR se basa en la estimación de estructuras de covarianza conscientes de la atención, lo que permite derivar rotaciones separadas para claves y valores de la caché de memoria. Esto se diferencia de los enfoques de rotación anterior que aplicaban transformaciones Hadamard no conscientes de datos. La innovación de OSCAR es que se puede aplicar a claves y valores de la caché de memoria de manera independiente, lo que permite una mayor flexibilidad y eficiencia.

Los resultados de los tests realizados por Together AI son impresionantes. En la tarea de evaluación de modelos de LLM, OSCAR reduce la brecha de precisión entre modelos en formato BF16 y modelos en formato FP32 en un 3,78% en el modelo Qwen3-4B-Thinking-2507, y en un 1,42% en el modelo Qwen3-8B. Además, OSCAR reduce la memoria utilizada en la caché de memoria en un 8 veces, y aumenta la velocidad de procesamiento en hasta un 3 veces en longitudes de contexto de 100K.

La importancia de OSCAR radica en su capacidad para mejorar la eficiencia de los modelos de LLM en dispositivos con recursos limitados. Esto puede estar particularmente relevante en escenarios de servicio en la nube, donde la eficiencia de los recursos es crucial para evitar costos adicionales. Además, la innovación de OSCAR puede estar disponible para otros modelos de IA que requieren una gran cantidad de memoria y procesamiento.

En resumen, la lanzamiento de OSCAR por Together AI es un paso importante en la evolución de los modelos de Lenguaje de Llamadas. La innovación de este método puede ayudar a reducir la memoria utilizada y mejorar la velocidad de procesamiento en dispositivos con recursos limitados. Esto puede tener un impacto significativo en la industria de la IA y en la forma en que se implementan los modelos de LLM en diversas aplicaciones.