Google TurboQuant: 6x menos memoria y 8x más velocidad en LLMs
Google presenta TurboQuant, un algoritmo que comprime el caché KV de modelos de lenguaje sin perder precisión. Reduce 6 veces el uso de memoria y acelera hasta 8 veces la inferencia, democratizando el acceso a IA avanzada.
5 min lectura19semIAOnda Redaccion