FreeToken se presenta como una solución de servicing nativa para el borde que permite ejecutar el modelo de lenguaje de 753 B GLM‑5.2 en una única tarjeta gráfica de una estación de trabajo, algo que hasta ahora solo era viable en clústeres de alto rendimiento. Esta innovación combina la arquitectura de Experto Mixtos (MoE) con una gestión inteligente del caché, ofreciendo una alternativa escalable y de bajo costo para la inferencia de modelos masivos.

La arquitectura se basa en la noción de Experto Mixtos (MoE), donde el caché de consultas se reparte entre transferencias por PCIe y ejecución en CPU según el ancho de banda medido. Este mecanismo reduce la latencia al evitar que las peticiones que fallan en la GPU sean enviadas a la CPU, y optimiza el uso del ancho de banda de la interfaz PCIe, lo que permite que la mayor parte del trabajo se ejecute directamente en la GPU, manteniendo la eficiencia sin sacrificar velocidad.

En pruebas controladas, FreeToken logró ejecutar GLM‑5.2 de 753 B con una latencia media de menos de 150 ms por solicitud de 1 k tokens, comparable a sistemas que emplean ocho GPUs de última generación. Además, el consumo energético se redujo en aproximadamente un 60 % respecto a enfoques tradicionales que dependen de múltiples tarjetas, lo que se traduce en una huella de carbono mucho menor y un ahorro económico significativo para las organizaciones.

Desde el punto de vista empresarial, la capacidad de correr modelos de varios trillones de parámetros en una workstation permite a empresas de todos los tamaños acelerar la innovación, reducir la dependencia de proveedores de cloud y cumplir con requisitos de soberanía de datos. Esto democratiza el acceso a la IA de última generación, facilitando proyectos de I+D, asistentes virtuales y aplicaciones de análisis en tiempo real sin la barrera de costos de infraestructura masiva.

No obstante, la adopción de FreeToken enfrenta retos importantes. La integración con frameworks populares requiere ajustes en la cadena de herramientas y una correcta sincronización entre CPU y GPU, lo que puede ser complejo para equipos sin experiencia profunda en paralelismo heterogéneo. Además, la eficiencia depende de la calidad de los datos de entrenamiento y de la capacidad del hardware de la workstation para manejar picos de carga, lo que implica que no todas las estaciones de trabajo son igualmente adecuadas.

El proyecto está respaldado por una comunidad de código abierto que ya contribuye con extensiones para Hugging Face Transformers y PyTorch, así como con kernels optimizados que mejoran la utilización de la memoria GPU. Se esperan colaboraciones de fabricantes de hardware que integren controladores especializados para acelerar la transferencia PCIe y reducir la latencia de los accesos a la memoria, lo que podría elevar aún más el rendimiento de FreeToken en futuras versiones.

En resumen, FreeToken demuestra que la combinación inteligente de MoE, gestión de ancho de banda y ejecución en el borde hace viable el despliegue de modelos gigantes en entornos locales, marcando un paso decisivo hacia una informática de inteligencia artificial más democratizada, sostenible y accesible para profesionales y organizaciones de todo el mundo.