Cuando un agente de IA ejecuta un loop, no esta innovando con cada paso: reenvia casi el mismo prompt decenas, cientos, a veces miles de veces con variaciones minúsculas. Y ahi, en ese detalle casi invisible, se juega una batalla silenciosa que esta redefiniendo el stack de inferencia para desarrolladores.
Segun un analisis reciente publicado por Towards AI, herramientas como vLLM y SGLang estan desplazando a Ollama como la opcion preferida para flujos de trabajo agenticos. La razon de fondo es tecnica pero las consecuencias son enormes para cualquiera que este construyendo agentes en produccion.
El problema del prompt repetido
En un agente tipico, el sistema toma una decision, ejecuta una accion, observa el resultado y vuelve a consultar al modelo con un prompt que es 95% identico al anterior. Solo cambian unas pocas lineas: la salida de la herramienta, el estado interno, el contexto actualizado.
Ollama, que se popularizo por hacer facil correr modelos locales con un solo comando, aplica por defecto una ventana de cache de prefijo de apenas cinco pasos. Despues de eso, descarta el prompt cacheado y empieza de cero. En terminos de rendimiento, esto significa que cada iteracion del loop paga el coste completo de reprocesar el prompt completo, aunque solo hayan cambiado unos tokens al final.
vLLM y SGLang operan de forma radicalmente distinta. Ambos implementan lo que se conoce como cache de prefijo automatico y persistente: detectan que el nuevo prompt comparte una granporcion con uno ya procesado y reutilizan los calculos intermedios, concretamente los estados de atencion del transformer, sin volver a computarlos. vLLM lo hace mediante su sistema PagedAttention; SGLang, a traves de RadixAttention, una estructura de datos tipo arbol que maximiza la reutilizacion entre llamadas concurrentes.
La diferencia en numeros
El articulo senala que en benchmarks tipicos de agentes la diferencia es de un orden de magnitud. Mientras Ollama puede tardar varios segundos en cada iteracion del loop, vLLM y SGLang completan la misma operacion en fracciones de segundo una vez que el cache esta caliente. Para un agente que ejecuta veinte pasos por tarea, esto se traduce en tiempos de respuesta que pasan de casi un minuto a apenas unos segundos.
Y el ahorro no es solo temporal: tambien es energetico y economico. En despliegues cloud con GPUs facturadas por hora, reducir el tiempo de inferencia por interaccion tiene un impacto directo en la cuenta de resultados.
Mas alla del rendimiento bruto
Hay un matiz importante. Ollama no es inherentemente peor tecnologia; de hecho, sigue siendo una opcion fantastica para experimentar, hacer prototipos y correr modelos en un portatil. Su simplicidad sigue siendo su mayor virtud. Pero esa misma simplicidad esconde decisiones de diseno que no escalan cuando el caso de uso pasa de 'un humano haciendo preguntas' a 'cientos de agentes operando autonomamente'.
vLLM, el proyecto open source que nacio en UC Berkeley, se ha convertido en el estandar de facto para servir modelos a escala, y empresas como Red Hat, NVIDIA y Anyscale lo han integrado en sus plataformas. SGLang, originalmente desarrollado en el equipo de Luca Soldaini en el Allen Institute for AI, ha ganado terreno rapido precisamente por su optimizacion para workloads agenticos y multimodelo.
Que significa esto para el desarrollador
Si estas construyendo agentes, la eleccion del motor de inferencia ya no es un detalle de implementacion: es una decision arquitectonica. Un stack con Ollama puede funcionar para validar una idea, pero migrar despues a vLLM o SGLang no es trivial: cambia la API, la gestion de memoria, el formato de los pesos y la forma de desplegar.
La leccion es clara: hay que elegir el motor pensando en el regimen de uso, no en la demo. Cuando los prompts se repiten, cuando los loops son largos, cuando la latencia importa, las optimizaciones de cache de prefijo se vuelven la diferencia entre un proyecto de fin de semana y un producto viable.
La inferencia local ya no es un monolito: empieza a fragmentarse en casos de uso especificos, y los flujos agenticos son el proximo campo de batalla donde se separan los amateurs de los que construyen infraestructura de verdad.