FluidPD revoluciona el serving de LLMs: elasticidad in-place sin recargar modelos
Investigadores presentan FluidPD, un sistema que reasigna workers entre prefill y decode en tiempo real. Mejora el cumplimiento de SLOs hasta 94,6 puntos porcentuales sin añadir GPUs.
6 min lectura1hIAOnda Redaccion