RBS-Attention: Un método de prefill disperso para modelos de lenguaje con contexto largo
RBS-Attention introduce un enfoque de prefill disperso sin entrenamiento que acelera la inferencia de LLM hasta 20× mientras preserva la precisión, usando una estrategia de doble rama que evita la dilución de relevancia en tokens clave. La técnica mejora el tiempo hasta el primer token en modelos como Qwen3-30B.
5 min lectura2hIAOnda Redaccion