El rápido crecimiento del contexto utilizable en los modelos de lenguaje grandes (LLM) ha abierto nuevas posibilidades para tareas que requieren una amplia memoria, como el razonamiento multi-paso, el resumen de documentos extensos o el análisis de vídeos. Sin embargo, a medida que los prompts se alargan hasta los 128·k tokens o más, la etapa de prefill se convierte en el principal cuello de botella: la atención densa procesa todo el prompt antes de que la generación comience, consumiendo una cantidad desproporcionada de recursos computacionales y latencia.
Los investigadores han explorado desde hace tiempo la atención dispersa como una forma de reducir este costo. La idea consiste en seleccionar un subconjunto de bloques de tokens en lugar de la matriz completa de auto-atención densa. No obstante, un método sencillo de selección basado en el centroide puede ocultar tokens altamente relevantes entre muchos irrelevantes: este fenómeno, conocido como dilución media, degrada la calidad de las respuestas.
Ahora, un equipo de ArXiv presenta RBS-Attention (Radius‑Bounded Sparse Prefill), una estrategia de prefill disperso libre de entrenamiento que aborda directamente el problema de la dilución. La propuesta combina dos ramas complementarias: una rama base que captura la relevancia promedio (centroide) y una rama de rescate que identifica bloques en riesgo de ser subestimados mediante un radio de bloque-clave dinámico, dependiente del prompt, la capa y la cabeza. Al aplicar umbrales independientes a cada rama y fusionar sus máscaras, el método equilibra la velocidad con la precisión, manteniendo la compatibilidad con FlashAttention disperso.
Los resultados en hardware H100 son notables. RBS-Attention logra un velocidad de prefill de atención 20,65× en comparación con el método standalone, un 11,92× de aceleración sobre vLLM y un 5,97× de mejora en el tiempo hasta el primer token (TTFT) a 128·k en el modelo Qwen3-30B-A3B-Instruct-2507 en FP8. En el modelo denso Qwen3-32B, la precisión global RULER se mantiene en 88,65 (frente a 89,52 de la atención densa), mientras que evaluaciones adicionales en LongBench-v2, InfiniteBench y Video-MME confirman que la calidad de las respuestas no se ve comprometida.
Más allá de la aceleración bruta, el enfoque de doble rama ofrece una adaptación al contexto que los métodos de densidad fija no pueden igualar. Al calcular un radio que varía según la distribución de claves en cada prompt y capa, RBS-Attention puede expandir selectivamente la ventana de atención allí donde la relevancia está concentrada, evitando tanto el exceso de tokens irrelevantes como la pérdida de información crítica. Esta adaptabilidad es especialmente valiosa en escenarios de inferencia real, donde los prompts pueden oscilar drásticamente entre ser concisos y ser extensos.
Desde el punto de vista de la industria, la técnica tiene implicaciones prácticas inmediatas. Los proveedores de servicios en la nube que ofrecen inferencia de LLM como servicio podrían reducir los costos operativos al acelerar el tiempo de respuesta sin sacrificar la calidad, haciendo que los modelos de contexto largo sean más accesibles para empresas y desarrolladores. Por otro lado, los usuarios finales que dependen de asistentes con memoria extendida (por ejemplo, revisores legales, analistas de datos o asistentes de codificación) experimentarían una latencia perceptible, especialmente en el momento en que aparece el primer fragmento de texto generado.
El trabajo también abre nuevas líneas de investigación. La selección adaptativa basada en radio podría integrarse con otras optimizaciones, como la atención de largo alcance o los aceleradores especializados, para llevar la eficiencia de los LLM a nuevos niveles. Futuras iteraciones podrían explorar la optimización dinámica de los umbrales a través de aprendizaje por refuerzo o el uso de modelos de relevancia guiados por el usuario para adaptar el equilibrio entre velocidad y precisión a dominios específicos.
En resumen, RBS-Attention demuestra que un enfoque bien diseñado de selección dispersa puede romper el cuello de botella del prefill en modelos de lenguaje de contexto largo, ofreciendo aceleraciones de más de 20× mientras se mantiene la precisión en niveles cercanos a los de la atención densa. Su enfoque de doble rama, libre de entrenamiento, y su capacidad para adaptarse a la distribución de tokens reales lo convierten en un paso significativo hacia una inferencia de LLM más rápida y económica, con un impacto potencial en una amplia gama de aplicaciones impulsadas por IA.