Nous Research, el laboratorio de investigación de IA de la firma francesa, ha publicado recientemente un nuevo mecanismo de atención llamado Lighthouse Attention. Esta innovación se centra en la etapa de preentrenamiento de modelos de lenguaje, ofreciendo un aumento de velocidad de entre 1.4 y 1.7 veces respecto a la atención escalar típica basada en producto punto, sin sacrificar la calidad final del modelo.
El concepto de Lighthouse Attention se basa en un enfoque de selección jerárquica: en lugar de procesar la secuencia completa con la atención convencional, el método agrupa los tensores de consulta (Q), clave (K) y valor (V) en una pirámide de resoluciones. De esta forma, el cálculo de la atención se reduce de O(N·S·d) a O(S²·d), donde N es el número de tokens, S el número de sub‑secuencias y d la dimensionalidad interna. Además, el algoritmo permite ejecutar FlashAttention, una implementación optimizada de atención, sobre un subconjunto denso de tokens, lo que mejora aún más la eficiencia.
A diferencia de sus predecesores como NSA (Non‑Subsampled Attention) y HISA (Hierarchical Sparse Attention), que solo reducen la cantidad de claves y valores, Lighthouse Attention aplica la reducción de forma simétrica a Q, K y V. Esto garantiza que la información se preserve de manera más equilibrada a lo largo de la jerarquía, evitando la pérdida de contexto que a veces ocurre cuando solo se trabajan con claves y valores.
El equipo de Nous evaluó el método sobre un modelo de 530 millones de parámetros inspirado en Llama‑3, entrenado con una longitud de contexto de 98 k tokens. Los resultados mostraron que, en comparación con un modelo base que emplea cuDNN SDPA (Scaled Dot‑Product Attention), Lighthouse Attention logró una reducción del tiempo de entrenamiento de 1.40 a 1.69 veces, manteniendo el mismo o incluso un menor valor final de la pérdida. Esta mejora se logró sin introducir una arquitectura compleja; el mecanismo se activa únicamente durante el preentrenamiento y se elimina al pasar a la fase de inferencia.
¿Por qué es importante esto? En la práctica, los modelos que manejan longitudes de contexto superiores a los 16 k tokens suelen ser prohibitivamente caros de entrenar. Los investigadores y las empresas que dependen de estos modelos —por ejemplo, en tareas de análisis de documentos extensos, generación de código o soporte técnico— se ven restringidos por el coste de cómputo y el tiempo de entrega. Lighthouse Attention ofrece una solución práctica: acelerar el preentrenamiento sin requerir hardware extra ni modificar la arquitectura de inferencia.
Además, la simplicidad de su implementación facilita su adopción. Los desarrolladores pueden integrar Lighthouse Attention en sus pipelines de entrenamiento existentes con pocas líneas de código, aprovechando las librerías estándar de PyTorch y FlashAttention. El hecho de que el mecanismo sea “solo de entrenamiento” elimina preocupaciones sobre la latencia en producción.
Desde la perspectiva de la investigación, Lighthouse Attention abre nuevas vías para explorar la atención jerárquica de forma más eficiente. Podría combinarse con técnicas de tokenización más inteligentes, con modelos de atención basada en discretización, o incluso con arquitecturas híbridas que mezclen transformers con redes convolucionales para aprovechar la estructura de los datos.
En resumen, Lighthouse Attention representa un avance significativo en la eficiencia de los modelos de lenguaje de gran contexto. Su enfoque de selección jerárquica, combinado con la eliminación de la complejidad durante la inferencia, lo convierte en una herramienta atractiva para investigadores y profesionales que buscan entrenar modelos más rápidos y económicos sin perder rendimiento.
La comunidad de IA no puede dejar de observar cómo este y otros métodos similares podrían redefinir el ritmo de innovación en NLP, especialmente a medida que se demanda mayor capacidad de procesamiento de textos extensos.