Lighthouse Attention acelera preentrenamiento de modelos con contexto largo
Nous Research presenta un mecanismo de atención jerárquica que reduce el tiempo de entrenamiento en un 1.4–1.7×. La técnica, llamada Lighthouse Attention, funciona solo durante la fase de preentrenamiento y desaparece al desplegar el modelo.
5 min lectura12semIAOnda Redaccion