MiniMax presenta MSA: atención escasa 2‑ramas que reduce 28× el costo computacional
MiniMax lanza MSA, una arquitectura de atención bloque‑esparsa que combina un índice ligero y un bloque principal, logrando el mismo rendimiento que GQA pero con 28,4 veces menos cálculo por token en contextos de 1 M.
5 min lectura6semIAOnda Redaccion