Los modelos basados en transformadores modernos incluyen siempre un par de n\u00fameros en sus tarjetas de modelo (model cards) que describen c\u00f3mo funciona su mecanismo de atenci\u00f3n. Aunque el nombre gen\u00e9rico sea "atenci\u00f3n", en realidad existen varias arquitecturas especializadas que equilibran precisión, velocidad y consumo de memoria. Entender la diferencia entre MHA, MQA, GQA y MLA es clave para elegir el modelo adecuado para una tarea concreta y para optimizar los costos de inferencia.\n\nMulti\u2011Head Attention (MHA)\nMHA es el dise\u00f1o original propuesto en el art\u00edculo de Vaswani et al. (2017). Divide la matriz de consultas (Q) en varias cabezas (h), generando as\u00ed consultas, claves y valores independientes para cada una:\n\nQ = [W_q^1, W_q^2, ..., W_q^h] · X\nK = [W_k^1, W_k^2, ..., W_k^h] · X\nV = [W_v^1, W_v^2, ..., W_v^h] · X\n\nCada cabeza opera en un espacio de representaci\u00f3n reducido, lo que permite al modelo aprender relaciones multiescala. El modelo card t\u00ipico de MHA muestra dos n\u00fameros iguales, por ejemplo, "num_heads=32, num_kv_heads=32". Este dise\u00f1o es preciso pero costoso: necesita 32 matrices de claves y valores, lo que duplica el consumo de memoria y aumenta la latencia.\n\nMulti\u2011Query Attention (MQA)\nMQA es una simplificaci\u00f3n agresiva que comparte las mismas claves y valores en todas las cabezas. En lugar de h matrices de K y V independientes, se utiliza una sola pareja (K,V). El model card muestra una relaci\u00f3n como "num_heads=32, num_kv_heads=1". Esta arquitectura reduce dr\u00e1sticamente el uso de memoria (hasta un 80\u00a0% menos) y acelera la inferencia, a costa de perder capacidad para representar simult\u00e1neamente muchas cabezas con diferentes patrones de atenci\u00f3n. MQA es com\u00fan en modelos optimizados para dispositivos m\u00f3viles o en servicios que priorizan la velocidad sobre la precisión, como algunas versiones de GPT-3.5 o modelos ligeros para chat.\n\nGrouped Query Attention (GQA)\nGQA se sit\u00faa entre MHA y MQA: permite a varias cabezas compartir claves y valores, pero no todas. El model card muestra un n\u00famero menor de cabezas KV que de cabezas de consulta, por ejemplo, "num_heads=32, num_kv_heads=8". Esto ofrece un punto medio \u00f0tico: mantiene parte de la flexibilidad de MHA mientras reduce la memoria y la latencia. Los principales modelos de texto actuales (Llama\u202f2, Falcon, GPT\u202f4) suelen adoptar GQA para lograr un buen equilibrio entre rendimiento y eficiencia.\n\nMemory\u2011Augmented Attention (MLA)\nMLA es una arquitectura m\u00e1s reciente que combina el mecanismo cl\u00e1sico de atenci\u00f3n con una memoria externa compuesta por un conjunto de keys/values precalculados. El model card muestra un par como "num_heads=64, num_kv_heads=8, memory_slots=256". Al almacenar claves y valores de consultas anteriores en una memoria auxiliar, MLA reduce la necesidad de recomputar K y V en cada paso, lo que mejora dr\u00e1sticamente la capacidad de secuencia larga y la velocidad de tokens por segundo en tareas de larga duraci\u00f3n (por ejemplo, resumen de documentos extensos). Sin embargo, la memoria adicional conlleva un sobrecosto de almacenamiento y solo est\u00e1 implementada en un n\u00famero limitado de modelos especializados.\n\nPor qu\u00e9 importa esto a los profesionales\nEntender la combinaci\u00f3n exacta de par\u00e1metros de atenci\u00f3n que aparece en el model card ayuda a predecir el comportamiento del modelo antes de implementarlo. Un modelo con MQA puede generar respuestas m\u00e1s r\u00e1pidamente en un chatbot en tiempo real, pero podr\u00eda sacrificar la coherencia en conversaciones largas. Por el contrario, un modelo con MLA puede mantener la coherencia a lo largo de un documento de cientos de p\u00e1ginas, aunque a costa de un mayor tiempo de inicio y de un mayor uso de RAM.\n\nPara los equipos de infraestructura, estos n\u00fameros determinan el dimensionamiento de los cl\u00fasters GPU. Un modelo GQA con 8 cabezas KV ocupa aproximadamente una cuarta parte de la memoria que su equivalente MHA de 32 cabezas, lo que puede traducirse directamente en ahorros de costos operativos. Los desarrolladores tambi\u00e9n deben considerar el impacto en la latencia de la decodificaci\u00f3n: MQA y GQA suelen ofrecer tiempos de latencia de un solo token m\u00e1s bajos, lo que es crucial para los servicios de streaming.\n\nEn resumen, el par\u00e1metro aparentemente t\u00e9cnico que aparece en el model card es en realidad una se\u00f1al de dise\u00f1o que revela el equilibrio entre tres dimensiones clave: precisión, velocidad y escalabilidad. Elegir el tipo de atenci\u00f3n adecuado para cada caso de uso permite a las organizaciones extraer el m\u00e1ximo valor de los modelos de IA sin pagar innecesariamente por recursos infrautilizados.