Descubre cómo los LLMs multimodales procesan sonido y visión
Los modelos de IA que combinan audio y visión siguen rutas de información distintas según la tarea. Esta estudio revela cómo descartar tokens innecesarios acelera la inferencia sin perder precisión.
6 min lectura13semIAOnda Redaccion