La irrupción de los grandes modelos lingüísticos (LLM) ha desatado una ola de investigación centrada en la *agencia*: la capacidad de razonar, planificar y actuar de forma autónoma. Esta tendencia ha dado lugar a marcos de agentes que orquestan percepción, memoria y toma de decisiones alrededor de potentes LLM como columna vertebral. Con la llegada de los grandes modelos multimodales (LMM), estos sistemas pueden procesar e integrar datos de diversas modalidades – imágenes, audio, vídeo – mejorando drásticamente su aplicabilidad en el mundo real.

Sin embargo, si bien existen revisiones sobre agentes basados en LLM, el papel de la multimodalidad en la configuración de la agencia no ha sido examinado sistemáticamente en los últimos años. Esta encuesta llena el vacío al analizar el impacto de la multimodalidad en los módulos funcionales centrales de un marco de agente: percepción, razonamiento, planificación, memoria y acción. Desde esta perspectiva, se rastrea la evolución desde agentes centrados en texto hasta marcos multimodales, se examina cómo las modalidades se integran mediante arquitecturas de fusión temprana, fusión tardía y delegación, y se evalúan los comportamientos agenticos emergentes habilitados por una percepción anclada y el razonamiento multimodal. El trabajo se organiza mediante una taxonomía centrada en la modalidad que vincula las decisiones de diseño arquitectónico con las capacidades de los agentes.

La encuesta también revisa sistemas agenticos multimodales en diversos dominios de aplicación. En *robótica*, los agentes pueden interpretar escenas visuales y navegar entornos dinámicos con mayor precisión. En *navegación de GUI y web*, la capacidad de entender interfaces gráficas y secuencias de acciones mejora la automatización de tareas en línea. En *generación y edición de contenido multimedia*, los agentes combinan texto, imagen y audio para producir recursos creativos de forma coherente. Finalmente, en *comprensión y recuperación de vídeo de larga duración*, la multimodalidad permite extraer eventos, objetos y relaciones a lo largo de horas de grabación.

Más allá de las capacidades, el estudio evalúa el desempeño en estos contextos y discute los compromisos entre eficiencia y escalabilidad. Los costes de entrenamiento e inferencia, la latencia y las limitaciones de despliegue son factores críticos que determinan la viabilidad práctica de los agentes multimodales. La encuesta identifica brechas como la falta de conjuntos de datos estándar para evaluar la agencia multimodal, la escasez de marcos de evaluación unificados y la necesidad de mejores técnicas de fusión que equilibren precisión y consumo de recursos.

Por qué esto importa: a medida que los modelos base adoptan capacidades visuales, auditivas y de vídeo, los agentes que pueden razonar a través de estas modalidades están llamados a convertirse en los pilares de los próximos sistemas de IA generales. Comprender los fundamentos técnicos y las fronteras actuales permite a investigadores y empresas priorizar inversiones, al tiempo que los responsables políticos pueden anticipar los riesgos y oportunidades de una IA más capaz y versátil.

La encuesta traza una hoja de ruta hacia sistemas inteligentes más robustos y de propósito general. Aboga por el desarrollo de arquitecturas unificadas que equilibren la fusión multimodal con la eficiencia computacional, la estandarización de métricas de evaluación y la colaboración interdisciplinaria entre comunidades de visión por computadora, NLP y robótica. Solo así podremos avanzar de prototipos fascinatingos a agentes multimodales fiables que operen de forma segura y ética en entornos del mundo real.