Google vuelve a mover ficha en la carrera por la eficiencia en modelos multimodales. La compañía acaba de anunciar una actualización que cambia las reglas del juego en el análisis de video con inteligencia artificial: sus modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite ahora incorporan una arquitectura basada en agentes que reduce el consumo de tokens hasta un 88% respecto a los métodos tradicionales, según datos publicados por The Decoder.

El planteamiento es sencillo de explicar pero técnicamente profundo. Hasta ahora, los modelos de IA que procesaban video lo hacían de forma lineal: muestreaban fotogramas a intervalos fijos, generalmente uno por segundo, y los analizaban sin discriminación. Esto generaba montañas de datos redundantes. ¿Para qué examinar cada frame de un video de vigilancia de cuatro horas si el 85% del tiempo no ocurre nada relevante?

La nueva aproximación agentica cambia esto radicalmente. En lugar de seguir una cadencia predefinida, el modelo evalúa el contenido y decide de forma autónoma qué segmentos merecen análisis detallado y cuáles puede ignorar o revisar a menor resolución. Es el equivalente a pasar de leer palabra por palabra a hacer lectura crítica: entiende qué importa y qué no.

Por qué importa este salto

Para los profesionales tech hispanohablantes que construyen productos sobre Gemini, las implicaciones son enormes. Primero, el coste por minuto de video procesado se desploma. Si una empresa estaba pagando procesar un video corporativo de dos horas, ahora podría analizar el mismo contenido con una fracción del gasto computacional. Esto democratiza casos de uso que antes eran prohibitivos: monitorización de seguridad en retail, análisis de partidos deportivos completos, revisión de grabaciones quirúrgicas, o procesamiento de archivos históricos de televisión.

Segundo, la precisión mejora precisamente porque el modelo no se distrae con información irrelevant. Cuando un sistema examina una presentación de una hora en busca de los momentos en que aparece un producto específico, no necesita procesar los minutos de diapositivas estáticas con la misma intensidad que los segmentos donde hay movimiento o cambios visuales.

Tercero, y esto es clave para desarrolladores, la latencia se reduce. Menos tokens significan respuestas más rápidas, lo que abre la puerta a aplicaciones en tiempo real que antes resultaban inviables por limitaciones de tiempo de procesamiento.

El contexto estratégico

Esta actualización llega en un momento donde la eficiencia se ha convertido en el campo de batalla principal entre los grandes laboratorios de IA. Tras años de carrera por modelos cada vez más grandes y potentes, la conversación ha girado hacia cómo obtener los mismos resultados con menos recursos. Google lleva meses posicionando su familia Flash como la apuesta para casos de uso donde el coste y la velocidad son críticos frente a modelos premium como Gemini Pro o Ultra.

La arquitectura agentica no es exclusiva de video. Google lleva tiempo aplicando este enfoque en otras modalidades, permitiendo que el modelo razone sobre qué información necesita realmente antes de lanzarse a procesar datos. Es parte de una filosofía más amplia: la IA eficiente no es solo la que corre más rápido, sino la que sabe pensar antes de actuar.

Para el ecosistema hispanohablante de desarrolladores y empresas, esto significa nuevas oportunidades de negocio. Sectores como la educación (análisis automático de clases grabadas), el periodismo deportivo (resúmenes de partidos completos), o la gestión documental corporativa (búsqueda inteligente en archivos de video institucionales) pueden ahora implementar soluciones que antes requerían presupuestos de infraestructura significativos.

El anuncio también refleja una tendencia que veremos consolidarse en 2025: los modelos de IA que no solo responden, sino que gestionan recursos computacionales de forma inteligente. El futuro de la multimodalidad no pasa solo por modelos que ven, oyen y leen mejor, sino por sistemas que deciden cómo mirar, escuchar y leer de la forma más eficiente posible.