Gemini entiende vídeos con "agencia": menos tokens y más precisión
Google DeepMind lanza la comprensión de vídeo agéntica en Gemini, que reduce el coste hasta un 66% y los tokens hasta un 88%.

Google DeepMind ha presentado una nueva capacidad de análisis de vídeo para sus modelos Gemini que, según la compañía, reduce el consumo de tokens hasta un 88% y el coste hasta un 66%, al tiempo que mejora la precisión hasta un 7%. La función, bautizada como "agentic video understanding", ya está disponible para los modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite a través de la API de Gemini en Google AI Studio y la plataforma Gemini Enterprise Agent.
La idea de fondo es que, en lugar de procesar el vídeo de forma estática a una tasa fija de fotogramas por segundo (por defecto, 1 FPS), el modelo decide dinámicamente qué partes del vídeo mirar, a qué velocidad y a través de qué modalidad (fotogramas, audio o transcripción). Así, solo consume los tokens necesarios para responder a la pregunta concreta, en lugar de procesar todo el vídeo completo.
Cómo funciona
El modelo entra en un bucle agéntico: invoca una herramienta interna para cargar el fragmento relevante del vídeo, lo inspecciona y repite hasta tener suficiente información. Esto no solo reduce costes, sino que permite tareas que antes eran difíciles con el procesamiento estático, como encontrar un momento concreto de menos de un segundo en un vídeo de varias horas, detectar anomalías re-muestreando a mayor FPS o contar acciones y objetos con precisión.
Google DeepMind destaca que los desarrolladores podían hacer esto manualmente, pero ahora la API lo gestiona sola, reduciendo la carga de desarrollo.
Resultados y casos de uso
La mejora es más notable en vídeos largos: desde tutoriales de 10 minutos hasta conferencias de 90 minutos o grabaciones de varias horas. En esos casos, el procesamiento estático obliga a elegir entre un coste alto de tokens o perder detalles. Con la función agéntica, Gemini 3.7 Flash se sitúa en la frontera de Pareto entre precisión y coste, según la compañía.
Los casos de uso que mencionan incluyen edición de vídeo automatizada, búsqueda de aguja en un pajar en vídeos largos, detección de anomalías en tiempo real y seguimiento de movimientos repetitivos.
Disponibilidad
La función está disponible hoy para subidas de vídeo y vídeos de YouTube a través de la API. Para activarla, basta con poner "processing" a "agentic" en la configuración. No tiene coste adicional: usa el precio estándar de tokens de la API.
Además, Google dice que llevará estas mejoras a sus productos: la función llegará pronto a la app de Gemini para todos los usuarios, y en los próximos meses también alimentará la función "Ask YouTube" en la página de visualización de vídeos.
Lo que queda por ver es si las cifras de mejora se mantienen en entornos reales y cómo afecta a la experiencia de usuario en productos como YouTube, donde la demanda de procesamiento de vídeo es masiva.
##Relacionado

Google lanza Gemini 3.7 Flash, Pixel 11 y supera los 1.000 millones de usuarios
Google repasa sus anuncios de IA de agosto: nuevos modelos, móviles Pixel 11, transcripción mejorada y el hito de la app Gemini.

Alexa avisa cuando algo nuevo te tiente a comprar
Amazon lanza 'Update Me With' en Alexa para avisar de novedades que inviten a comprar, como nuevos productos o eventos.
Dyson lanza un cepillo de dientes con cámara que usa IA para limpiar entre los dientes
El CameraJet de Dyson, a 499 dólares, detecta huecos entre los dientes con una cámara y dispara chorros de enjuague bucal automáticamente.