Inteligencia artificial··2 min de lectura

Google hace que Gemini analice video solo donde importa, ahorrando un 88% en tokens

El modelo deja de leer frame a frame a velocidad fija. Ahora decide qué partes ver y a qué ritmo, bajando costes drásticamente sin perder precisión.

Google ha cambiado la forma en que Gemini procesa videos. Hasta ahora, el modelo analizaba el contenido de forma estática, extrayendo un frame por segundo por defecto. Era un enfoque predecible pero ineficiente: si pasaba algo rápido en medio de un segundo, el modelo lo perdía. Si querías más detalle, tenías que subir la tasa de muestreo manualmente, lo que disparaba el consumo de tokens y el coste. La nueva implementación usa agentes. En lugar de escanear todo el archivo linealmente, el modelo ahora decide por sí mismo qué segmentos son relevantes. Determina qué partes ver, a qué velocidad y mediante qué modalidad (video, audio o transcripción). Solo extrae la información necesaria para la tarea específica. Google aplica esto a Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. El sistema puede detectar cambios de estado o cortes inferiores a un segundo que antes se escapaban. Esto mejora la edición automática y permite rastrear escenas específicas en horas de grabación sin gastar millones de tokens. El modelo aumenta la tasa de fotogramas solo en las ventanas de tiempo sospechosas donde detecta anomalías. También cuenta movimientos repetidos y objetos individuales con mayor exactitud. Los datos de Google son contundentes. En los benchmarks 1H-VideoQA y LVBench, el uso de tokens cae un 88%. Curiosamente, la precisión sube ligeramente. Es decir, gastas mucho menos y obtienes respuestas mejoradas. Hasta ahora, los desarrolladores podían construir este enfoque selectivo manualmente, pero siempre requería código adicional. Ahora, el modelo maneja el bucle de "pensar-actuar-observar" internamente. Se basa en "agentic vision", una capacidad que Google lanzó para Gemini 3 Flash en enero. Aquel sistema permitía al modelo ejecutar código Python para recortar o anotar imágenes. No funcionaba perfectamente al inicio, pero sentó las bases. La eficiencia brilla con videos largos. Tutoriales de 10 minutos, clases de 90 o grabaciones de varias horas. Con el procesamiento estático, había que elegir entre costes altos o perder detalles. Con agentes, Gemini 3.7 Flash lidera en calidad general y equilibrio coste-precisión según LongVideoBench. La función ya está activa en la API de Gemini en Google AI Studio y en la plataforma empresarial. No hay cargo extra. Los desarrolladores solo deben configurar el modo de procesamiento como "agentic" en la configuración. Google también trae estos cambios a sus propios productos. Próximamente llegue a todos los usuarios de la app de Gemini en dispositivos Flash y Flash Lite. Además, potenciará "Ask YouTube" en las páginas de reproducción. Las respuestas se vincularán más estrechamente con lo que realmente se ve en el video. Es un paso lógico. La industria de la IA generativa busca desesperadamente reducir la latencia y el coste de entrada de contexto. Analizar video completo es caro. Permitir que el modelo ignore el ruido y se centre en la señal es una optimización natural. Queda por ver cómo escala esto en entornos reales con videos de baja calidad o ruido visual extremo. Pero en laboratorio, los números hablan claro.

##Relacionado