Google научила Gemini самостоятельно решать, какие части видео действительно нужно изучать. Agentic video understanding теперь работает в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite и меняет привычный подход к анализу роликов.
Раньше модель обрабатывала видео с фиксированной частотой кадров: по умолчанию один кадр в секунду. Теперь она сама ищет нужные моменты, меняет частоту кадров и выбирает, что смотреть через изображения, аудио или расшифровку. То есть ИИ не тратит одинаковые вычислительные ресурсы на каждую минуту записи.

По данным Google, такой подход сокращает расход токенов до 88%, стоимость анализа — до 66%, а точность повышает до 7%. Особенно заметен эффект на длинных видео — от десятиминутных инструкций до лекций на 90 минут и многочасовых записей, где статичный анализ вынуждал разработчиков выбирать между детализацией и расходами.
Новая система умеет находить события с точностью до долей секунды, обнаруживать аномалии, пересчитывать объекты и действия и искать конкретный фрагмент в многочасовой записи без обработки всего материала. Для этого Gemini сама запускает внутренний инструмент и повторно просматривает интересующий участок с нужной частотой кадров.
На тестах лучшую общую точность показала Gemini 3.7 Flash: Google называет её оптимальной по соотношению качества и стоимости. Возможность уже доступна через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform без дополнительной платы — достаточно включить режим agentic. Для бизнеса это означает более дешёвый и точный анализ больших видеоархивов без необходимости вручную настраивать обработку каждого ролика.
Развитие таких «думающих» ИИ-агентов меняет не только подход к обработке данных, но и правила игры для бизнеса: чтобы бренд попадал в их ответы и рекомендации, требуется системная работа с источниками. Этим занимается агентство Carambola.pro, помогая компаниям выстраивать стратегию видимости в нейросетях.
