Google DeepMind представил режим agentic video understanding в Gemini API: вместо прежней статической нарезки с фиксированной частотой 1 кадр в секунду и аудио модель в агентном цикле сама решает, какие фрагменты видео посмотреть, с какой частотой кадров и в какой модальности. По данным Google, на длинных записях это сокращает расход токенов до 88%, снижает стоимость анализа до 66% и повышает точность до 7%. Режим включается одним флагом processing: "agentic", уже доступен для трёх Flash-моделей, а позже должен появиться в приложении Gemini и в Ask YouTube.

image
image

Что произошло

Google DeepMind представил в Gemini API режим agentic video understanding. Вместо прежнего статического семплирования с фиксированной частотой 1 FPS и аудио модель в агентном цикле сама решает, какие фрагменты видео посмотреть, с какой частотой кадров и в какой модальности — кадры, аудио или транскрипт — и может повторять несколько циклов анализа, запрашивая отдельные таймкоды и кадры через внутренний инструмент загрузки фрагментов файла. Режим включается флагом processing: "agentic" и уже доступен для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite в Google AI Studio и Gemini Enterprise Agent Platform без доплаты поверх стандартных тарифов на токены. Ранние партнёры — Ponder, Revyl, Mosaic и Resemble.AI — строят на этом режиме первые продукты.

Контекст

Раньше длинное видео в Gemini обрабатывалось целиком: модель получала равномерную нарезку 1 кадр в секунду плюс аудиодорожку независимо от содержания, поэтому токены уходили и на кадры без полезной информации. Новый режим переносит на видео принцип, который Google уже применял для изображений под названием agentic vision: модель сама выбирает, куда смотреть. По сути это изменение стратегии распределения вычислений на этапе инференса, а не новая архитектура или метод обучения, поэтому научная новизна здесь умеренная, а ценность прежде всего инженерная. Заявленная экономия токенов — структурное следствие отказа от равномерного семплирования: селективный доступ к нужным фрагментам снижает расход почти по построению, так что эту часть цифр Google стоит принять без скидки.

Почему это важно для индустрии

Для команд, строящих продукты на видео, меняется unit-экономика: по данным Google, экономия до 88% токенов и до 66% стоимости делает рентабельными сценарии, которые раньше не сходились по бюджету, — автоматический анализ многочасовых лекций, созвонов и архивов камер. Gemini 3.7 Flash с этим режимом заявлен на границе Парето по соотношению точности и стоимости среди протестированных моделей. Если Google встроит режим в Ask YouTube, агентное понимание видео станет дефолтным способом ответов на вопросы по видео у крупнейшего видеохостинга, конкурентам придётся отвечать собственными механизмами селективного восприятия, а дешёвый базовый слой «понять длинное видео» коммодитизируется.

Почему это важно для пользователей

Если вы работаете с Gemini API, достаточно указать флаг processing: "agentic" в конфигурации запроса: точнее и дешевле прямо сейчас, без переписывания пайплайна, а документация с примером кода уже есть в руководстве разработчика Google AI Studio. Пользователям приложения Gemini и YouTube стоит подождать ближайшие месяцы: Google обещает вынести режим в приложение для всех и встроить в Ask YouTube на странице просмотра, так что качество ответов «спроси про это видео» должно заметно вырасти — вплоть до поиска моментов с точностью до долей секунды и подсчёта действий в кадре.

Что пока неизвестно / ограничения

Ключевые цифры — экономия до 88% токенов, до 66% стоимости и прирост точности «до 7%» — заявлены самим Google и пока не прошли независимой проверки; формулировка «до» указывает на лучший случай, а названия бенчмарков, базлайны и размеры выборок не раскрыты. Метрики задержки не опубликованы, а агентный цикл с несколькими итерациями может занимать больше времени, чем одиночный проход по файлу. Сравнительный набор моделей для Парето-оценки выбран самим Google, независимого сравнения нет. Надёжнее всего выглядит экономия токенов, а заявленный прирост точности лучше проверять самостоятельно — A/B-тестом на своих записях против прежнего статического семплирования.

Источники

Автор

Look at AI, редакция