🤖 Google научил Gemini понимать видео по-агентски

Модель сама решает, какие фрагменты видео посмотреть и в какой модальности — кадры, аудио или транскрипт, — и может повторять анализ. По данным Google, расход токенов падает до 88%, стоимость — до 66%, точность растёт до 7%, особенно на длинных видео.

🌍 Вместо «прогнать всё видео целиком» модель ищет нужные моменты сама, как ранее для изображений. Анализ многочасовых записей — лекций, созвонов, архивов камер — дешевеет, а режим обещают встроить в «Ask YouTube».

👤 Разработчикам достаточно флага processing: "agentic" в Gemini API — режим уже работает для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite в Google AI Studio. В приложении Gemini и на YouTube — в ближайшие месяцы.

Источник 1: https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/ Источник 2: https://aistudio.google.com/learn/agentic-video-understanding-with-gemini