Google выпустила Gemini Omni 1.1 Flash — продакшен-обновление видеомодели Gemini Omni, доступное через Gemini API в Google AI Studio, Gemini Enterprise Agent Platform, Flow и приложении Gemini. Модель продлевает сцену до 40 секунд с шагом в 10 секунд, опираясь на 10 секунд предыдущего контекста, генерирует видео между заданными первым и последним кадрами и принимает до 3 секунд видео-референса. Черновики рендерятся в 360p на 60% быстрее и втрое дешевле, чем 720p, а финал апскейлится до 1080p и 4K. Adobe Firefly, Runway и Figma Weave уже встроили модель в свои инструменты.

image

Что произошло

Обновление выведено сразу в продакшен, а не показано как исследовательское демо: модель подключается через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform, а также доступна в Flow и приложении Gemini. Ключевое техническое изменение касается продления сцены: раньше модель учитывала только последнюю секунду предыдущего фрагмента, теперь она анализирует до 10 секунд контекста, что позволяет наращивать сцену шагами по 10 секунд вплоть до 40 секунд. Появилась генерация видео между заданными первым и последним кадрами, а на вход можно подавать до 3 секунд видео-референса. Рендеринг построен по двухступенчатой схеме: сначала быстрый черновик в 360p, который на 60% быстрее и втрое дешевле, чем 720p, затем апскейл финального ролика до 1080p и 4K. В анонсе Google также сообщает о первом месте модели на Video Arena и о том, что Adobe Firefly, Runway и Figma Weave уже интегрировали её в свои продукты.

Контекст

Фон, на котором стоит читать этот релиз, — смена парадигмы в видеогенерации. Ещё недавно типовым сценарием была одноразовая генерация клипа по промпту, где результат во многом зависел от удачи, а связность длинных сцен была слабым местом. Расширение окна контекста с одной до десяти секунд — это архитектурное условие для непрерывного повествования: без памяти о предыдущем фрагменте длинная сцена распадается на несвязанные куски. Интерполяция между первым и последним кадром и видео-референс — это фичи контроля сцены, а не декларативный прирост качества: индустрия движется от «лотереи промптов» к управляемому конвейеру, где дешёвый черновой прогон отделяется от дорогого финала. Такой двухэтапный подход методологически повторяет то, как давно устроена итеративная генерация изображений, где варианты перебирают в низком разрешении, а апскейл делают в конце. О зрелости модели при этом говорит не только слово вендора: сторонние компании встроили её в рабочие инструменты для монтажа и дизайна, что для оценки production-готовности — аргумент сильнее, чем позиция в вендорском рейтинге.

Почему это важно для индустрии

Для индустрии релиз означает перевод видеогенерации из категории демо в категорию рабочего инструмента. Продление сцен на основе 10-секундного контекста и интерполяция между кадрами впервые делают выполнимыми многошотовые сцены с непрерывной камерой без склеек — это прямой вызов моделям класса Veo и Sora в профессиональном видеопродакшене. Меняется экономика итераций: дешёвый черновой режим снижает цену перебора вариантов, поэтому в продуктовых стеках ожидаемо закрепится паттерн «дешёвый черновик → дорогой финал», а отбор идей сместится на ранний этап конвейера. Для стартапов, чья ценность сводится к «один клип по промпту», возникает ценовое давление: тот же примитив Google делает общедоступным через API, Flow и приложение. Если заявленные характеристики воспроизводятся, контроль сцены — продление, интерполяция кадров, референсы — рискует стать гигиеническим минимумом, и конкурентам придётся отвечать либо сопоставимыми функциями, либо публичными методологиями сравнения. Ожидаемая волна — keyframe-first интерфейсы, сториборд-инструменты и агентные пайплайны «сценарий → черновик → апскейл», где дифференциация уходит в оркестрацию и вертикальные шаблоны.

Почему это важно для пользователей

Практическая выгода для читателя в том, что эксперименты ничего не стоят на старте: в Google AI Studio черновики в 360p доступны бесплатно, поэтому перебирать варианты сцены можно без бюджета на рендер, а финализация до 1080p и 4K доступна подписчикам Google AI Plus, Pro и Ultra в приложении Gemini и в Flow. Монтажные навыки не обязательны: сцену можно собрать из ключевых кадров, задав первый и последний кадр, продлить её шагами по 10 секунд вплоть до 40 секунд и передать модели до 3 секунд видео-референса для задания стиля или движения. Реалистичные первые сценарии — предпросмотр концептов, короткие сцены до 40 секунд, подбор раскадровки и быстрые итерации по референсу до заказа финального рендера.

Что пока неизвестно / ограничения

Все ключевые факты материала исходят из вендорского анонса: технического отчёта, методологии и независимых оценок качества в источнике нет, поэтому внутренний механизм 10-секундного контекста — кондиционирование, токенизация видео, память — остаётся нераскрытым. В объявлении нет абсолютных цен и данных о латентности. Первое место на Video Arena известно только из поста Google; интеграции Adobe Firefly, Runway и Figma Weave — более весомый независимый сигнал зрелости, но и они не заменяют замеров. Количественные заявления о скорости и цене черновиков фальсифицируемы — доступ через Gemini API позволяет воспроизвести измерения за дни, — однако пока это слова вендора. Выводы о коммодитизации сырой генерации и становлении нового отраслевого стандарта — интерпретации поверх одного анонса, и их стоит проверять по независимым тестам.

Источники

Автор

Look at AI, редакция