Google DeepMind представила Gemini Omni 1.1 Flash — заметное обновление своей видеогенеративной линейки. Если коротко, Google делает ставку не просто на «ещё одну модель для роликов», а на более управляемую генерацию видео, с которой разработчикам и продуктовым командам проще строить реальные сценарии, а не только красивые демо.
Главное в релизе — модель стала заметно ближе к рабочему продакшену: можно продлевать сцены, задавать первый и последний кадр, делать быстрые черновые рендеры в 360p и затем апскейлить результат до 1080p или 4K.
Что произошло
Google объявила, что Gemini Omni 1.1 Flash доступна через Gemini API и Google AI Studio как production-ready-инструмент для генеративного видео.
В релиз вошло сразу несколько важных возможностей:
- Продление сцены: модель теперь анализирует до 10 секунд предыдущего контекста, а не только последний фрагмент. Это должно заметно улучшить визуальную связность и удержание логики сцены. Продлевать ролик можно шагами по 10 секунд, суммарно — до 40 секунд.
- Интерполяция между первым и последним кадром: разработчик может задать стартовую и конечную точку, а модель построит непрерывный видеопереход между ними. Это полезно для пролётов камеры, зумов, циклических сцен и сложных переходов.
- Быстрые черновики в 360p: Google заявляет, что такой режим может быть до 60% быстрее и примерно втрое дешевле, чем стандартная генерация в 720p. Для продуктовой работы это важно: сначала можно быстро перебирать идеи, а потом рендерить финальную версию.
- Апскейл до 1080p и 4K: то есть модель нацелена не только на прототипирование, но и на более качественный выходной материал.
- Видео как референс: можно использовать до 3 секунд видеореференса во входных данных, чтобы лучше удерживать визуальный контекст и консистентность персонажей.
Отдельно Google подчёркивает, что Omni 1.1 выходит не только для разработчиков. Модель также приходит в Google Flow, а функция продления сцен — в приложение Gemini для подписчиков платных тарифов.
Почему это важно
Рынок генерации видео уже давно упёрся не только в качество картинки, но и в управляемость. Красивый ролик по одному промпту — это хорошо для вау-эффекта, но для реального продукта нужны другие вещи: возможность быстро делать черновики, удерживать стиль между сценами, задавать траекторию перехода и доводить результат до приемлемого качества без бесконечной ручной сборки.
Именно сюда и бьёт релиз Google.
Во-первых, 10 секунд контекста для продления сцены — это важный шаг. У генеративного видео одна из главных проблем в том, что при продолжении ролика модель часто теряет логику происходящего, ломает движение камеры или «забывает» детали сцены. Более длинное окно контекста не гарантирует идеального результата, но сильно повышает шанс на связный ролик.
Во-вторых, режим дешёвого и быстрого 360p-прототипирования делает продукт намного практичнее. Командам не нужно тратить дорогой рендер на каждую гипотезу: можно быстро прогонять версии, а финальный вариант выводить уже в высоком разрешении.
В-третьих, Google делает ставку на связку API + студия + потребительский продукт. Это сильный ход: один и тот же стек начинает работать одновременно для разработчиков, креативных инструментов и конечных пользователей. Обычно именно такие релизы двигают рынок быстрее всего, потому что технология не остаётся в лаборатории.
Наконец, это ещё один сигнал, что борьба в AI-видео идёт уже не за «умение генерировать», а за контроль, скорость итераций и пригодность для внедрения. В этом смысле Gemini Omni 1.1 Flash выглядит не как декоративный апдейт, а как попытка превратить видеогенерацию в нормальный строительный блок для приложений.
Что дальше
Дальше будет интересно смотреть не только на демо Google, но и на то, какие реальные продукты вырастут вокруг Omni 1.1 Flash.
Самые очевидные сценарии:
- AI-инструменты для монтажа и сторибординга;
- генерация рекламных и social-first роликов с быстрым циклом правок;
- креативные редакторы, где сначала создаётся грубая версия сцены, а затем она доводится до 4K;
- агентные или мультимодальные пайплайны, где ИИ не просто рисует видео, а собирает полноценные визуальные истории из текста, изображений и референсных клипов.
Для Google это ещё и стратегический шаг: компания показывает, что хочет быть заметным игроком не только в языковых моделях и агентах, но и в инфраструктуре для профессионального AI-видео.
Если заявленные преимущества подтвердятся в реальных продуктах, то рынок может довольно быстро сдвинуться от коротких эффектных роликов к более длинным, управляемым и коммерчески полезным видео-сценариям.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно