Google DeepMind представила Gemini Omni — новое семейство моделей, где мультимодальность перестаёт быть просто распознаванием и становится инструментом генерации. Первый релиз в этой линейке называется Gemini Omni Flash. Его главная идея в том, что модель может брать текст, изображения, видео и аудио как вход и на этой основе создавать новый видеоролик, а затем редактировать его через обычный разговор.
Это уже не просто «видео по промпту». Google явно показывает следующий шаг: модель должна понимать контекст сцены, держать логику изменений между итерациями и помогать собирать ролик как рабочий процесс, а не как одноразовую генерацию.
Что произошло
Google DeepMind объявила о запуске Gemini Omni и сразу начала выкатывать первую модель семейства — Gemini Omni Flash. По официальному анонсу, она уже появляется в Gemini app, Google Flow и YouTube Shorts.
Ключевые возможности релиза:
- модель принимает комбинацию разных типов входа: текст, изображения, видео и аудио;
- на старте главный фокус сделан именно на генерации и редактировании видео;
- ролики можно править через диалог, шаг за шагом, без пересборки всего с нуля;
- Google отдельно подчёркивает более сильное понимание физики, движения и визуальной связности сцены;
- модель опирается не только на визуальные паттерны, но и на знания Gemini о мире, чтобы строить более осмысленные сцены и объясняющие видео;
- для пользователей доступна функция Avatars, где можно создавать видео со своим цифровым аватаром и собственной голосовой основой;
- весь сгенерированный контент получает невидимую маркировку SynthID.
Важно и то, куда именно Google встраивает Omni. Это не отдельная исследовательская демка в вакууме. Gemini Omni Flash идёт сразу в пользовательские и creator-сценарии: в приложение Gemini, в инструмент Flow и в экосистему YouTube Shorts. Для части аудитории Shorts и YouTube Create доступ обещан без дополнительной оплаты, а для разработчиков и enterprise-клиентов Google собирается открыть доступ через API в ближайшие недели.
Почему это важно
Главная причина проста: рынок AI-видео быстро уходит от формата «сделай один красивый ролик по промпту» к формату полноценного монтажного и креативного процесса внутри модели.
У Gemini Omni здесь сильная позиция по нескольким причинам.
Во-первых, Google делает ставку на настоящую мультимодальность на входе. Если модель действительно уверенно собирает результат из текста, картинок, видеофрагментов и голосовых референсов, это резко снижает трение для создателей контента. Не нужно начинать с пустого листа: можно взять уже снятый ролик, картинку, черновой скетч или готовую сцену и превратить это в новый видеоартефакт.
Во-вторых, важен сам подход к редактированию. Google продвигает идею, что видео теперь можно править итеративно через разговор, сохраняя персонажей, логику сцены и визуальную непрерывность. Если это будет работать стабильно, то AI начнёт конкурировать не только с генераторами, но и с частью классических инструментов монтажа и препродакшна.
В-третьих, Google связывает генерацию не только с визуальным качеством, но и с пониманием мира. В анонсе компания отдельно говорит про физику, причинно-следственные связи и использование знаний Gemini в объясняющих и сюжетных роликах. Это важный сдвиг: цениться будет не только «красиво», но и «осмысленно».
Для рынка это ещё и стратегический сигнал. OpenAI усиливает агентные рабочие сценарии, Anthropic идёт в специализированные профессиональные среды, а Google явно хочет занять важную территорию на стыке мультимодального интеллекта, creator-tools и видео-платформы. У Google здесь редкое преимущество: собственные модели, собственные приложения и сразу собственная гигантская площадка дистрибуции в лице YouTube.
Что дальше
Теперь главный вопрос не в том, впечатляет ли демо, а в том, насколько стабильно Gemini Omni поведёт себя в реальной работе.
Имеет смысл следить за несколькими вещами:
- насколько хорошо модель держит согласованность персонажей, объектов и сцены между правками;
- будет ли заявленное понимание физики заметно не только в рекламных примерах, но и в обычных пользовательских роликах;
- насколько быстро Google откроет API-доступ и смогут ли сторонние продукты встраивать Omni в свои пайплайны;
- усилит ли это давление на конкурентов в сегменте AI-видео, где борьба уже идёт не только за качество генерации, но и за удобство полного цикла создания ролика.
Если коротко, Gemini Omni — одна из самых сильных AI-новостей последних недель, потому что это не косметический апдейт и не ещё одна абстрактная модель. Google показывает попытку превратить мультимодальный ИИ в практичный видеодвижок для массового использования — от быстрых шортсов до более сложных креативных сценариев.
Источник: официальный анонс Google DeepMind / Google Blog о запуске Gemini Omni и Gemini Omni Flash.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно
