Модели Видео Цены Блог FAQ API Войти

Google DeepMind представила Gemini Omni — модель, которая делает видео из текста, картинок, аудио и клипов

Google DeepMind представила Gemini Omni — модель, которая делает видео из текста, картинок, аудио и клипов

Google DeepMind представила Gemini Omni — новое семейство моделей, где мультимодальность перестаёт быть просто распознаванием и становится инструментом генерации. Первый релиз в этой линейке называется Gemini Omni Flash. Его главная идея в том, что модель может брать текст, изображения, видео и аудио как вход и на этой основе создавать новый видеоролик, а затем редактировать его через обычный разговор.

Это уже не просто «видео по промпту». Google явно показывает следующий шаг: модель должна понимать контекст сцены, держать логику изменений между итерациями и помогать собирать ролик как рабочий процесс, а не как одноразовую генерацию.

Что произошло

Google DeepMind объявила о запуске Gemini Omni и сразу начала выкатывать первую модель семейства — Gemini Omni Flash. По официальному анонсу, она уже появляется в Gemini app, Google Flow и YouTube Shorts.

Ключевые возможности релиза:

Важно и то, куда именно Google встраивает Omni. Это не отдельная исследовательская демка в вакууме. Gemini Omni Flash идёт сразу в пользовательские и creator-сценарии: в приложение Gemini, в инструмент Flow и в экосистему YouTube Shorts. Для части аудитории Shorts и YouTube Create доступ обещан без дополнительной оплаты, а для разработчиков и enterprise-клиентов Google собирается открыть доступ через API в ближайшие недели.

Почему это важно

Главная причина проста: рынок AI-видео быстро уходит от формата «сделай один красивый ролик по промпту» к формату полноценного монтажного и креативного процесса внутри модели.

У Gemini Omni здесь сильная позиция по нескольким причинам.

Во-первых, Google делает ставку на настоящую мультимодальность на входе. Если модель действительно уверенно собирает результат из текста, картинок, видеофрагментов и голосовых референсов, это резко снижает трение для создателей контента. Не нужно начинать с пустого листа: можно взять уже снятый ролик, картинку, черновой скетч или готовую сцену и превратить это в новый видеоартефакт.

Во-вторых, важен сам подход к редактированию. Google продвигает идею, что видео теперь можно править итеративно через разговор, сохраняя персонажей, логику сцены и визуальную непрерывность. Если это будет работать стабильно, то AI начнёт конкурировать не только с генераторами, но и с частью классических инструментов монтажа и препродакшна.

В-третьих, Google связывает генерацию не только с визуальным качеством, но и с пониманием мира. В анонсе компания отдельно говорит про физику, причинно-следственные связи и использование знаний Gemini в объясняющих и сюжетных роликах. Это важный сдвиг: цениться будет не только «красиво», но и «осмысленно».

Для рынка это ещё и стратегический сигнал. OpenAI усиливает агентные рабочие сценарии, Anthropic идёт в специализированные профессиональные среды, а Google явно хочет занять важную территорию на стыке мультимодального интеллекта, creator-tools и видео-платформы. У Google здесь редкое преимущество: собственные модели, собственные приложения и сразу собственная гигантская площадка дистрибуции в лице YouTube.

Что дальше

Теперь главный вопрос не в том, впечатляет ли демо, а в том, насколько стабильно Gemini Omni поведёт себя в реальной работе.

Имеет смысл следить за несколькими вещами:

Если коротко, Gemini Omni — одна из самых сильных AI-новостей последних недель, потому что это не косметический апдейт и не ещё одна абстрактная модель. Google показывает попытку превратить мультимодальный ИИ в практичный видеодвижок для массового использования — от быстрых шортсов до более сложных креативных сценариев.

Источник: официальный анонс Google DeepMind / Google Blog о запуске Gemini Omni и Gemini Omni Flash.

Нейросети для текста, картинок, видео и музыки

Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.

Начать бесплатно
← Все статьи