Модели Видео Цены Блог FAQ API Войти

Google запустила agentic video understanding в Gemini: видео‑анализ стал дешевле до 66% и точнее

Google запустила agentic video understanding в Gemini: видео‑анализ стал дешевле до 66% и точнее

Google DeepMind представила agentic video understanding — новый режим анализа видео для Gemini, который уже доступен в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Это не просто косметическое улучшение: модель теперь не прогоняет ролик статично кадр за кадром, а сама решает, какие участки видео нужно пересмотреть, с какой детализацией и по каким сигналам — кадрам, аудио или транскрипту.

Что произошло

По данным Google, новый режим даёт сразу три заметных эффекта:

Ключевая идея в том, что Gemini переходит от «статического» разбора видео к агентному. Раньше модель обычно получала видео с фиксированной частотой кадров — например, 1 FPS — и на этом строила выводы. Теперь она может динамически искать нужные моменты, приближаться к важным сегментам, повторно смотреть короткие эпизоды и выбирать, что важнее для ответа: визуальный поток, звук или текстовая расшифровка.

Google отдельно подчёркивает, что особенно сильный эффект виден на длинных видео: лекциях, записях встреч, обучающих роликах и многочасовых архивах, где раньше разработчикам приходилось выбирать между высокой ценой и потерей деталей.

Функция уже доступна через Gemini API, Google AI Studio и Gemini Enterprise Agent Platform. Для включения достаточно указать режим обработки agentic.

Почему это важно

Рынок ИИ давно умеет «понимать видео» на уровне демо, но в реальной разработке почти всегда упирался в две проблемы: дорого и слишком грубо. Если анализировать длинный ролик плотнее, растёт расход токенов. Если реже — модель пропускает важные микрособытия, быстрые смены сцен и короткие аномалии.

Agentic video understanding бьёт именно по этой боли. Вместо тупого просмотра всего подряд модель начинает вести себя как исследователь: сначала ищет, где находится нужный сигнал, а потом углубляется только туда, где это действительно нужно. Для бизнеса и разработчиков это означает более практичный сценарий использования видео‑ИИ в продакшене.

Самые важные прикладные эффекты такие:

Ещё один важный момент: Google сразу выводит функцию не только для разработчиков, но и для собственных продуктов. Компания уже заявила, что этот подход появится в Gemini app, а позже усилит Ask YouTube на странице просмотра видео. То есть речь идёт не о лабораторной фиче, а о технологии, которую Google собирается раскатывать в массовый продукт.

Что дальше

Скорее всего, в ближайшие месяцы именно агентный подход к мультимодальному анализу станет новым стандартом. После текстовых и веб‑агентов рынок закономерно переходит к агентам, которые умеют не просто «смотреть видео», а целенаправленно исследовать его под задачу.

Для Google это ещё и сильный аргумент в борьбе за разработчиков: если Gemini даёт не только качество, но и заметно лучшую экономику на видео, это может подтолкнуть команды переносить мультимодальные пайплайны именно в экосистему Gemini.

На практике теперь стоит ждать следующего шага: более глубоких сценариев, где видео‑анализ будет связан с действиями агента — от автоматической нарезки контента и мониторинга инцидентов до рабочих помощников, которые умеют извлекать смысл из многочасовых встреч, лекций и обучающих архивов без чудовищных затрат на инференс.

Источник: Google DeepMind.

Нейросети для текста, картинок, видео и музыки

Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.

Начать бесплатно
← Все статьи