Google DeepMind представила agentic video understanding — новый режим анализа видео для Gemini, который уже доступен в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Это не просто косметическое улучшение: модель теперь не прогоняет ролик статично кадр за кадром, а сама решает, какие участки видео нужно пересмотреть, с какой детализацией и по каким сигналам — кадрам, аудио или транскрипту.
Что произошло
По данным Google, новый режим даёт сразу три заметных эффекта:
- до 88% меньше потребления токенов;
- до 66% ниже стоимость анализа;
- до 7% выше точность на стандартных бенчмарках по video understanding.
Ключевая идея в том, что Gemini переходит от «статического» разбора видео к агентному. Раньше модель обычно получала видео с фиксированной частотой кадров — например, 1 FPS — и на этом строила выводы. Теперь она может динамически искать нужные моменты, приближаться к важным сегментам, повторно смотреть короткие эпизоды и выбирать, что важнее для ответа: визуальный поток, звук или текстовая расшифровка.
Google отдельно подчёркивает, что особенно сильный эффект виден на длинных видео: лекциях, записях встреч, обучающих роликах и многочасовых архивах, где раньше разработчикам приходилось выбирать между высокой ценой и потерей деталей.
Функция уже доступна через Gemini API, Google AI Studio и Gemini Enterprise Agent Platform. Для включения достаточно указать режим обработки agentic.
Почему это важно
Рынок ИИ давно умеет «понимать видео» на уровне демо, но в реальной разработке почти всегда упирался в две проблемы: дорого и слишком грубо. Если анализировать длинный ролик плотнее, растёт расход токенов. Если реже — модель пропускает важные микрособытия, быстрые смены сцен и короткие аномалии.
Agentic video understanding бьёт именно по этой боли. Вместо тупого просмотра всего подряд модель начинает вести себя как исследователь: сначала ищет, где находится нужный сигнал, а потом углубляется только туда, где это действительно нужно. Для бизнеса и разработчиков это означает более практичный сценарий использования видео‑ИИ в продакшене.
Самые важные прикладные эффекты такие:
- точный поиск моментов внутри видео, включая почти покадровые изменения;
- лучший анализ длинных записей без взрывного роста бюджета;
- более надёжный поиск аномалий в наблюдении, производстве и операционных процессах;
- подсчёт действий и объектов во времени, где обычный редкий семплинг часто ошибается.
Ещё один важный момент: Google сразу выводит функцию не только для разработчиков, но и для собственных продуктов. Компания уже заявила, что этот подход появится в Gemini app, а позже усилит Ask YouTube на странице просмотра видео. То есть речь идёт не о лабораторной фиче, а о технологии, которую Google собирается раскатывать в массовый продукт.
Что дальше
Скорее всего, в ближайшие месяцы именно агентный подход к мультимодальному анализу станет новым стандартом. После текстовых и веб‑агентов рынок закономерно переходит к агентам, которые умеют не просто «смотреть видео», а целенаправленно исследовать его под задачу.
Для Google это ещё и сильный аргумент в борьбе за разработчиков: если Gemini даёт не только качество, но и заметно лучшую экономику на видео, это может подтолкнуть команды переносить мультимодальные пайплайны именно в экосистему Gemini.
На практике теперь стоит ждать следующего шага: более глубоких сценариев, где видео‑анализ будет связан с действиями агента — от автоматической нарезки контента и мониторинга инцидентов до рабочих помощников, которые умеют извлекать смысл из многочасовых встреч, лекций и обучающих архивов без чудовищных затрат на инференс.
Источник: Google DeepMind.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно
