Google выпустила Gemini 3.5 Transcribe — новую модель для распознавания речи и преобразования аудио в текст. Это не просто очередной voice feature, а отдельный релиз под разработчиков и продукты, где важны точность, низкая задержка и работа с живой разговорной речью.
Что произошло
По официальному анонсу Google, Gemini 3.5 Transcribe доступна в двух режимах:
- потоковая расшифровка в реальном времени через Live API для голосовых приложений и агентов;
- обработка заранее записанного аудио через отдельный API для встреч, звонков, интервью и аналитики.
Google делает ставку не только на базовое распознавание слов, но и на более «умную» транскрибацию. Модель умеет:
- убирать слова-паразиты и самокоррекции из сырой речи;
- автоматически приводить текст к более аккуратному и читаемому виду;
- учитывать кастомный словарь и специализированные термины;
- поддерживать более 85 языков;
- работать с идентификацией говорящих в записанном аудио;
- использоваться в сценариях, где голос запускает дальнейшие действия через function calling.
Google отдельно приводит метрики из анонса: средний Word Error Rate заявлен на уровне 4,0% для streaming-сценариев и 2,6% для non-streaming. Компания также говорит о заметном улучшении по задержке и качеству по сравнению с прошлой моделью Chirp 3.
Новый релиз уже встраивается не только в API, но и в собственные продукты Google: Gemini app на macOS, Android-функции вроде Rambler, а в будущем — и в Chrome для голосового ввода в веб-поля.
Почему это важно
Рынок ИИ давно вышел за рамки текстовых чат-ботов: следующий большой слой интерфейсов — это голос. Но у speech-to-text до сих пор была хроническая проблема: модель могла распознать слова, но плохо справлялась с шумом, разговорной речью, сбивками, именами, артикулами и отраслевым жаргоном.
Gemini 3.5 Transcribe интересна тем, что Google подаёт её не как «диктовку», а как более интеллектуальный речевой слой для приложений. Это особенно важно для нескольких сегментов сразу:
- AI-агенты и voice assistants — когда важна почти мгновенная реакция на речь пользователя;
- колл-центры и post-call analytics — где нужны точные расшифровки, таймкоды и разделение спикеров;
- субтитры и live-captioning — где качество текста влияет на реальный UX;
- рабочие инструменты — заметки, встречи, редактирование текста голосом, управление действиями внутри приложений.
По сути, Google усиливает своё предложение в одной из самых прикладных AI-категорий. Если заявленные цифры по качеству и задержке подтверждаются в реальных продуктах, Gemini 3.5 Transcribe может стать для разработчиков одним из самых удобных способов собрать голосовой интерфейс без отдельного сложного speech-стека.
Что дальше
В ближайшее время главное будет не в красивом анонсе, а в том, насколько быстро модель закрепится в реальных сценариях. Тут есть три маркера, за которыми стоит следить:
- Скорость внедрения в экосистему Google. Если голосовой ввод и голосовые команды на базе 3.5 Transcribe действительно широко развернутся в Chrome, Android и Gemini app, это усилит позиции Google в everyday AI.
- Реакция разработчиков. Для рынка важно, насколько удобно и дёшево использовать модель в продакшене по сравнению с альтернативами от OpenAI, ElevenLabs, AssemblyAI и других игроков.
- Качество в сложных условиях. Шумные звонки, многоголосие, акценты, смешение языков и отраслевой жаргон — именно там станет понятно, насколько анонс соответствует практике.
Если Google удержит качество, низкую задержку и хорошую интеграцию с Gemini API, этот релиз может стать заметным шагом к тому, чтобы голосовые AI-интерфейсы перестали быть нишевой функцией и стали обычной частью рабочих и пользовательских продуктов.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно