Google DeepMind представила SL2T (sign-language-to-text) — мультиязычную модель, которая переводит жестовый язык в текст. Главное в этой новости не только сам исследовательский результат, а то, что технология уже добралась до пользовательских продуктов: sign-to-text работает в Gboard и Live Transcribe на Pixel 11, сначала для ASL → English.
Это важный шаг для прикладного ИИ: речь уже не про очередной красивый демо-ролик, а про функцию, которую можно использовать в повседневных сценариях — от поиска и переписки до общения вживую через телефон.
Что произошло
Google DeepMind объявила о запуске SL2T, своей новой модели перевода жестового языка в текст. По данным компании, модель обучалась более чем на 100 000 часов данных и охватывает свыше 50 жестовых языков, хотя первый массовый релиз стартует с американского жестового языка (ASL).
Ключевая новость в том, что SL2T уже встроена в реальные продукты:
- Gboard — для ввода текста жестами вместо печати
- Live Transcribe — для ответа жестами в живом разговоре
- стартовая платформа — Pixel 11
Google отдельно подчёркивает, что система не отправляет на сервер «сырое» видео целиком. Сначала на устройстве работает модель, которая переводит движения в геометрические точки и координаты позы, и уже они используются для перевода. Это важный момент и для приватности, и для практического внедрения.
С технической стороны Google называет SL2T прорывом по двум причинам. Во-первых, жестовые языки — это не «английский руками», а полноценные языки со своей грамматикой. Во-вторых, модели нужно понимать не только движения рук, но и мимику, положение головы и корпуса, то есть фактически решать сложную задачу компьютерного зрения и перевода одновременно.
По заявлению DeepMind, SL2T показывает лучший результат на ключевых бенчмарках вроде FLEURS-ASL и умеет работать без промежуточных «глосс», которые раньше часто ограничивали качество перевода.
Источник: Google DeepMind
Почему это важно
У ИИ давно есть сильные решения для голоса, текста и изображений, но с жестовыми языками рынок заметно отставал. Поэтому здесь важна не только точность модели, но и сам факт, что технология наконец выходит из лаборатории в массовый продукт.
Что делает релиз значимым:
- Это новая прикладная категория AI-функций. До сих пор жестовый язык в потребительских продуктах был слабо представлен, а теперь появляется прямой сценарий «жесты → текст» в системных инструментах.
- ИИ становится полезнее в доступности, а не только в генерации контента. На фоне гонки моделей это редкий пример, где заметный AI-апдейт напрямую расширяет цифровую доступность.
- Google показывает, как упаковывать сложные модели в повседневный UX. Не отдельный экспериментальный сервис, а клавиатура и инструмент для общения — то есть место, где функция реально может использоваться каждый день.
- Это может стать новой точкой конкуренции между платформами. Если такой класс возможностей начнёт приживаться, похожие функции будут ждать и от других экосистем.
Для аудитории AI Chat Hub это ещё и хороший сигнал о том, куда движется рынок: ценность ИИ всё чаще измеряется не только бенчмарками, но и тем, насколько быстро модель превращается в понятную пользовательскую функцию.
Что дальше
Пока запуск ограничен Pixel 11 и направлением ASL → English, но Google уже пишет, что будет расширять список устройств и добавлять новые языки. Если качество в реальном использовании подтвердится, дальше логично ждать несколько следующих шагов:
- расширение за пределы ASL
- интеграцию в большее число Android-сценариев и сервисов Google
- развитие двусторонних инструментов общения, где ИИ помогает и понимать жесты, и формировать ответ
- движение в сторону генерации жестового языка, а не только распознавания
Иными словами, SL2T — это не просто ещё одна модель в длинном списке августовских релизов. Это один из тех AI-апдейтов, которые показывают, как большие модели начинают менять базовые интерфейсы взаимодействия с устройствами для миллионов людей.
Нейросети для текста, картинок, видео и музыки
Попробуйте AI Chat Hub бесплатно — без VPN, оплата в рублях.
Начать бесплатно