Google представил новую разработку — модель перевода жестового языка, которая дает людям возможность искать информацию в интернете с помощью жестов, а не традиционного ввода текста.

В основе этой технологии лежит колоссальный объем данных — свыше 100 000 часов видеозаписей, охватывающих более 50 различных жестовых языков. Система, известная как sign-language-to-text (SL2T), совершает переход из лабораторных исследований в реальные потребительские устройства. Первым шагом станет поддержка американского жестового языка (ASL) на смартфоне Pixel 11.

Ирина Петрова

Модель SL2T от Google переводит жесты на языке жестов в текст на смартфоне. Google DeepMind

Что дает новая технология

По сообщению компании, эта технология открывает новые возможности в приложениях Gboard и Live Transcribe. Пользователи смогут отказаться от клавиатуры и выполнять поисковые запросы, составлять сообщения и документы или общаться с ассистентом Google Gemini, используя исключительно жесты. В Live Transcribe также появится опция отвечать на вопросы во время живого диалога с помощью жестикуляции.

Стоит отметить принципиальное отличие перевода жестового языка от обычной транскрипции речи. Нельзя просто сопоставить последовательность звуков со словами, поскольку жестовые языки являются полноценными самостоятельными языковыми системами со своей уникальной грамматикой и словарным запасом. Смысловая нагрузка здесь передается комплексно — через движения рук, выражение лица, наклоны головы, положение корпуса. Вся эта информация может транслироваться одновременно.

Таким образом, задача перевода жестового языка распадается на две взаимосвязанные проблемы: собственно языковой перевод и компьютерное зрение. Разработанная Google система SL2T решает обе задачи — она сначала преобразует движения человека в структурированное представление, а затем уже занимается переводом этого представления в текстовую форму.

Вместо видео – ориентиры на теле

Ключевой особенностью системы является отказ от обработки сырого видеопотока. Вместо этого применяется модель MediaPipe Holistic, которая выделяет ключевые ориентиры тела человека. Эти ориентиры представляют собой геометрические координаты, описывающие движения рук, лицевую мимику и перемещения корпуса.

Именно эти координаты отправляются в систему перевода, а исходное видео может быть немедленно удалено. Такой подход существенно снижает объем конфиденциальной визуальной информации, покидающей устройство, при этом модель получает все необходимые данные о жестикуляции человека.

Далее SL2T напрямую преобразует последовательность ориентиров в текст. Примечательно, что система не использует промежуточные «глоссы» — упрощенные символьные обозначения отдельных жестов, которые часто применяются в академических исследованиях жестовых языков. Как поясняют разработчики, это решение позволяет модели точнее улавливать пространственные взаимоотношения и невербальные нюансы, которые теряются при использовании упрощенных промежуточных представлений.

Обучение модели происходило на огромном массиве данных — более 100 000 часов записей, охватывающих свыше 50 языков. Примечательно, что около четверти всего объема приходится на американский жестовый язык. Представители Google подчеркивают, что использование разнообразных данных — разных языков, диалектов и уровня владения — помогло модели выявить универсальные структуры, характерные для жестовых языков в целом.

По результатам тестирования на эталоне FLEURS-ASL, модель достигла показателя 70 баллов по шкале BLEURT, что, по заявлению компании, значительно превосходит ранее опубликованные результаты в этой области. Кроме того, разработчики провели испытания на устойчивость модели к различным практическим сложностям, возникающим в реальных повседневных условиях использования.

Еще одно принципиальное преимущество системы, которое не лежит на поверхности, связано с адаптивностью к невербальным нюансам. Отказ от промежуточных «глоссов» позволяет модели улавливать тонкие различия в интенсивности жеста, длительности паузы и скорости движения, которые в жестовых языках играют ту же роль, что интонация в устной речи.

Например, гнев или сарказм могут передаваться не столько самим жестом, сколько резкостью его исполнения. Система, обученная на более чем 100 000 часах видео, учится интерпретировать эти изменения, что приближает перевод к полноценному семантическому анализу, а не простому перекодированию символов. Это значит, что пользователи получат менее «роботизированный» и более естественный результат, который учитывает контекст и эмоциональную окраску диалога.

Обеспечение работы перевода в режиме онлайн

Архитектура системы изначально спроектирована для потоковой обработки, а не для работы с записанными видео. В процессе разработки особый упор делался на минимизацию задержек, предотвращение ложных срабатываний в моменты, когда человек не жестикулирует, а также на обеспечение корректной работы при жестах одной рукой. Последний аспект особенно важен для смартфонов, поскольку пользователь часто вынужден держать устройство одной рукой, оставляя свободной только вторую для жестикуляции.

С практической точки зрения, инженерам пришлось решить сложную задачу минимизации задержек в потоковой обработке. Для комфортного общения в режиме реального времени, особенно в Live Transcribe, задержка между жестом и появлением текста не должна превышать доли секунды. Это потребовало оптимизации вычислительной модели до такой степени, чтобы она могла работать непосредственно на нейронных процессорах смартфона Pixel 11, без обращения к облачным вычислительным кластерам.

Такой подход не только ускоряет реакцию системы, но и позволяет использовать функцию офлайн, что критически важно для пользователей в зонах с нестабильным интернетом или в ситуациях, где передача данных запрещена. Вместе с тем, офлайн-работа накладывает ограничения на словарный запас, который будет доступен системе без подключения к сети, что может потребовать гибридного подхода в будущем.

В процессе создания технологии Google активно привлекала глухих пользователей и профильные организации. Они участвовали в тестировании, сборе данных и оценке результатов. Компания особо подчеркивает, что система разрабатывалась при непосредственном участии экспертов из числа глухих людей и консультативного комитета, представляющего интересы сообщества глухих.

На первом этапе запуска будет доступен перевод с американского жестового языка на английский в приложениях Gboard и Live Transcribe на устройстве Pixel 11. В планах компании — расширение поддержки на другие устройства и добавление новых жестовых языков в будущем.

Перспектива технологии

Подобный шаг имеет все шансы изменить сам подход к взаимодействию человека с цифровой средой, но одновременно он поднимает и ряд непростых вопросов, касающихся доступности и приватности.

Для сообщества глухих появление SL2T на массовых устройствах — это не просто новая функция, а инструмент, способный сократить разрыв между жестовой культурой и миром, где доминирует текст. Однако важно понимать, что модель пока ориентирована на односторонний перевод: от жеста к слову.

Обратная задача, когда ИИ генерирует жестовый ответ для пользователя, остается на уровне экспериментальных разработок, что делает текущую коммуникацию асимметричной. Тем не менее, сама возможность мгновенного перевода сложных грамматических конструкций ASL в письменный английский открывает глухим пользователям доступ к полной функциональности смартфона, включая навигацию, заказ услуг и участие в переписке без необходимости переключаться на печать.

Критически важным аспектом, который выделяют разработчики, является архитектура обработки данных. Использование модели MediaPipe Holistic для извлечения антропометрических ориентиров — это не просто технический компромисс, а продуманное решение в области конфиденциальности.

Вместо передачи непрерывного видеопотока на серверы, устройство преобразует движения в набор геометрических координат, которые не позволяют восстановить изображение или идентифицировать человека.

Для пользователей, которые обеспокоены тем, что камера их смартфона может следить за ними, это снижает уровень потенциального слежения. Тем не менее, сами координаты, особенно описывающие мимику и положение корпуса, являются крайне чувствительными биометрическими маркерами, и то, как Google будет защищать эти данные на уровне облачной обработки, останется предметом пристального внимания регуляторов.

И все же не исключено, что в долгосрочной перспективе работа выйдет за рамки простого перевода. Google уже упоминает о перспективных направлениях, включая генерацию жестового языка и другие смежные области исследований.

Долгосрочные планы Google по генерации жестового языка открывают еще более амбициозную перспективу полного двустороннего общения.

Если SL2T сегодня позволяет глухому человеку обращаться к миру через текст, то обратная модель превратит смартфон в «говорящие руки» для слышащего пользователя, который не владеет жестовой речью. Это автоматически устранит необходимость в услугах профессиональных переводчиков для базового общения, что может иметь как позитивный эффект (снижение барьеров), так и вызвать беспокойство в сообществе переводчиков жестового языка.

Однако до реализации этой симметрии потребуется решить еще множество задач, включая синтез естественных движений рук, мимики и артикуляции. Тем не менее, уже сейчас очевидно, что SL2T закладывает фундамент не просто для перевода, а для совершенно новой парадигмы человеко-машинного взаимодействия, где язык тела станет полноценным интерфейсом наряду с голосом и прикосновением.

Мы используем cookie-файлы для наилучшего представления нашего сайта. Продолжая использовать этот сайт, вы соглашаетесь с использованием cookies в соответствии с Политикой конфиденциальности.
Принять