Глубокие нейронные сети для автоматического распознавания речи и жестов во взаимодействии человека и машины

Введение в глубокие нейронные сети при взаимодействии человека и машины

Глубокие нейронные сети (DNN) представляют собой класс архитектур машинного обучения, свободно смоделированных на нейронных структурах биологического мозга. С момента возрождения глубокого обучения в начале 2010-х годов DNNs привели к трансформационным достижениям в человеко-машинном взаимодействии (HMI). Благодаря тому, что системы могут изучать иерархические представления непосредственно из необработанных данных, DNN позволили машинам интерпретировать разговорный язык и физические жесты с беспрецедентной точностью. Эти возможности являются не просто постепенными улучшениями; они являются основой для интерфейсов следующего поколения, которые чувствуют себя интуитивно понятными, отзывчивыми и естественными для пользователей.

Основное преимущество DNN в HMI заключается в их способности моделировать сложные, нелинейные отношения в высокоразмерных сенсорных потоках. Аудиоволновые формы, видеокадры и данные датчика глубины содержат сложные временные и пространственные паттерны, которые традиционные функции ручной работы изо всех сил пытались захватить. С глубокими архитектурами, содержащими десятки или даже сотни слоев, современные DNN могут автоматически изучать надежные представления, которые обобщают между динамиками, средами и вариациями пользователей. В этой статье исследуются два столпа HMI & mdash на основе DNN; автоматизированное распознавание речи и распознавание жестов; и исследуется, как эти технологии сходятся для создания действительно мультимодальных систем взаимодействия.

Автоматическое распознавание речи (ASR)

Системы ASR преобразуют акустические речевые сигналы в текст. Появление глубокого обучения значительно улучшило производительность ASR, понизив частоту ошибок слов до уровней паритета человека в конкретных областях. Сегодня коммерческие двигатели ASR используют ряд архитектур DNN для обработки шумных сред, различных акцентов и ограничений обработки в реальном времени.

Глубокие архитектуры для акустического моделирования

Ранние глубокие нейронные сети на основе ASR системы заменили модели гауссовской смеси с передовыми DNN для акустического моделирования. Эти сети принимают кадры аудио особенностей (таких как мел-частотные цепстральные коэффициенты) в качестве вероятностей ввода и вывода по контекстно-зависимым фонемным состояниям. Введение сверточные нейронные сети (CNN) дальнейшее улучшение извлечения признаков путем изучения сдвиг-инвариантных локальных паттернов в спектральной области. Нейронные сети с задержкой времени, которые захватывают временный контекст через фиксированные рецептивные поля, также оказались эффективными.

Рекуррентные нейронные сети (RNN), особенно блоки с длинной кратковременной памятью (LSTM) и закрытые рекуррентные блоки (GRU), стали рабочей лошадкой ASR, поскольку они могут моделировать последовательные зависимости переменной длины. Двунаправленные RNN обрабатывают ввод как вперед, так и назад, давая системе доступ к будущему контексту. Однако обучение RNN является вычислительно дорогостоящим и страдает от исчезающих градиентов в очень длинных последовательностях.

Архитектура Transformer, первоначально разработанная для машинного перевода, в значительной степени заменила RNN в современном ASR. Трансформаторы полагаются на механизмы самоанализа, которые взвешивают важность каждого шага против каждого другого шага времени, позволяя параллельную обработку и превосходное моделирование зависимости на большие расстояния. Модели, такие как Wav2Vec 2.0, HuBERT и Whisper от OpenAI, используют кодеры Transformer, обученные с самоконтролируемым обучением на массивных немаркированных аудиоданных, достигая замечательной производительности с нулевым и небольшим количеством снимков на десятках языков.

Конечные трубопроводы ASR

Традиционные системы АСР включали отдельные модели акустических, языковых и произношений, обученные независимо друг от друга. Сквозные подходы сводят эти компоненты в единую нейронную сеть, обученную непосредственно на парах аудио-текст. Существуют три преобладающие сквозные архитектуры:

  • Коннекционистская временная классификация (CTC): Вводит пустую метки, чтобы позволить модели выводить последовательности произвольной длины. CTC используется в DeepSpeech и многих встроенных системах ASR.
  • RNN Transducer (RNN-T) : Расширяет CTC с помощью сети прогнозирования, которая моделирует зависимости от меток, позволяя потоковую передачу ASR без необходимости полного высказывания. Помощник Google &rsquo и многие двигатели ASR на устройстве используют RNN-T.
  • Кодер-декодер на основе внимания (Listen, Attend, and Spell): использует механизм внимания для выравнивания состояний аудиокодера с выходными символами. Эта архитектура превосходит транскрипцию в длинных формах, но сложнее развертывать в настройках с низкой задержкой.

Практические приложения и системы бенчмарков

Современный ASR повсеместен. Amazon’s Alexa, Apple&rsquo’s Siri, Google Assistant и Microsoft&rsquo’s Cortana все полагаются на глубокий нейронный ASR. Помимо виртуальных помощников, ASR обеспечивает автоматическую подпись на YouTube, транскрипцию в реальном времени в здравоохранении, голосовую навигацию в автомобилях и программное обеспечение для диктовки для доступности. В 2023 году тест-контроль LibriSpeech сообщил о частоте ошибок слов ниже 2% с использованием моделей трансформатора ансамбля, в то время как более сложный набор данных CHiME-6 на дальних званых вечеринках по-прежнему видит ставки выше 30%, подчеркивая разрыв, остающийся для шумной и перекрывающей речи.

Основные вызовы в ASR

Для всестороннего обзора современных методов ASR читатели могут ознакомиться с опросом Nassif et al. в IEEE Access (]DOI: 10.1109/ACCESS.2019.2942026].

Технологии распознавания жестов

Распознавание жестов позволяет машинам интерпретировать движения тела человека, движения рук, кивки головы или позы всего тела как команды или входные данные. Глубокие нейронные сети позволили надежно классифицировать жесты в реальном времени с помощью камер, датчиков глубины и носимых устройств, открывая парадигмы управления без касания.

Распознавание визуального жеста с помощью CNN и 3D-CNN

Наиболее распространенный подход использует сверточную нейронную сеть (CNN) для классификации статических жестов рук из единичных RGB-изображений. Системы, такие как среда MediaPipe от Google, используют легкие CNN на основе MobileNetV3 для обнаружения ориентиров в реальном времени и классификации жестов на мобильных устройствах. Для динамических жестов (например, свайпов, щипцов или махания) одного кадра недостаточно. 3D CNNs расширяют операцию свертки во временное измерение, обрабатывая короткие видеоклипы для захвата шаблонов движения. Однако 3D CNNs являются вычислительно тяжелыми и требуют больших аннотированных видеоданных.

Многие современные системы принимают двухступенчатый конвейер: сначала 2D или 3D-оценщик поз извлекает координаты ключевых точек (например, суставы рук, скелет тела), затем последовательный классификатор, такой как LSTM или Transformer, интерпретирует траектории ключевых точек. Этот подход на основе скелета значительно снижает размерность входа и обеспечивает инвариантность фону и освещению. Например, библиотека OpenPose и Graph Neural Networks (GNNs), применяемая к графам скелета, достигли состояния в самых современных тестах, таких как NTU RGB + D и Kinetics.

Признание жестов на основе датчиков

Помимо камер, распознавание жестов может использовать датчики глубины (Microsoft Kinect, Intel RealSense), радар (Google Soli) или носимые инерциальные измерительные блоки (IMU). Датчики глубины обеспечивают 3D-облака точек, которые могут обрабатываться с помощью 3D CNN или точечных сетей, таких как PointNet. Радарные системы, такие как Soli, используют микро-доплеровские сигнатуры, закодированные в спектрограммы и классифицированные CNNs — позволяющие обнаруживать жесты через ткань или в условиях низкой освещенности. Носимые IMU (акселерометры и гироскопы) обнаруживают движения конечностей; глубокие RNN часто используются для отображения последовательностей IMU на жестовые метки, как видно в элементах управления жестами умных часов.

Приложения в разных отраслях

  • Виртуальная и дополненная реальность: Отслеживание рук в Oculus Quest и HoloLens использует CNN на стереокамерах для естественного взаимодействия.
  • Игры: Nintendo Switch Joy-Con и Sony PlayStation Move используют инерциальные датчики для управления движением.
  • Распознавание языка жестов: Системы, использующие GNN или трансформаторы на основе скелета, могут переводить американский язык жестов (ASL) в текст или речь. Популярный набор данных ASL-лексикона и такие модели, как SignBERT, повышают точность более чем на 90% на изолированных знаках, хотя непрерывное распознавание на уровне предложений остается сложной задачей.
  • Автомобильные : камеры в кабине контролируют жесты водителя для бесхозного управления информационно-развлекательными системами и обнаруживают сонливость.
  • Здравоохранение: Системы помогают физиотерапии, отслеживая реабилитационные упражнения, обеспечивая обратную связь в реальном времени о правильности движения.

Для углубленного обзора глубокого обучения для распознавания жестов см. работу Кормушева и его коллег в журнале Journal of Machine Learning Research (]PDF ссылка ).

Мультимодальная интеграция: объединение речи и жеста

В естественном общении человека речь и жест тесно связаны. Указывая при произнесении “положите его туда” или кивая при ответе “yes” являются общими примерами. Мультимодальные системы, которые сливаются аудио и визуальные сигналы, могут достичь более высокой точности и более естественного взаимодействия, чем унимодальные подходы.

Стратегии слияния

  • Раннее слияние: Сырые или почти сырые функции обеих модальностей сцепляются перед входом в общую сеть. Это позволяет модели с самого начала изучать кросс-модальные взаимодействия, но рискует доминировать над одной модальностью над другой.
  • Промежуточное слияние: Отдельные кодеры извлекают представления для речи и жеста, и они позже объединяются (например, путем конкатенации или внимания) перед конечным классификатором. Это наиболее распространенная стратегия и позволяет использовать предварительно обученные унимодальные компоненты.
  • Поздний синтез: Два классификатора дают независимые прогнозы, которые объединяются правилом принятия решения (например, средневзвешенным).
  • Кросс-модальное внимание: Архитектура на основе трансформеров может вычислять внимание по модальностям, позволяя модели учитывать особенности жестов, когда речевой сигнал неоднозначный и наоборот.

Пример: Мультимодальные виртуальные помощники

Siri от Apple &rsquo на iPhone может объединять голосовые команды с сенсорными жестами на экране (например, “вызовите этот ресторан ” при нажатии на список). Системы внутри транспортного средства все чаще сливаются с отслеживанием голоса и взгляда, так что запись “показать информацию об этом здании ” при взгляде на ориентир запускает соответствующие данные. Исследовательские прототипы, такие как MIT “Мультимодальная глубокая нейронная сеть для взаимодействия человека и робота ” интегрировать ASR, распознавание жестов и анализ выражения лица, чтобы роботы могли следовать сложным инструкциям.

Одним из примечательных случаев является End-to-End Multimodal ASR for Human-Robot Dialogue, опубликованный в IEEE Robotics and Automation Letters DOI: 10.1109/LRA.2021.3065195. Система использует поздний синтез речи и жеста (с камеры глубины) для устранения двусмысленностей, таких как “there” или “, что один ” и достиг 12% относительного сокращения ошибок понимания команд по сравнению с речью.

Проблемы и будущие направления

Несмотря на быстрый прогресс, остается несколько препятствий, прежде чем полностью бесшовный мультимодальный ИМТ станет повсеместным.

Дефицит данных и аннотация

Обучение надежным DNN для ASR и распознавания жестов требует больших помеченных корпусов. В то время как речевые данные относительно многочисленны для основных языков, наборы данных жестов меньше и менее стандартизированы. Мультимодальные наборы данных, сочетающие синхронизированную речь, жесты и контекстную информацию сцены, редки. Самоконтролируемое обучение и обучение немаркированным данным (например, маскированное прогнозирование для речи и контрастное обучение для видео) предлагают путь к снижению затрат на маркировку. Техники, такие как слабый надзор , используя видеоподписи веб-масштаба, также показывают обещание.

Персонализация и адаптация

Конкретные для пользователя вариации в речи (голосовой тональности, скорости речи) и жесте (длина руки, предпочтительный радиус движения) ухудшают производительность общих моделей. Будущим системам необходимо будет выполнить незначительную или однократную адаптацию для отдельных пользователей, возможно, посредством метаобучения или тонкой настройки на минимальных персональных данных. Обучение на устройстве сохраняет конфиденциальность, но должно бороться с ограниченным вычислительным и аккумуляторным питанием.

Задержка и ограничения в реальном времени

Для таких приложений, как разговор, автономное вождение или управление игрой, задержка должна быть значительно ниже 100 миллисекунд. Потоковые модели ASR (например, RNN-T, монотонное внимание) и легкие модели жестов (например, MobileNet, EfficientNet) теперь стандартны, но мультимодальный синтез добавляет вычислительные накладные расходы. Обрезка, квантование и дистилляция знаний будет иметь важное значение для развертывания полных мультимодальных систем на краю.

Устойчивость к смене домена

Модели, обученные в одной среде (например, студии, лаборатории), ухудшаются в реальном мире. Для ASR методы адаптации домена, такие как выравнивание уровня CORAL или помощь в распознавании состязательных функций. Для распознавания жестов рандомизация домена во время обучения (изменение фона, освещения, углов камеры) улучшает обобщение. Адаптация в тестовое время является новой тенденцией, когда модели корректируют свои собственные параметры на лету, чтобы соответствовать входящему распределению.

Этические и конфиденциальные соображения

Постоянно включенные микрофоны и камеры вызывают проблемы с конфиденциальностью. Будущие системы должны уделять приоритетное внимание обработке на устройстве и обеспечивать, чтобы необработанные аудио/видео потоки обрабатывались эфемерно без передачи в облако. Кроме того, предубеждения в данных обучения (например, недопредставление определенных акцентов, полов или культур) могут привести к неравной производительности. Обучение модели с учетом справедливости и инклюзивное курирование наборов данных являются постоянными требованиями.

Заключение

Глубокие нейронные сети коренным образом изменили автоматизированное распознавание речи и жестов, позволив машинам слушать и видеть так, как это было научной фантастикой всего десять лет назад. От трансформаторной ASR, достигающей почти человеческой точности, до скелетных моделей жестов, позволяющих бесконтактное управление, эти технологии вплетаются в потребительскую электронику, здравоохранение, автомобиль и робототехнику. Будущее заключается в бесшовной, мультимодальной интеграции, которая уважает индивидуальные различия пользователей и работает надежно в реальных условиях. Продолжение инноваций в самоконтролируемом обучении, эффективных архитектурах и персонализации обещает закрыть оставшийся пробел, делая взаимодействие человека и машины действительно естественным и универсально доступным.