Как цифровая обработка сигналов используется в современных системах виртуальной реальности
Виртуальная реальность (VR) развилась далеко за пределы нишевого игрового аксессуара в краеугольный камень захватывающих цифровых впечатлений, питающих приложения в здравоохранении, образовании, военной подготовке, технике и развлечениях. В основе этой трансформации лежит часто забытая инженерная дисциплина: Цифровая обработка сигналов (DSP) . DSP - это математическая основа, которая позволяет аппаратному обеспечению VR преобразовывать необработанные аналоговые данные от датчиков, микрофонов и камер в текучие, отзывчивые и правдоподобные виртуальные среды. Без DSP современные гарнитуры VR будут страдать от неприемлемой задержки, рывкового отслеживания движения, приглушенного звука и визуальных искажений, которые разрушают иллюзию присутствия. В этой статье исследуются критические роли, которые DSP играет в современных системах VR, конкретных алгоритмах и технологиях, используемых и как непрерывные достижения в DSP формируют будущее виртуальной реальности.
Что такое цифровая обработка сигналов?
Цифровая обработка сигналов - это наука анализа, модификации и синтеза непрерывных сигналов - таких как звук, свет, ускорение или электромагнитные волны - после того, как они были преобразованы в цифровую форму. В отличие от аналоговой обработки, которая манипулирует необработанными электрическими волнами, DSP работает на дискретных численных образцах с использованием математических операций, таких как преобразования Фурье, свертка, фильтрация и адаптивные алгоритмы. Процесс обычно следует за конвейером: аналого-цифровое преобразование (ADC) захватывает сигнал реального мира, чип DSP или программное обеспечение применяет ряд операций, а затем цифро-аналоговое преобразование (DAC) выводит обработанный сигнал для потребления человеком - будь то визуальные изображения, аудио или тактильная обратная связь.
В контексте VR DSP обрабатывает три основных потока данных: сигналы движения и ориентации от инерциальных единиц измерения (IMU), акустические сигналы от микрофонов и связанных с головкой функций передачи (HRTF) и визуальные сигналы от камер и конвейеров рендеринга. Каждый поток требует обработки в реальном времени с показателями задержки, часто измеряемыми в однозначных миллисекундах — намного превышающими возможности процессоров общего назначения, работающих только с программным обеспечением.
Роль DSP в системах виртуальной реальности
DSP проявляется почти в каждой подсистеме внутри гарнитуры VR и сопутствующих устройств. Ниже мы разбиваем три основных домена, где DSP незаменим.
1. Обработка данных датчика и отслеживание движения
Современные VR-гарнитуры полагаются на комбинацию микроэлектромеханических (MEMS) датчиков — акселерометров, гироскопов и иногда магнитометров — для отслеживания движений головы пользователя в шести степенях свободы (6DoF). Необработанные показания этих датчиков по своей сути шумны, содержат дрейф, вибрационные артефакты и ошибки квантования. Алгоритмы DSP применяются сразу после ADC для очистки и плавления данных. Обычная техника — фильтр Калмана , рекурсивный оценщик состояния, который предсказывает следующую ориентацию на основе предыдущих измерений и моделей шума датчика, затем корректирует предсказание с использованием фактических показаний датчика. Более продвинутые варианты, такие как Расширенный фильтр Калмана (EKF) или Дополнительный фильтр , используются для слияния угловой скорости гироскопа с векторами гравитации акселерометра и данными заголовка магнитометра, производя точные оценки ориентации с
Помимо отслеживания головы, ручного и контроллерного отслеживания также сильно зависит от DSP. Для оптического отслеживания изнутри-вне (например, с использованием камер на гарнитуре для отслеживания инфракрасных светодиодов на контроллерах) необработанные кадры камеры должны обрабатываться для изоляции и определения местоположения светодиодных капель на фоне шума. Это включает в себя алгоритмы обнаружения светодиодов , которые применяют пороги, морфологические фильтры и вычисления центроидов - все формы DSP. Для систем, которые используют внешние базовые станции (например, маяк SteamVR от Valve), DSP интерпретирует лазерные развертки, обнаруженные фотодиодами на гарнитуре и контроллерах, чтобы вычислить положение с субмиллиметровой точностью. В обоих случаях скорость и точность трубопровода DSP напрямую определяют, насколько хорошо система VR борется с укачиванием и сохраняет иллюзию присутствия.
2. Обработка звуковых сигналов для пространственного звука
Аудио, возможно, наполовину реализм любого опыта виртуальной реальности. Человеческие уши исключительно чувствительны к сигналам локализации звука и без убедительного пространственного звука пользователи сообщают о чувстве отключения от виртуального мира. DSP делает пространственное аудио возможным, эмулируя физические сигналы, которые наш мозг использует для определения местоположения звуков в 3D пространстве. Краеугольной технологией является Связанная с головкой функция передачи (HRTF) — набор фильтров, которые моделируют, как звуковые волны дифрактируют вокруг головы, плеч и пиннэ человека перед достижением барабанной перепонки. HRTF представлен как пара импульсных реакций (левое и правое ухо) для каждого направления в пространстве. Когда разработчик хочет разместить виртуальный источник звука под определенным углом и высотой, система свертывает аудиосигнал этого источника с соответствующими фильтрами HRTF в реальном времени. Качество этой свертки — его способность обрабатывать движущиеся источники, реверберация комнаты и затухание расстояния — полностью зависит от эффективности реализации DSP.
Современные аудиодвижки VR, такие как Steam Audio, Oculus Audio SDK и Microsoft Windows Sonic, расширяют базовый HRTF с амбисоникой и бинауральным рендерингом . Амбисоника — это полносферное представление объемного звука, которое можно декодировать в наушники с использованием сферических гармоник более высокого порядка; DSP используется для вращения амбисонического поля по мере того, как пользователь поворачивает голову, обеспечивая, чтобы источники звука оставались неподвижными в виртуальном мире. Кроме того, моделирование акустики комнаты использует DSP для моделирования ранних отражений и поздней реверберации с помощью измеренных или синтетических импульсных реакций свертки с помощью измеренных или синтетических импульсных реакций или с помощью параметрических алгоритмов, таких как трассировка лучей
Аудио также играет роль в пользовательском вводе. Голосовые команды и социальная связь в многопользовательской VR требуют подавления шума в реальном времени и отмену эха . Алгоритмы, такие как фильтрация Винер , спектральное вычитание и адаптивная фильтрация (например, наименее средние квадраты)] очищают сигналы микрофона, поврежденные шумом вентилятора, дыханием или реверберацией комнаты, обеспечивая четкую передачу голоса без добавления заметной задержки.
3. Обработка изображений и видеосигналов для рендеринга
В то время как современные графические процессоры (GPU) обрабатывают большую часть рабочей нагрузки 3D-рендеринга, DSP в значительной степени участвует в стадиях обработки изображений, которые происходят до и после конвейера GPU. Одним из классических примеров является коррекция искажений объектива . VR-гарнитуры используют выпуклые линзы для увеличения дисплея и создания широкого поля зрения, но эти линзы вводят искажение ствола и хроматическую аберрацию. Чтобы противодействовать этому, система VR применяет обратное искажение (подушка) к каждому визуализируемому кадру до его отображения. Эта операция представляет собой геометрическое деформирование, которое может быть выполнено на шейдере GPU, но многие реализации выгружают его в выделенный блок DSP или используют аппаратное обеспечение с фиксированной функцией внутри контроллера дисплея. Например, Oculus Rift CV1 использовал отдельный процессор дисплея для преварп-кадров с преобразованием на основе сетки 4x4, уменьшая нагрузку на GPU и снижая задержку движения к фотону.
Другая критическая область — асинхронная репроектия и пространственный варп. Когда приложение VR не может поддерживать требуемую частоту обновления (обычно 90 Гц или выше), система времени выполнения может синтезировать промежуточные кадры с использованием векторов движения и информации о глубине. Этот метод — называемый Асинхронный пространственный варп (ASW) в Oculus или Motion Smoothing в SteamVR — относится к DSP для анализа последних двух визуализированных кадров, оценки движения каждого пикселя и создания нового кадра, который интерполирует положение камеры для учета непрерывного движения головы пользователя. Алгоритм по существу является оптическим вычислением потока, классической задачей DSP, которая может быть эффективно реализована на аппаратных средствах DSP или специализированных ускорителях машинного обучения.
Плавная визуализация является ещё одним DSP-зависимым нововведением. Камеры слежения за глазами в новых гарнитурах (например, HP Reverb G2 Omnicept, PlayStation VR2) захватывают движение глаз и ориентацию зрачка. DSP обрабатывает изображения камеры для определения точки взгляда, затем передает эту информацию движку рендеринга, который визуализирует центральную область дисплея с полным разрешением, при этом резко сокращая разрешение на периферии. Это не только экономит ресурсы GPU, но и снижает пропускную способность, позволяя обрабатывать более высокие плотности пикселей без перегрева. Обработка сигнала слежения за глазами должна быть чрезвычайно низкой задержкой (до 5 мс полной петли), чтобы избежать заметной деградации, когда пользователь смещает взгляд.
Примеры технологий DSP в современных VR-гарнитурах
Чтобы понять, как DSP проявляется в реальных потребительских товарах, рассмотрим несколько ключевых технологий, которые в настоящее время используются:
- Снижение шума в микрофонных лучах: Наушники, такие как Valve Index и Meta Quest Pro, имеют многомикрофонные массивы. Алгоритмы DSP, такие как формирование луча, направляют чувствительность микрофона к рту пользователя, отключая при этом окружающий шум. Это сочетается с адаптивным шумоподавлением, который непрерывно моделирует спектр фонового шума и вычитает его из захваченного сигнала.
- Алгоритмы отслеживания движения для 6DoF:] Meta Quest 2 использует сложный конвейер синтеза датчиков, где данные IMU сливаются с визуальной SLAM (одновременной локализацией и отображением) от четырех камер серого масштаба. Блок DSP внутри чипсета Qualcomm XR2 объединяет данные IMU, камеры и датчика глубины на частоте 1000 Гц, запускает извлечение функций в реальном времени, ассоциацию данных и алгоритмы оптимизации позы. Это дает субмиллиметровую точность отслеживания с задержкой менее 10 мс.
- Аудио-пространство через HRTF Convolution: Apple Vision Pro использует пространственное аудио с динамическим отслеживанием головы. Его аудио DSP выполняет свертку HRTF на ухо, применяет акустическое отслеживание лучей для отражений в помещении и постоянно настраивает пространственное изображение по мере перемещения пользователем головы или тела. Для достижения этого без заметной задержки Apple использует пользовательский аудио DSP кремний (вероятно, аудиосопроцессор, разработанный Apple), который выгружает свертку из основного процессора.
- Коррекция дисторций и сопоставление линз:] HTC Vive Pro 2 использует комбинированную систему объектива Fresnel, которая требует агрессивного искажения подушки безопасности. DSP контроллера дисплея выполняет коррекцию искажений с использованием предварительно вычисленной сетки, генерируемой из измеренных оптических характеристик объектива. Сетка пересчитывается на лету, если пользователь настраивает межпупиллярное расстояние (IPD), поддерживая правильную геометрию в диапазоне положений глаз.
- Репроектирование для Frame Smoothing: Motion Smoothing от SteamVR генерирует интерполированные кадры, анализируя векторы движения вместе с данными о глубине. DSP запускает оптический алгоритм потока на двух последних кадрах, вычисляет движение на пиксель, а затем композитирует новый кадр в интерполированной позе головы. Это вычислительно тяжело; Valve сообщает, используя комбинацию шейдеров вычислений GPU и выделенных ядер DSP на Link Box (для проводных гарнитур), чтобы уменьшить накладные расходы.
Влияние DSP на пользовательский опыт
Кумулятивный эффект этих технологий DSP является резким улучшением субъективного качества VR. Единственной наиболее важной метрической является задержка движения к фотону — время между перемещением головы пользователя и обновлением дисплея, которое происходит. Человеческое восприятие может обнаружить задержку выше 15-20 мс, вызывая дезориентацию и тошноту. Системы DSP предназначены для минимизации задержки на каждом этапе: быстрое считывание IMU, немедленная фильтрация, прогнозирование поз и репроекция. Современные гарнитуры достигают сквозной задержки около 10-12 мс, а репроекция кадра сохраняет визуальный конвейер плавным даже при падении частоты кадров приложений.
Другим важным воздействием является присутствие , ощущение «быть там» в виртуальном мире. Пространственный аудио DSP создает иллюзию 3D-звукового пейзажа, который соответствует движениям головы пользователя, что делает виртуальные объекты, по-видимому, занимают реальное физическое пространство. Исследования показали, что добавление точного аудио на основе HRTF к визуальной сцене значительно увеличивает чувство присутствия пользователей и их способность локализовать объекты. Аналогично, коррекция искажений объектива с низкой задержкой не позволяет пользователю напоминать, что он смотрит через оптику; изображение выглядит естественным образом экспансивным без геометрического искажения.
DSP также уменьшает физический дискомфорт. Включая вентилируемый рендеринг, DSP снижает разрешение рендеринга в периферийном зрении, что снижает нагрузку на GPU и, следовательно, тепло и шум, генерируемые системой VR. Более легкое рассеивание тепла означает более легкие гарнитуры - критический эргономичный фактор для длительного использования. Кроме того, снижение шума и отмена эха в социальной VR поддерживают связь чистой, уменьшая когнитивную нагрузку и предотвращая разочарование во время совместных задач.
Будущие разработки в DSP для виртуальной реальности
По мере того, как VR будет продолжать продвигаться к более высокой точности и более естественному взаимодействию, DSP будет играть еще более центральную роль.
Машинное обучение - основанное на DSP
Традиционный DSP полагается на линейные фильтры и фиксированные математические модели, но машинное обучение начинает дополнять или заменять классические методы. Например, нейронные сети были обучены супер-решению сигналов отслеживания головы , предсказывающим будущее движение с большей точностью, чем фильтры Калмана. В аудио модели глубокого обучения могут синтезировать HRTF из общих форм головы , заменяя индивидуализированные измерения HRTF, которые дорого получить. нейронная репроекция (например, генерация кадров на основе DLSS) использует сверточные сети для интерполяции кадров с гораздо меньшим количеством артефактов, чем методы оптического потока. Эти нейронные алгоритмы являются вычислительно интенсивными и, вероятно, потребуют специализированных ускорителей DSP, таких как Neural Engine от Apple или Hexagon DSP от Qualcomm, которые объединяют скалярные, векторные и тензорные ядра.
Высшая амбисоника и синтез волнового поля
Будущее аудио VR будет выходить за рамки стандартной амбисоники первого порядка (4 канала) на более высокие заказы (например, амбисоника девятого порядка, требующая 100+ каналов). Соответственно умножается сложность DSP - каждый канал должен быть повернут, декодирован и свёрнут с HRTF. Выделенные аудио чипы DSP со многими агрегатами мультиаккумуляции (MAC) уже разрабатываются для обработки этих рабочих нагрузок с минимальной задержкой.
Обработка сигналов Haptic
DSP также распространяется на тактильную обработку. Новые тактильные перчатки и жилеты используют исполнительные механизмы, которые вибрируют на определенных частотах для имитации текстуры, удара или непрерывного движения. Сигналы управления для этих исполнительных механизмов являются цифровыми волновыми формами, которые должны быть синтезированы и отфильтрованы в соответствии с предполагаемым тактильным ощущением. Алгоритмы DSP могут моделировать механический резонанс исполнительного механизма и предварительно компенсировать нелинейности, обеспечивая более точную тактильную обратную связь.
Оптический DSP для отслеживания глаз и лица
Будущие гарнитуры будут включать камеры слежения за глазами, которые работают с более высоким разрешением и частотой кадров для рендеринга в режиме ожидания взгляда и анимации социального аватара. DSP потребуется для обработки этих изображений в реальном времени, извлечения положения зрачка, состояния мигания и даже движений лицевых мышц. Например, камера слежения за глазами со скоростью 120 кадров в секунду с разрешением 8K генерирует огромные данные; DSP должен уменьшить данные до набора координат и выражений, потребляя при этом минимальную мощность.
Кроме того, обработка на устройстве датчиков глубины (например, времени полета или структурированного света) улучшит отслеживание рук и понимание окружающей среды. Карты глубины требуют фильтрации для удаления шума, заполнения окклюзий и извлечения функций - снова опираясь на сложные трубопроводы DSP.
Заключение
Цифровая обработка сигналов - это молчаливая рабочая лошадка современной виртуальной реальности. Она устраняет разрыв между необработанными данными датчиков и убедительными, малозадерживаемыми впечатлениями, которые ожидают пользователи. От отслеживания движения и аудиопространства до коррекции визуальных искажений и репроекции кадров, алгоритмы DSP, работающие на специализированном оборудовании, гарантируют, что каждое движение головы, каждое произнесенное слово и каждое тонкое изменение виртуальной сцены обрабатываются достаточно быстро, чтобы поддерживать иллюзию присутствия. По мере того, как VR развивается в сторону более легких, более мощных и более проницательных устройств, роль DSP будет только расти - движимая машинным обучением, сенсорным восприятием с более высоким разрешением и неустанным спросом на реализм. Разработчики и инженеры аппаратного обеспечения, которые понимают и используют передовые методы DSP, будут на переднем крае создания следующего поколения захватывающих виртуальных миров.