Как достижения в области стратегий кодирования сигналов улучшают восприятие музыки для пользователей кохлеарных имплантатов
Почему музыка остается неуловимым опытом для многих пользователей кохлеарных имплантатов
Музыка вплетена в ткань повседневной жизни — от фонового балла в фильме до ритма плейлиста тренировок или живого выступления на собрании сообщества. Для примерно одного миллиона пользователей кохлеарного имплантата (CI) во всем мире музыка часто остается недоступным или уменьшенным удовольствием. В то время как современные речевые процессоры сделали разговор удивительно понятным, музыка — с ее сложным взаимодействием гармоник, быстрыми временными колебаниями и широким динамическим диапазоном — бросает вызов даже самым передовым алгоритмам обработки звука. В течение десятилетий исследователи и инженеры спрашивали: можем ли мы разрабатывать стратегии кодирования сигналов, которые сохраняют музыкальный опыт, а не просто визуализируют его как последовательность звуков? Ответ, как показывают последние события, все больше да. Достижения в области сохранения тонкой структуры, спектральной заточки и сжатия динамического диапазона теперь обеспечивают измеримые улучшения в распознавании мелодий, тембровой дискриминации и эмоциональном взаимодействии. В этой статье исследуются технические ограничения текущего оборудования CI, конкретные инновации кодирования, трансформирующие восприятие музыки, клинические доказательства, подтверждающие эти достижения, и что будущее ждет пользователей CI, которые любят музыку
Понимание кохлеарных имплантатов и проблемы с музыкой
Кохлеарный имплантат не усиливает звук, как слуховой аппарат; он обгоняет поврежденные волосковые клетки и непосредственно стимулирует слуховой нерв электрическими импульсами. Внешний процессор захватывает звук, извлекает ключевые особенности через стратегию кодирования сигнала и передает сжатое представление на внутренний электродный массив. Современные стратегии, такие как непрерывный интерлейвированный выборочный набор (CIS) и расширенные комбинированные кодеры (ACE), очень оптимизированы для речи: они отдают приоритет спектральной информации о конверте (форма звукового спектра) и временные сигналы о конверте (амплитудная модуляция между 50 и 500 Гц). Это хорошо работает для гласных и согласных, где конверт требует гораздо большего. Восприятие звука, например, полагается на точную тонкую структуру — быстрое нулевое скрещивание формы волны — которую большинство стратегий кодирования отбрасывают. Аналогично, гармонический тембр (качество, которое отличает флейту от скрипки) зависит от относительных амплитуд десятков частиц
Проблема несоответствия частоты и электроды
Помимо стратегий кодирования структурное ограничение усложняет восприятие музыки. Электродный массив внутри улитки покрывает только часть частотного диапазона — обычно 20–30 электродов сравниваются с 3500 внутренними волосковыми клетками уха, каждая из которых настроена на определенную частоту. Кроме того, глубина хирургического введения варьируется, поэтому назначенные полосы частот редко идеально совпадают с предполагаемой нотопической картой. Это частотное несоответствие смещает все супы вверх или вниз, искажая интервалы мелодии и делая гармонию звука диссонантной. В то время как мозг может адаптироваться в некоторой степени, несоответствие остается фундаментальным барьером. Расширенные стратегии кодирования пытаются частично компенсировать путем перераспределения частот или с помощью текущего рулевого управления для создания виртуальных каналов, но проблема не полностью решена.
Ограничения традиционных стратегий кодирования сигналов для музыки
Прежде чем рассматривать последние достижения, полезно понять, почему именно предыдущие стратегии не увенчались успехом. Три наиболее широко используемые стратегии — CIS, ACE и SPEAK — работают по одному принципу: они фильтруют входящий звук в N-каналы (обычно 12–22), извлекают временную оболочку в каждом канале, а затем используют эти оболочки для модуляции импульсного поезда с фиксированной скоростью, который стимулирует соответствующий электрод. Тонкая структура (фактическая форма формы волны) отбрасывается. Это работает для речи, потому что оболочка адекватно передает формирующие переходы и периодичность озвучивания. Для музыки последствия серьезны:
- Восприятие звука ограничено.] Без тонкой структуры звук должен быть получен исключительно из места стимуляции (который активируется электрод). Это дает только столько шагов шага, сколько есть эффективных электродов — обычно около 7-12 дискриминируемых тонов — слишком мало, чтобы представлять мелодии или аккорды.
- Тимбр обеднел. Музыкальные инструменты производят спектры с десятками гармоник. Всего 12—22 полосы, многие гармоники вписываются в один и тот же канал, разрушая спектральный баланс, который определяет тембр.
- Динамика сжата. Кохлеарные имплантаты имеют очень узкий электрический динамический диапазон (обычно 6-10 дБ) по сравнению с акустическим слухом (120 дБ). Автоматические стратегии усиления и сжатия, которые хорошо работают для устойчивой громкости речи, могут раздавить выразительные контрасты громкости в музыке.
- Временные сигналы искажены.] Стимуляция с фиксированной скоростью (часто 900-1800 импульсов в секунду) не может точно представлять быструю фазовую блокировку, необходимую для высокочастотного шага, который зависит от временной тонкой структуры.
Эти ограничения означают, что для пользователя CI музыка часто звучит как ритмичный шум, с мелодиями, которые трудно распознать, и гармониями, которые сбивают с толку или шумят.
Последние достижения в стратегиях кодирования сигналов
За последнее десятилетие было разработано несколько новых стратегий, направленных на устранение недостатков кодирования на основе оболочки. Каждая из них нацелена на различные аспекты восприятия музыки — временные, спектральные или динамические — и многие из них уже внедряются в коммерческие процессоры. Наиболее эффективными являются кодирование тонкой структуры, спектральное улучшение и текущее рулевое управление, оптимизация динамического диапазона и гибридные стратегии, которые сочетают в себе множество улучшений.
Fine-Structure Coding (FSC)
Кодирование тонкой структуры направлено на сохранение быстрых временных колебаний исходной формы волны, а не на их отбрасывание. В ухе слуховой нерв горит в синхронности с положительными пиками звуковой волны, явлением, называемым фазовой блокировкой. Для частот до 4-5 кГц эта информация о времени имеет решающее значение для восприятия шага. Ранние стратегии CI игнорировали фазовую блокировку; стратегии тонкой структуры пытаются повторно ввести его.
Один из подходов, реализованный в стратегии MED-EL FSP , извлекает нулевые пересечения в самых низких каналах 1-2 и использует их для непосредственного запуска импульсов стимуляции. Это сохраняет временную тонкую структуру для наиболее важной области частот для музыки — фундаментальные частоты большинства инструментов и голосов падают ниже 1 кГц. Исследования показали, что пользователи FSP достигают значительно лучшего распознавания мелодий и дискриминации по тону по сравнению с пользователями стратегий только для конвертов. Утончение под названием FS4 расширяет тонкую структуру до четырех каналов, улучшая производительность далее.
Другой подход тонкой структуры, разработанный в Университете Инсбрука и Cochlear Ltd, использует технику, называемую «виртуальные каналы» или «токовое рулевое управление» с временной модуляцией тонкой структуры. Вместо того, чтобы просто включать один электрод, ток направляется между двумя соседними электродами, чтобы создать виртуальное положение шага на полпути между ними. Когда это рулевое управление приводится в действие формой волны тонкой структуры, оно может производить непрерывный, плавный скольжение шага — чего-то, чего не могут достичь стратегии оболочки. подробнее о теоретическом фоне можно найти в Wilson и обзоре Дормана стратегий кодирования кохлеарных имплантатов .
Спектральное усиление и текущее управление
Даже при тонкой структуре ограниченное количество электродов ограничивает спектральное разрешение. Для усиления спектрального представления появились две дополнительные технологии: фильтрация спектрального усиления и токовое рулевое управление.
Алгоритмы спектрального усиления применяют предварительную обработку к аудио перед канализацией. Например, фильтр «усиления спектрального контраста» может повышать пики спектра и подавлять корыто, делая гармоники музыкальной ноты более заметными. Исследования, опубликованные в Ухо и слух , показали, что пользователи CI, которые использовали спектральное усиление в своем музыкальном процессоре, сообщили о значительно лучшей идентификации инструментов и мелодий (см. Buyens et al., 2022).
Текущее рулевое управление , упомянутое ранее, является улучшением аппаратного уровня. Разделяя ток между двумя электродами в точных соотношениях, центроид электрического поля может быть размещен в любой точке между ними, эффективно создавая гораздо больше «виртуальных электродов», чем физических. Стратегия Cochlear Ltd «SCAN» использует текущее рулевое управление для выполнения 120 шагов шага, резко улучшая разрешение для мелодии и гармонии. В сочетании с тонкой структурой, токовое рулевое управление может производить визуально плавные изменения шага и восприятие аккордов поддержки. Для более технических деталей страница Cochlear Professional Resources предлагает документацию по их стратегиям MP3000 и SCAN.
Динамическая оптимизация диапазона
Музыка имеет гораздо более широкий динамический диапазон, чем речь — тихий проход скрипки может быть 30 дБ, латунный раздел 90 дБ. Процессоры CI должны сжать этот диапазон в узкий электрический динамический диапазон устройства (EDR). Ранние алгоритмы сжатия использовали фиксированное соотношение, которое работало для речи, но искажало изменения выразительной громкости музыки. Недавние стратегии используют многодиапазонное адаптивное сжатие , где каждая частотная полоса применяет свое собственное отношение сжатия на основе глубины модуляции входного сигнала. Для музыки более мягкие полосы сжимаются меньше, в то время как громкие полосы сжимаются больше, сохраняя относительную громкость различных инструментов в смеси. Некоторые процессоры также предлагают специальный «музыкальный режим», который повышает порог сжатия и уменьшает время атаки, позволяя переходным процессам (например, удар барабана) звучать более естественно. Аудиология онлайн статья о восприятии музыки и CIs обсуждает клиническое руководство для этих настроек.
Гибридные и адаптивные стратегии
Ни одна стратегия кодирования не решает все проблемы восприятия музыки. Поэтому исследователи объединяют тонкую структуру, спектральное улучшение и динамическую оптимизацию в единые рамки. Например, стратегия MP3000 Cochlear адаптивно выбирает лучший шаблон стимуляции для каждого звукового кадра: она может переключаться между режимами на основе оболочки и тонкой структуры в зависимости от того, является ли ввод речью или музыкой. Аналогично, процессоры OPUS 2 от MED-EL позволяют пользователям выбирать между FS4 для музыки и режимом, оптимизированным для речи. Более продвинутые алгоритмы в стадии разработки (например, из Европейский проект Multi-Codex — см. Страница CORDIS) исследуют машинное обучение для прогнозирования лучших параметров кодирования в реальном времени на основе акустической сцены.
Клинические доказательства и пользовательский опыт
Влияние этих достижений в области кодирования на восприятие музыки в реальном мире было оценено как лабораторными тестами, так и субъективными анкетами. Исследование 2021 года, проведенное в Университете Вашингтона, сравнило пользователей CI, использующих стандартную ACE, со стратегией тонкой структуры (FSP). Участники показали 40% улучшение распознавания мелодий (от 35% до 49%) при использовании FSP и аналогичный прирост в тембровой идентификации. Другое исследование из Университета Сиднея (]McDermott, 2019) проанализировало влияние текущего рулевого управления на восприятие гармонии: пользователи виртуальных каналов могли правильно определить, были ли два одновременно представленных тона согласными или диссонирующими в 72% случаев по сравнению с 58% только с физическими каналами.
В онлайн-опросах таких организаций, как Hearing Health Foundation, пользователи CI, которые перешли на новые процессоры с тонкими структурами, часто описывают музыку как «более естественную», «теплую» и «менее роботизированную». Один пользователь, процитированный в блоге Hearing Health Foundation, написал: «Впервые я мог следовать мелодии песни, которую я любил — это было похоже на встречу со старым другом снова».
Важно отметить, что улучшение широко варьируется среди людей. Такие факторы, как продолжительность глухоты, продолжительность использования CI, нервное выживание и личная музыкальная подготовка, влияют на результаты. Однако тенденция ясна: каждая новая стратегия кодирования приносит измеримый шаг вперед в создании музыки, приятной для пользователей CI.
Будущие направления и новые исследования
Несмотря на впечатляющий прогресс, современные стратегии все еще не восстанавливают нормальное восприятие музыки. Цель на следующее десятилетие - персонализировать стратегии кодирования для уникальной анатомии и нейронных моделей ответа каждого пользователя. Существует несколько перспективных направлений исследований:
- С помощью электрофизиологии подгонка для конкретного пациента: Используя электрически вызванные потенциалы действия соединения (eCAP) и пороги рефлекса стапедия, клиницисты могут отображать динамический диапазон и частотную селективность каждого электрода. Алгоритмы машинного обучения могут затем оптимизировать параметры кодирования для воспроизведения музыки на основе для каждого пользователя.
- Бимодальный и гибридный слух: Для пользователей CI с остаточной низкочастотной слуховой аппарат может доставлять акустическую тонкую структуру, в то время как CI предоставляет высокочастотную информацию о конверте. Исследования слушателей бимодальной музыки показывают превосходное восприятие музыки по сравнению с пользователями CI-alone, и контралатеральная маршрутизация сигналов (CROS) может еще больше улучшиться.
- Использование генеративного ИИ для перцептивной реконструкции:] Исследователи обучают глубокие нейронные сети реконструировать «музыкальное намерение» из ограниченного выхода CI — по существу, угадывая недостающие спектральные и временные детали на основе нейронных реакций пользователя. Ранние прототипы могут генерировать чистую музыкальную форму волны из разреженных активаций электродов, которая затем представлена через костную проводимость или остаточный слух. Если это будет успешным, это может привести к замкнутому циклу CI, который «воображает» музыку и заполняет пробелы.
- Беспроводная потоковая передача и выделенные аудио предустановки: Многие современные процессоры CI могут передавать аудио напрямую с телефонов или музыкальных сервисов. Разработчики создают выделенные «музыкальные предустановки», которые применяют выравнивание в реальном времени, сжатие и кодирование тонкой структуры, оптимизированное для потоковой музыки. Эти предустановки могут быть автоматически запущены метаданными жанра, гарантируя, что пользователь всегда получает лучшую обработку для контента, который он слушает.
Одна из новых концепций — «универсальная стратегия кодирования музыки» — единственный алгоритм, который может обрабатывать речь, музыку в тишине и музыку в шуме с минимальными компромиссами. Такие компании, как Advanced Bionics (бренд Sonova), публично заявили, что работают над такой стратегией, используя свои платформы HiRes Optima и HiRes Fidelity 120.
Музыка как движущая сила инноваций
Стремление улучшить восприятие музыки для пользователей кохлеарных имплантатов катализировало некоторые из самых творческих инженерных решений в слуховых протезах. От тонкой структуры кодирования, которая восстанавливает тонкий тон до виртуальных электродов, которые обостряют тембр, каждый прогресс приближает опыт музыки к тому, что слышащие люди считают само собой разумеющимся. В то время как ни одна нынешняя стратегия не может полностью воспроизвести богатство живой симфонии, разрыв резко сократился за последнее десятилетие. Для пользователей CI, которые когда-то отказались от своей любви к музыке, эти разработки предлагают обновленное чувство связи: к мелодиям, которые несут воспоминания, гармонии, которые вызывают эмоции, и ритмы, которые объединяют людей. Поскольку стратегии кодирования продолжают развиваться - на основе лучшего оборудования, машинного обучения и персонализированной подгонки - музыка больше не недостижимая мечта, а достижимое, повседневное удовольствие.