Влияние психоакустики на методы сжатия звуковых сигналов
Цифровая аудиореволюция зависит от способности представлять звук с дискретными данными. Без сжатия одна песня CD-качества потребляла бы более 30 МБ, что делало бы потоковую передачу и переносимое хранение непрактичными. Гениальность современных кодеков заключается не только в математической эффективности, но и в их использовании ограничений человеческого слуха. Эта область, ]психоакустика , обеспечивает дорожную карту восприятия, которая позволяет инженерам отбрасывать огромные объемы звуковых данных без ущерба для опыта слушателя. Как мы слышим, мы можем спроектировать то, что мы храним и передаем.
Взаимосвязь между психоакустикой и аудиосжатием симбиотична. По мере углубления нашего понимания слуховой системы алгоритмы сжатия становятся более эффективными. Эта постоянная уточненность сформировала ландшафт цифровых носителей, с первых дней MP3 до сложных потоковых кодеков, используемых сегодня. В этой статье исследуются основные принципы психоакустики, их реализация в перцептивном кодировании, эволюция кодеков и будущее слуховой науки в обработке сигналов.
Основы слухового восприятия человека
Чтобы понять, почему мы можем выбросить до 90% данных в аудиофайле без заметок среднего слушателя, мы должны сначала понять биологические и психологические ограничения человеческого уха. Ухо не является идеальным микрофоном; это нелинейный, частотно-зависимый и контекстно-чувствительный орган.
Анатомия слуха и базиларовая мембрана
Наружное ухо собирает звук и направляет его в барабанную перепонку. Оссиклы среднего уха усиливают механические вибрации и передают их улитке во внутреннее ухо. Внутри улитки базилярная мембрана действует как анализатор спектра в реальном времени. По мембране движется движущаяся волна, и её пиковое положение зависит от частоты входящего звука. Высокие частоты вызывают максимальное смещение вблизи основания, а низкие частоты пика около вершины. Распределение волосковых клеток вдоль этой мембраны диктует наше частотное разрешение. Эта физическая структура является основной причиной существования маскирующих и критических полос.
Критические группы и шкала коры
Базилярная мембрана функционирует как банк перекрывающихся полосовых фильтров. Эти фильтры, известные как критические полосы, определяют нашу способность разрешать различные частоты. Ширина этих полос увеличивается с частотой. Это означает, что мы можем легко различать 100 Гц и 200 Гц, но мы изо всех сил пытаемся различать 4000 Гц и 4100 Гц. Это нелинейное частотное разрешение формализовано в Шкала Барка, названная в честь Генриха Бархаузена. Шкала Барка отображает физическую частоту (Гц) на частоту восприятия (Bark). Одна Кора соответствует одной критической полосе. Эта шкала имеет основополагающее значение для перцептивного аудиокодирования, потому что она диктует, как маскировка распространяется по спектру.
Абсолютный порог слушания
Другим критическим ограничением является абсолютный порог слышимости (ATH. Мы не слышим все частоты одинаково хорошо. Люди наиболее чувствительны к звукам в среднем диапазоне, примерно между 2 кГц и 5 кГц, где находятся речевые согласные и многие музыкальные переходные процессы. Чувствительность резко падает ниже 500 Гц и выше 8 кГц. ATH часто визуализируется с использованием контуров равной громкости (кривые Флетчера-Мюнсона), которые показывают уровень звукового давления, необходимый для того, чтобы тон воспринимался одинаково громко на разных частотах. Кодеки восприятия используют ATH напрямую: любая спектральная энергия ниже ATH считается неслышимой и может быть отброшена или квантована с чрезвычайно низкой точностью.
Основные психоакустические явления, используемые для сжатия
В то время как ATH определяет глобальные пределы слуха, маскировка определяет локальные динамические пределы. Маскировка происходит, когда один звук (маскарад) делает другой звук (маскарад) неслышимым. Это единственный самый мощный инструмент в перцептивном аудиокодировании.
Одновременная (частотная) маскировка
Одновременное маскирование происходит, когда одновременно присутствуют два звука. Громкий тон на одной частоте повышает порог слышимости для близлежащих частот. Форма этой кривой маскировки асимметрична: она распространяется больше на более высокие частоты (восходящий разброс маскировки), чем на более низкие частоты. Если ударный барабан бьет на 100 Гц, он может маскировать сбой цимбала на 8000 Гц, но цимбал не легко маскирует ударный барабан. Существуют два основных типа маскирующих средств:
- Тональные маски: Сигналы узкой полосы (например, чистый тон или флейта) имеют четко определенный шаблон маскировки.
- Шумовые маски: Широкополосные сигналы (например, звук ветра или рычажного барабана) имеют более плоский рисунок маскировки, но могут маскироваться в более широком диапазоне частот.
Энкодеры анализируют входной сигнал для идентификации как тональных, так и шумоподобных компонентов и вычисляют комбинированный порог маскировки для каждой критической полосы.Любые компоненты сигнала, падающие ниже этого порога, являются потенциальными кандидатами на уменьшение бита.
Временная маска
Слух не мгновенный. Ухо требует времени для обработки звуков, и это создает окно для маскировки событий, которые не являются одновременными. Существует два типа временной маскировки:
Задняя маска (Backward Masking)
Это самое удивительное явление: громкий звук может маскировать более тихий звук, который возникает до него. Это возможно, потому что мозгу требуется до 20 миллисекунд, чтобы полностью зарегистрировать тихий звук. Если громкий всплеск приходит до того, как мозг закончит обработку тихого звука, тихий звук перезаписывается. Это самое короткое окно маскировки (обычно 5-20 мс), но это имеет решающее значение для управления переходными процессами атаки.
Пост-маскировка (Forward Masking)
Это более интуитивное явление. После остановки громкого звука ухо остается «оглушенным» на короткий период (50-200 мс.) Волосовые клетки на базилярной мембране требуют времени, чтобы перестать вибрировать и восстановить свою чувствительность. В этот период маскируются тихие звуки, следующие за громким звуком. Это используется кодерами при работе с ударными звуками. Удар барабана маскирует реверберационный хвост или следующую ноту, позволяя кодеру тратить меньше битов на непосредственные последствия.
Внедрение психоакустических принципов в кодеки
Перевод психоакустической теории в практический алгоритм сжатия является сложным инженерным подвигом. Он требует преобразования аудио в область, где можно вычислить и применить маскирующие пороги. Это область перцептивного аудиокодер.
Психоакустическая модель в действии
Все современные кодеки восприятия следуют аналогичной архитектуре высокого уровня. Сигнал ввода PCM (Модуляция импульсного кода) сначала оконно преобразуется в частотный домен с использованием модифицированного дискретного преобразования космического вещества (MDCT) или гибридного фильтра банка. Кодер затем параллельно запускает психоакустическую модель .
- Спектральный анализ: Сигнал анализируется с использованием быстрого преобразования Фурье (FFT) для достижения высокочастотного разрешения.
- Картирование критических полос: Спектральные линии группируются в критические полосы на основе шкалы Барка.
- Маскинирование порогового значения: Модель идентифицирует тональные и шумовые маскировщики и вычисляет их индивидуальные кривые маскировки. Эти кривые суммируются для создания глобального порога маскировки для каждой критической полосы. Этот порог представляет собой максимально допустимую энергию шума квантования, которая останется неслышной.
- Сигнал-маска (SMR): Кодер вычисляет SMR для каждой полосы. Высокий SMR означает, что сигнал силен относительно порога маскировки, оставляя место для сильного квантования. Низкий SMR означает, что сигнал близок к порогу и должен быть тщательно закодирован.
Бит-распределение и шумообразование
На основе SMR кодер выделяет ограниченный битовый бюджет по частотному спектру. Полосы с высоким SMR получают меньше битов (грубое квантование), в то время как полосы с низким SMR получают больше битов (тонкое квантование). Этот процесс называется шумообразование . Формируя шум квантования, чтобы соответствовать порогу маскировки, кодер делает шум неслышимым для слушателя.
Цель перцептивного кодера не в том, чтобы минимизировать общий шум квантования, а в том, чтобы минимизировать слышимый шум квантования , скрывая его под порогом маскировки сигнала.
Отраслевые стандартные перцептивные кодеки
Различные кодеки реализовали эти принципы с различными уровнями сложности.
MPEG-1 Audio Layer III (MP3)
MP3 был первым широко успешным перцептивным кодеком. Он использовал гибридный фильтр-банк (полифазный четырехугольный фильтр с последующей MDCT) и базовую психоакустическую модель. В то время как революционное для своего времени, его частотное разрешение было ограничено, а его временное разрешение было плохим. Это привело к печально известному «плохому» звуку на цимбалах и «пре-эхо» на переходных атаках при низких битрейтах (128 кбит/с и ниже). Несмотря на свои недостатки, MP3 доказал, что перцептивное кодирование было жизнеспособным для массового принятия потребителем. Узнайте больше о формате MP3 .
Advanced Audio Coding (AAC)
AAC был разработан как преемник MP3 и является основой современного потокового вещания (Apple Music, YouTube). Он предлагает превосходную производительность благодаря нескольким ключевым инновациям:
- Чистая MDCT: AAC использует чистую MDCT с большим размером окна (1024 образца), обеспечивая лучшее разрешение частоты для стационарных сигналов.
- Window Switching: AAC может динамически переключаться на короткое окно (128 образцов) для предотвращения преэхо на переходных сигналах, предлагая гораздо лучшую точность атаки, чем MP3.
- Темпоральное формирование шума (TNS):ТНС работает во временной области, чтобы контролировать временное распространение шума квантования, непосредственно решая проблему преэхо.
- Улучшенное стереокодирование: AAC позволяет совместному стереокодированию использовать межканальную маскировки.Исследуйте технические характеристики AAC.
Другие известные кодеки
Sony's ATRAC (Adaptive Transform Acoustic Coding), используемые для MiniDiscs, и Dolby Digital (AC-3), также были ранними пользователями перцептивного кодирования, каждый из которых имел уникальные психоакустические модели, адаптированные для их конкретных случаев использования (низкая мощность или многоканальное, соответственно).
Преимущества и ограничения восприятия
Преимущества психоакустического сжатия очевидны: уменьшение на порядки размера данных, обеспечивающих потоковую передачу, портативных музыкальных плееров и цифрового радио.Однако подход имеет присущие ограничения.
Прозрачность vs. эффективность
Священным Граалем перцептивного кодирования является прозрачность — точка, где слушатель не может отличить сжатый сигнал от оригинала. Это сильно зависит от битрейта и материала прослушивания. Для простых голосовых проходов прозрачность может быть достигнута при 64 кбит/с с современными кодеками. Для сложной, хаотической музыки (например, оркестровых кульминаций, хэви-метала) прозрачность может потребовать 192 кбит/с или более. «смертельный удар» перцептивного аудио остается активной областью исследования, поскольку слушатели становятся более критичными с высокоточным оборудованием.
Общие артефакты
Когда кодек выталкивается за пределы своих возможностей, психоакустическая модель терпит неудачу, и появляются слышимые артефакты.
- Предэхо: Вызвано неисправностью временной маскировки.Квантирующий шум распространяется назад во времени перед резкой атакой, создавая «беспорядочный» или «размазанный» звук.
- Спектральные дыры: Высокие частоты полностью удаляются, потому что кодер судит их, чтобы быть замаскированным, в результате чего получается тусклый, «закрытый» звук.
- Бирди Артефакты:] Тональный шум, часто металлический или деформирующийся, появляется там, где кодер плохо квантовал конкретную спектральную линию.
- Варблинг: Нестабильная стереоизображение или «плавание» звука из-за плохо закодированных параметров стереосвязи суставов.
Прослушивание тестов и субъективность
Оценка качества кодека по своей сути субъективна. Отраслевой стандарт — это методология MUSHRA (тест Multi Stimulus с скрытой ссылкой и якорем), стандартизированная ITU (ITU-R BS.1534). Слушатели представлены с эталонной и несколькими закодированными версиями, включая низкокачественный якорь. Они оценивают «базовое качество звука» каждого по шкале от 0 до 100. Это строгое тестирование показывает, что, хотя кодеки значительно улучшились, ни один кодек не является универсально прозрачным при низких битрейтах для всех слушателей и всего контента. Читайте о стандарте MUSHRA .
Эволюция перцептивного аудио кодирования
Поиски более низких битрейтов и более высокой прозрачности не прекратились с AAC. Исследователи нашли способы дополнить базовый кодер восприятия параметрическими инструментами, которые выходят за рамки прямого кодирования сигналов.
Высокоэффективная AAC (HE-AAC) и спектральная репликация
HE-AAC (aacPlus) вводит Spectral Band Replication (SBR) . Вместо того, чтобы напрямую кодировать высокие частоты (например, выше 8 кГц) , кодер направляет декодер на то, как реконструировать их из кодированных низких частот. Это использует снижающуюся чувствительность уха к высоким частотам и шагу. Результат значительно улучшает качество при очень низких битрейтах (32-48 кбит/с), что делает его стандартом для интернет-радио и потоковой передачи с низкой пропускной способностью.
Opus и xHE-AAC: современное состояние искусства
Opus — открытый, безвозмездный кодек, который сочетает в себе речевой кодек (SILK) и общий аудиокодек (CELT). Он динамически переключается между ними на основе входного сигнала. Opus широко хвалят за его неизменное качество в широком диапазоне битрейтов (6 кбит/с до 510 кбит/с) и его низкую задержку, что делает его идеальным для VoIP и потоковой передачи в реальном времени. Узнайте о кодеке Opus.
xHE-AAC расширяет HE-AAC с Расширенная спектральная репликация полос (eSBR) и унифицированным ядром речевого и аудиокодирования (USAC). Он может обеспечивать высокое качество при удивительно низких битрейтах (до 12 кбит/с) и легко обрабатывает смешанный контент (речь над музыкой). Это кодек позади MPEG-H Audio и используется для потоковой передачи на платформах, таких как Netflix.
Возвышение машинно-обученных кодеков
Новейшим рубежом в области сжатия аудио является применение глубокого обучения.Нейронные сети в настоящее время используются для изучения сквозных схем сжатия, эффективно изучая собственную «психоакустическую модель» из данных.
- Конечные модели: Кодеки, такие как Google SoundStream и MetaEnCodec, используют нейронные сети для кодирования аудио непосредственно в скрытое пространство. Генеративная модель (например, трансформатор или GAN) затем реконструирует аудио.
- Обученные перцептивные сигналы: Эти модели часто обучаются с использованием комбинации стандартных функций потери (например, MSE) и дискриминатора потери, который пытается различать оригинальное и закодированное аудио. Это косвенно заставляет модель сохранять наиболее важные для восприятия функции, часто превосходящие созданные вручную психоакустические модели с чрезвычайно низкими битрейтами (например, 3-6 кбит/с).
Будущие горизонты в перцептивном аудио
Будущее психоакустики в сжатии очень персонализировано и захватывающе. Традиционные кодеки используют универсальную модель «нормального» слуха. По мере совершенствования технологии слуховых аппаратов мы движемся к персонализированной психоакустике. Будущие кодеки могут включать в себя конкретную аудиограмму пользователя для оптимизации сжатия для их уникального слухового профиля.
Кроме того, такие иммерсивные аудиоформаты, как Dolby Atmos и MPEG-H, вводят новые задачи. Эти форматы основаны на объектах, то есть звуки описываются как отдельные объекты с пространственными координатами. Для этого требуются новые психоакустические модели, которые учитывают пространственную маскацию и эффект приоритета. Определение того, какие аудиообъекты наиболее важны для пространственного опыта слушателя, является новым рубежом для перцептивного кодирования.
Заключение
Психоакустика остается бьющимся сердцем каждой эффективной системы сжатия звука. От критических полос шкалы Барка до нейронных сетей современных кодеков ИИ принцип остается прежним: понимая биологические и психологические ограничения человеческого слуха, мы можем разработать эффективную, высококачественную передачу данных. Продолжающееся совершенствование моделей восприятия движет будущее погружения, высокой точности и доступного аудио для всех.