Civil &: строительная инженерия
Роль цифровой обработки сигналов в современных стандартах сжатия видео
Table of Contents
Незаменимая роль цифровой обработки сигналов в современных стандартах сжатия видео
В эпоху, когда видео доминирует в интернет-трафике - от потоковой передачи в прямом эфире и видеоконференций до развлечений по требованию и наблюдения - способность эффективно хранить, передавать и декодировать высококачественное видео имеет первостепенное значение. В основе этой способности лежит сложная область цифровой обработки сигналов (DSP). DSP обеспечивает математическую и алгоритмическую основу для современных стандартов сжатия видео, позволяя уменьшить массивные необработанные видеоданные в управляемые битовые потоки без заметной потери качества. Без DSP видео высокой четкости было бы невозможно передавать по обычным интернет-соединениям, а требования к хранению даже коротких клипов были бы непомерными. В этой статье рассматриваются критические функции DSP в сжатии видео, рассматривая ключевые методы, которые питают широко распространенные кодеки и смотрят в будущее этой быстро развивающейся технологии.
Что такое цифровая обработка сигналов в контексте видео?
Обработка цифровых сигналов относится к манипулированию сигналами, такими как аудио, видео, температура или давление, которые были преобразованы в цифровую форму. В видео сигнал представляет собой последовательность кадров, каждая из которых состоит из миллионов пикселей. Сырое видео содержит огромное количество избыточной и не имеющей отношения к восприятию информации. Алгоритмы DSP предназначены для идентификации и удаления этих избыточностей, используя как пространственные (в пределах одного кадра), так и временные (между последовательными кадрами) корреляции. Цель состоит в том, чтобы сохранить информацию, которая имеет решающее значение для визуального восприятия человека, отбрасывая или упрощая данные, к которым глаз менее чувствителен. Этот принцип перцептивного кодирования является центральным для каждого основного стандарта сжатия видео, и DSP является двигателем, который управляет им.
Основные методы DSP, лежащие в основе сжатия видео
Современные стандарты сжатия видео, от H.264/AVC до новейшего Versatile Video Coding (VVC), полагаются на общий набор методов DSP. Каждая техника играет определенную роль в трубопроводе сжатия. Понимание этих строительных блоков имеет важное значение для оценки того, как достигаются высокие коэффициенты сжатия при сохранении визуальной точности.
Трансформация кодирования: преобразование пикселей в частоты
Первым крупным шагом в большинстве видеокодеков является трансформация кодирования, чаще всего дискретного космического преобразования (DCT). DCT преобразует блок значений пикселей (обычно 8x8 или 16x16) из пространственного домена в частотный домен. Проще говоря, он разбивает блок изображения на сумму косинусных функций на разных частотах. Низкочастотные компоненты представляют гладкие области блока, в то время как высокочастотные компоненты представляют собой края и мелкие детали. Ключевое понимание заключается в том, что человеческий глаз менее чувствителен к высокочастотным вариациям. После преобразования многие высокочастотные коэффициенты близки к нулю, что позволяет кодеру отбрасывать или сильно квантовать их с минимальным воздействием восприятия. Этот процесс является квинтэссенцией DSP-операции: он преобразует сигнал в представление, где сжатие становится гораздо более эффективным. Узнайте больше о дискретном космическом преобразовании .
Квантизация: снижение точности там, где это имеет наименьшее значение
После кодирования преобразования квантование является шагом, который вводит фактическую потерю данных. Квантизация снижает точность преобразованных коэффициентов, деля их на параметр квантования (QP) и округление до ближайшего целого числа. Большие значения QP приводят к более агрессивному квантованию, что означает, что больше коэффициентов становятся нулевыми, что приводит к более высокому сжатию, но также и к более низкому качеству. В современных кодеках, таких как H.265 / HEVC и AV1, квантование является адаптивным - оно может варьироваться в разных областях кадра на основе сложности и важности восприятия. Например, плоское синее небо может терпеть высокую квантованность, в то время как сложные текст или лица могут потребовать более тонкого квантования. Алгоритмы DSP контролируют эту адаптацию, балансируя битрейт и качество в реальном времени.
Оценка движения и компенсация: использование временной избыточности
Видео, в отличие от неподвижного изображения, демонстрирует сильную временную корреляцию между последовательными кадрами. Вместо того, чтобы кодировать каждый кадр независимо, современные кодеки используют оценку движения и компенсацию для прогнозирования текущего кадра из ранее закодированных кадров. DSP играет здесь критическую роль. Поиск кодера в пределах эталонного кадра для блока пикселей, который лучше всего соответствует блоку в текущем кадре (оценка движения). Этот поиск является вычислительно интенсивным - часто с использованием алгоритмов, таких как сопоставление блоков или более продвинутые методы оптического потока. Полученные векторы движения описывают смещение каждого блока. Затем кодер кодирует только разницу (остаток) между прогнозируемым блоком и фактическим блоком. Компенсация движения реконструирует прогнозируемый блок с использованием кодируемых векторов. Этот метод сам по себе может уменьшить данные на 50% или более по сравнению с внутрикадровым кодированием. По мере увеличения разрешений до 4K и 8K сложность оценки движения растет, требуя мощного оборудования DSP и эффективных алгоритмов.
Энтропийное кодирование: сжатие данных без потерь
После стадий потерь (трансформации и квантования) полученные данные — квантованные коэффициенты, векторы движения и данные управления — должны быть сжаты без потерь. Кодирование энтропии, такое как кодирование Хаффмана или контекстно-адаптивное бинарное арифметическое кодирование (CABAC), присваивает более короткие двоичные коды более часто встречающимся символам и более длинные коды менее частым. Принципы DSP используются для моделирования распределения вероятностей символов адаптивно на основе контекста (например, значения соседних блоков). CABAC, используемый в H.264 и более поздних стандартах, достигает отличной эффективности сжатия путем динамического обновления своих вероятностных моделей по мере кодирования каждого бита. Этот метод является прямым применением теории информации, ветви DSP.
Как DSP управляет основными стандартами сжатия
Каждый крупный стандарт сжатия видео представляет собой тщательную оптимизацию и интеграцию описанных выше методов DSP.Эволюция от H.264 до H.265, AV1 и VVC в значительной степени является историей более сложных алгоритмов DSP и более гибких структур кодирования.
H.264/AVC: основной пионер
Введенный в 2003 году H.264/AVC (Advanced Video Coding) остается одним из наиболее широко используемых стандартов. Его успех построен на усовершенствовании методов DSP по сравнению с более ранними кодеками, такими как MPEG-2. H.264 ввел переменные размеры блоков для компенсации движения (от 4x4 до 16x16), множественные опорные рамки и фильтр деблокировки в петле. Деблокирующий фильтр - это метод DSP, который сглаживает артефакты на границах блоков, улучшая субъективное качество. CABAC, сложная схема кодирования энтропии, также дебютировала в качестве опции. H.264 обычно достиг 50% снижения битрейта по сравнению с MPEG-2 для того же качества, благодаря этим улучшениям DSP.
H.265/HEVC: удвоение эффективности
Высокоэффективное кодирование видео (HEVC или H.265), стандартизированное в 2013 году, было направлено на снижение битрейта H.264 вдвое при сохранении эквивалентного качества. Это было достигнуто благодаря значительным инновациям DSP: более крупным единицам дерева кодирования (до 64x64), более направленным режимам внутрипредсказания (33 против 8), улучшенному прогнозированию вектора движения и фильтру с замещением с помощью выборки (SAO). Размеры блоков преобразования в HEVC могут быть до 32x32, что позволяет лучше сжимать контент с высоким разрешением. Вычислительная сложность кодирования в HEVC значительно выше, чем H.264, что отражает повышенную сложность его алгоритмов DSP. Подробнее о HEVC .
AV1: Контендер на открытый исходный код
Разработанный Альянсом за открытые медиа (AOMedia), AV1 представляет собой кодек без роялти, предназначенный для конкуренции с HEVC и превосходящий VVC по эффективности для использования в потоковой передаче. AV1 включает в себя широкий спектр передовых методов DSP, многие из которых заимствованы из более ранних запатентованных кодеков, таких как VP9 и Daala. Ключевые функции включают: рекурсивное разделение блоков (позволяющее асимметричные блоки), прогнозирование соединений (объединение двух эталонных блоков), синтез зерна пленки (повторное добавление шума в декодере для сохранения качества восприятия) и более 56 режимов внутри прогнозирования. Кодер AV1 чрезвычайно сложен - часто на порядки медленнее, чем HEVC - но его эффективность превосходна, как правило, соответствует или превышает HEVC. Использование DSP в AV1 очень гибко, что позволяет кодеру принимать множество небольших решений, которые в совокупности дают большой выигрыш. Узнайте больше об AV1 .
VVC (H.266): Следующее поколение
Стандарт Versatile Video Coding (VVC), завершенный в 2020 году, нацелен на снижение битрейта на 30-50% по сравнению с HEVC. VVC подталкивает DSP к новым крайностям: он поддерживает размеры блоков до 128x128, увеличенную гранулярность предсказаний и новые инструменты, такие как матричное внутри-прогнозное картирование (MIP) и отображение luma с масштабированием хрома (LMCS). Одной из заметных инноваций DSP является использование нескольких наборов преобразований (MTS), что позволяет кодеру выбирать среди различных типов преобразований (DCT, DST и т. Д.) для каждого блока, лучше адаптируясь к местной статистике сигналов. VVC предназначен для широкого спектра приложений, от потоковой передачи 8K до кодирования контента экрана, и его сложность DSP является самой высокой, но все же замеченной в стандартном кодеке.
Роль DSP в прогнозировании: внутри и внутри
Предсказание является сердцем сжатия видео, и методы DSP используются как в кадре (внутри-предсказание), так и между кадрами (интер-предсказание). Внутри-предсказание использует окружающие уже закодированные пиксели для прогнозирования текущего блока, с режимами направления, которые определяют углы кромки. Алгоритмы DSP вычисляют лучшее направление предсказания, анализируя градиент локальных пикселей. Интер-предсказание использует оценку движения, классическую проблему DSP, которая включает поиск совпадений в опорных кадрах. Современные кодеки используют оценку движения субпикселя (например, четвертьпиксель для H.264, восьмой пиксель для VVC) с использованием интерполяционных фильтров, разработанных с использованием теории обработки сигналов (например, конечные фильтры импульсного отклика). Эти фильтры имеют решающее значение для точной компенсации движения, особенно в быстро движущихся сценах.
Фильтры Loop: очистка артефактов с помощью DSP
После петли кодирования ядра используются встроенные фильтры для уменьшения артефактов, вызванных обработкой и квантованием на основе блоков. Разблокирующий фильтр сглаживает границы блоков, в то время как адаптивный смещенный фильтр (SAO) в HEVC и ограниченный фильтр с низким пропуском (CLPF) в AV1 основаны на DSP-методах, которые избирательно корректируют значения пикселей для уменьшения звонков и полос. Эти фильтры улучшают как объективные показатели, такие как PSNR, так и субъективное визуальное качество. В VVC адаптивный фильтр с циклом (ALF) использует фильтрацию Wiener - метод DSP для оптимального снижения шума - для минимизации средней квадратной ошибки между фильтрованным кадром и оригиналом. Использование расширенной конструкции фильтра DSP является отличительной чертой современных стандартов.
Оборудование: DSP процессоры и специализированные чипы
Вычислительные требования современного сжатия видео, особенно кодирования, огромны. Для кодирования видео 4K в режиме реального времени при высоком качестве часто требуется специализированное оборудование. Процессоры DSP, программируемые на полевых условиях массивы ворот (FPGA) и специализированные интегральные схемы (ASIC) предназначены для ускорения операций DSP, таких как DCT, оценка движения и кодирование энтропии. Многие потребительские устройства включают блок аппаратного видеокодера / декодера, который реализует тяжелую работу DSP в выделенных схемах, экономит мощность и обеспечивает производительность в реальном времени. Программное кодирование с использованием инструкций ЦП, таких как AVX Intel или NEON ARM, также использует концепции DSP, выполняя параллельные векторные операции. Взаимодействие между проектированием алгоритма и аппаратными возможностями является ключевым фактором прогресса в сжатии видео.
Будущие направления: машинное обучение и за его пределами
По мере приближения традиционных подходов к теоретическим пределам машинное обучение (ML) становится мощным инструментом для увеличения сжатия на основе DSP. Нейронные сети могут использоваться для таких задач, как адаптивное квантование, фильтрация в петле и даже сквозное сжатие. Например, Lyra от Google и другие аудиокодеки используют нейронные сети, и аналогичные идеи изучаются для видео. Оценка движения на основе ML и фильтры в петле показали значительные преимущества по сравнению с традиционными методами DSP. Однако интеграция ML в стандарты требует тщательного баланса сложности и совместимости. Следующее поколение кодеков может комбинировать классические преобразования DSP с изученными преобразованиями или вероятностными моделями. Кроме того, метрики качества восприятия, управляемые нейронными сетями (например, VMAF), сами являются приложениями DSP, которые влияют на решения кодирования. Метрика VMAF Netflix является ярким примером этой тенденции.
DSP как двигатель видеоинноваций
Цифровая обработка сигналов - это не просто дополнение к стандартам сжатия видео - это та самая ткань, из которой они сотканы. От базового DCT до адаптивных фильтров в VVC каждый прирост эффективности за последние два десятилетия был достигнут с помощью более сложных методов обработки сигналов. Поскольку разрешение видео и требования к битрейту продолжают взрываться с 8K HDR, VR и облачными играми, DSP останется критическим фактором. Будущее имеет захватывающую синергию между традиционным DSP и машинным обучением, обещая еще большую эффективность сжатия без ущерба для качества. Понимание DSP поэтому необходимо для всех, кто работает в видеотехнологиях, будь то разработка кодеков, создание потоковых трубопроводов или проектирование следующего поколения видеооборудования.