Введение в коды LDPC и энергоэффективность мобильных устройств

Коды с низкой плотностью проверки паритета (LDPC) стали краеугольным камнем современных стандартов беспроводной связи, включая 5G New Radio, Wi-Fi 6/6E и DVB-S2X, из-за их почти предельных характеристик коррекции ошибок. В мобильных устройствах, где время автономной работы и тепловое рассеивание являются критическими ограничениями, энергия, потребляемая декодером LDPC, может представлять значительную часть вычислительной мощности базовой полосы. Поскольку скорость передачи данных возрастает до нескольких Гбит/с, а устройства сокращаются в форм-факторе, оценка и оптимизация энергоэффективности алгоритмов декодирования LDPC больше не является опциональной - это необходимое условие для обеспечения адаптивного, длительного мобильного опыта.

Основная проблема заключается в компромиссе между точностью декодирования и вычислительными усилиями. Более мощные алгоритмы, такие как алгоритм Sum-Product Algorithm (SPA), обеспечивают отличную производительность с битовой скоростью ошибки (BER), но требуют интенсивных операций с плавающей запятой, в то время как более простые варианты, такие как алгоритм Min-Sum (MSA), обмениваются некоторыми возможностями коррекции ошибок для более низкой сложности и более низкого энергопотребления. В этой статье рассматриваются ключевые алгоритмы, анализируются факторы, которые стимулируют использование энергии в мобильных декодерах, и представлен ряд стратегий - от архитектурных решений до адаптивных циклов управления - которые помогают дизайнерам достичь оптимального баланса для сред с ограниченными батареями.

Справочная информация: коды LDPC и их роль в мобильной связи

Коды LDPC были впервые введены Робертом Галлагером в его диссертации 1960 года, но были в значительной степени забыты до их повторного открытия в середине 1990-х годов. Сегодня они повсеместно используются в высокопроизводительных беспроводных системах. В 5G NR коды LDPC используются для канала передачи данных (PDSCH и PUSCH), потому что они могут обрабатывать большие блоки кода и высокие скорости кода, требуемые расширенной мобильной широкополосной связью (eMBB). Работа декодера заключается в итеративном обмене сообщениями между переменными узлами и контрольными узлами вдоль графика Таннера кода; каждая итерация уточняет оценки надежности передаваемых битов.

Мобильные устройства выполняют эти итерации на интегральных схемах с ограниченным энергопотреблением (ASIC) или цифровых сигнальных процессорах (DSP). Количество итераций, точность сообщений и схема планирования напрямую влияют на потребление энергии. Типичный декодер LDPC в смартфоне может потреблять от десятков до сотен милливатт во время активного приема данных и при интенсивном трафике, который может доминировать в энергетическом бюджете базовой полосы. Следовательно, выбор алгоритма декодирования и методов реализации, которые его сопровождают, становится параметром проектирования первого порядка для архитектора системы на чипе (SoC).

LDPC расшифровывает алгоритмы в деталях

Алгоритм Sum-Product (SPA)

Алгоритм Sum-Product — это канонический декодер распространения убеждений с полной сложностью. Он вычисляет соотношения логарифмической вероятности (LLR) с использованием гиперболических тангенсных функций и умножений, выполняя точный вывод на факторном графе кода. В то время как SPA достигает наилучшей возможной производительности BER для данной структуры кода, его вычислительная стоимость высока: каждое обновление контрольного узла требует оценки трансцендентных функций, а обновления переменного узла включают в себя множество дополнений и умножений. В аппаратном обеспечении реализация этих операций с достаточным динамическим диапазоном требует либо блоков с плавающей запятой, либо тщательно масштабируемых представлений с фиксированной запятой, оба из которых потребляют значительную площадь и мощность утечки.

Алгоритм Мин-Сум (MSA)

Алгоритм Min-Sum упрощает обновление контрольного узла, заменяя точную формулу сумма-продукт на мини-операцию. В частности, величина чек-переменного сообщения аппроксимируется как минимум входящих переменных-проверочных величин, а знак является продуктом знаков входящих сообщений. Это устраняет все тригонометрические или логарифмические вычисления, уменьшая критический путь и позволяя более простое, более низкое оборудование. Штраф представляет собой систематическую переоценку выходных величин контрольного узла, которая ухудшает кривую BER на 0,2-0,5 дБ для типичных скоростей кода. Многочисленные уточнения, такие как нормализованный алгоритм Min-Sum (NMSA) и алгоритм Offset Min-Sum (OMSA), включают коэффициент масштабирования или смещения, чтобы компенсировать эту переоценку, тем самым восстанавливая большую часть потери производительности, все еще будучи намного дешевле, чем SPA.

Слоеный (заглушенный) график

Вместо того, чтобы обновлять все переменные узлы одновременно (затопленное планирование), слоистые процессы планирования проверяют узлы последовательно, используя самые последние сообщения немедленно. Это ускоряет конвергенцию, позволяя декодеру достигать того же BER с 30-50% меньшими итерациями. Поскольку масштабы потребления энергии почти линейно с подсчетом итераций, слоистые или перетасовочные графики обеспечивают прямой прирост эффективности. Многие коммерческие декодеры мобильных чипсетов принимают слоистый вариант MSA в качестве базового.

Другие вариации и гибридные подходы

Исследователи также исследовали стохастическое декодирование, где сообщения представлены в виде случайных битовых потоков, и аналоговые итеративные декодеры, которые работают непосредственно на непрерывных напряжениях. Пока перспективные для сетей датчиков сверхнизкой мощности, эти подходы еще не достигли производственной зрелости, необходимой для мобильных устройств. Более практичным гибридом является адаптивный алгоритм: декодер, который начинается с МСА низкой сложности для ранних итераций и переключается на SPA (или усиленный МСА) только тогда, когда декодер изо всех сил пытается сблизиться. Такие схемы могут сэкономить 15-30% энергии без заметной потери пропускной способности.

Факторы, влияющие на потребление энергии в мобильных декодерах LDPC

На энергопотребление декодера LDPC влияет комбинация решений алгоритма, архитектуры и уровня схемы. Понимание этих факторов помогает дизайнерам предсказать, какая оптимизация даст наибольшее влияние.

  1. Подсчет итерации и раннее прекращение: Количество итераций декодирования непосредственно умножает энергию на блок кода. Методы раннего прекращения — остановка при обнаружении действительного кодового слова (удовлетворение всех проверок четности) — могут уменьшить среднее количество итераций до 40% при умеренных соотношениях сигнал-шум (SNR).
  2. Квантирование сообщений и длина слова:] Реализации с фиксированной точкой должны выбирать количество битов, используемых для представления каждого сообщения LLR. Меньше битов уменьшают размер памяти и энергию чтения / записи, но могут ухудшать BER. Типичный мобильный декодер использует от 4 до 8 бит для сообщений с переменной проверкой; тщательные исследования квантования показывают, что 6 бит часто обеспечивают почти ту же производительность, что и плавающая точка, при этом уменьшая мощность памяти примерно на 30%.
  3. Проверить сложность обработки узлов: Как описано выше, мин-приближение в MSA потребляет гораздо меньше логики, чем операции SPA на основе танха. В реализации CMOS на 28 нм одно исследование показало, что блок контрольного узла для SPA занимает примерно 3,5× площадь и 4× динамическую мощность соответствующего блока MSA.
  4. Межсоединения и доступ к памяти:] Декодеры LDPC очень параллельны; перемежающаяся сеть, которая маршрутизирует сообщения между переменными узлами и контрольными узлами, может способствовать до 30% общей энергии декодера. Эффективные топологии связи, такие как полностью параллельные или частично параллельные (рядовые-параллельные) архитектуры, торговая зона для энергии. В мобильных проектах частично параллельные архитектуры с банками SRAM на чипе являются нормой, и снижение количества считываний памяти на итерацию является ключевой оптимизацией.
  5. Часовое и силовое оборудование: Поскольку разрывы данных в мобильных сетях являются прерывистыми, декодер часто простаивает. Расширенное время ожидания, питание и динамическое напряжение-частотное масштабирование (DVFS) могут уменьшить статическую (утечку) мощность во время холостых сущностей. Адаптивный контроллер напряжения, который регулирует напряжение питания декодера на основе требуемой пропускной способности, может сэкономить 10-20% от общей энергии в типичных случаях использования.

Сравнительный анализ: торговля энергией и производительностью

Многочисленные академические и промышленные исследования количественно оценили компромиссы. Для обычного кода LDPC с частотой 1/2, длиной 1024 (3,6) SPA обычно требует около 15-18 полных итераций для достижения BER 10 -5 при Eb/N0 2.0 дБ. MSA с тем же количеством итераций дает BER примерно 10 -4 — полом ошибок, который часто неприемлем для мобильных каналов передачи данных. Однако нормализованный MSA (с коэффициентом масштабирования ~ 0,75) восстанавливается до 0,1 дБ SPA, в то время как энергия контрольного узла на итерацию еще больше уменьшает итерации почти наполовину, что означает, что общая энергия на декодированный блок может быть на 40-60% ниже для слоистого NMSA по сравнению с затопленным SPA.

В реальном мире мобильный тестовый чип, опубликованный на IEEE International Solid-State Circuits Conference (ISSCC) 2020 года, 12-нм декодер FinFET LDPC, поддерживающий 5G NR, достиг 8,1 pJ / бит при 2,4 Гбит с использованием многослойного алгоритма с минимальной суммой с 6-битным квантованием. В аналогичных условиях сопоставимый декодер на основе SPA сообщил о ранее потребляемом 14,5 pJ / бит - 44% улучшение. Площадь также сократилась примерно на 35%.

Внешние ссылки:
IEEE ISSCC 2020: 12-нм 2,4 Гбит/с 8,1pJ/бит LDPC Декодер для 5G NR
Сравнение алгоритмов Min-Sum и Sum-Product для LDPC Декодирование в энергосдержанных системах

Стратегии для максимизации энергоэффективности в мобильных декодерах

Оптимизация уровня алгоритма

  • Выборочное использование масштабирования/вычета: Реализация нормализованной или смещенной коррекции с минимальной суммой добавляет незначительные вычислительные накладные расходы при восстановлении 0,2-0,3 дБ SNR. Это часто позволяет декодеру работать с одной меньшей итерацией, непосредственно экономя энергию.
  • Раннее прекращение и адаптивная итерация: Используйте правило остановки, основанное на сумме четности чек-узла. Как только все строки удовлетворены, декодирование немедленно прекращается. Для типичных условий сотового канала это уменьшает среднее количество итераций на 25-40%.
  • Структуры узлов с низкой сложностью: Использование того факта, что обновление с минимальной суммой требует только двух наименьших входных величин (и их индексов), позволяет очень компактное дерево компараторов, сводя к минимуму активность переключения.

Техники архитектуры Hardware

  • Минимизация памяти: Использование однопортовой SRAM вместо двухпортовой, а также совместное использование памяти между переменными узлами и контрольными узлами, уменьшает площадь и утечку. Многоуровневый график по своей сути требует меньше памяти, поскольку промежуточные сообщения могут храниться в регистровых файлах.
  • Обмен процессорами (PE): Один ПЭ может быть умножен на несколько контрольных узлов в частично параллельной архитектуре. Это уменьшает площадь кремния и, следовательно, статическую мощность, хотя и за счет пропускной способности. Для мобильных устройств, где пиковая пропускная способность необходима только для коротких всплесков, такой обмен является энергоположительным в целом.
  • Масштабирование напряжения и адаптивное наведение часов:] Когда условия канала хорошие (высокий SNR), декодер может выдерживать меньше итераций и более низкую точность. Динамичное снижение напряжения или частоты в соответствии с SNR-зависимой рабочей нагрузкой может уменьшить энергию сверх того, что обеспечивает точка фиксированной работы. Это иногда называют «почти пороговыми вычислениями» для базовой полосы.

Интеграция системного уровня

  • Совместный дизайн с оценкой канала: Подача метрики надежности (например, коэффициента ошибки модуляции) вперед к декодеру позволяет декодеру предварительно выбрать подходящий вариант точности или алгоритма.Когда канал чист, достаточно быстрой мини-суммы с 4-битным квантованием; когда шумно, декодер может вернуться в более точный режим.
  • Стандартные оптимизации: 5G NR использует сопоставление скорости, которое может быть использовано. Декодер может пропустить обработку проколотых или укороченных битов, которые всегда равны нулю-LLR, уменьшая эффективный размер блока кода и, следовательно, количество операций.

Тематические исследования: Энергоэффективность в современном 5G модеме

Рассмотрим флагманский модем смартфона 5G, работающий на носителе среднего диапазона (100 МГц, 64-QAM, скорость кода 0,8). Требование пиковой скорости передачи данных составляет около 2 Гбит / с. На физическом уровне декодирование LDPC составляет примерно 25-30% от общей энергии базовой полосы во время устойчивой загрузки. Используя слоистый NMSA с 6-битным квантованием и ранним завершением, декодер потребляет примерно 7 пДж / бит. Для потока 2 Гбит / с. Для стандартного затопленного SPA потребуется около 25 мВт при тех же условиях. Разница в 11 мВт, накопленная за 2-часовой сеанс потоковой передачи YouTube, экономит почти 80 мВтч емкости батареи - продлевая опыт пользователя на 5-8% во время воспроизведения видео. В сочетании с DVFS и питанием (что сокращает резервную мощность от 2 мВт до 20 мкВт во время коротких интервалов ожидания между подкадрами), общая энергия декодера может быть уменьшена вдвое по сравнению с неоптимизированным дизайном.

Внешняя ссылка:
Декодер 5G NR LDPC с адаптивным ранним завершением и масштабированием напряжения в 7 нм

Будущие направления и открытые проблемы

Поскольку 3GPP работает в направлении 5G Advanced и 6G, возникнут новые проблемы. Ультранадежные коммуникации с низкой задержкой (URLLC) требуют декодеров, которые работают с очень низкими скоростями ошибок блока со строгими бюджетами задержки, что может подтолкнуть дизайнеров к более сложным алгоритмам только для достижения целей надежности. Между тем, интеграция декодирования на основе ИИ - распространение убеждений с помощью нейронной сети - является активной областью исследований. Эти «обученные» декодеры могут сокращать итерации дальше, но их энергетический профиль сильно зависит от аппаратного ускорителя вывода. Для мобильных чипсетов небольшой нейронный двигатель (например, систолический массив) может добавить значительную площадь и мощность, поэтому точка безубыточности все еще изучается.

Еще одним перспективным направлением является использование динамического квантования, где битовая ширина сообщений адаптируется при декодировании итераций. Ранние результаты показывают, что снижение точности в более поздних итерациях (когда LLR имеют большую величину) экономит 10-15% мощности памяти без потери производительности.

В конечном счете, наиболее энергоэффективным декодером LDPC для мобильных устройств будет тот, который будет кооптимизирован по алгоритму, архитектуре и технологии - сочетая многоуровневую мини-сумму с адаптивной итерацией, точным масштабированием и агрессивным управлением мощностью. Промышленность неуклонно движется в этом направлении, и мы можем ожидать, что будущие модемы будут декодировать при скорости ниже 5 pJ / бит, обеспечивая скорость 6G в несколько Гбит / с без разрядки батареи.

Заключение

Энергоэффективность в декодировании LDPC является многомерной проблемой оптимизации. Выбор алгоритма - сумма продукта против суммы и его производных - устанавливает базовый уровень, но наибольшие выгоды приходят от объединения упрощений алгоритма с аппаратными средствами - программными методами, такими как многоуровневое планирование, раннее завершение, тщательное квантование, адаптивное масштабирование напряжения и определение мощности. Для производителей мобильных устройств, инвестируя в оптимизированный дизайн декодера LDPC, выплачивает дивиденды в течение длительного времени автономной работы, более прохладную работу и способность доставлять все более высокие скорости передачи данных, не достигая теплового потолка. По мере развития стандартов принципы, изложенные здесь - всегда ищут компромиссы с точностью передачи энергии, которые соответствуют мгновенным требованиям к каналу и пропускной способности - останутся центральными для проектирования энергосберегающих систем беспроводной связи.

Внешние ссылки:
3GPP 5G System Overview
Обзор архитектуры декодера LDPC для 5G и за его пределами