Обзор проблем внедрения аппаратного обеспечения для декодеров Ldpc в устройствах 5g
Понимание роли кодов LDPC в 5G NR
Коды с низкой плотностью проверки паритета (LDPC) были приняты в качестве схемы кодирования каналов данных в 5G New Radio (NR), заменив турбокоды, используемые в 4G LTE. Этот переход был обусловлен превосходной производительностью коррекции ошибок LDPC кодов при высоких скоростях кода и присущим им параллелизмом, который обеспечивает высокую пропускную способность декодирования - требование для расширенной мобильной широкополосной связи 5G (eMBB). Спецификация 3GPP (TS 38.212) определяет два базовых графика (BG1 и BG2), которые позволяют гибко сопоставлять скорость и поддерживать размеры транспортных блоков от нескольких сотен бит до десятков тысяч бит. В то время как теоретические преимущества очевидны, практическая реализация декодеров LDPC в пределах ограничений мощности, площади и задержки устройств 5G остается серьезной инженерной задачей.
Основные проблемы аппаратного обеспечения в реализации декодера LDPC
1. Сложность и использование ресурсов
Декодирование LDPC обычно выполняется с использованием итеративных алгоритмов передачи сообщений, чаще всего алгоритма распространения убеждений (BP). Каждая итерация требует обновления контрольных узлов (CN) и переменных узлов (VN) путем обмена вероятностными сообщениями по краям графа Таннера. Для декодера, поддерживающего квазициклические коды LDPC, используемые в 5G, количество краев может варьироваться от десятков тысяч до более миллиона для больших размеров блоков. Внедрение этих обновлений в аппаратное обеспечение требует значительных логических ресурсов: блоки чек-узлов (CNU), блоки переменных узлов (VNU), сети маршрутизации и банки памяти для хранения промежуточных сообщений. В ASIC физическая область, потребляемая этими компонентами, напрямую увеличивает стоимость кремния. Для мобильных устройств, где площадь гибки находится на уровне премиум, дизайнеры должны тщательно сбалансировать количество параллельных блоков обработки с требуемой пропускной способностью. Полностью параллельная архитектура предлагает максимальную скорость, но является запретительной для больших длин кода из-за перегруженности маршрутизации и взрыва области. Частично параллельные архитектуры, в то время
Другая проблема с ресурсами связана с точностью внутренних сообщений. Арифметика с плавающей точкой непрактична для аппаратного обеспечения с низким энергопотреблением; вместо этого распространены представления с фиксированной точкой с 4-8 битами на сообщение. Однако уменьшение битовой ширины усиливает ошибки квантования, потенциально ухудшая производительность коррекции ошибок. Моделирование необходимо для определения минимальной битовой ширины, которая соответствует целевой скорости блок-ошибки (BLER) в условиях канала 5G, добавляя другое измерение в пространство проектирования.
2. Потребление электроэнергии
Энергоэффективность, возможно, является наиболее важным ограничением для пользовательского оборудования 5G с батарейным питанием (UE). Декодеры LDPC по своей итерационной природе потребляют энергию, пропорциональную количеству итераций и активности переключения в процессорных блоках и памяти. Типичному декодеру может потребоваться 10-20 итераций для сходства при низких соотношениях сигнал-шум (SNR). Во время работы с пиковой пропускной способностью декодер может доминировать над бюджетом мощности процессора базовой полосы.
Динамическое рассеивание мощности преобладает доступами к памяти, поскольку сообщения читаются и пишутся в банки SRAM каждую итерацию. Снижение мощности памяти требует таких методов, как аббревиатура часов, подавление чтения / записи для ранних конвергентных контрольных узлов и многовольтовые библиотеки для ячеек с низким уровнем утечки. Мощность утечки, в то время как меньше на продвинутых узлах (7 нм и ниже), становится пропорционально более значительной в периоды простоя. Дизайнеры могут использовать аббревиатуру мощности для полного закрытия блоков декодера, когда они не используются, но задержка пробуждения должна быть приемлемой для бюджетов задержки 5G (около 1 мс время туда и обратно для URLLC).
Более того, сам алгоритм влияет на мощность. Алгоритм суммарного продукта (SPA) предлагает лучшую производительность, но включает в себя вычислительно дорогие гиперболические функции. Большинство аппаратных реализаций используют приближение min-sum (MS) или его варианты (зачет min-sum, нормализованная min-sum) для замены обновлений контрольных узлов более простыми операциями сравнения и выбора. Это снижает логическую сложность и динамическую мощность, хотя и за счет небольшого штрафа за производительность, который может быть компенсирован увеличением итераций или уточнения алгоритма.
3. Пропускная способность и задержка
5G NR нацелен на пиковые скорости передачи данных 20 Гбит/с для нисходящей линии связи и 10 Гбит/с для восходящей линии связи. Для достижения такой пропускной способности декодер LDPC должен обрабатывать новый блок кода каждые несколько сотен наносекунд. Задержка, особенно для сверхнадежных коммуникаций с низкой задержкой (URLLC), должна составлять порядка десятков микросекунд. Эти противоречивые требования - высокая пропускная способность с низкой задержкой - устанавливают строгие требования к архитектуре декодера.
Пропускная способность может быть увеличена обработкой нескольких итераций трубопроводным способом, но трубопроводная обработка вводит задержку, равную количеству этапов трубопровода, умножающему период времени. В полностью параллельных декодерах критический путь часто лежит в сети маршрутизации, соединяющей CNU и VNU. По мере роста размера кода длинные межсоединения вызывают задержки распространения сигнала, которые ограничивают тактовую частоту. Частично параллельные архитектуры уменьшают перегрузку маршрутизации за счет ресурсов обработки с временным многократным использованием, но это уменьшает мгновенную пропускную способность. Компромисс между параллелизмом и задержкой захватывается концепцией эффективного параллелизма: числом чековых узлов, обновляемых одновременно. Для кодов 5G LDPC с квазициклической структурой, поднимающий фактор Z определяет естественный параллелизм (обычно до 384 для BG1). Декодер, который обрабатывает узлы Z проверки за цикл, достигает максимальной пропускной способности, но требует Z CNU, который может быть запретительным для области.
4. Застой в памяти и маршрутизации
LDPC декодеры связаны с памятью. Каждая итерация требует хранения LLR канала, сообщений VN-to-CN, сообщений CN-to-VN, а иногда и апостериорных значений. Для кодового блока длины N = 26144 бит (максимум для BG1) и 8-битных сообщений, требование к памяти превышает 200 КБ на итерацию только для внутренних сообщений. Эта память обычно реализуется как несколько банков SRAM для обеспечения параллельного доступа. Однако нерегулярность матрицы проверки четности (хотя циклична для каждой подматрицы) создает сложные шаблоны доступа, которые могут вызывать банковские конфликты, уменьшая использование памяти и затягивая трубопровод. Кроме того, маршрутная сеть между блоками обработки и банками памяти - часто переключатель ствола или сеть Benes - потребляет значительную площадь и мощность. В продвинутых узлах CMOS задержка межсоединения доминирует на критическом пути, делая планирование пола и оптимизацию провода решающим.
5. Гибкость и многоступенчатая поддержка
5G-устройства должны поддерживать широкий диапазон скоростей кода (от 1/3 до 8/9) и размеров блоков через версии сопоставления скорости и избыточности (RV) для гибридного автоматического повторного запроса (HARQ). Аппаратное обеспечение декодера должно вмещать различные факторы подъема и базовые графики без существенной потери производительности. Перенастройка графика декодирования (слойный против затопленного) или количество итераций на лету также требуется для адаптации к различным условиям канала и требованиям качества обслуживания (QoS). Необходимость гибкости часто заставляет дизайнеров принимать частично параллельные архитектуры с программируемым хранилищем для матрицы проверки четности, что добавляет сложность и снижает максимальную тактовую частоту по сравнению с конструкцией с фиксированной функцией.
Стратегии преодоления проблем с оборудованием
1.Параллельные и пипелинированные архитектуры
Выбор графика декодирования оказывает глубокое влияние на эффективность аппаратного обеспечения. Затопленное обновление расписания одновременно обновляет все узлы проверки, максимизируя параллелизм, но требуя двойного буферизации сообщений и приводя к высокой пропускной способности памяти. Слоевая декодировка (также называемая последовательной или вертикальной шкалой) обрабатывает один ряд матрицы проверки четности за раз, позволяя немедленно повторно использовать обновленные сообщения и быстрее конвергенцию (обычно вдвое сокращая количество итераций). Это снижает как задержку, так и мощность, что делает многоуровневое декодирование чрезвычайно популярным в современных декодерах 5G.
Архитектурно степень параллелизма должна соответствовать структуре кода. Для квазициклических LDPC-кодов общий подход заключается в инстанцировании Z-процессорных блоков (CNU и VNU) и использовании сменной сети для выравнивания сообщений в соответствии с циклическими сдвигами, указанными в базовой матрице. Обрабатывая Z-слои параллельно (подблоковый параллелизм), декодер может приближаться к пропускной способности полностью параллельных конструкций при сохранении управляемой маршрутизации. Для более высокой пропускной способности несколько таких подблоковых процессоров могут работать на разных строках одновременно, за счет увеличения аппаратного обеспечения.
Пипелинирование в каждом блоке обработки также необходимо для закрытия времени. Например, CNU может иметь 3-ступенчатый конвейер: считывать сообщения, вычислять минимальные значения и записывать результаты. Глубина трубопровода должна учитываться в расписании, чтобы избежать опасностей данных. При многоуровневом декодировании обработка последовательных слоев может быть перекрыта, если структура памяти позволяет одновременно читать и писать по одному и тому же адресу - метод, известный как двойное буферирование или трубопроводное перемешивание .
2. Алгоритмическая и арифметическая оптимизация
Стандартна арифметика с фиксированной точкой, но важен тщательный выбор квантования. Многие конструкции используют 6-8 бит для LLR и 4-6 бит для внутренних сообщений. Алгоритм min-sum и его производные (зачет min-sum, нормализованная min-sum) почти универсальны из-за их низкой сложности. Например, смещенная min-sum вычитает небольшую константу (обычно 0,5 в фиксированной точке) из величины контрольного узла для компенсации переоценки. Нормализованная min-sum применяет масштабирующий фактор (например, 0,75). Эти алгоритмы могут быть реализованы с помощью простых компараторов, аддиторов и сдвигателей, избегая таблиц поиска, необходимых для SPA.
Методы раннего прекращения прекращают декодирование при обнаружении действительного кодового слова (с использованием проверки на синдром) или при сближении сообщений. Это снижает среднюю мощность и задержку, особенно при высоком SNR, где может быть достаточно только одной или двух итераций. Логика проверки на синдром должна быть тщательно интегрирована, чтобы избежать добавления длинного критического пути.
Другая оптимизация — использование подходов, основанных на самокорректировке или , основанных на надежности , которые подавляют ненадежные сообщения для улучшения конвергенции и уменьшения количества итераций. Эти методы добавляют незначительные аппаратные накладные расходы, но могут уменьшить требуемые итерации на 20-30%.
3. Методы управления электроэнергией
Динамическое напряжение и частотное масштабирование (DVFS) позволяет декодеру работать при более низком напряжении и тактовой частоте, когда устройство не находится в режиме пиковой пропускной способности, резко снижая динамическую мощность. Поскольку структура кадра 5G NR включает в себя слоты с различной скоростью передачи данных, декодер может быть введен в состояние малой мощности во время праздных символов. Силовое орнаментирование полностью выключает декодер, когда никакие блоки кода не декодируются, но задержка запуска должна быть скрыта планировщиком.
В декодере галочка часов применяется на уровне блока обработки: когда чековый узел или переменный узел завершает обновление, его часы могут быть отключены для остальной части итерации. Аналогично, банки памяти, к которым не осуществляется доступ, могут быть переведены в спящий режим через галочку удержания мощности. В продвинутых узлах галочка с мелкозернистой мощностью может уменьшить утечку на 90% в простаивающих областях.
4. повторное использование памяти и сжатие
Память является доминирующим фактором как в области, так и в мощности. Сжатие представления матрицы с проверкой четности может снизить требования к хранению. Для квазициклических кодов необходимо хранить только значения циклического сдвига, а не полную матрицу, сохраняя значительную область ПЗУ. Для сообщений с переменным узлом инкрементное квантование и дельта-хранилище могут уменьшить количество бит памяти на сообщение на 1-2 бита с незначительной потерей производительности.
Слоеный график декодирования по своей сути снижает требования к памяти, потому что только один уровень сообщений CN-to-VN должен храниться в любое время, в отличие от затопленного планирования, которое требует хранения для всех краев. В сочетании с обновлениями на месте памяти LLR, многоуровневые декодеры обычно нуждаются в памяти на 50% меньше, чем затопленные декодеры.
5. Реконфигурируемые и многорежимные конструкции
Для поддержки полного диапазона параметров кода 5G дизайнеры часто реализуют реконфигурируемую архитектуру, где выбор базового графа, коэффициент подъема и количество итераций программируются через регистры управления. Процессинговые блоки предназначены для обработки максимального размера подблока (Z = 384), а для меньших Z неиспользуемые блоки имеют силовую направленность. Сменная сеть, как правило, сдвигатель ствола или многоступенчатая сеть Бенеса, может быть сконфигурирована для соответствия циклическому шаблону сдвига на лету. Поддержка комбинирования HARQ требует хранения нескольких мягких битов на битовое положение; это может быть достигнуто путем расширения памяти LLR и записи комбинированных значений соответствующим образом.
Некоторые передовые конструкции включают в себя многорежимный декодер, который может обрабатывать как LDPC, так и полярные коды (используемые для каналов управления в 5G). Такое повторное использование арифметических блоков экономит площадь, но добавляет сложность в планировании и управлении. Для чувствительных к затратам UE-чипов такая интеграция становится обычным явлением.
Расширенные алгоритмы и их аппаратные последствия
В то время как стандартная мини-сумма адекватна для многих сценариев, исследователи продолжают разрабатывать улучшенные алгоритмы, которые предлагают лучшие компромиссы производительности-сложности. Многобитные смещенные схемы мини-суммы динамически корректируют смещение на основе условий канала, требуя небольшой таблицы поиска. Коэффициенты специфичной для уровня нормализации могут улучшить скорость конвергенции. Другим перспективным направлением является стохастическое декодирование , где сообщения представлены в виде битовых потоков. Стохастические декодеры LDPC имеют чрезвычайно низкую площадь на узел, но требуют длинных потоков для точного представления, ограничивая пропускную способность. Они в основном исследуются для коротких кодов.
Аппаратные реализации этих алгоритмов должны быть тщательно оценены для критического пути и мощности. Например, добавление множителя для масштабирования в нормализованной мин-сумме может удвоить площадь CNU по сравнению с простым блоком мин-суммы. Преимущества в сокращении итерации должны перевешивать стоимость оборудования. Многие коммерческие проекты придерживаются смещенной мин-суммы из-за ее благоприятного компромисса.
Будущие тренды и 5G
По мере того, как 3GPP развивается в направлении 5G-Advanced и 6G, требования к декодерам LDPC будут увеличиваться. Более высокие полосы пропускания (mmWave, sub-THz) и новые варианты использования, такие как интегрированное зондирование и связь, потребуют декодеров с пропускной способностью, превышающей 100 Гбит/с. Достижение таких скоростей, вероятно, подтолкнет полностью параллельные архитектуры для небольших кодов и высоко трубопроводных многоуровневых архитектур для более крупных кодов. Расшифровка с помощью ИИ - использование нейронных сетей для прогнозирования раннего прекращения или оптимизации масштабирования сообщений - является активной областью исследований, хотя аппаратно эффективные механизмы вывода остаются сложными для мобильных устройств.
Еще одна тенденция - использование высокоавтоматизированных проектных потоков: высокоуровневый синтез (HLS) из моделей C++ позволяет быстрее исследовать архитектурные компромиссы. Однако ручная оптимизация RTL по-прежнему доминирует в производственных проектах для максимальной эффективности. Можно ожидать большей интеграции специализированных декодерных IP-ядер LDPC с подсистемами мягких процессоров для гибкости.
Наконец, внедрение кодов LDPC за пределами 5G, таких как спутниковая связь и сети дальнего космоса, будет продолжать стимулировать инновации в реализации декодеров с низкой мощностью и высокой пропускной способностью.
Заключение
Внедрение декодеров LDPC для устройств 5G является многогранной задачей, которая требует тщательного совместного проектирования алгоритмов и аппаратного обеспечения. Сложность, мощность, пропускная способность, память и гибкость взаимодействуют в ограниченном пространстве проектирования. Благодаря использованию многоуровневого декодирования, оптимизированной арифметики, передового управления мощностью и реконфигурируемых паттернов данных инженеры разработали декодеры, которые отвечают амбициозным целям 5G NR. По мере развития беспроводных систем уроки, извлеченные из этих реализаций, будут информировать следующее поколение аппаратных средств коррекции ошибок, обеспечивая надежную и эффективную связь во все более связанном мире.
Для дальнейшего чтения по стандарту 5G NR LDPC обратитесь к спецификации 3GPP TS 38.212. Подробное исследование архитектуры декодера LDPC можно найти в этой статье IEEE. Пример многоуровневого декодера с низким энергопотреблением представлен в этой работе по 28 нм CMOS.