Микропроцессоры в процессорах цифровых сигналов для сетей 5g и за их пределами
Неустанный спрос на более высокую пропускную способность данных, сверхнадежную связь с низкой задержкой и массовое подключение к устройствам позиционировал сети пятого поколения (5G) как основу современной цифровой инфраструктуры. В основе каждой базовой станции 5G лежит сложное цифровое сигнальное устройство (DSP), производительность которого тесно связана с микропроцессорным ядром, которое его управляет. Микропроцессор в 5G DSP - это не просто процессор общего назначения; это специально построенный вычислительный движок, оптимизированный для математической интенсивности, ограничений в реальном времени и энергетических бюджетов беспроводной связи. Понимание архитектуры, критических функций и эволюционной траектории этих микропроцессоров имеет важное значение для понимания того, как 5G - и сети, которые следуют - будут выполнять свои обещания почти мгновенной, высокопроизводительной связи.
Основная роль микропроцессоров в DSP для беспроводных устройств
Цифровые сигнальные процессоры представляют собой специализированные микроархитектуры, предназначенные для выполнения алгоритмов обработки сигналов — фильтров с конечным импульсным откликом (FIR), быстрых преобразований Фурье (FFT), выравнивания, оценки канала и коррекции ошибок — с высокой скоростью и с детерминированным временем. Микропроцессор внутри DSP организует эти операции, управляя потоком команд, движением данных и доступом к памяти. В контексте 5G, где субмиллисекундная задержка и скорость передачи данных в гига-образце на секунду являются нормой, микропроцессор должен делать гораздо больше, чем запускать однопоточную программу. Он должен обрабатывать массово параллельные векторные операции, поддерживать несколько одновременных потоков данных и адаптироваться к динамическим условиям канала в реальном времени.
В отличие от процессора общего назначения, который отдает приоритет прогнозированию ветвей и выполнению не по порядку для улучшения однопоточной производительности, микропроцессор DSP подчеркивает многократную накопленную (MAC) пропускную способность, накладные расходы с низким контуром и поддержку аппаратного контура. Он часто имеет архитектуру Гарварда с отдельными инструкциями и памятью данных, множеством банков памяти для обеспечения одновременного доступа и выделенными блоками генерации адресов для снижения накладных расходов на арифметику указателей. Эти характеристики позволяют DSP поддерживать высокую вычислительную нагрузку, которую требует обработка сигналов 5G, такая как демодулирование ортогонального частотного деления (OFDM) и массивное формирование луча MIMO.
Почему DSP-микропроцессоры незаменимы для 5G
Спецификации 5G New Radio (NR) определяют физический слой, который намного сложнее, чем 4G LTE. Нумерологическая гибкость, масштабируемый интервал поднесущей и динамическое дуплексирование времени-дивизиона предъявляют строгие требования к конвейеру обработки. Базовой станции 5G может потребоваться обрабатывать 64 или более потоков антенны одновременно (массивный MIMO), каждый со своей собственной оценкой канала и коэффициентами формирования луча. Микропроцессор внутри DSP должен координировать эти параллельные задачи без введения дисперсии задержки. Кроме того, переход к более высоким частотам несущей - миллиметровым диапазонам волн (24-52 ГГц) - увеличивает частоту выборки и вводит новые проблемы в аналого-цифровом преобразовании и управлении помехами, дополнительно подчеркивая вычислительные возможности DSP.
В пользовательском оборудовании энергоэффективность имеет первостепенное значение. Смартфон DSP должен обрабатывать сигналы 5G, рассеивая при этом всего несколько сотен милливатт. Архитектура микропроцессора — конструкция набора инструкций, глубина трубопровода, время ожидания и иерархия памяти — непосредственно определяет энергию на операцию. Поэтому выбор ядра микропроцессора в DSP является критическим инженерным компромиссом между пиковой производительностью, с одной стороны, и площадью и мощностью, с другой.
Архитектурные инновации в микропроцессорах 5G DSP
Для удовлетворения противоречивых требований к производительности, гибкости и эффективности производители полупроводников разработали несколько архитектурных инноваций. Они выходят за рамки классического одноядерного DSP с фиксированной точкой для включения гетерогенных многоядерных конструкций, аппаратных ускорителей и расширенных расширений набора инструкций. В следующих подразделах подробно описаны наиболее влиятельные тенденции.
VLIW и SIMD: рабочие лошадки параллельной обработки сигналов
Архитектура Very Long Instruction Word (VLIW) доминирует в современных DSP-микропроцессорах для 5G. В VLIW компилятор статически запланировал несколько операций (например, умножить, добавить, загрузить, хранить) в одно длинное слово инструкции, позволяя нескольким функциональным блокам выполнять одновременно без накладных расходов на аппаратное обеспечение динамического планирования. Такие компании, как Texas Instruments (TI) и NXP Semiconductors уже давно используют VLIW в своих семействах C6000 и StarCore DSP соответственно. Для 5G ядра VLIW достигают десятков тысяч операций MAC за цикл на тактовых частотах 1–2 ГГц.
Дополнение VLIW - это обработка единой инструкции, множественных данных (SIMD). SIMD позволяет микропроцессору применять одну и ту же арифметическую операцию к нескольким элементам данных - например, выполнять 16 параллельных умножений на 16-битных данных с фиксированной точкой. Алгоритмы 5G по своей сути векторизуемы: коэффициенты формирования луча, матрицы каналов и бабочки FFT - все это выгодно для SIMD. Современные микропроцессоры DSP интегрируют пути передачи данных SIMD 512 бит или более, обеспечивая пропускную способность, которая потребует процессора общего назначения, многократно превышающего тактовую частоту для эмуляции.
Комбинация VLIW и SIMD дает микропроцессор, который может поддерживать высокую долю своей теоретической пиковой производительности на реальных ядрах обработки сигналов, избегая холостых циклов, которые преследуют суперскалярные процессоры, когда поток управления предсказуем. Однако компилятор должен быть исключительно умным для эффективной упаковки операций; это привело к значительным инвестициям в ретаргетинговые цепочки компиляции и фреймворки с открытым исходным кодом, такие как LLVM для целей DSP.
Многоядерные и гетерогенные вычисления
Ни одно ядро микропроцессора не может эффективно покрыть все этапы обработки 5G. Обработка базового диапазона обычно разделяется на плоскость управления (медленная, ориентированная на управление) и плоскость данных (высокоскоростная потоковая передача). Для решения этой проблемы ведущие конструкции используют гетерогенные многоядерные архитектуры. Например, модемы Qualcomm Snapdragon X60 и X65 интегрируют несколько пользовательских ядер DSP (таких как семейство Qualcomm Hexagon) вместе с ядрами приложений ARM Cortex-A и специализированными аппаратными ускорителями для таких функций, как декодирование каналов и преобразование Fast Fourier.
Для инфраструктурного оборудования тенденция направлена на многоядерные кластеры DSP. Семейство NXP Layerscape, например, объединяет ядра приложений Arm Cortex-A72 с многопоточными ядрами DSP (например, SC3900FP) для обработки как стека протоколов, так и физического слоя. FPGA от Xilinx (теперь AMD) и Altera (Intel) также встраивают закаленные блоки DSP, которые включают блоки MAC и небольшие локальные воспоминания, размывая грань между микропроцессором и перенастраиваемой логикой. В этой гетерогенной модели микропроцессор DSP координирует поток: он извлекает задачи из планировщика, отправляет их на аппаратные ускорители и результаты постпроцессов. Это разделение труда снижает энергопотребление на 20-40% по сравнению с монолитным подходом.
Иерархия памяти и движение данных
Микропроцессоры 5G DSP предъявляют чрезвычайные требования к пропускной способности памяти. Несущая 64-антенна 100 МГц с интервалом поднесущей 30 кГц может генерировать несколько гигабит в секунду образцов базовой полосы. Традиционные кэши неэффективны, потому что доступ к обработке сигналов часто потоковый и не имеет временного повторного использования. Поэтому многие микропроцессоры DSP используют память на царапинах (на чипе SRAM), к которой можно получить доступ в одном цикле, в сочетании с двигателями прямого доступа к памяти (DMA), которые перемещают данные между основной памятью и локальными буферами, в то время как ядро вычисляет. Семейство Intel Agilex FPGA, например, включает в себя выделенный векторный процессор с 512-битным SIMD-каналом и многобанковской локальной системой памяти, которая может доставлять 3 ТБ / с внутренней полосы пропускания - необходимость для массивной MIMO в реальном времени.
Ключевые параметры эффективности и их измерение
Оценка пригодности микропроцессора DSP для 5G включает в себя несколько показателей, выходящих за рамки сырой тактовой частоты. Наиболее важными являются мультиаккумулируемая пропускная способность, задержка на алгоритм, рассеивание мощности и эффективность области (операции на мм2). Стандартные эталоны, такие как BDTI DSP Kernel Benchmarks или EEMBC CoreMark-NN для нейронных сетей, помогают сравнивать ядра между поставщиками. Однако для 5G-специфических рабочих нагрузок, таких как оценка канала 5G NR, полярное декодирование и миллиметровое лучевое сканирование, требуется более целенаправленный анализ. Например, микропроцессор, который может выполнять 64-точечный FFT менее чем за 500 наносекунд, часто требуется для демодуляции OFDM в реальном времени на расстоянии поднесущей 120 кГц.
Низкозадержанный дизайн
5G накладывает на узкую плоскость задержки 1 мс для сверхнадежных коммуникаций с низкой задержкой (URLLC). Это заставляет микропроцессор DSP минимизировать задержку прерывания, поддерживать детерминированное время выполнения и поддерживать аппаратное разматывание петли, чтобы избежать протекания трубопровода. Многие микроархитектуры DSP предлагают механизм нулевой накладной петли: процессор может выполнять последовательность с известным количеством итераций без многократного извлечения инструкции цикла, сохраняя как циклы, так и мощность. Кроме того, поддержка отмены хвоста и раннего прекращения в декодировании итераций уменьшает задержку в худшем случае. Например, подсистема Qualcomm FastConnect 6900 использует выделенный микропроцессор DSP, который может переключаться между задачами обработки менее чем за 100 циклов, что позволяет ему соответствовать строгим требованиям 3GPP для обработки HARQ в реальном времени (гибридный автоматический повторный запрос).
Энергоэффективность и термоменеджмент
Энергоэффективность является основным ограничением проектирования для DSP пользовательского оборудования. Мобильная промышленность сблизилась на пикожоуле за MAC (pJ/MAC) показатель заслуг. Современные 5G DSP микропроцессоры достигают близкого к 1 pJ/MAC на продвинутых 5 нм или 3 нм FinFET процессов, благодаря агрессивному масштабированию напряжения, мелкозернистому часовому стилю и снижению активности переключения сигналов через операндовую изоляцию. Такие методы, как динамическое напряжение и частотное масштабирование (DVFS) позволяют микропроцессору регулировать свою рабочую точку на основе мгновенной нагрузки трафика. В типичном 5G смартфоне ядро DSP базовой полосы проводит большую часть своего времени в состоянии низкой мощности, бодрствуя только когда приходит подкадр. Этот шаблон, в сочетании с тирадированием мощности для простаивающих ядер, помогает сохранить среднюю мощность ниже 500 мВт даже во время передачи данных с высокой пропускной способностью.
Для инфраструктуры, где рассеивание тепла менее ограничено, фокус смещается в сторону эффективности площади. Массивные блоки базовой полосы MIMO требуют сотни ядер DSP на одном чипе или нескольких чипах. Возможность интеграции микропроцессоров DSP вместе с памятью и ускорителями на одном и том же кристалле - через передовую упаковку, такую как 3D-укладка или технология интерпозитора - снижает мощность и задержку соединения. Например, AirEngine 8760 Huawei использует пользовательский процессор базовой полосы, который складывается ядра DSP и плитки SRAM с использованием процесса гибридной связи, достигая рекордных 12 ТОП/Вт на уровне блока.
Интеграция ИИ и машинного обучения
3GPP Release 18 и далее вводят поддержку AI/ML непосредственно в стандартизацию воздушного интерфейса 5G. Микропроцессоры DSP теперь должны вместить модели вывода нейронной сети для таких задач, как сжатие информации о состоянии канала (CSI), классификация автоматической модуляции и управление лучом. Это требует перехода от чисто фиксированной арифметики к поддержке операций с плавающей точкой (обычно BF16 или FP16) и целочисленных тензоров. Многие поставщики DSP расширили свои наборы инструкций с помощью инструкций с умножением матриц (например, C7000 TI с точечными продуктами и матричными операциями). Технология Helium Arm для Cortex-M55 и M85 обеспечивает векторный движок SIMD для DSP и ML, но для высокого класса 5G пользовательские нейронные ускорители часто объединяются с основным ядром DSP.
Нарождающаяся тенденция - это "вычисления в памяти", где микропроцессор DSP использует архитектуру обработки в памяти (PIM) для уменьшения движения данных. Память Samsung HBM-PIM интегрирует процессорные блоки в слой памяти, позволяя вычислять продукты вектора матрицы непосредственно там, где находятся данные. Это может сократить энергию вывода нейронной сети в 5G-формировании луча на 5 × по сравнению с традиционными архитектурами фон Неймана. По мере развития исследований 6G, вероятно, граница между микропроцессором, ускорителем и памятью будет продолжать размываться.
За пределами 5G: 6G, mmWave и Terahertz
Дорожная карта сетей следующего поколения (6G, ожидаемая около 2030 года) предусматривает частоты Terahertz (THz), субмиллиметровые длины волн и скорости передачи данных, превышающие 100 Гбит/с. Микропроцессор в DSP столкнется с беспрецедентными скоростями отбора проб (> 100 ГС/с) и полосами пропускания (> 10 ГГц). Традиционные цепочки ADC и DSP не могут масштабироваться линейно; вместо этого отрасль исследует гибридные аналоговые цифровые архитектуры, где простая аналоговая обработка снижает нагрузку на цифровое ядро. Микропроцессору DSP необходимо будет поддерживать восстановление скудных сигналов, неравномерную выборку и передовые алгоритмы выравнивания, которые являются вычислительно тяжелыми - часто требующими сложности O(n log n) на итерацию.
Для достижения этих целей новые микропроцессоры DSP разрабатываются с использованием почти пороговых вычислений (NTC) для работы при сверхнизких напряжениях при использовании параллелизма. Исследовательские прототипы из Центра беспроводных исследований Беркли продемонстрировали 16-ядерный кластер DSP, способный работать со скоростью 1 ТОП при 0,5 В с использованием технологии 7 нм. Кроме того, исследуются перенастраиваемые векторные процессоры, которые могут динамически изменять ширину своего канала передачи данных (например, от 128-бит до 1024-бит) для адаптации к условиям переменного канала. Для систем с частотой передачи данных микропроцессору также необходимо будет компенсировать серьезные потери распространения с использованием передовых алгоритмов формирования луча, которые требуют инверсии больших матриц в реальном времени - задача, которая требует как точности FP32, так и высокой пропускной способности.
Проблемы масштабирования микропроцессоров для 6G
Одной из основных проблем является стенка памяти: несоответствие между скоростью процессора и пропускной способностью памяти ухудшается с каждым узелом. В то время как 3D-стек HBM предлагает высокую пропускную способность (до 2 ТБ / с в стек), его задержка (десятки наносекунд) может не удовлетворять закодированным THz OFDM-символам, которые длятся всего несколько наносекунд. Исследователи изучают вычисления с близкой памятью и логическое стекирование, чтобы приблизить микропроцессор DSP к массиву памяти. Другая проблема - тепловая плотность: многоядерный кластер DSP, потребляющий сотни ватт на квадратный сантиметр, требует расширенного охлаждения, такого как встроенные микрофлюидики или двухфазное погружение - методы, которые в настоящее время возможны только в центрах обработки данных.
Безопасность также становится проблемой. Поскольку DSP-микропроцессоры программируемы, они уязвимы для атак по боковым каналам, которые могут утечка ключей для зашифрованного трафика 5G/6G. Промышленность реагирует путем интеграции криптографических ускорителей непосредственно в кластер микропроцессоров, используя аппаратную изоляцию (например, Arm's TrustZone для серии Cortex-R) и физически неклонируемые функции (PUF) для защиты загрузки и хранения ключей.
Заключение
Микропроцессоры в цифровых сигнальных процессорах являются бесшумными двигателями, управляющими беспроводной революцией. От ядер VLIW-и-SIMD, которые питают сегодняшние базовые станции и смартфоны 5G до почти пороговых, навеянных ИИ архитектур, предназначенных для 6G, эти специализированные вычислительные устройства продолжают расширять диапазон производительности, эффективности и гибкости. Их эволюция тесно связана с достижениями в производстве полупроводников, технологии памяти и алгоритмов. По мере того, как 5G созревает и 6G приближается к чертежной доске, микропроцессор останется критическим фактором для сетей, которые быстрее, умнее и более отзывчивы, чем когда-либо прежде. Будущее подключенного интеллекта - автономные транспортные средства, удаленная хирургия, голографические коммуникации - зависит от неустанных инноваций скромного микропроцессора DSP.