Проектирование систем Fpga для обработки сигналов радара высокого разрешения

Императив для радара высокого разрешения

Современное боевое пространство, автомобильная среда безопасности и миссия наблюдения за землей требуют радиолокационных систем, которые могут решать цели с беспрецедентной ясностью. Разрешение диапазона фундаментально привязано к полосе пропускания: форма волны 1 ГГц дает теоретическое разрешение всего 15 сантиметров, что позволяет различать объекты с близко расположенными мишенями, идентификацию особенностей цели и конструирование изображений с богатым синтетическим разрешением, приводящее к мгновенной полосе пропускания в многогигагерцовый режим, создавая канат сложных данных базовой полосы, которые должны обрабатываться с детерминированной, субмиллисекундной задержкой. Полевые программируемые массивы ворот (FPGA) стали незаменимой вычислительной тканью для этой задачи, предлагая уникальную комбинацию пространственного параллелизма, жестких блоков DSP и перенастраиваемого I / O, который не может соответствовать ни одному другому процессору. Эта статья обеспечивает глубокое, инженерно-ориентированное исследование того, как создавать цепочки обработки сигналов на основе FPGA для радара с высоким разрешением, охватывая алгоритмическое картирование, дизайн иерархии памяти

Почему FPGA доминируют в обработке радиолокационных сигналов

Процессоры общего назначения (GPP) и графические процессоры (GPU) плохо подходят для фронтенда радарного приемника высокого разрешения. GPP страдают от недетерминированного поведения кэша и джиттера операционной системы, в то время как GPU накладывают задержки пакетной обработки, которые нарушают ограничения в реальном времени. FPGA преодолевают эти ограничения с помощью принципиально другой вычислительной модели.

Помимо этих фундаментальных преимуществ, FPGA также позволяют точно контролировать арифметику с фиксированной точкой, позволяя разработчикам оптимизировать динамический диапазон и использование ресурсов таким образом, который сложен на GPU. Возможность адаптировать битовую ширину на каждом этапе трубопровода, используя, например, 12-битное представление в DDC и 18-битное представление в FFT, дает значительную площадь и экономию энергии при сохранении требуемого соотношения шума сигнал-квантирование.

Потоп данных: понимание проблемы пропускной способности

Прежде чем погрузиться в архитектуру, необходимо количественно оценить скорости данных. Радиолокационная система с 1 ГГц мгновенной полосой пропускания, использующая 2 GSPS двухканального ADC (I и Q) с 16-битным разрешением, генерирует необработанный поток данных 64 Гбит/с (8 ГБ/с). После цифрового нисходящего преобразования и децимации в четыре раза, скорость передачи данных в базовой полосе все еще составляет 2 ГБ/с. Умножьте это на несколько каналов, длинный когерентный интервал обработки (CPI) тысяч импульсов и потребность в памяти углового поворота, а требование к совокупной полосе пропускания памяти может легко превышать 20 ГБ/с. FPGA должны поддерживать эту пропускную способность через глубоко трубопроводные этапы обработки, при этом внешняя полоса пропускания памяти становится основным узким местом. Широкие шины AXI4-Stream (512 бит или более), несколько контроллеров DDR4/HBM и тщательное планирование операций чтения-изменения-записи являются обязательными.

Задержка: жесткое ограничение в реальном времени

В радиолокаторе слежения время от импульсного излучения до отчета о детектировании часто должно оставаться ниже 100 мкс. Это исключает любую модель пакетной обработки. Трубопровод FPGA должен быть полностью потоковым: каждый этап принимает один действительный образец за тактовый цикл без обратного давления. Общая задержка — это просто сумма глубин регистра трубопровода, умноженная на период времени. Достижение этого требует полностью развернутых архитектур для FFT, FIR-фильтров и процессоров CFAR, даже при более высоком потреблении ресурсов. Каждый FIFO, каждый буфер и каждый доступ к памяти должны быть проанализированы на предмет его вклада в критический путь.

Власть: встроенное ограничение

Воздушные, переносные и автомобильные радары работают при строгом бюджете мощности. В то время как FPGA являются энергоэффективными для параллельной математики, большие устройства, обрабатывающие широкополосные сигналы, могут рассеивать 30–50 Вт или более. Методы проектирования включают в себя часовое вещание неиспользуемых цепей, динамическое напряжение и частотное масштабирование (DVFS) на способных устройствах и использование закаленных блоков DSP вместо множителей на основе LUT. Инструменты анализа мощности должны использоваться на ранней стадии цикла проектирования, используя реалистичные скорости переключения от моделирования RTL для выявления горячих точек и планирования пола.

Другой эффективный метод снижения мощности заключается в оптимизации ширины битов пути передачи данных. Тщательный анализ компромиссов с использованием моделирования с фиксированной точкой в MATLAB или Python может показать, что сокращение всего нескольких битов в среднем пути CFAR может сохранить сотни регистров и десятки блоков DSP, не влияя на вероятность обнаружения. Аналогично, замена блоковой ОЗУ (BRAM) для распределенной памяти в линейных буферах может сократить динамическую мощность на 30% или более.

Архитектура технологического трубопровода: пошаговое руководство

Радиолокационная сигнальная цепь FPGA высокого разрешения лучше всего структурирована как модульный, глубоко трубопроводный путь передачи данных. Каждая основная функция инкапсулирована в качестве многоразового IP-ядра со стандартизированными потоковыми интерфейсами. Следующие разделы подробно описывают каждый этап и его реализацию FPGA.

Этап 1: интерфейс ADC и цифровая конверсия (DDC)

Высокоскоростные ADC, такие как Analog Devices AD9695 или TI ADC12DJ5200RF, доставляют серийные образцы через JESD204B/C полосы, работающие на скорости 12,5–28 Гбит/с. Гигабитные приемопередатчики FPGA десерализуют эти данные и подают IP-ядро JESD204B, которое обрабатывает выравнивание полосы, дескремблинг и детерминированную задержку. После выравнивания образцы передаются в цифровой нисходящий преобразователь, содержащий численно управляемый осциллятор (NCO) и миксер, за которым следует децимирующий FIR-фильтр. Для сверхширокополосных систем многоступенчатый DDC с грубым CIC-фильтром с последующим тонким FIR-фильтром является ресурсоэффективным. Современные устройства, такие как Xilinx RFSoC

При проектировании DDC обращайте пристальное внимание на NCO spurious-free dynamic range (SFDR). Прямой цифровой синтез с использованием таблицы поиска и фазового аккумулятора может вводить шпоры, если глубина таблицы недостаточна. Использование NCO на основе CORDIC или методов дитеринга может толкать шпоры далеко ниже уровня шума. Также рассмотрите возможность использования двухрежимного DDC, который поддерживает как узкополосную (высокоразмерную), так и широкополосную (низкоразмерную) работу, выбираемую посредством частичной реконфигурации.

Этап 2: Сжатие импульса с помощью быстрой свертки частотного домена

Сжатие импульса является сердцем радара высокого разрешения. Сопоставленный фильтр реализован как быстрая свертка частотной области: выполняется входящая последовательность, в реальном времени выполняется FFT, умноженная по стрелке с заранее вычисленным FFT импульса с обратной FFT. Полностью трубопроводное потоковое ядро FFT, такое как Xilinx LogiCORE или Intel FFT IP, поддерживает один выходной образец на часы. Длина FFT выбрана для размещения ширины импульса и частоты выборки без чрезмерной нулевой накладки. Для полос частот, превышающих 1 ГГц, radix-2 или radix-22] архитектура предлагает хороший баланс пропускной способности и эффективности ресурсов. Использование уменьшенного битового представления (например, монобит или 8-бит) для эталонного ядра может значительно уменьшить использование множителя с минимальным штрафом SNR. Метод перекрытия-сохранения предпочтительнее, чтобы избежать накладных расходов на перекрытие-добавление.

Один из нюансов проектирования часто упускается из виду — обработка факторов FFT-виддла. Предварительная вычисление и хранение их в блок-ОЗУ стандартно, но для очень длинных FFT (8192 точки и более) ПЗУ-виддл может стать большим. Использование генерации веточки на лету с процессорами CORDIC может сэкономить память за счет нескольких дополнительных срезов DSP. Кроме того, FFT должен быть настроен для естественного заказа (а не для вывода с обратной битовой обработкой), чтобы упростить обработку вниз по течению. Современные IP-ядра поддерживают это без накладных расходов на цикл.

Стадия 3: поворот угла и доплеровская обработка

После сжатия импульсов данные организованы в виде 2D-массивной матрицы. Доплеровская обработка требует FFT по импульсам для каждого диапазонного бина. Это требует последовательной транспонирования матрицы или «поворота угла». FPGA записывает линии сжатого диапазона во внешнюю память DDR4 или HBM, затем считывает их в транспонированном порядке для питания банка FFT-двигателей. Эффективная конструкция поворота на угол является критической. Используйте лопнувшие шаблоны доступа (например, написание полной линии кэша сразу) и двойное буферирование (пинг-понг) для перекрытия вычислений с передачами памяти. Для больших CPI, HBM2 или HBM2e память, доступная на устройствах, таких как серия Xilinx Versal HBM, обеспечивает значительно более высокую пропускную способность (до 460 ГБ/с) и более низкую задержку, чем традиционные DDR4, уменьшая узкую точку поворота. Банк Doppler FFT может быть реализован как несколько параллельных потоковых ядер FFT, каждая обработка бинта диапазона

Другой подход, который набирает тягу, заключается в том, чтобы выполнять поворот в углу распределенным образом с использованием нескольких меньших каналов DDR или HBM, каждый из которых обслуживает подмножество диапазонных бункеров. Это уменьшает эффективную задержку на поворот в углу и улучшает использование памяти. Для систем, требующих более 1000 диапазонных бункеров и 4096 импульсов, рассмотрите возможность использования систолического массива для Doppler FFT, который отображает каждый диапазонный бункеровщик в выделенный двигатель FFT. Это может отменять логические ячейки для резко сниженных требований к пропускной способности памяти.

Стадия 4: постоянное обнаружение ложной тревоги (CFAR)

Окончательный этап обнаружения обрабатывает значения доплеровской фильтрации величин. Сотовый усредненный CFAR (CA-CFAR) является наиболее распространенным алгоритмом, требующим раздвижного окна опорных ячеек вокруг тестируемой ячейки. FPGA реализует это с помощью линейных буферов (или регистров сдвига) и дерева потокового аддитора, которое вычисляет среднее в реальном времени. Порог получается путем умножения среднего на постоянную (полученную из желаемой ложной частоты сигнализации) и сравнения его с тестируемой ячейкой. Для систем, работающих в гетерогенном беспорядке, могут быть реализованы более продвинутые варианты CFAR (OS-CFAR, цензурированный CFAR или адаптивный CFAR), но они требуют сортировки или более сложной логики. Выходом является двоичная целевая карта, которая может быть переадресована по PCIe, Ethernet (например, 10/25/40 GbE) или Aurora на процессор хоста для кластеризации и отслеживания.

При реализации OS-CFAR, требующей сортировки опорного окна, может быть построена полностью потоковая архитектура с использованием сети частичной сортировки или битонного сортировщика. Для окна 16-ячеек это может потреблять около 200 LUT и 100 регистров на канал, что приемлемо для многих конструкций. Адаптивный CFAR, где пороговый множитель варьируется на основе статистики локального беспорядка, может быть реализован путем подачи статистики опорных ячеек в небольшую нейронную сеть или таблицу поиска, которая обучается офлайн. Этот гибридный подход может значительно улучшить обнаружение в неоднородных средах без больших логических накладных расходов.

Внедрение лучших практик для надежных радаров FPGA

Для перевода цепочки обработки в надежный, масштабируемый дизайн FPGA требуется дисциплинированная аппаратная инженерия.

Модульный дизайн со стандартизированными интерфейсами

Принять методологию блокировки зданий с интерфейсами AXI4-Stream для потока данных и AXI4-Lite/AXI4-Memory-Mapped для управления и конфигурации. Каждая основная функция - DDC, FFT, CFAR - должна быть упакована в виде автономного IP-ядра с четко определенными интерфейсами. Это позволяет быстро интегрировать, проводить независимую проверку и повторно использовать проекты. IP-ядра, предоставляемые поставщиками для FFT, FIR-фильтров, NCO и контроллеров памяти, могут значительно сократить время разработки, но их конфигурация должна быть тщательно подобрана к параметрам радара.

Рассмотрите возможность использования стандартизированной шины, такой как AXI4-Stream, с боковыми сигналами для метаданных (например, метка времени, индекс импульса, идентификатор канала). Это упрощает отладку и позволяет легко вставлять тестовые мониторы или счетчики производительности. Кроме того, реализация карты регистра управления (AXI4-Lite) для каждого модуля позволяет настраивать время выполнения параметров, таких как порог CFAR или коэффициенты фильтра, что бесценно во время интеграции и полевых испытаний.

Пересечение часовых доменов (CDC)

РЛС FPGA обычно работает с несколькими тактовыми доменами: часы ADC, тканевые часы FPGA (часто полученные из образцовых часов через PLL), часы контроллера памяти и часы системы процессора. Все пересечения доменов должны использовать проверенные структуры CDC - асинхронные FIFO, двухчасовые BRAM или синхронизаторы рукопожатия - для предотвращения метастабильности. Такие инструменты, как анализ CDC Xilinx Vivado или советник CDC Intel, могут автоматически проверять пересечения. Пренебрежение CDC является единственной наиболее распространенной причиной периодических, трудно отлаженных сбоев в системах FPGA.

Одна из лучших практик заключается в том, чтобы изолировать все пересечения CDC в небольшие специализированные модули обертки, которые тщательно проверяются с помощью ограниченных случайных тестов в симуляции. Использование синхронных FIFO с независимыми часами и почти полными / почти пустыми флагами может упростить конструкцию и снизить риск переполнения. Всегда моделируйте с пересечениями часового домена в наихудшем случае фазовых сдвигов, чтобы выявить настройку и удерживать нарушения на ранней стадии.

Закрытие и планирование этажей

Конструкции класса Gigahertz требуют тщательного физического планирования. Высокочастотные сети, такие как сбросы и включенные часы, должны использовать выделенные ресурсы маршрутизации (например, глобальные буферы часов). Большие FFT и процессоры CFAR часто доминируют во времени из-за сложных деревьев аддиторов и длинных комбинационных путей. Логика блокировки конкретных областей на кремниевой план этажа (с использованием блоков в областях Vivado или LogicLock в Intel Quartus) и репликация вычислительных плиток может улучшить размещение, уменьшить перегрузку маршрутизации и повысить достижимую тактовую частоту. Ограничение дизайна с реалистичными исключениями по времени (многоцикловые пути на регистрах медленного управления, ложные пути на сигналах тестового режима) является искусством, которое непосредственно влияет на результаты. Чрезмерное ограничение может привести к разочарованию инструмента и неоптимальному PPA.

Современные инструменты также предлагают варианты физического синтеза, такие как «ограничение» и «дублирование реестра», которые могут автоматически фиксировать неисправные пути. Однако их следует использовать экономно на критических путях и всегда проверять статичным анализом времени. Планирование пола должно быть сделано в начале цикла проектирования, с приблизительной оценкой области, необходимой для каждого модуля. Используйте стиль «planAhead» в Vivado или «Chip Planner» в Quartus, чтобы разместить ключевые модули, прилегающие к их интерфейсам ввода-вывода и памяти.

Проверка: от моделирования до аппаратного обеспечения в петле

О правильности обработки радара трудно судить, наблюдая только за волновыми формами. Среда ко-симуляции жизненно важна. В модели RTL вводятся эталонные векторы, генерируемые из битоточной модели MATLAB или Python, и выход сравнивается цикл за циклом. Это должно быть сделано для каждой стадии трубопровода независимо и для полной цепи. Для сложных алгоритмов, таких как CFAR, должны быть проверены угловые случаи (например, цели на краю пролета, несколько близко расположенных целей). После моделирования испытательная стенда аппаратного обеспечения в петле (HIL) соединяет FPGA с реальными устройствами ADC / DAC и симулятором радиолокационной цели (например, генератор произвольной формы волны или анализатор сигналов Rohde & Schwarz). Это проверяет всю цепочку, от антенны до обнаружения, в реалистичных условиях. Формальная проверка свойств также может применяться к критическим модулям логики управления, чтобы исключить тупики, потерю данных или неправильные переходы состояния.

Для моделирования используйте современную систему верификации, такую как UVVM или OSVVM, для создания многоразовых испытательных стендов с функциями самопроверки. Автоматизируйте набор регрессии для ночного запуска на вычислительной ферме, охватывая различные наборы радиолокационных параметров (PRF, ширина импульса, полоса пропускания, длина ИПЦ). Также реализуйте метрики покрытия кода (заявление, ветвь, переключение) для идентификации непроверенной логики. На стороне HIL используйте симулятор сцены радара, который может генерировать реалистичные сценарии цели и беспорядка, и регистрируйте выход обнаружения FPGA для сравнения с ожидаемой правдой.

Новые тенденции: ИИ, Direct-RF и открытые архитектуры

Ландшафт FPGA быстро развивается, и три разработки значительно влияют на конструкцию радара.

AI-усовершенствованная обработка

Устройства, подобные AMD Versal и Intel Agilex 7, встраивают выделенные процессорные массивы AI — VLIW или SIMD, оптимизированные для вывода глубокого обучения. Они позволяют использовать нейронные сети на чипе для таких задач, как классификация беспорядков, распознавание целей и интеллектуальная адаптация формы волны. Радиолокационная система теперь может дополнять обычный CFAR с помощью выученного детектора, который подавляет ложные тревоги в сложных городских или морских средах, или использовать нейронную сеть для оценки целевых микродоплеровских сигнатур для классификации. Двигатели AI работают на потоковых данных с детерминированной задержкой, что делает их пригодными для обработки в реальном времени.

Более того, двигатели ИИ могут использоваться для оптимизации самой радиолокационной формы волны. Алгоритмы обучения с подкреплением, работающие на FPGA, могут научиться адаптировать PRF, параметры чирпа и шаблоны скачков частоты в реальном времени, чтобы избежать помех и максимизировать вероятность обнаружения. Это замыкает петлю между зондированием и передачей таким образом, что ранее было возможно только в программном обеспечении на процессоре хоста, но теперь с временем отклика наносекундного масштаба.

Прямо-RF интеграция

Интеграция высокоскоростных преобразователей данных непосредственно в пакет FPGA (RFSoC, Agilex 9 Direct RF) устраняет связь JESD и резко снижает размер системы, мощность и сложность. При скорости выборки, достигающей 10 GSPS и прямой выборки RF до C-диапазона, один чип может выполнять нисходящую конверсию, фильтрацию и сжатие импульсов, что ранее требовало платы, полной дискретных аналоговых и цифровых компонентов. Это позволяет использовать компактные маломощные радиолокационные системы для БПЛА, небольших спутников и автомобильных приложений.

Direct-RF также открывает двери для новых архитектур, таких как полностью цифровые фазированные массивы. Благодаря интеграции ADC и DAC напрямую, каждый элемент антенны может быть напрямую подключен к FPGA, что позволяет полностью осуществлять формирование луча в цифровой области. Это упрощает калибровку и позволяет адаптивные шаблоны луча, которые могут изменяться на основе импульс-импульс.

Открытые радарные архитектуры

Такие инициативы, как FLT:0 Future Airborne Capability Environment (FACE) Open Group и Sensor Open Systems Architecture (SOSA), способствуют стандартизации в обработке радиолокационных сигналов. FPGA являются центральной частью этих усилий, обеспечивая реконфигурируемую платформу, которая может реализовывать стандартизированные интерфейсы и модули обработки. Дизайнеры должны рассмотреть возможность принятия этих стандартов для обеспечения совместимости, переносимости и будущей модернизации.

Соответствие этим стандартам также упрощает закупки и управление жизненным циклом. Используя выровненные по SOSA мезонинные карты FPGA (FMC) и стандартные IP-ядра, радиолокационная система может быть модернизирована до следующего поколения FPGA с минимальным редизайном. Это снижает долгосрочные затраты на техническое обслуживание и ускоряет развертывание новых возможностей.

Практическая оценка ресурсов: тематическое исследование SAR

Для иллюстрации компромиссов в отношении ресурсов рассмотрим процессор синтетической апертуры (SAR), реализованный на среднемагистральном процессоре Xilinx Kintex UltraScale + FPGA (XCKU115). РЛС работает с пропускной способностью 600 МГц, частотой выборки комплекса 1,2 GSPS после DDC, CPI 4096 импульсов и диапазонной полосой 8192 диапазонных узлов. В трубопровод входит 4096-точечный потоковый FFT для сжатия импульсов, поворот на угол во внешнем DDR4 и 4096-точечный доплеровский FFT. Расчетное потребление ресурсов:

Конструкция удобно вписывается в KU115, работая на тканевых часах 300 МГц. Задержка трубопровода от ADC до отчета о обнаружении составляет примерно 80 мкс, что хорошо соответствует требованиям реального времени. Этот пример демонстрирует, что даже широкополосная обработка SAR не требует самой большой или самой дорогой FPGA, при условии тщательной оптимизации архитектуры. Масштабирование до многоканальной или более высокой полосы пропускания потребует перехода на более крупное устройство (например, Xilinx VU13P или Intel Agilex 7) или использования HBM для поворота на угол.

Для грубого бюджета ресурсов первого прохода используйте следующее эмпирическое правило per-FFT: 4096-точечный потоковый FFT потребляет около 60 срезов DSP, 20 BRAM36 и 15k LUT. Умножьте на количество параллельных FFT-двигателей. Для CFAR допустите 4 срезов DSP на раздвижное окно плюс 1 BRAM на линейный буфер. ФИР-фильтры снизу преобразования потребляют примерно 2 DSP на кран на канал для децимации. Всегда добавляйте 20% маржи для учета заторов маршрутизации и запасную емкость для будущих обновлений.

Вывод: FPGA как радарный процессор выбора

Обработка радиолокационных сигналов высокого разрешения представляет собой грозную комбинацию высоких скоростей передачи данных, строгой задержки и требовательных ограничений мощности. FPGA превратились из простой логики клея в вычислительное сердце этих систем, предлагая уникальное сочетание пространственного параллелизма, детерминированного времени и реконфигурируемого ввода-вывода. Успешный дизайн требует глубокого понимания иерархий памяти, управления часовой областью, арифметики с фиксированной точкой и физического планирования этажей. Следуя модульной, трубопроводной архитектуре, разумно используя IP-адрес поставщика и внедряя новые технологии, такие как двигатели ИИ и интеграция с прямой радиочастотой, инженерные команды могут доставлять радиолокационные процессоры, которые отвечают сегодняшним строгим требованиям и остаются адаптируемыми к формам волн и миссиям завтрашнего дня. Поскольку разрешение радара продолжает свою восходящую траекторию, двигаясь к разрешению субдециметрового диапазона и за его пределами, FPGA останется незаменимой платформой, которая превращает сырые эхо в четкий, действенный интеллект в реальном времени.

Для дальнейшего чтения на высокоскоростной ADC интерфейс, обратитесь к JESD204B Survival Guide от Analog Devices. Для всестороннего обзора алгоритмов обработки радиолокационных сигналов, классический текст Сколника по-прежнему является отличной ссылкой. Для последних в FPGA-ориентированных радарных эталонных конструкций, см. Xilinx Radar Solutions страница .