Влияние масштабирования технологических процессов на производительность процессора Dsp и энергоэффективность

Достижения в области технологических процессов коренным образом изменили ландшафт обработки цифровых сигналов. За последние два десятилетия неустанная миниатюризация транзисторов позволила процессорам цифровых сигналов (DSP) достичь беспрецедентных уровней производительности при одновременном снижении энергопотребления. Это двойное преимущество позволило открыть новые области применения - от обработки базовой полосы 5G в реальном времени и вывода краевого ИИ до высококачественного аудио и автономного синтеза датчиков. Понимание того, как масштабирование технологических процессов непосредственно влияет на ядра DSP, имеет важное значение для системных архитекторов, инженеров прошивки и дизайнеров оборудования, которые должны балансировать пропускную способность, задержку и энергетические бюджеты во все более ограниченных средах.

Основы масштабирования технологических процессов

Процессное масштабирование относится к систематическому уменьшению размеров транзисторов - длины шлюзов, толщины оксида и шага межсоединения - через последовательные литографические узлы. Исторически описанное законом Мура, это масштабирование продвинулось от нескольких микрометров в 1970-х годах до 3 нм и далее в коммерческом производстве сегодня. Каждый новый узел позволяет примерно вдвое увеличить количество транзисторов на единицу площади, тенденция, которая держалась в течение десятилетий, хотя с недавним замедлением на самых передовых узлах.

Физические принципы масштабирования основаны на масштабировании Деннарда, которое предсказало, что по мере уменьшения размеров транзистора в 0,7 раза рабочее напряжение и ток также уменьшаются пропорционально, оставляя плотность мощности примерно постоянной. На практике масштабирование Деннарда сломалось около 90 нм узла из-за токов утечки и пороговых ограничений напряжения. Тем не менее, преимущества меньших транзисторов - более высокая скорость переключения, более низкая емкость и уменьшенная динамическая мощность на транзистор - продолжают приводить к повышению производительности в современных DSP.

Ключевые параметры масштабирования

Три основных параметра определяют влияние масштабирования на дизайн DSP:

Понимание этих параметров имеет важное значение, поскольку архитектуры DSP особенно чувствительны к запасам времени и шаблонам доступа к памяти.Изменение в узле процесса может изменить оптимальный баланс между глубиной трубопровода, размером множителя и шириной интерфейса памяти.

Влияние масштабирования на производительность процессора DSP

Процессоры DSP специализируются на операциях с множественным накоплением (MAC), фильтрации, FFT и другой арифметике сигналов.Масштабирование процессов улучшает их производительность с помощью трех взаимосвязанных механизмов: более высоких тактовых частот, большей памяти на чипе и регистровых файлов и поддержки более широких путей передачи данных SIMD (Single Instruction Multiple Data).

Часовая частота и временные границы

Уменьшенные задержки затвора позволяют ядрам DSP работать на более высоких частотах без увеличения напряжения. Например, DSP, спроектированный на узле 28 нм, может достигать 1,2 ГГц, в то время как та же архитектура, портированная на 7 нм, может превышать 2,5 ГГц - более чем удвоение сырой пропускной способности для вычислительных нагрузок. Однако одного только масштабирования частоты недостаточно; для поддержания параллелизма на уровне команд часто требуются более глубокие трубопроводы и улучшенное предсказание ветвей, особенно для кода обработки сигналов с большой управляемостью.

Транзисторная плотность и архитектурная сложность

Более высокая плотность транзисторов позволяет архитекторам интегрировать больше блоков MAC, более широкие векторные полосы и специализированные ускорители на одном и том же кристалле. Типичный высокопроизводительный DSP сегодня может содержать 16-32 блока MAC на ядро по сравнению с 4-8 в более ранних конструкциях 45 нм. Это позволяет одному ядру выполнять несколько этапов FFT radix-2 параллельно, резко снижая задержку демодуляции OFDM в реальном времени в беспроводной связи.

Широкая полоса пропускания памяти также благоприятно масштабируется. Сокращение ячеек SRAM обеспечивает большие кэши L1 и L2 и скретчпады памяти без пропорционального увеличения площади. Например, перемещение с 28 нм до 7 нм примерно утрояет плотность встроенной SRAM, позволяя DSP удерживать более крупные коэффициенты фильтра или таблицы веса на кристалле. Это уменьшает доступ к памяти вне чипа, основной источник задержки и потери мощности.

Инструкция-установка улучшений

С большим количеством доступных транзисторов архитектуры набора инструкций (ISA) развиваются, чтобы включать специализированные инструкции для арифметики сложных чисел, округления, насыщения и разворота битов. Эти инструкции, часто реализуемые как машины с микрокодированным состоянием, уменьшают количество циклов на MAC и улучшают плотность кода. Масштабирование, таким образом, позволяет более тонкой детализации в настройке ISA для соответствия шаблонам обработки сигналов - преимущество, которого не хватает процессорам общего назначения.

Иллюстративный пример: 14 нм DSP может обрабатывать 256-точечный FFT примерно в 1,2 мкс при 1,5 ГГц; тот же алгоритм на 7 нм версии того же ядра работает в 0,6 мкс при 2,4 ГГц — улучшение 2x. В сочетании с удвоением MAC-единиц, увеличение реальной пропускной способности 3-4× на поколение распространено в плотно зацикленных ядрах DSP.

Влияние на эффективность власти

Эффективность энергопотребления, измеряемая в GOPS / W (гига-операции на ватт), является наиболее важной метрической для приложений DSP с питанием от батареи и термически ограниченным DSP. Процесс масштабирования исторически улучшал эффективность, но механизмы более нюансированы, чем простое снижение напряжения.

Динамическое снижение мощности

Динамическая мощность пропорциональна емкости × напряжение 2 × частота. Масштабирование уменьшает емкость каждого транзистора и межсоединения, а также позволяет снизить рабочие напряжения. Падение с 1,0 В при 28 нм до 0,75 В при 7 нм приводит к 44%-ному снижению динамической мощности на событие переключения, даже когда частота увеличивается. Чистый эффект заключается в том, что энергия на команду MAC значительно уменьшается - примерно с 10 pJ при 40 нм до менее 1 pJ при 7 нм для стандартного 16-битного фиксированного MAC.

Статическая власть и проблемы утечки

Статическая мощность, в которой доминирует субпороговая утечка, растет экспоненциально с уменьшением порогового напряжения. На узлы ниже 28 нм утечка может составлять 30-50% от общей мощности чипа в простаивающих состояниях. DSP, которые часто работают в режиме рабочего цикла или разрыва, должны использовать агрессивное забивание мощности, смещения тела и многопороговые CMOS-библиотеки для сдерживания утечки. Промышленность ответила транзисторами с эффектом плавникового поля (FinFET) при 14 нм и ниже, которые обеспечивают лучшее электростатическое управление и меньшую утечку, чем планарные транзисторы.

Несмотря на эти меры, статическая мощность остается серьезной проблемой для всегда-на DSP приложений, таких как голосовой триггер пробуждение или синтез датчиков. Для того, чтобы справиться, дизайнеры принимают мелкозернистые часы и динамическое напряжение-частотное масштабирование (DVFS) на уровне IP-блока, гарантируя, что только активный путь передачи данных потребляет динамическую мощность.

Метрики эффективности для рабочих нагрузок DSP в реальном мире

Улучшения энергоэффективности лучше всего иллюстрируются сравнением DSP между поколениями. Исследование оптимизированных по пропускной способности ядер DSP показывает:

Эти цифры предполагают типичный трубопровод DSP с 8-16 блоками MAC и 256 КБ локальной памяти. Улучшение 6× с 28 нм до 7 нм позволяет использовать новые варианты использования, такие как обработка радара на устройстве и формирование звукового луча высокого разрешения, которые ранее были непрактичными из-за бюджетов мощности.

Торговые компромиссы и возникающие вызовы

Хотя преимущества масштабирования очевидны, путь к продвинутым узлам чреват увеличением сложности и стоимости. Эти компромиссы заставляют дизайнеров DSP принимать сложные архитектурные решения.

Производственные затраты и доходность

Стоимость одной пластины резко возрастает на каждом узле из-за продвинутой литографии (экстремальный ультрафиолет или EUV, на 7 нм и ниже), нескольких этапов рисования и увеличенных наборов масок. Один 5 нм набор масок может стоить более 5 миллионов долларов, а доходность на новых узлах изначально низкая. Для больших объемов DSP, используемых в смартфонах и сетевом оборудовании, амортизированная стоимость на чип все еще может быть приемлемой, но для более низких объемов промышленных или аэрокосмических приложений, старые узлы, такие как 28 нм или 22 нм, остаются экономически эффективными. Многие поставщики DSP теперь предлагают многоузловые портфели, позволяя клиентам выбирать лучший компромисс между ценой и производительностью.

Надежность и изменчивость

По мере приближения размеров транзисторов к атомным масштабам вариации процессов — случайные колебания допанта, шероховатость линейного края и несоответствия порогового напряжения — становятся более выраженными. Эта изменчивость может вызвать сбои в синхронизации в критических арифметических путях DSP, особенно для высокоточных операций с плавающей точкой. Дизайнеры должны включать статистический анализ времени и адаптивное смещение тела, чтобы гарантировать, что защитные полосы не ухудшают производительность. Кроме того, нестабильность температуры отрицательного смещения (NBTI) и электромиграция становятся более серьезными, ограничивая максимальное рабочее напряжение и сокращая срок службы устройства в всегда-на приложениях DSP.

Теплоотдаление и тепловая плотность

Даже при снижении мощности на транзистор, общая плотность мощности - ватт на квадратный миллиметр - увеличилась на продвинутых узлах. Ядро DSP 7 нм, выполняющее устойчивую рабочую нагрузку FFT, может генерировать более 100 Вт / см2, приближаясь к пределам обычного воздушного охлаждения. Это тепловое ограничение часто заставляет дизайнеров дроссельной тактовой частоты или внедрять сложные динамические политики управления тепловыми потоками (DTM), снижая эффективное повышение производительности, которое обещает масштабирование. Для DSP в ускорителях центров обработки данных становится необходимым жидкое охлаждение и передовые распределители тепла.

«Конец масштабирования Dennard сместил фокус с чистого частотного масштабирования на архитектурные инновации и специализированное ускорение. DSP с их регулярными каналами передачи данных и предсказуемыми шаблонами доступа к памяти хорошо расположены для использования плотности транзисторов, которую обеспечивают продвинутые узлы, но только если дизайнеры тщательно управляют утечками и тепловыми бюджетами». — IEEE Micro, 2023

Оригинальное название: Beyond Conventional Scaling

Поскольку закон Мура замедляется, полупроводниковая промышленность изучает несколько путей для дальнейшего повышения производительности и эффективности DSP, не полагаясь исключительно на геометрическую усадку.

3D-интеграция и гетерогенная упаковка

Трехмерное укладывание кристаллов позволяет укладывать память непосредственно поверх логики DSP, резко уменьшая длину и задержку межсоединений. Например, чиплет DSP, интегрированный со стеком с высокой пропускной способностью памяти (HBM), используя сквозные силиконовые связки (TSV), может достичь пропускной способности памяти, превышающей 1 ТБ / с - критически важной для обработки радаров и лидаров. Гибридное соединение, которое стекает, умирает на шаге межсоединений в несколько микрон, обещает еще более короткие пути и меньшую емкость, потенциально повышая энергоэффективность на 30-50% по сравнению с 2D-реализациями.

Гетерогенная интеграция также позволяет смешивать ядра DSP, построенные на продвинутом логическом узле (например, 5 нм) с аналоговыми / радиочастотными блоками на более дешевом, более старом узле (например, 28 нм).

Новые материалы канала и транзисторные архитектуры

FinFET доминировали в диапазоне от 16 нм до 3 нм, но следующий шаг — нанопластовые транзисторы с разворотом вокруг (GAA) — предлагает лучшее электростатическое управление и меньшую утечку. Процесс GAA 3 нм от Samsung показал снижение мощности на 30% при той же производительности по сравнению с FinFET. Для DSP это напрямую приводит к увеличению срока службы батареи для мобильных устройств и снижению теплового рассеивания для промышленных контроллеров.

Помимо кремния, исследователи изучают 2D-материалы, такие как дисульфид молибдена (MoS2) и углеродные нанотрубки (CNT) для будущих узлов. В то время как все еще экспериментальные, эти материалы обещают почти баллистическую транспортировку и чрезвычайно низкую утечку, потенциально позволяя DSP, которые работают при температуре ниже 0,5 В.

Доменные архитектуры

Вместо создания монолитных DSP общего назначения многие вендоры теперь разрабатывают ускорители для конкретных областей для таких задач, как FFT, умножение матриц или вывод нейронной сети. Эти ускорители еще больше выигрывают от масштабирования, потому что они торгуют гибкостью для сырой эффективности. Специальный ускоритель FFT на 7-нм узле может достичь более 1 ТОП / Вт - 10 × лучше, чем общий DSP, работающий по одному и тому же алгоритму. Тенденция к чиплетам и модульному дизайну позволяет интегрировать несколько таких ускорителей вместе со скалярным ядром DSP, создавая гетерогенные процессоры, которые являются мощными и энергоэффективными.

Ультранизковольтная операция

Пороговые вычисления, где логика работает при напряжениях чуть выше порога транзистора (0,4-0,6 В), могут сократить энергию за операцию на 5-10 × по сравнению с номинальным напряжением. В то время как производительность существенно падает, этот режим идеально подходит для задач всегда - на DSP, таких как определение ключевых слов или кондиционирование датчиков. Масштабирование технологии процесса делает работу вблизи порога более жизнеспособной, уменьшая статистическую изменчивость, которая вызывает сбои синхронизации при низких напряжениях. Конструкции, которые сочетают DVFS с адаптивным смещением тела, могут плавно переключаться между высокопроизводительными и сверхнизкими режимами питания.

Заключение

Масштабирование технологических процессов остается мощным двигателем для повышения производительности процессора DSP и энергоэффективности, но отношения стали более сложными по мере приближения фундаментальных физических ограничений. С 28 нм до 3 нм каждый новый узел обеспечивает более высокие тактовые частоты, более плотные арифметические блоки и более низкую энергию на операцию MAC - позволяя приложениям от формирования луча в реальном времени до портативного медицинского ультразвука. Однако проблемы утечки, стоимости производства и тепловой плотности требуют тщательной архитектурной кооптимизации, а не слепой зависимости от усадочной геометрии. Будущее, вероятно, увидит, что DSP развиваются в гетерогенные, 3D-интегрированные системы, которые сочетают в себе лучшие из передовой логики, плотной памяти и специализированных ускорителей. Для системных дизайнеров понимание взаимодействия между технологическими процессами и архитектурой DSP больше не является опциональным - это ключ к созданию конкурентоспособных, энергосдержанных продуктов в предстоящем десятилетии.

Внешние ссылки:
Закон Мура — Википедия
3D Обзор технологий интеграции — Wevolver
Gate-All-Around Transistors — Semiconductor Engineering