Инновации в дизайне процессоров для энергоэффективных вычислений

Заря энергетического дизайна CISC

На протяжении десятилетий повествование о дизайне процессора противопоставляло сырую производительность энергопотреблению. Архитектуры сложных наборов инструкций (CISC), воплощенные в семействе x86, часто рассматривались как энергоемкие гиганты, лучше всего подходящие для настольных компьютеров и серверов. Однако неустанный толчок для мобильных вычислений, ультрапортативных устройств и массивной эффективности центров обработки данных заставил фундаментально переосмыслить. Сегодня процессоры CISC не просто выживают в эру энергоэффективности - они являются новаторскими инновациями, которые переопределяют то, что возможно в маломощных высокопроизводительных вычислениях.

Эта трансформация обусловлена сочетанием достижений аппаратного обеспечения и микроархитектуры. В то время как архитектуры RISC (Reduced Instruction Set Computing) как ARM когда-то доминировали в разговоре об энергоэффективности, современные чипы CISC закрыли разрыв благодаря сложной инженерии. Результатом является новый класс процессоров, которые могут динамически адаптировать свой профиль мощности, минимизировать отходы на каждом уровне транзисторов и предоставлять беспрецедентные показатели производительности на ватт. В этой статье рассматриваются ключевые инновации, меняющие дизайн процессора CISC для энергоэффективных вычислений.

Основополагающая эволюция: от скорости часов до пропорциональности энергии

Первые годы проектирования CISC были определены неустанной гонкой за увеличение тактовых частот. Intel Pentium 4, например, выдвинулся за пределы 3 ГГц, но ценой огромного рассеивания мощности и тепла. В итоге отрасль ударилась о тепловую стену, что привело к сдвигу парадигмы от масштабирования частоты к архитектурной эффективности. Этот сдвиг является основой современных энергоэффективных процессоров CISC.

Конец масштабирования Деннарда

Шкалирование Деннарда, в котором говорилось, что по мере сокращения транзисторов плотность мощности оставалась постоянной, разрушалась вокруг 90-нм узла. Ток утечек и ограничения масштабирования напряжения означали, что меньшие транзисторы больше не автоматически снижали мощность. Разработчикам CISC пришлось отказаться от наивного подхода «сжимать и ускорять» и вместо этого сосредоточиться на пропорциональной энергии вычислениях — разработке чипов, которые потребляют мощность пропорционально выполняемой работе, а не фиксированным, расточительным образом.

Рост многоядерных и разнородных архитектур

Одним из наиболее значимых ответов был поворот к многоядерным конструкциям. Вместо одного горячего высокочастотного ядра процессоры CISC теперь интегрируют несколько ядер, которые могут быть индивидуально приведены в действие или работать на более низких частотах при сохранении пропускной способности через параллелизм. Совсем недавно гетерогенные архитектуры — сочетание мощных «производительных» ядер с меньшими «эффективными» ядрами на одном и том же кристалле — стали отличительной чертой энергоэффективного дизайна CISC. Гибридная архитектура Intel, начиная с Alder Lake, является ярким примером, используя сочетание производительности-ядер (P-ядра) и эффективности-ядра (E-ядра) для интеллектуального распределения рабочих нагрузок.

Такой подход позволяет операционной системе планировать фоновые задачи или процессы низкой интенсивности на эффективных ядрах, в то время как требовательные приложения задействуют ядра производительности только при необходимости. Результатом является резкое снижение потребления энергии без работы и низкой нагрузки без ущерба для пиковой производительности. Аналогично, конструкция чиплета AMD с отдельными кристаллами ввода/вывода и CCD (основные сложные диски) позволяет тонко заземлять питание и масштабирование напряжения в разных частях процессора.

Инновации в области управления мощностью на уровне оборудования

Помимо подсчета ядер, современные процессоры CISC встраивают передовые схемы и алгоритмы для управления мощностью при наносекундной гранулярности. Эти аппаратные механизмы невидимы для программного обеспечения, но имеют решающее значение для энергоэффективности.

Динамическое натяжение и частотное масштабирование (DVFS) 2.0

Традиционные DVFS масштабируемое напряжение и частота в грубых шагах на основе использования ЦП. Современные процессоры CISC реализуют per-core DVFS, где каждое ядро может самостоятельно устанавливать свою рабочую точку. Технология Intel Speed Shift делает это дальше, позволяя аппаратному обеспечению управлять частотными переходами намного быстрее, чем традиционные управляющие на базе ОС, уменьшая задержку и улучшая отзывчивость при экономии энергии. В сочетании со сложными регуляторами напряжения, интегрированными в пакет (полностью интегрированные регуляторы напряжения или FIVR), снижение напряжения и перепады сводятся к минимуму, что еще больше повышает эффективность.

Мощное и тонко выработанные часы Gating

Силовое галстукование отключает питание целых блоков логики, которые не используются. В современных чипах CISC могут быть энергозатратными целые ядра, ломтики кэша, контроллеры памяти и даже специфические функциональные блоки внутри ядра. Это устраняет ток утечки, на который приходится значительная часть мощности в простаивающих состояниях. На более тонком уровне галочка часов отключает тактовый сигнал к неактивным регистрам и логике, предотвращая ненужное динамическое энергопотребление. Продвинутые конструкции сочетают в себе обе методики: тактовые затворы применяются в течение коротких холостых периодов, а силовые затворы задействуются во время более длительных холостых состояний, например, когда ядро входит в состояние C6 (глубокого сна).

Адаптивное предвзятое отношение к телу и почти пороговые вычисления

Для дальнейшего снижения напряжения некоторые чипы CISC экспериментируют с адаптивным смещением корпуса, где пороговое напряжение транзисторов динамически регулируется на основе рабочей нагрузки и температуры. Вычисления с почти пороговым напряжением (NTV), где напряжение питания снижается до почти порогового значения транзистора, могут сократить мощность в 10 и более раз. В то время как традиционно сложные из-за штрафов за производительность и чувствительности к изменению процесса, конструкторы CISC включают методы NTV в маломощных режимах для КПД ядер и непрофильных компонентов.

Микроархитектура для повышения энергоэффективности

Архитектура набора инструкций CISC по своей сути сложна, с инструкциями переменной длины и многими режимами адресации. Традиционно эта сложность приводила к высокой энергии декодирования. Однако инженеры разработали ряд методов микроархитектуры, которые превращают эту сложность в эффективность.

Микро-операционные кэши и декодирование слияний

Вместо многократного расшифрования сложных инструкций x86 (которые могут составлять от 1 до 15 байт), современные процессоры CISC кэшируют декодированные микрооперации (μops). μop-кэш Intel хранит до тысяч обычно используемых μops, минуя энергоемкую логику декодирования. Это снижает динамическое энергопотребление в инструкции fetch и декодирует конвейер до 30%. В тандеме декодирование слияния объединяет несколько μops в одну запись, еще больше уменьшая энергию поиска кэша.

Macro-op Fusion и Micro-op Fusion

Макро-оп синтез объединяет две простые инструкции x86 (например, сравнение с последующим условным скачком) в одну макрооперацию на ранней стадии трубопровода, уменьшая количество микро-опов, которые необходимо обработать. Микро-оп синтез делает еще один шаг, комбинируя два микро-опса (например, нагрузку и операцию ALU) в один, позволяя их отправлять вместе и выполнять на одном порте выполнения. Это не только экономит энергию, но и улучшает пропускную способность за счет снижения разности портов.

Эффективные внезапные исполнительные двигатели

Выполнение вне порядка является отличительной чертой высокопроизводительных процессоров CISC, но традиционно потребляет значительную мощность из-за больших буферов переупорядочения (ROB), станций резервирования и логики пробуждения. В более новых конструкциях используется выборочное пробуждение — только пробуждение зависимых инструкций, которые фактически готовы выполнять, а не передача всем инструкциям ожидания. Кроме того, меньшие, более эффективные ROB со сжатыми зависимостями уменьшают как площадь, так и мощность. Некоторые процессоры также реализуют цепь , где результат одной инструкции пересылается непосредственно в следующую, не проходя через регистровый файл, экономя время и энергию.

Оптимизация иерархии кэша

Доступ к памяти является основным потребителем энергии. Процессоры CISC обновили свои иерархии кэша, чтобы уменьшить энергию на доступ. Инновации включают неинклюзивные конструкции кэша , которые уменьшают когерентный трафик, секторы кэша , которые позволяют частичную проверку тегов, и только для чтения кэша L1 для инструкций, чтобы избежать избыточных записей. Некоторые процессоры Intel имеют большой кэш L4 на пакете (например, Crystalwell eDRAM в Haswell), который уменьшает доступ к памяти вне чипа, экономя значительную мощность.

Инструкция Набор расширений для энергоэффективности

Парадоксально, но добавление большего количества инструкций в CISC ISA может фактически повысить энергоэффективность, если эти инструкции выполняют сложные операции в один оптимизированный шаг, а не последовательность более простых. В архитектуре x86 наблюдается увеличение расширений, специально разработанных для снижения мощности за счет минимизации количества команд и трафика памяти.

AVX-512 и VNNI: энергоэффективная обработка векторов

Расширения векторов, такие как AVX-512 (Advanced Vector Extensions) и VNNI (Vector Neural Network Instructions), позволяют одним инструкциям обрабатывать несколько элементов данных. Для параллельных рабочих нагрузок данных, таких как вывод ИИ, кодирование среды и научные вычисления, эти инструкции резко уменьшают количество командных феток и декодов. В сочетании с выделенными блоками исполнения векторов, которые могут работать при более низких напряжениях, чем скалярные блоки, общая энергия на операцию значительно падает. Более новые реализации даже позволяют блокам векторов питаться затвором, когда они не используются.

Криптографические и компрессионные инструкции

Выделенные инструкции для шифрования AES, хеширования SHA и сжатия DEFLATE (например, Intel QAT в ядре) выгружают эти задачи из программных циклов в специальное оборудование. Это не только повышает производительность, но и снижает мощность, устраняя необходимость во многих ветвях инструкций и доступа к памяти. Например, AES-NI может выполнять полный раунд шифрования в одной инструкции, потребляя гораздо меньше энергии, чем реализованный программным обеспечением поиск S-box.

Расширения транзакционной синхронизации (TSX) и блокировка оборудования

Синхронизация в многопоточном программном обеспечении часто включает в себя вращение на замках, что приводит к потере мощности. Intel TSX (теперь частично отключен из-за уязвимостей, но концептуально важен) позволил аппаратному обеспечению ускользать от замков и выполнять критические секции спекулятивно. Когда это успешно, это устранило спин, связанный с блокировкой, и связанные с этим энергетические отходы. В то время как проблемы безопасности имеют ограниченное принятие, принцип снижения накладных расходов на синхронизацию является ключевым фокусом для будущих энергоэффективных конструкций CISC.

Интеграция системного уровня и неосновная эффективность

Эффективность энергопотребления - это не только ядра процессора. "непрофильные" компоненты - контроллеры памяти, концентраторы ввода-вывода, межсоединения и интегрированная графика - могут потреблять значительную долю общей мощности чипов. Чипы CISC видели основные инновации в этой области.

Интегрированные контроллеры мощности (PCU)

Современные процессоры имеют выделенный блок управления мощностью (PCU), который действует как мини-микроконтроллер, работающий со сложной прошивкой управления питанием. PCU постоянно контролирует температуру, ток, использование и доставку мощности, регулируя напряжение, частоту и затворы питания в сотнях областей в режиме реального времени. Этот уровень детализации и интеллекта является ключевым дифференциатором эффективности CISC, позволяя такие функции, как поддержка жидкостного охлаждения, мониторинг температуры на ядро и прогнозирующее тепловое дросселирование.

Высокоширотные, низкоэнергетические межсоединения

В многочиповых модулях (MCM), таких как чиплет AMD, междиевая межсоединение (Infinity Fabric) оптимизирована для пропорциональности энергии. Она может динамически изменять ширину, частоту и напряжение на основе трафика. Аналогично, EMIB Intel (Embedded Multi-die Interconnect Bridge) использует очень короткую сигнализацию с низким энергопотреблением между кристаллами. В более широком масштабе CXL (Compute Express Link) по PCIe Gen 5/6 обеспечивает кэш-когерентную семантику памяти при меньшей мощности, чем предыдущие запатентованные протоколы.

Эффективные контроллеры DRAM и шифрование памяти

Доступы к DRAM являются одной из самых энергозатратных операций в системе. Процессоры CISC теперь используют интеллектуальные контроллеры памяти, которые отдают приоритет запросам памяти, чтобы минимизировать обновления строк и активировать только необходимые банки. Многоканальные контроллеры памяти также могут быть частично отключены от питания, когда требуется только один канал. Кроме того, шифровальные движки в памяти (например, IME Intel или SME AMD) работают с низкой мощностью и уменьшают потребность в программном шифровании, которое потребляет циклы процессора.

Влияние в реальном мире: от центров обработки данных до устройств Edge

Описанные выше инновации не являются теоретическими. Они напрямую транслируются в измеримую экономию энергии в реальных развертываниях.

Эффективность центров обработки данных и TCO

В гипермасштабных центрах обработки данных мощность составляет значительную часть общей стоимости владения (TCO). Современные серверы CISC от Intel (Xeon Scalable) и AMD (EPYC) включают такие функции, как P-состояние, которое агрессивно замедляет работу ядер, ограничение мощности , чтобы избежать штрафов за пиковую мощность, и глубокие C-состояния, которые позволяют процессорам эффективно спать во время низкой нагрузки. Глубокое внедрение Google пользовательских Intel Xeons с несколькими блоками AVX для облачных рабочих нагрузок иллюстрирует, как индивидуальные проекты CISC могут уменьшить энергию центра обработки данных. Кроме того, процессоры AMD EPYC с их многоядерными чиплетами могут консолидировать рабочие нагрузки на меньшее количество серверов, полностью уменьшая потребляемую мощность от простаивающих серверов.

Мобильная производительность и срок службы батареи

На мобильном фронте процессоры Intel Core (от Skylake до Meteor Lake) значительно улучшили срок службы батареи в ноутбуках. Внедрение E-cores в Alder Lake позволило ультрабукам с тонким и легким питанием достигать полного дня работы от батареи, при этом обеспечивая высокую производительность для взрывных задач. Использование Apple x86 в своих Mac на базе Intel (до перехода на Apple Silicon) также показало преимущества от итеративных улучшений эффективности, хотя компания в конечном итоге перешла на ARM. Наибольшее влияние может оказать встраиваемое и промышленное пространство, где энергоэффективные процессоры CISC, такие как Intel Atom и AMD Ryzen Embedded, IoT шлюзы, прочные планшеты и периферийные устройства AI, которые должны работать на ограниченном запасе мощности или аккумуляторе.

Edge AI и Inference

Процессоры CISC все чаще используются для вывода ИИ на краю, где бюджеты мощности ограничены. Оптимизированные библиотеки выводов Intel DL Boost (VNNI) и AMD AVX2 используют векторные расширения для эффективной работы нейронных сетей без необходимости дискретного графического процессора. В сочетании с эффективными шаблонами доступа к памяти и маломощными состояниями простоя эти процессоры могут запускать обнаружение объектов в реальном времени или обнаружение аномалий на камерах на солнечных батареях или промышленных контроллерах, потребляя всего несколько ватт.

Проблемы и будущие направления

Несмотря на эти достижения, сохраняются значительные проблемы. Фундаментальная сложность декодирования инструкций CISC по-прежнему накладывает базовые затраты на энергию, которых нет у архитектур RISC. Отрасль изучает несколько путей вперед.

Архитектурные гибриды и чиплеты

Будущее CISC может включать дальнейшую гибридизацию. Предстоящие проекты Intel могут включать в себя специализированные сопроцессоры на основе RISC для конкретных задач (например, двигатель управления или блок обработки контекста с низким энергопотреблением). Chiplets также позволяют смешивать различные узлы процессов - используя передовой, энергоэффективный узел для ядер и менее дорогой, высоковольтный толерантный узел для ввода-вывода - в одном и том же пакете. Эта гетерогенная интеграция может оптимизировать мощность по всему чипу.

AI-Driven Power Management

Машинное обучение используется для прогнозирования моделей рабочей нагрузки и проактивной регулировки решений по напряжению, частоте и мощности. Технология динамической настройки Intel уже использует телеметрию для адаптации тепловой и энергетической политики. Будущие процессоры могут встраивать легкие нейронные сети в PCU для достижения еще более быстрого и точного управления мощностью.

За пределами кремния: передовые материалы и упаковка

Инновации транзисторов, такие как Gate-All-Around (GAA) в Intel RibbonFET и передача обратной мощности (PowerVia), обещают снизить сопротивление межсоединений и обеспечить более жесткое регулирование напряжения, непосредственно повышая энергоэффективность. На стороне упаковки 3D-укладка кэша и логика с использованием гибридного соединения снижает энергетическую стоимость перемещения данных, что является доминирующим отводом энергии в современных процессорах CISC.

Компромиссы в области безопасности и эффективности

Уязвимости Spectre и Meltdown вынудили поставщиков CISC внедрять меры по смягчению последствий, которые иногда добавляли накладные расходы на электроэнергию. Будущие проекты должны решать эти проблемы безопасности без ущерба для энергоэффективности. Это означает разработку новых устойчивых к боковым каналам микроархитектур или внедрение эффективных аппаратных средств, которые не полагаются на промывку кэша или сокращение спекуляций.

Заключение

Представление о том, что процессоры CISC по своей сути неэффективны по мощности, является устаревшей реликвией. На протяжении десятилетий итеративных инноваций в управлении питанием, микроархитектуре, проектировании набора инструкций и системной интеграции современные чипы CISC стали энергоэффективными электростанциями. От смартфонов (по иронии судьбы, x86 пробовали и потерпели неудачу, но уроки были применены) до экзафлопсных суперкомпьютеров процессоры CISC теперь конкурируют за эффективность, сохраняя при этом наследие высокой однопоточной производительности и обширных программных экосистем.

По мере продвижения отрасли к гетерогенным вычислениям, чиплетным архитектурам и оптимизации на основе ИИ разрыв между CISC и RISC в энергоэффективности будет продолжать сокращаться. Обозначенные здесь инновации не просто постепенны; они представляют собой фундаментальное переосмысление процессора CISC для мира с ограниченными энергоресурсами. Следующее поколение энергоэффективных вычислений будет построено на этих основах, обеспечивая производительность, которая когда-то считалась несовместимой с низким энергопотреблением.


Внешние ресурсы: