Достижения в области цифровой электроники для высокопроизводительных вычислительных кластеров
Введение в высокопроизводительные вычисления и цифровую электронику
Кластеры высокопроизводительных вычислений (HPC) составляют основу современных научных открытий, инженерного моделирования и аналитики, интенсивной обработки данных. Эти системы объединяют тысячи вычислительных узлов для решения проблем, которые будут трудноразрешимы на одной машине. Неустанная эволюция цифровой электроники - расширяющиеся процессоры, память, хранение, межсоединения и управление мощностью - непосредственно приводит к скачкам производительности, наблюдаемым в каждом новом поколении кластеров HPC. Понимание этих аппаратных достижений имеет важное значение для архитекторов, системных администраторов и исследователей, которые стремятся максимизировать пропускную способность и минимизировать время на решение.
Инновации в области цифровой электроники сместили ландшафт от однородных кластеров процессоров к гетерогенным системам, включающим графические процессоры (GPU), программируемые на полевых условиях массивы ворот (FPGA) и пользовательские ускорители. В то же время пропускная способность памяти выросла благодаря технологиям сложенных кристаллов и новым парадигмам постоянной памяти, в то время как межсоединения продвинулись к более низкой задержке и более высокой двунаправленной пропускной способности. Эти компоненты должны работать в гармонии, и последние достижения решают давние узкие места, которые когда-то ограничивали масштабирование. В этой статье рассматривается каждая основная область цифровой электроники и объясняется, как они коллективно расширяют возможности последних кластеров HPC.
Инновации в архитектуре процессоров
Вычислительный узел является сердцем каждого кластера HPC, и дизайн процессора претерпел радикальные изменения для обеспечения операций с плавающей запятой в секунду (FLOPS), требуемых современными рабочими нагрузками. Доминируют три основные тенденции: повышенный параллелизм, специализированное ускорение и масштабирование технологических узлов.
Многоядерные и многоядерные CPU
Традиционные процессоры теперь интегрируют десятки ядер на разъем. Линии EPYC «Bergamo» от AMD и Xeon «Sierra Forest» от Intel предлагают до 128 ядер на процессор, полагаясь на меньшие узлы процессов (5 нм и 7 нм) для упаковки большего количества транзисторов при управлении мощностью. Эти конструкции подчеркивают высокую пропускную способность памяти через несколько каналов памяти и поддержку DDR5 и HBM3. Увеличение количества ядер напрямую приносит пользу параллельным рабочим нагрузкам, таким как моделирование климата, молекулярная динамика и вычислительная динамика жидкости, где задачи могут быть распределены по ядрам с минимальными накладными расходами связи.
GPU ускорители
Графические процессоры стали рабочими лошадками HPC, особенно для задач искусственного интеллекта и моделирования, которые демонстрируют массивный параллелизм данных. Архитектура NVIDIA Hopper и Blackwell обеспечивают более 60 терафлопс с двухточными характеристиками на чип, используя тензорные ядра, оптимизированные для операций с многократным накоплением матриц. Instinct MI300X и Intel Ponte Vecchio (серия максимум 1000) конкурируют через высокоширотную память и конструкции чиплетов. Эти ускорители полагаются на передовую упаковку, такую как CoWoS NVIDIA (Chip-on-Wafer-on-Substrate) и 3D V-Cache AMD, для стека вычислительных матриц и памяти, уменьшая расстояния перемещения данных.
FPGA и пользовательские ускорители
Для рабочих нагрузок, где фиксированные GPU избыточно обеспечивают, FPGA предлагают реконфигурируемую логику, которая может быть адаптирована к конкретным алгоритмам. Microsoft использует Altera FPGA в своих проекционных системах Azure для ускорения сети в реальном времени, в то время как исследовательские проекты отображают аналитику графов непосредственно на ткань FPGA. Пользовательские ASIC, такие как TPU Google (Tensor Processing Unit) и движок вафельной шкалы Cerebras, доводят специализацию до крайности. Эти устройства демонстрируют, что цифровая электроника движется к доменным архитектурам, торгуя универсальной гибкостью для увеличения эффективности заказов величины в целевых областях применения.
Узел обработки и прогресс упаковки
Сокращение геометрии транзисторов (от 7 нм до 3 нм и выше) позволяет увеличить тактовые частоты и снизить мощность за операцию. Но самые преобразующие инновации в упаковке происходят из 3D-архитектуры стекинга и чиплетов. Процессоры AMD EPYC объединяют несколько чиплетов на интерпозиторе, подключенном через Infinity Fabric. Этот модульный подход улучшает выходы и позволяет гетерогенную интеграцию - например, смешивание чиплетов процессора с чиплетами ускорителя на одном пакете. Технологии Intel Foveros и EMIB (Embedded Multi-die Interconnect Bridge) выполняют аналогичные роли, логика стекания умирает вертикально для ультракоротких межсоединительных расстояний.
Технологии памяти и хранения
Улучшения скорости процессора приводят к скорости приложения только в том случае, если данные могут быть поданы в вычислительные блоки достаточно быстро. Память и хранилище эволюционировали, чтобы соответствовать требованиям современных кластеров HPC, уменьшая расширяющийся разрыв между вычислением и доступом к данным.
Высокоширотная память (HBM)
HBM-стек DRAM гибнет вертикально, используя сквозные силиконовые сквозные сети (TSV), обеспечивая при этом огромную пропускную способность, занимая при этом небольшой участок. HBM2e предлагает до 460 ГБ/с на стек, а HBM3 достигает более 800 ГБ/с. Это имеет решающее значение для ускорителей GPU, которые требуют высокой пропускной способности памяти для обучения нейронных сетей или моделирования рендеринга. Последний NVIDIA H100 Tensor Core GPU интегрирует 80 ГБ HBM3, обеспечивая пропускную способность памяти 3,35 ТБ/с, что необходимо для обучения большой языковой модели.
DDR5 и память CXL
DDR5 DRAM стал стандартом в серверных платформах, предлагая более высокую плотность и пропускную способность по сравнению с DDR4. Что еще более важно, протокол Compute Express Link (CXL) позволяет объединять и дезагрегировать память по узлам. CXL-прикрепленная память может динамически делиться, позволяя кластерам HPC распределять емкость памяти для рабочих мест, которые в ней нуждаются больше всего, сокращая отходы и улучшая общую стоимость владения. CXL 3.0 поддерживает когерентное совместное использование памяти, что означает, что процессоры и ускорители могут получить доступ к единому пространству памяти без явного копирования, что упрощает программирование и снижает задержку.
Нелетучая память и память класса хранения
Оптанная постоянная память Intel (в настоящее время прекращена, но технология живет в других формах) ввела ярус между DRAM и SSD. Текущие решения, такие как SSD PM1743 PCIe 5.0 от Samsung и XL-FLASH от Kioxia, предлагают очень низкую задержку по сравнению с твердотельными накопителями NAND. Видение памяти класса хранения (SCM) - память, которая сохраняет данные в течение циклов питания с временем доступа в сотни наносекунд - постепенно становится жизнеспособным благодаря таким технологиям, как модули постоянной памяти MRAM и CXL. В кластерах HPC SCM может использоваться для быстрых контрольных точек, больших баз данных в памяти и ускорения метаданных.
NVMe и высокопроизводительное хранилище
Нелетучая память Express (NVMe) над тканями расширяет преимущества NVMe SSD с прямым подключением по всему кластеру. Параллельные файловые системы, такие как Lustre, GPFS (IBM Spectrum Scale) и WekaFS, используют NVMe SSD для высокой IOPS и пропускной способности. Современные системы хранения HPC теперь достигают нескольких терабайт в секунду пропускной способности чтения / записи, что позволяет проверять большие симуляции в секундах, а не минутах. Сочетание NVMe и эффективного программного обеспечения файловой системы уменьшает узкое место ввода / вывода, которое часто поражает научные рабочие процессы.
Высокоскоростные соединения
Для объединения тысяч узлов в когерентный кластер требуется сеть, которая обеспечивает низкую задержку, высокую пропускную способность и надежное управление перегрузками. Недавние достижения в технологии межсоединения напрямую влияют на масштабируемость и производительность приложений.
InfiniBand и HDR/NDR
InfiniBand остается главным межсоединением для HPC, с Mellanox (теперь NVIDIA) толкая скорости от HDR (200 Гбит/с) до NDR (400 Гбит/с) на полосу. Платформа NVIDIA Quantum-2 поддерживает 400 Гбит/с на порт, RDMA (Удаленный прямой доступ к памяти) и расширенное управление перегрузками. Эффективность InfiniBand в коллективных операциях (все сокращают, транслируют) имеет решающее значение для рабочих нагрузок машинного обучения, которые синхронизируют градиенты во многих графических процессорах. Сеть также поддерживает GPUDirect RDMA, позволяя данным перемещаться непосредственно между памятью GPU и сетевым адаптером без участия процессора, уменьшая задержку и освобождая циклы процессора.
Ethernet-продвижение
В то время как InfiniBand доминирует в системах Top500, Ethernet продолжает развиваться для использования HPC. 200 GbE и 400 GbE в настоящее время распространены, и определяются стандарты 800 GbE. Такие технологии, как RoCEv2 (RDMA по конвергентному Ethernet) привносят возможности RDMA в стандартные сети Ethernet, хотя они требуют сложного управления перегрузками (например, DCQCN), чтобы избежать потери пакетов. Open Network Linux и SONiC Open Compute Project позволяют настраивать сетевые стеки, а новые поколения коммутаторов Ethernet поддерживают балансировку нагрузки на пакет и телеметрию для шаблонов трафика HPC.
NVLink, NVSwitch и Compute Express Link (CXL)
Для внутриузловой связи между GPU, проприетарные межсоединения, такие как NVLink NVIDIA (сейчас на уровне до 900 ГБ / с двунаправленным) и NVSwitch создают полностью подключенную ткань GPU. Последние системы DGX H100 используют NVSwitch для подключения восьми GPU в одном узле с общей семантикой памяти. Аналогично, Infinity Fabric AMD связывает несколько GPU вместе. На системном уровне CXL и его варианты появляются как когерентное межсоединение для CPU-ускорителя и обмена памятью. Эти межсоединения размывают линии между границами узлов, позволяя объединять память и дезагрегированные вычисления.
Топология и сетевой дизайн
Выбор сетевой топологии (жировое дерево, стрекоза, тор) взаимодействует с базовой производительностью межсоединения. Современные кластеры HPC часто используют комбинацию технологий: высокорадиксовый переключатель в ядре (например, стрекоза) для глобальной связи и более низкий уровень задержки, более высокий уровень пропускной способности для локальных групп узлов. Достижения в цифровой электронике позволяют строить переключатели с сотнями портов по 400 Гбит/с каждый, уменьшая количество переключателей и минимизируя задержку. Сетевой дизайн также должен учитывать ограничения мощности и охлаждения, которые все более ограничивают факторы.
Управление питанием и охлаждение
Кластеры HPC потребляют мегаватты энергии, а цифровые электронные приводные вычисления также генерируют огромное количество тепла. Повышение энергоэффективности и управление тепловой энергией являются обязательными для контроля эксплуатационных расходов и воздействия на окружающую среду.
Динамическое натяжение и частотное масштабирование (DVFS)
Современные процессоры и графические процессоры поддерживают мелкозернистые DVFS, которые могут регулировать состояния мощности на основе требований к рабочей нагрузке. Графики HPC и менеджеры ресурсов могут устанавливать ограничения мощности на узел, позволяя кластерам работать в пределах пределов мощности объекта при соблюдении сроков работы. На микроархитектурном уровне такие методы, как Intel Speed Select и AMD cTDP (настраиваемый TDP), позволяют системным дизайнерам торговать пиковой производительностью для эффективности. Узлы процессов также уменьшают ток статической утечки, обеспечивая более высокую производительность при той же самой оболочке мощности.
Жидкое охлаждение и погружение
Воздушное охлаждение достигает пределов для высокоплотных узлов HPC, потребляющих 1 кВт или более на вычислительный клинок. Жидкое охлаждение с прямым к чипу циркулирует охлаждающей жидкостью через холодные пластины, прикрепленные к процессорам, графическим процессорам и другим горячим компонентам. Это более эффективно удаляет тепло, позволяя более высокие тактовые частоты или более плотную упаковку. Некоторые объекты развертывают погружение охлаждения, где целые узлы погружены в диэлектрическую жидкость. Этот подход устраняет вентиляторы, снижает шум и может достичь эффективности использования энергии (PUE) до 1,02. Японское агентство аэрокосмических исследований (JAXA) и несколько гипермасштаберов продемонстрировали кластеры HPC с погружением, которые значительно снижают потребление энергии.
Энергоэффективная связь и хранение
Межсоединения и устройства хранения также являются целями для оптимизации энергопотребления. Переключатели нового поколения используют маломощные приемопередатчики (например, 100 Гбит/с на лямбду с модуляцией PAM4) и амортизацию мощности для неработающих портов. NVMe SSD работают на долю мощности на I/O по сравнению с вращающимися дисками, а новые технологии NAND снижают активную мощность во время считывания и записи. Стойкие модули памяти могут сидеть в состояниях с низкой мощностью и быстро просыпаться при доступе. Общее управление мощностью на уровне системы требует скоординированных политик в вычислительной, сетевой и запоминающей системах, часто реализуемых через кластерный контроллер питания, который настраивается на основе рабочих характеристик.
Программное обеспечение и аппаратное обеспечение Co-Design
Инновации в области аппаратного обеспечения приносят пользу только тогда, когда программное обеспечение может их использовать. Программный стек HPC эволюционировал, чтобы обеспечить абстракции, которые скрывают сложность, одновременно выставляя критически важные функции.
Модели программирования и библиотеки
CUDA, ROCm и oneAPI позволяют разработчикам писать код, который работает на GPU и других ускорителях. Унифицированная память CUDA и кооперативные группы упрощают программирование GPU, в то время как ROCm AMD обеспечивает аналогичную функциональность для ускорителей Instinct. Один AMD использует параллельную с данными абстракцию C++ (DPC++), которая компилирует для CPU, GPU и FPGA из одной базы кода. Библиотеки, такие как cuDNN, rocBLAS и oneMKL, настроены вручную для конкретного оборудования, часто достигая почти пиковой производительности, используя конкретные наборы инструкций и иерархии памяти.
Контейнеризация и оркестровка
Сингулярность (теперь Apptainer), Docker и Podman позволяют пользователям упаковывать сложные программные стеки со всеми зависимостями. В средах HPC контейнеризация упрощает воспроизводимость и переносимость по кластерам. В сочетании с инструментами оркестровки, такими как Slurm или Kubernetes (с плагинами HPC-планировщика), контейнеры обеспечивают эластичное масштабирование и изоляцию ресурсов. Основные аппаратные абстракции, такие как NVIDIA Container Toolkit для доступа к GPU, позволяют рассматривать ускорители и сеть как ресурсы, которые могут запрашивать контейнеры.
I/O и управление данными
Подсистема ввода/вывода в кластерах HPC является критическим узким местом. Параллельные файловые системы (Lustre, GPFS) теперь интегрируются с переносчиками данных и слоями кэширования (например, DAOS от Intel, Cray DataWarp). Архитектура DAOS (Distributed Asynchronous Object Storage) использует энергонезависимую память и RDMA для обхода ядра операционной системы, достигая задержки микросекундного уровня для операций с метаданными. HDF5, NetCDF и библиотеки ADIOS обеспечивают высокоуровневые абстракции ввода/вывода, которые прозрачно используют эти инновации хранения. По мере роста наборов данных до эксабайт, интеграция интеллектуальных узлов хранения с NVMe-of и объединение памяти становится необходимой.
Тематические исследования: как цифровая электроника управляет реальными системами HPC
Чтобы оценить влияние инноваций в области цифровой электроники, рассмотрите два репрезентативных кластера HPC: лидер Frontier в Национальной лаборатории Ок-Ридж Top500 и предстоящий El Capitan в Ливерморской национальной лаборатории Лоуренса.
Frontier использует процессоры AMD EPYC и графические процессоры Instinct MI250X, подключенные межсоединением HPE Slingshot (настраиваемая ткань на основе Ethernet). Он достигает 1,2 exaFLOPS, используя память HBM2e на графических процессорах и DDR4 на узлах. Оболочка мощности системы составляет 21 МВт, что требует расширенного жидкостного охлаждения для процессоров и графических процессоров. Дизайнеры Frontier использовали архитектуру Infinity для создания унифицированной системы памяти, которая упрощает программирование. Сеть использует топологию Dragonfly для минимизации задержки в 74 шкафах.
El Capitan (ожидается 2024-2025) нацелен на 2 exaFLOPS с использованием APU Instinct MI300 следующего поколения от AMD, который объединяет чиплеты CPU и GPU на одном пакете с унифицированной памятью HBM3. Эта система использует межсоединенную версию 11 HPE Slingshot, поддерживающую 400 Гбит/с на линию связи и расширенное управление перегрузкой. El Capitan будет включать в себя объединение памяти с CXL, чтобы обеспечить большие размеры проблем для моделирования управления ядерными запасами. Цифровая электроника, стоящая за этими машинами — фиолетовая упаковка, высокоширотная память и высокорадиксовые переключатели — являются прямым результатом достижений, обсуждаемых выше.
Будущие направления в цифровой электронике для HPC
Хотя современные экзафлопсные системы являются замечательными, некоторые новые технологии обещают еще большую производительность и эффективность в ближайшее десятилетие.
Квантовые и нейроморфные вычисления
Квантовые вычисления, хотя и все еще экспериментальные для HPC общего назначения, предлагают экспоненциальное ускорение для конкретных проблем, таких как квантовая химия и оптимизация. Цифровая электроника играет роль в системах квантового управления (FPGA для считывания кубитов и коррекции ошибок) и в гибридных классических квантовых алгоритмах. Нейроморфные чипы, такие как Intel Loihi 2 и IBM TrueNorth, эмулируют биологические нейроны для пиковых нейронных сетей, которые могут значительно снизить мощность для определенных рабочих нагрузок ИИ. Эти архитектуры, не связанные с фон Нейманом, могут интегрироваться в будущие кластеры HPC в качестве сопроцессоров.
Фотонные межсоединения
Оптическая связь с использованием фотонных чипов и кремниевой фотоники может заменить медные межсоединения для соединений дальнего действия в кластерах. Такие компании, как Ayar Labs и Lightmatter, разрабатывают оптические интерпозиторы и приемопередатчики TeraPHY, которые переносят данные со скоростью сотни Гбит/с на канал, потребляя при этом меньше энергии, чем эквивалентные электрические связи. Фотонные межсоединения могут нарушить компромисс между полосой пропускания и расстоянием, позволяя полностью дезагрегировать вычислительные пулы с минимальными накладными расходами на задержку.
Экосистемы Chiplet и универсальные соединения Die
Стандарт Universal Chiplet Interconnect Express (UCIe) направлен на создание открытой экосистемы, в которой чиплеты от разных поставщиков могут быть смешаны на одной упаковке. Это позволило бы системным интеграторам HPC выбирать лучшие вычислительные, запоминающие и ускорительные чиплеты для каждого приложения, сокращая время выхода на рынок и стоимость. Расширенная упаковка (гибридное связывание, микро-накачки) является ключом к достижению требуемой плотности полосы пропускания. В течение следующего десятилетия мы можем увидеть узлы HPC, построенные из десятков чиплетов, каждый из которых оптимизирован для конкретной функции.
Энергетические пропорциональные вычисления
Будущая цифровая электроника будет стремиться к пропорциональному поведению энергии, где потребление энергии масштабируется линейно с использованием. Это требует схем, которые могут динамически заводить часы, рельсы питания и целые логические блоки. Управление питанием на основе ИИ - с использованием датчиков на чипе и обучение усилению - регулирует напряжение и частоту в реальном времени. В кластерной шкале ограничение и планирование мощности с учетом рабочей нагрузки станут стандартными, потенциально снижая общее потребление энергии на 20-30% без ущерба для пропускной способности.
Заключение
Достижения в цифровой электронике являются двигателем неустанного прогресса высокопроизводительных вычислительных кластеров. От многоядерных процессоров и ускорителей GPU до памяти с высокой пропускной способностью, межсоединения с низкой задержкой и интеллектуального управления мощностью каждый компонент эволюционировал, чтобы преодолеть конкретные узкие места, которые когда-то ограничивали масштабирование. Интеграция чиплетов, фотоники и ускорителей, специфичных для домена, обещает расширить преимущества Moore's Law-like даже в то время, когда традиционное масштабирование транзисторов замедляется. Для практиков HPC оставаться в курсе этих разработок имеет решающее значение для проектирования систем, которые могут решать следующие поколения грандиозных задач в науке, технике и искусственном интеллекте. Примеры Frontier и El Capitan иллюстрируют, что инновации в области цифровой электроники не просто теоретические - они обеспечивают экзафлопсную производительность сегодня, и будущие системы станут только более мощными и эффективными.