Вычислительные требования науки о климате

Современные климатические модели входят в число наиболее вычислительно интенсивных рабочих нагрузок во всех научных исследованиях. Моделирование атмосферы Земли, океанов, поверхности суши и морского льда в течение десятилетий или столетий требует решения миллионов связанных дифференциальных уравнений. Эти модели используют трехмерную сетку, которая часто охватывает весь земной шар с горизонтальным разрешением 10 км или более, с тысячами вертикальных слоев. Каждый шаг — иногда короткий, как полсекунды смоделированного времени — должен вычислять динамику жидкости, радиационный перенос, фазовые изменения воды, химические реакции и множество параметризованных процессов, таких как формирование облаков, турбулентность и взаимодействие с поверхностью земли. Запуск одновекового моделирования модели системы Земли с высоким разрешением (ESM) на обычном кластере ЦП может потреблять недели настенного времени и мегаватт-часов электроэнергии. Это узкое место ограничивает как научную пропускную способность, так и способность выполнять большие ансамбли, необходимые для количественной оценки неопределенности в будущих климатических прогнозах.

Стремление к более точному разрешению и более физически полным моделям подталкивает обычное оборудование к своей критической точке. Графические процессоры (GPU) были широко приняты во многих областях HPC, но их эффективность в климатических рабочих нагрузках варьируется. Алгоритмы, в которых доминируют операции трафаретов и редкая линейная алгебра, часто не могут эффективно отображаться на потоковых мультипроцессорах GPU, оставляя значительную производительность на столе. Между тем, полевые программируемые воротные массивы (FPGA) появились в качестве убедительной альтернативы, предлагая крайнюю настраиваемость и параллелизм трубопроводов, которые могут быть адаптированы к конкретным шаблонам потоков данных климатических кодов. С появлением памяти высокой пропускной способности (HBM) на современных картах FPGA, эти устройства теперь могут обрабатывать массивные наборы климатических данных, не будучи связанными I / O. Вычислительные требования только увеличиваются: Межправительственная группа по изменению климата (IPCC) требует многовекового моделирования в разрешениях, где динамика облаков явно решена, цель, которая требует аппаратного обеспечения, способного обеспечить устойчив

Что делает архитектуру FPGA уникальной

FPGA - это перенастраиваемое кремниевое устройство, состоящее из массива логических блоков, срезов цифровой обработки сигналов (DSP), блоковой RAM (BRAM) и программируемого межсоединения. В отличие от процессора, который последовательно извлекает и декодирует инструкции или графического процессора, который выдает одну и ту же инструкцию многим полосам данных в шаге блокировки, FPGA может быть запрограммирован для реализации пользовательской схемы, которая обрабатывает данные, когда она проходит через глубоко трубопроводный путь передачи данных. Дизайнеры описывают аппаратную логику с использованием аппаратных языков описания, таких как VHDL или Verilog, или все чаще с помощью инструментов описания C / C++ на уровне регистра-передачи (RTL). результирующий битовый поток загружается на FPGA, эффективно превращая его в интегральную схему для конкретных приложений (ASIC), которая может быть перепрограммирована всякий раз, когда алгоритм изменяется.

Эта архитектурная гибкость дает несколько уникальных преимуществ для научного моделирования. Во-первых, FPGA может использовать мелкозернистый параллелизм трубопроводов в нескольких масштабах: битовый, операторский и целевой уровни. Данные перемещаются по цепочке выделенных арифметических блоков без накладных расходов на выполнение инструкций, декодирование или управление кэшем. Хорошо спроектированный конвейер может достигать интервала инициации 1 - это означает, что один результат возникает каждый тактовый цикл после начальной задержки. Во-вторых, иерархия памяти на чипе - BRAM, ультра-RAM (URAM) на больших устройствах и распределенная ОЗУ - может быть организована в точно сформированные буферы, которые соответствуют шаблону доступа к данным трафаретом, устраняя ошибки кэша, которые мешают процессорам общего назначения. В-третьих, связанные с кэшем операции, такие как чтение и запись в память с вычитанными чипами или сетевые интерфейсы, могут быть отделены от вычислений с использованием глубокой буферизации и многоканальных контроллеров памяти. Это позволяет вычислительному конвейеру оставаться насыщенным даже тогда, когда система памяти находится под большой нагрузкой, возможность критическ

Почему FPGA Excel в ядрах моделирования климата

Климатические модели не монолитны; они представляют собой большие наборы взаимодействующих компонентных процедур, многие из которых имеют общие вычислительные мотивы, которые идеально подходят для ускорения FPGA.

  • Вычисления на трафаретах — Они появляются повсеместно в динамическом ядре (решатели с конечной разницей или спектральными элементами для примитивных уравнений) и в транспортных схемах для адвекции трассера. FPGA могут разворачивать внутренние пространственные петли в глубоко трубопроводные паттерны данных, которые вычисляют несколько точек сетки на тактовый цикл, одновременно получая соседние значения из пользовательских окон сдвига-регистратора, реализованных в BRAMs. Используя линейные буферы или систолические массивы, FPGA может доставлять один результат трафарета на цикл, эффективно скрывая задержку памяти. Например, 25-точечный трафарет на сетке 256×128 может быть полностью трубопроводирован с задержкой всего в несколько сотен циклов, после чего пропускная способность составляет одну точку сетки на цикл независимо от радиуса трафарета.
  • Сокращение и префиксные суммы — Диагностика глобальных величин, таких как общая энергия, сохранение массы или вычисление оптических глубин в модуле радиационного переноса, требуют параллельных сокращений. FPGA реализуют деревья сокращения с логарифмической глубиной, которые дают результаты с детерминированной задержкой и низким энергопотреблением. Дерево сокращения с использованием 32-битных добавителей с плавающей точкой может объединять 1024 входа всего за 10 тактовых циклов, по сравнению с O(log N), но с более высокими накладными расходами на графические процессоры из-за синхронизации потоков.
  • Спарастрофическая линейная алгебра — Имплицитные решатели для вертикальной диффузии, динамики морского льда или коррекции давления океана включают разреженные матрицы с нерегулярными шаблонами разреженности. Пользовательские архитектуры FPGA могут обрабатывать произвольную разреженность, сохраняя сжатые форматы (например, CSR, COO) и используя декодирование на лету, избегая накладных расходов на деформацию деформации, наблюдаемых в графических процессорах. Параллельно могут быть инстанцированы несколько независимых решателей, каждый из которых работает на разных столбцах климатической сетки. Один FPGA может содержать 64 независимых тридиагональных решателя, каждый завершающий 60-неизвестную систему каждые 60 циклов, достигая совокупной пропускной способности более 1 триллиона системных решений в секунду для небольших систем.
  • Параметрическая оценка модели — Параметризации субсетевых масштабов, такие как облачная микрофизика, химия аэрозолей и потоки наземной поверхности, часто состоят из многочисленных небольших независимых вычислений со многими условными ветвями. FPGA могут инстанцировать параллельные копии логики параметризации — каждая обрабатывает отдельный столбец — и использовать поток данных для поддержания активности всех блоков. Отсутствие штрафов за неверное прогнозирование ветвей и возможность использовать арифметику индивидуальной точности еще больше увеличивают пропускную способность. Недавняя работа с параметризацией CLUBB показала, что FPGA может обрабатывать 256 столбцов одновременно на частоте 300 МГц, в то время как ядро процессора обрабатывает всего 1 столбец за шаг времени на аналогичной частоте.

Загружая эти горячие точки в одну или несколько FPGA, целые модели могут достигать значительных ускорений - часто от 10 до 50 × для ускоренного модуля - при одновременном снижении энергии на моделирование на 30-60% по сравнению с базовыми линиями только для процессора или GPU. Важно отметить, что, поскольку FPGA являются реконфигурируемыми, ученые могут обновлять дизайн аппаратного обеспечения по мере развития кода модели, что невозможно с помощью ASIC с фиксированной функцией. Возможность быстрой итерации аппаратных конструкций с использованием HLS означает, что разработчики моделей могут рассматривать FPGA как настраиваемый сопроцессор, который адаптируется к меняющимся физическим схемам.

Картографирование физики климата на FPGA Fabric

Динамические ядра и трубопроводы трафаретов

Динамическое ядро климатической модели решает уравнения движения на сфере. Дискретизации, такие как кубические сферические методы конечного объема или спектрального элемента, производят большие операции трафарета, которые должны быть применены ко всей глобальной сетке несколько раз за смоделированный час. Наивная реализация CPU 7-точечного или 25-точечного трафарета страдает от плохого повторного использования кэша, когда радиус трафарета велик относительно размера линии кэша. Однако на FPGA трафарет может быть реализован с архитектурой строки-буфера. FPGA считывает поток поля ввода из внешней памяти, заполняет набор регистров сдвига, которые содержат соседние строки, и подает параллельный вычислительный массив, который выводит результат трафарета в полностью трубопроводном виде - один результат за тактовый цикл после начальной задержки, которая зависит только от радиуса трафарета. Это эффективно устраняет узкое место на стенке памяти для трафаретных ядер.

В недавней работе, опубликованной в IEEE Transactions on Parallel and Distributed Systems , продемонстрирован ускоритель трафарета для негидростатической ICosahedral Model (NICAM) на карте Xilinx Alveo U280, обеспечивающий устойчивую производительность 4,2 TFLOPS при однократном потреблении всего 45 Вт, по сравнению с 300 Вт для высокопроизводительного процессора, обеспечивающего аналогичную пропускную способность. Ключом был оптимизированный вручную поток данных, который буферизировал индексацию икосаэдрической сетки в таблицах поиска на основе BRAM, переводя нерегулярную компоновку сетки в регулярный поток доступа. В конструкции использовались 32 параллельных трафаретных двигателя, каждый из которых обрабатывал различную горизонтальную плитку, и сообщали граничные условия через память FPGA на чипе, чтобы избежать трафика вне чипа. Реализация для динамического ядра с кубической сферой конечного объема в модели системы Земля сообщества (CESM)

Для ядер спектральных элементов, таких как те, которые используются в ядре HOMME в CESM, FPGA могут ускорять локальные матрично-векторные продукты, которые доминируют в решении элемента за элементом. Матрица жесткости каждого элемента хранится на чипе и применяется конвейерным способом, причем несколько элементов обрабатываются одновременно с использованием реплицированных вычислительных блоков. Ранние результаты Национального центра атмосферных исследований (NCAR) показывают, что один процессор Intel Stratix 10 FPGA может соответствовать пропускной способности 20-ядерного процессора Xeon для динамического ядра спектрального элемента HOMME при использовании менее одной трети мощности.

Радиационный перенос и расчет оптической глубины

Модуль радиационной передачи вычисляет скорости нагрева путем интеграции солнечных и тепловых инфракрасных потоков через сотни спектральных полос. Оптические свойства каждой колонны зависят от температуры, давления и количества поглотителя, что приводит к каскаду таблиц поиска и экспоненциальных интеграций. Этот модуль, как известно, трудно векторизовать на GPU, поскольку поток управления сильно расходится между колоннами, в зависимости от схем перекрытия облаков и распределения аэрозолей. На FPGA можно инстанцировать глубокий трубопровод, который обрабатывает одну спектральную полосу на тактовый цикл при агрегировании результатов колонки, или альтернативно воспроизвести полностью трубопроводный процессор колонки несколько раз для обработки сотен колонн одновременно. Лаборатория геофизической гидродинамики FPGA экспериментировала с реализацией RRTMGP с ускорением 12 × над одним ядром Xeon для длинноволнового излучения, что позволило использовать более высокое спектральное разрешение без надувания среды выполнения модели. В конструкции использовались пользовательские операторы с плавающей точкой с пониженной точностью (24-битная мантисса), которые все еще отвечали требованиям точности, экономя логические ресурсы и мощность. Кроме того,

Океаническая циркуляция и неявные растворители

Модели океана, такие как модульная модель океана (MOM6), в значительной степени полагаются на неявные решения для свободной поверхности и параметризации вертикального смешивания. Они включают в себя тридиагональные или более общие разреженные матричные инверсии вдоль каждой колонки. Поскольку матрицы малы (обычно 60×60 от 60 вертикальных уровней), но многочисленны (один на горизонтальную ячейку сетки), пакетный ускоритель FPGA может решать тысячи независимых линейных систем параллельно с использованием глубоко трубопроводного пользовательского решателя. Каждый экземпляр решателя может содержать реализованный аппаратным обеспечением алгоритм Томаса для тридиагональных систем, достигая интервала инициации 1 - это означает, что новый результат решения выскакивает каждый тактовый цикл после заполнения трубопровода. Используя память HBM2e с пропускной способностью до 460 ГБ / с, ускоритель может передавать данные сотням параллельных решателей без остановки. При сочетании с архитектурой потоковой передачи, выполнение компонента океана может быть почти невидимым в общем времени модели, позволяя процессору сосредоточиться на I / O и оркестровке. Прототип в Университете Вашингтона продемонстрировал 256 параллельны

Сравнение FPGA с GPU и CPU

Выбор ускорителя для моделирования климата включает в себя сложный компромисс между производительностью, программируемостью и зрелостью экосистемы. GPU предлагают огромную пиковую пропускную способность с плавающей точкой и относительно знакомую модель программирования CUDA с богатым набором библиотек для плотной линейной алгебры и FFT. Для очень регулярных, плотных рабочих нагрузок, таких как спектральные преобразования в динамическом ядре, GPU часто являются лучшим выбором. Однако для нерегулярных трафаретов, физики на основе колонок и разреженных решателей, которые доминируют в климатических кодах, FPGA могут обеспечить более высокую долю пиковой производительности без накладных расходов на планирование потоков и коалесцирование памяти. Исследование 2023 года в Национальной лаборатории Oak Ridge сравнило GPU V100 и Stratix 10 FPGA на модели атмосферы сообщества (CAM) физический пакет. FPGA поддерживал 78% своей теоретической пиковой производительности в 32-битной плавающей точке, в то время как GPU достигал только 23% для тех же ядер, в первую очередь из-за накладных расходов

Эффективность энергопотребления - еще одно измерение, где FPGAs сияют. Достижение 10 TFLOPS на GPU может потребовать 400 Вт, тогда как ускоритель на основе FPGA может обеспечить сопоставимую эффективную пропускную способность при 75-100 Вт, когда алгоритм хорошо соответствует потоку данных. В эпоху экзафлопсных вычислений, когда общая мощность системы ограничена и углеродные следы должны быть сведены к минимуму, каждый ватт, сэкономленный FPGA, переводится в дополнительные вычислительные ресурсы или снижение воздействия на окружающую среду. Метрика «Энергия-решение» имеет решающее значение для климатических центров, которые работают непрерывно, часто 24/7, и должна оправдывать их потребление энергии для финансирующих учреждений и общественности. Детальное сравнение с FLT:0]Oak Ridge Leadership Computing Facility показало, что для типичного 100-летнего моделирования CESM ускоренный узел может снизить общее потребление энергии на 35% по сравнению с GPU-эквивалентным узлом при достижении той же пропускной способности.

Однако FPGA не являются панацеей. Они требуют другого рабочего процесса разработки: разработчики аппаратного обеспечения должны думать с точки зрения тактовых циклов, этапов трубопровода и бюджетов ресурсов. В то время как инструменты HLS (такие как AMD Vitis HLS и Intel oneAPI) снизили барьер - позволяя описания на основе C с прагмами для руководства синтезом - оптимизация для закрытия времени и маршрутизации все еще может занять несколько месяцев для сложных конструкций. Программная экосистема для ускоренного HPC FPGA менее зрелая, чем CUDA; интеграция с моделями на основе MPI обычно требует пользовательского кода на стороне хоста и тщательного картирования памяти. По этим причинам многие группы принимают гибридную стратегию, используя графические процессоры для динамического ядра и FPGA для физических параметризаций, тем самым сочетая сильные стороны обеих архитектур.

Реальные мировые программы развертывания и исследования

Несколько крупных учреждений активно изучают ускорение FPGA для прогнозирования климата и погоды:

  • Европейский центр среднесрочных прогнозов погоды (ECMWF) создал прототип ускоренных FPGA версий ядра спектрального преобразования IFS на картах AMD/Xilinx Alveo. Конструкция снижает стоимость связи за счет переключения вычислений непосредственно внутри ткани FPGA, достигая 2,5-кратного сокращения движения данных и 1,4-кратного общего ускорения для процедуры спектрального преобразования. ECMWF в настоящее время оценивает кластер мульти-FPGA для ассимиляции данных глобального ансамбля.
  • JAMSTEC в Японии перенес части глобальной модели NICAM для решения облачных задач на Intel Stratix 10 FPGA с использованием HLS на основе OpenCL. Ядро адвекции достигло почти линейного масштабирования на восьми FPGA, подключенных через высокоскоростную топологию колец, демонстрируя, что кластеры FPGA могут обрабатывать разложение домена и обмен ореолом, необходимый для крупномасштабного моделирования климата. Их результаты показали 5-кратное ускорение динамического ядра на одном FPGA по сравнению с 16-ядерным процессором.
  • Национальный центр атмосферных исследований (NCAR) работал с Университетом Колорадо над реконфигурируемым климатическим ускорителем (RCA), который сочетает в себе мягкие процессоры RISC-V с пользовательской логикой FPGA для выполнения параметризации облачных слоев, унифицированных бинормами (CLUBB). Гибридная конструкция уменьшила задержку в разы по сравнению с ядром процессора в 17 раз, сохраняя при этом битовоспроизводимые результаты благодаря тщательному дизайну дерева сокращения. NCAR планирует интегрировать RCA в прототип рабочего процесса моделирования климата.
  • Британское Метеорологическое бюро сотрудничало с Maxeler Technologies (теперь часть Groq) для ускорения кода излучения Единой модели. Настраиваемый механизм потока данных обеспечил 35-кратное ускорение по базовому уровню процессора, что побудило Метеорологическое управление оценить FPGA для оперативного прогнозирования погоды. Последующая работа была сосредоточена на переносе всего физического пакета на FPGA с многообещающими ранними результатами для цикла связи динамика-физика. Ожидается реализация производственного уровня в течение двух лет.
  • Немецкий центр климатических вычислений (DKRZ) тестирует ускорители FPGA для модели ICON (Icosahedral Nonhydrostatic). Начальные бенчмарки на процессоре Xilinx Alveo U250 показывают, что ядро трассирующего транспорта может быть ускорено на 8× по сравнению с 32-ядерным процессором Ice Lake, при этом FPGA потребляет только 75 Вт против 280 Вт для процессора. DKRZ также изучает использование FPGA для сжатия выходных данных моделирования в режиме реального времени, уменьшая потребности в хранении на 5× без значительной потери научной информации.

Интеграционные вызовы и практические решения

Сложность программирования и зрелость HLS

The historic barrier to FPGA adoption in climate science has been the need for hardware design expertise. Writing efficient VHDL or Verilog for a complex stencil kernel can take a skilled engineer several months. High‑Level Synthesis, offered by both Intel (Quartus HLS via oneAPI) and AMD (Vitis HLS), enables domain scientists to write kernels in C++ with pragmas to guide pipelining and memory partitioning. HLS can dramatically reduce development time from months to weeks, but achieving performance comparable to hand‑crafted RTL still requires familiarity with hardware‑aware coding practices: loop unrolling factors, array partitioning, and memory banking must be explicitly specified. To bridge this gap, research groups have developed domain‑specific languages (DSLs) and template libraries. The Climate Modeling Alliance has created an HLS template library for geophysical fluid dynamics stencils that abstracts away most hardware details, letting scientists describe the stencil in a high‑level mathematical notation that the toolchain compiles toАналогично, проект с открытым исходным кодом HLS4ML, первоначально разработанный для физики элементарных частиц, был адаптирован для создания ускорителей FPGA для эмуляторов нейронных сетей климатической модели, что еще больше снижает барьер.

Движение данных хоста-акселератора

Общим недостатком гетерогенных вычислений является то, что передача данных между памятью ЦПУ и картой ускорителя может стать узким местом. Климатические модели генерируют огромные объемы данных - глобальное моделирование на 1 км может производить десятки терабайтов данных состояния на модель-день. Если каждый шаг физики времени требует копирования всего атмосферного состояния на FPGA и обратно, преимущество производительности ускорителя может быть растрачено. Решение заключается в принятии потоковой архитектуры: как только начальное состояние загружается на FPGA, устройство обрабатывает несколько этапов времени внутри, сообщая только граничные условия и диагностические выходы. Прямая связь FPGA-to-FPGA более 100 ГБЕ или ткань PCIe может дополнительно уменьшить участие хоста, эффективно создавая перенастраиваемый суперкомпьютер для моделирования климата. Новый стандарт CXL (Compute Express Link) также обещает обеспечить кэш-когерентный доступ к памяти между центральными процессорами и памятью FPGA, устраняя явные копии данных. В то же время платформы, такие как BittWare IA-840F и серия AMD Alveo поддерживают прямую одноран

Верификация и воспроизводимость на битовом уровне

Климатические моделисты требуют бит-идентичные или, по крайней мере, статистически идентичные результаты на разных аппаратных платформах для проверки новых архитектур и обеспечения сопоставимости ансамблевых прогонов. Блоки FPGA с плавающей точкой, обычно придерживающиеся IEEE-754, могут быть сконфигурированы для соответствия режимам округления процессора. Однако переупорядочение операций в глубоко трубопроводном паттерне данных может изменять порядок накопления, приводя к крошечным расхождениям, которые накапливаются в ходе длительного моделирования. Для решения этой проблемы дизайнеры реализуют деревья сокращения с детерминированным упорядочиванием, часто используя компенсированную суммировку (алгоритм Кахана), реализованную в арифметике фиксированной точки или плавающей точки блока в FPGA. Опубликованная работа из ETH Zurich показывает, что такие методы могут достигать бит-точных результатов по сравнению с пробегами с двойной точностью процессора, все еще предлагая значительные ускорения. Кроме того, использование бит-точных тренажеров и формальных инструментов проверки для конструкций RTL гарантирует, что ускоритель ведет себя одинаково в нескольких прогона

Будущие горизонты: ИИ, облака и архитектуры следующего поколения

Заглядывая вперед, пересечение ускорения FPGA, машинного обучения (ML) и облачных вычислений обещает изменить моделирование климата. Параметризации на основе ML, которые заменяют традиционную субсетевую физику нейронными сетями, обученными на моделях с высоким разрешением или наблюдениях, являются вычислительно эффективными, но все еще требуют огромной пропускной способности вывода. FPGA, с их способностью реализовывать пользовательские точные (например, 8-битные, 12-битные или смешанные) ускорители нейронной сети, могут обслуживать эти модели ML со скоростью миллионов предсказаний в секунду, все в пределах оболочки мощности, совместимой с облачным экземпляром. Исследования из NASA продемонстрировали эмулятор на основе FPGA для кода излучения GISS ModelE с использованием квантованной нейронной сети, которая была на 200 × быстрее, чем исходный код Fortran с незначительной потерей точности. Это открывает дверь для замены целых физических модулей с изученными эмуляторами, работающими полностью на FPGA. Сочетание FPGA и ML также позволяет онлайн коррекцию смеще

Облачные провайдеры теперь предлагают экземпляры FPGA (AWS F1, Azure NP-Series, Alibaba Cloud f3) с предварительно построенными оболочками, что позволяет климатологам арендовать ускорение FPGA по требованию. В облачной среде несколько FPGA могут быть организованы как динамически перенастраиваемый кластер, масштабируемый с размером моделирования. Сочетание ускорения FPGA и бессерверных вычислений может в конечном итоге позволить исследователям запускать климатические прогнозы высокого разрешения в качестве услуги, вызванной экстремальными погодными явлениями, без владения специализированным оборудованием. Новые инструментальные цепочки с открытым исходным кодом (Symbiflow, Verilator) также уменьшают блокировку поставщиков, позволяя переносимым конструкциям, которые могут быть отображены на FPGA от разных производителей. Проект F4PGA обеспечивает поток компиляции с открытым исходным кодом для Xilinx-совместимых FPGA, позволяя климатологам экспериментировать с пользовательскими архитектурами без патентованных лицензий.

Следующее поколение устройств FPGA будет встраивать более продвинутые жесткие IP-блоки, такие как двигатели AI (AMD Versal ACAP) с векторными процессорами, тесно связанными с программируемой логикой, и даже более тесная интеграция с высокоширотной памятью (HBM2e / HBM3). Эти платформы позволят одноустройству работать с производительностью, превышающей 10 TFLOPS для двухточной плавающей точки, что позволит ускорить не только физические параметризации, но и целые компоненты модели. Между тем, стандарты OpenCAPI и CXL уменьшат задержку между FPGA и центральными процессорами, еще больше размыв линию между универсальными и реконфигурируемыми вычислениями. С толчоком к экзафлопсным и зеленым вычислениям FPGA готовы стать стандартным компонентом в климатических суперкомпьютерах, дополняя CPU и GPU в сбалансированной гетерогенной архитектуре.

Экономические соображения и соображения устойчивости

Ускорение климатических моделей с помощью FPGA является не просто техническим решением; оно имеет значительные экономические и экологические аспекты. Недавний анализ жизненного цикла аффилированных с Green500 исследователей предполагает, что FPGA-ускоренные кластеры могут уменьшить углеродный след моделирования на 30-50% по сравнению с CPU-только кластерами, обеспечивающими одинаковую научную производительность. Первоначальная стоимость FPGA-панелей выше, чем GPU на основе per-peak-FLOP, но общая стоимость владения в течение 5-летнего срока службы системы HPC часто благоприятствует FPGA, когда учитываются затраты на энергию и инфраструктура охлаждения. Кроме того, реконфигурируемость FPGA позволяет повторно использовать одно и то же оборудование для различных научных областей - геномики, материаловедения или физики частиц - между климатическими кампаниями, улучшением использования оборудования и амортизацией капитальных затрат. В климатических центрах одна FPGA-карта может ускорить несколько компонентов модели, просто загружая различные битовые потоки, уменьшая потребность в выделенном оборудовании для каждой параметризации. Примером является подход DKRZ [[FLT

С точки зрения устойчивости способность снижать потребление энергии на моделирование напрямую способствует достижению целей по сокращению выбросов углерода в климатическом исследовательском сообществе. Многие климатические центры обязались достичь чистых нулевых выбросов к 2030 году, а ускорение на основе FPGA является конкретным технологическим путем для достижения этой цели. В HPCwire сообщили, что крупнейшие объекты моделирования климата, такие как Национальный исследовательский научный вычислительный центр энергетики (NERSC), инвестируют в испытательные стенды FPGA специально для снижения эксплуатационных выбросов углерода.

Заключение

FPGA больше не являются экзотическим любопытством в климатическом моделировании; они являются практичной, энергоэффективной и все более доступной технологией ускорителей, которая обращается к конкретным вычислительным моделям моделей системы Земли. От потоковых трубопроводов трафаретов, которые устраняют стену памяти, до пользовательских разреженных решателей и эмуляторов нейронных сетей, FPGA предлагают путь к экзафлопсному прогнозированию климата с резко меньшим потреблением энергии. Хотя проблемы в сложности программирования и интеграции остаются, достижения в синтезе высокого уровня, доменных библиотеках и облачных платформах FPGA неуклонно снижают барьер. По мере того, как климатический кризис обостряет спрос на своевременные прогнозы с высоким разрешением, роль реконфигурируемого оборудования в инструментарий климатолога будет только расти, дополняя процессоры и графические процессоры для обеспечения вычислительной производительности, необходимой для устойчивого будущего.