Моделирование потока охлаждающих веществ в высокопроизводительных вычислительных серверах с использованием Ansys Fluent
Критическая роль анализа охлаждающего потока в высокопроизводительных вычислениях
Серверы высокопроизводительных вычислений (HPC) являются основой современных научных исследований, обучения ИИ, финансового моделирования и крупномасштабной аналитики данных. Эти системы упаковывают тысячи процессоров, графических процессоров и модулей памяти в плотные стойки, генерируя огромные тепловые нагрузки - часто превышающие 30 кВт на стойку. Без эффективного управления тепловыми нагрузками компоненты ухудшаются, дроссельная заслонка и скорость отказа резко возрастают. Традиционное воздушное охлаждение достигает своих пределов по мере увеличения плотности мощности, что делает необходимым моделирование жидкостного охлаждения и расширенный воздушный поток. Вычислительная динамика жидкости (CFD) , особенно с использованием таких инструментов, как Ansys Fluent , стал стандартным инженерным подходом для прогнозирования и оптимизации поведения охлаждающей жидкости в корпусах HPC.
В этой статье рассматривается полный рабочий процесс моделирования потока охлаждающей жидкости в серверах HPC с помощью Ansys Fluent, от подготовки геометрии до постобработки, и объясняется, почему дизайн на основе CFD незаменим для центров обработки данных следующего поколения.
Тепловой вызов в современных HPC-серверах
Современные процессоры и графические процессоры могут потреблять 300-700 Вт каждый, и один узел HPC может рассеивать 1-2 кВт. При густонаселенности в стойках общий тепловой поток требует сложных стратегий охлаждения. Ключевые проблемы включают:
- Образование горячей точки: Неравномерный поток воздуха из-за размещения компонентов, обструкций кабеля или отказа вентилятора приводит к локализованным температурам, превышающим безопасные пределы.
- Падения давления: Сжатые пространства и радиаторы создают сопротивление, уменьшая поток охлаждающей жидкости к компонентам нисходящего потока.
- Шум и энергетические штрафы: Работающие вентиляторы на высоких скоростях для компенсации плохого воздушного потока потребляют значительную мощность - до 15% от общей энергии центра обработки данных.
- Выбор охлаждающих веществ: Воздух, вода, диэлектрические жидкости или двухфазные хладагенты имеют уникальные тепловые свойства и характеристики потока, которые должны быть точно смоделированы.
Физическое прототипирование каждой итерации дизайна является дорогостоящим и трудоемким. Моделирование CFD позволяет быстро и недорого оценить десятки конфигураций перед созданием оборудования.
Почему Ansys Fluent используется для моделирования HPC?
Ansys Fluent является одним из наиболее широко используемых CFD-решателей в промышленности и научных кругах.
- Комплексные физические модели: Турбулентный поток, теплообмен (проводимость, конвекция, излучение), многофазный поток и взаимодействие жидкостной структуры.
- Параллельные вычислительные возможности: Эффективно масштабируется на нескольких ядрах / графических процессорах, что имеет решающее значение для больших моделей серверов с миллионами ячеек.
- Интеграция с CAD: Импортирует детальную геометрию из SolidWorks, Creo или других инструментов, сохраняя сложные функции, такие как решетки плавников и лопасти вентиляторов.
- Создание устойчивой сетки: Поддерживает структурированные, неструктурированные и многогранные сетки с локальной уточнением для пограничных слоев.
Для охлаждения HPC Fluent используется для имитации как систем с воздушным охлаждением (форсированная конвекция над радиаторами), так и решений с жидкостным охлаждением (холодные пластины, резервуары для погружения или насосные петли).
Рабочий процесс моделирования: шаг за шагом
1.Создание и упрощение геометрии
Моделирование начинается с 3D CAD модели серверного шасси, в том числе материнских плат, процессоров, графических процессоров, радиаторов, вентиляторов и воздуховодов. Однако полнодетальная модель может быть вычислительно непомерно. Инженеры обычно:
- Упростите небольшие функции: винты, шарфы и кабели, которые не оказывают существенного влияния на воздушный поток.
- Представляют собой теплоотводы в виде пористых сред или подробных решеток плавников в зависимости от желаемой точности.
- Используйте плоскости симметрии, когда макет сервера повторяется (например, несколько идентичных слотов).
Pro tip: Для систем с жидкостным охлаждением моделируйте каналы с холодными пластинами и твердый блок источника тепла отдельно, назначая соответствующие теплопроводности.
2.Стратегия сетки
Сетка разделяет геометрию на дискретные элементы (ячейки), где решаются уравнения потока. Качественная сетка имеет решающее значение для точных результатов. Общие подходы в моделировании охлаждения HPC:
- Неструктурированная тетраэдрическая сетка: Быстро генерируется для сложных геометрий, но требует много ячеек для разрешения пограничного слоя.
- Полигедальная сетка: Предлагает хороший компромисс между количеством клеток и точностью; родное многогранное преобразование Fluent может уменьшить количество клеток на 3-5 × по сравнению с тетраэдральным.
- Слои прайма: Прикреплены к твердым стенкам для захвата вязкого подслоя (y+ ~1). Необходим для точного прогнозирования коэффициентов теплопередачи.
- Исследование независимости сетки: Запуск моделирования на постепенно более тонких сетках до тех пор, пока ключевые выходы (падение давления, максимальная температура) не изменятся менее чем на 2%.
Типичное моделирование на уровне сервера использует 5-20 миллионов ячеек. С параллельным решателем Fluent, стационарный запуск может завершиться через 1-4 часа на 64-ядерной рабочей станции.
3. граничные условия и материальные свойства
Для сервера с воздушным охлаждением, типичные БЦ включают:
- Впуск: Скорость или скорость потока массы на основе спецификаций вентилятора, с интенсивностью турбулентности (например, 5%) и гидравлическим диаметром.
- Пустошь: Пустошь давления при условиях окружающей среды (давление калибра = 0 Па или небольшое отрицательное значение для имитации выхлопа).
- Источники тепла: Объемная генерация тепла (W/m3) или фиксированная температура для чипов. Используйте максимальную температуру соединения производителя (например, 85°C для процессоров).
- Стены: Состояние без скольжения; конъюгированный теплообмен через твердые компоненты (база теплоотвода, шасси).
- Фановые зоны: Модель как источники импульса или детализированные вращающиеся области (MRF или сдвижная сетка).
Свойства материала (плотность, удельное тепло, теплопроводность, вязкость) должны быть температурно-зависимыми для газов, таких как воздух; несжимаемый закон идеального газа Fluent подходит для низких чисел Маха.
4. Настройки растворителя и моделирование турбулентности
Поток внутри серверов турбулентный (Re > 104 в большинстве регионов). Fluent предлагает несколько моделей турбулентности; наиболее часто используемыми для охлаждения HPC являются:
- k-эпсилон (стандартный или реализуемый): Надежный и экономичный в вычислительном отношении; хорош для областей основного потока, но может недооценивать теплопередачу околостенной.
- k-omega SST: Смешивает k-omega вблизи стен и k-epsilon в свободном потоке; рекомендуется для точных предсказаний теплопередачи в сложных геометриях.
- Переход SST: Полезен для потоков с ламинарно-турбулентным переходом, например, вокруг плавников теплоотвода.
Для моделирования в устойчивом состоянии используйте растворитель на основе давления с простым или сопряженным алгоритмом. Включите энергетическое уравнение для теплопередачи. Коэффициенты пониженного расслабления (0,3-0,7) стабилизируют конвергенцию. Мониторинг остатков (непрерывность, импульс, энергия) и температуры ключевых точек для оценки конвергенции (обычно 1e-4 для непрерывности, 1e-6 для энергии).
5. Постпроцессинг и толкование
После конвергенции инструменты постобработки Fluent (или CFD-Post) генерируют идеи:
- Контурные графики: Температура на твердых поверхностях и внутренних плоскостях — идентифицируют горячие точки.
- Векторы/стримлайны скорости: Визуализируйте рециркуляции потока, обход и мертвые зоны.
- Отчеты о падении давления: На шасси, теплоотводе или фильтре.
- Распределение коэффициента теплопередачи: На поверхностях теплоотвода для оценки эффективности плавников.
- Распределение скорости потока: Среди параллельных каналов (разъемы CPU/GPU) для обнаружения дисбаланса.
Пример понимания: Общим выводом в симуляции сервера является то, что компоненты верхнего потока получают обильный поток воздуха, в то время как слоты нижнего потока голодают. Инженеры могут затем регулировать кривые вентилятора, добавлять перегородки или перепроектировать геометрию протока, чтобы сбалансировать поток.
Продвинутые темы в HPC Coolant Simulation
Жидкое охлаждение и двухфазный поток
По мере того, как воздушное охлаждение достигает своего практического предела (около 40-50 кВт на стойку), центры обработки данных принимают прямое жидкостное охлаждение.
- Холодные пластины: Конъюгированный теплообмен между теплоносителями (вода/гликоль) и основанием теплоотвода; конъюгированный растворитель соединяет твердые и жидкие области.
- Погружение охлаждения: Диэлектрическая жидкость в резервуаре; многофазные модели (VOF) имитируют движение жидкости и образование пузырьков, если происходит кипение.
- Двухфазное охлаждение: Изменение фазы (испарение/конденсация) усиливает теплообмен. Модели испарения-конденсации флюента (модель Ли) предсказывают образование паров и изменения давления. Требует тщательной проверки на экспериментальные данные.
Эти модели требуют более тонких сеток (границы слоев в жидких каналах), температурно-зависимых свойств жидкости (вязкость, скрытое тепло) и часто переходных растворителей для захвата тепловых неустойчивостей.
Сетка лучших практик для тепловых палочек
Теплоотводы часто являются наиболее геометрически сложной частью сервера. Для точного теплового моделирования:
- Разрешение финов: Используйте по меньшей мере 3-5 ячеек через зазор плавника для разрешения проточного и термического пограничного слоя.
- Спряжение теплопередачи: Сетчатые твердые плавники и основание с отдельной твердой зоной; пара на интерфейсе (без теплового сопротивления, если не моделируется TIM).
- Приближение пористых сред: Для больших массивов (например, пин-финов) можно моделировать теплоотвод как пористую зону с калиброванными инерциальными и вязкими сопротивлениями и объемным источником тепла. Это уменьшает количество сеток, но теряет локальную деталь. Лучше всего для раннего исследования конструкции.
Проверка и экспериментальная корреляция
Результаты КФД должны быть проверены на соответствие физическим измерениям.
- Сравните прогнозируемое падение давления с измеренными данными при известных скоростях потока.
- Размещайте термопары на ключевых компонентах и сравнивайте температуры перехода в устойчивом состоянии.
- Велоциметрия изображения частиц (PIV) или анемометрия горячей проволоки могут проверять закономерности потока, хотя редко используются в производстве.
- Итерационная модель на сетке и турбулентности до тех пор, пока не будет достигнута договоренность в пределах 5-10% для первичных количеств.
Внешний ресурс: Официальная страница продукта Ansys Fluent включает тематические исследования и примеры проверки для охлаждения электроники.
Преимущества CFD-симуляции для команд HPC Cooling
Принятие процесса проектирования на основе моделирования для потока охлаждающей жидкости обеспечивает измеримые преимущества:
- Сэкономление затрат и времени: Уменьшите физические прототипы на 50-80%; оцените 100+ конфигураций за время, необходимое для создания одного тестового блока.
- Оптимизация производительности: Скорости вентилятора тонкой настройки, геометрия воздуховода и скорость потока охлаждающей жидкости для снижения температуры компонентов на 5-15 ° C без увеличения мощности системы.
- Энергоэффективность: Оптимизация воздушного потока снижает энергопотребление вентилятора; моделирование жидкостного охлаждения помогает минимизировать мощность насоса при сохранении безопасных температур.
- Прогноз надежности: Определите ранние режимы отказа, такие как голодание охлаждающей жидкости, риск конденсации или тепловая усталость от езды на велосипеде.
- Анализ масштабируемости: Имитировать полный поток воздуха в стойке или зале данных, чтобы обеспечить хорошее взаимодействие охлаждения на уровне комнаты с потоками на уровне сервера.
Для центров обработки данных, нацеленных на PUE ниже 1,2, CFD, особенно с использованием таких инструментов, как Ansys Fluent, больше не является опциональной, а основной инженерной практикой.
Обычные подводные камни и как их избежать
Даже при наличии надежного набора инструментов ошибки могут подорвать результаты.
- Слияние слишком грубо на теплоотводах: Неразрешенные граничные слои сверхпредсказывают температуру стыковки. Всегда выполняйте исследование сетчатой независимости.
- Неправильное применение моделей турбулентности: Использование стандартного k-эпсилона в переходном потоке (например, над плоскими плавниками) может дать неточный теплообмен. Предпочтение k-омега SST для настенных потоков.
- Пренебрежение радиацией: Для естественной конвекции или низкоскоростной принудительной конвекции передача радиационного тепла может быть значительной. Включить дискретные ординаты (DO) или модель «поверхность-поверхность» (S2S).
- Неправильные свойства материала: Вязкость и проводимость воздуха изменяются с температурой; всегда используют температурно-зависимые кривые.
- Предполагая равномерное тепловое течение: Реальные процессоры имеют динамические карты мощности. Для большей точности импортируйте карты мощности на уровне чипов (например, из инструментов Intel или AMD) в качестве объемных источников.
Пример реального приложения: оптимизация воздушного потока в 1U-сервере
Рассмотрим сервер стойки 1U с четырьмя картами GPU, каждая из которых рисует 300 Вт. Первоначальная конструкция разместила два 40-мм вентилятора сзади. Моделирование в Ansys Fluent показало, что передние GPU достигли 95 ° C, в то время как задние GPU были на 75 ° C. Обтекатели скорости показали, что воздух вошел плавно, но затем отделился за опорной кронштейном среднего шасси, создавая зону рециркуляции над задними GPU.
Добавив простой пластиковый воздуховод, перенаправляющий поток и увеличивающий скорость заднего вентилятора всего на 10%, максимальная температура заднего GPU упала до 82 ° C - все без изменения следа шасси. Моделирование было проверено с помощью физического прототипа, показывая ошибку корреляции 6 ° C. Компания сохранила три недели итераций дизайна.
Внешняя ссылка: Библиотека ресурсов Ansys содержит много таких примечаний для электронного охлаждения.
Будущие тенденции: симуляция на основе ИИ и цифровые близнецы
Следующий рубеж в моделировании охлаждающей жидкости HPC включает в себя соединение Ansys Fluent с машинным обучением. Модели с пониженным порядком (ROM), обученные высокоточным данным CFD, могут прогнозировать тепловое поведение в режиме реального времени, что позволяет использовать цифровые двойники серверных стоек. Это позволяет динамически управлять вентилятором / насосом на основе фактической рабочей нагрузки. Кроме того, ускоренный CFD GPU (Ansys Fluent на графических процессорах NVIDIA) сокращает время оборота моделирования с часов до минут.
По мере того, как центры обработки данных будут приближаться к 100 кВт на стойку, потребность в точном и быстром моделировании потока охлаждающей жидкости будет только усиливаться. Инженеры, которые овладеют этими навыками, будут играть важную роль в разработке устойчивой высокопроизводительной вычислительной инфраструктуры в предстоящем десятилетии.
Заключение
Моделирование потока охлаждающих жидкостей в серверах HPC с использованием Ansys Fluent является зрелой, мощной и необходимой инженерной методологией. От понимания фундаментальных моделей воздушного потока до моделирования сложных двухфазных жидкостных охлаждений Fluent обеспечивает точность и гибкость, необходимые для оптимизации тепловых характеристик. Следуя структурированному рабочему процессу - создание геометрии, высококачественная сетка, правильные граничные условия, соответствующее моделирование турбулентности и тщательная постобработка - инженеры могут проектировать системы охлаждения, которые сохраняют компоненты в безопасности, минимизируя потребление энергии.
Инвестирование в моделирование CFD приносит дивиденды в виде снижения стоимости разработки, сокращения времени выхода на рынок и повышения надежности. По мере того, как вычислительная мощность продолжает расти, будет расти и тепло, которое она генерирует; те, кто эффективно моделирует, будут лидировать в тепловых инновациях.
Далее читать: Тепловые рекомендации ASHRAE для центров обработки данных и Блог Ansys о лучших практиках охлаждения электроники .