Преимущества использования жидкого охлаждения в высокопроизводительных вычислительных кластерах
Введение в жидкое охлаждение в высокопроизводительных вычислениях
Кластеры высокопроизводительных вычислений (HPC) образуют основу современных научных открытий, инженерного моделирования и анализа больших данных. От моделирования климата до открытия лекарств эти системы выполняют миллиарды вычислений в секунду, генерируя огромное количество тепла в качестве побочного продукта. По мере того, как закон Мура замедляет и увеличивает плотность транзисторов, тепловая плотность процессоров, графических процессоров и ускорителей опережает способность традиционных воздушных охлаждений поддерживать безопасные рабочие температуры. Эта проблема подтолкнула операторов центров обработки данных и архитекторов HPC принять жидкое охлаждение в качестве основной стратегии управления температурой. Путем прямого удаления тепла у источника с использованием жидкостей с гораздо более высокой теплопроводностью, чем воздух, объекты могут достичь значительно более низкой эффективности использования энергии (PUE), более высокой плотности вычислений и продления срока службы оборудования. Эта статья исследует механику, преимущества, проблемы реализации и будущие перспективы жидкого охлаждения в средах HPC, предоставляя всеобъемлющее руководство для инженеров, ИТ-менеджеров и исследователей, оценивающих эту технологию.
Что такое жидкое охлаждение?
Жидкостное охлаждение относится к любому методу управления теплом, который использует жидкую охлаждающую жидкость - обычно воду, диэлектрическую жидкость или хладагент - для поглощения и переноса тепла от теплогенерирующих компонентов, таких как процессоры, модули памяти и регуляторы напряжения. В отличие от воздушного охлаждения, которое опирается на принудительную конвекцию через плавные теплоотводы, жидкое охлаждение использует превосходную удельную теплоемкость и теплопроводность жидкостей для достижения на порядки большей скорости теплопередачи. Несколько различных архитектур существуют в экосистеме жидкого охлаждения:
- Охлаждение с прямой на кристалл (холодная пластина): Охлаждение протекает через металлические блоки, установленные непосредственно на процессорах и графических процессорах. Тепло передается через проводимость от чипа через материал теплового интерфейса (TIM) к холодной пластине, затем уносится циркулирующей жидкостью. Это наиболее распространенный подход в коммерческих развертываниях HPC.
- Погружение охлаждения:] Целые серверы или отдельные компоненты погружены в непроводящую диэлектрическую жидкость (например, минеральное масло или инженерные фторуглеродные жидкости). Тепло переносится непосредственно из аппаратного обеспечения в жидкость, которая затем перекачивается через теплообменник. Погружение устраняет необходимость в вентиляторах и может обрабатывать очень высокие плотности тепла.
- Задние теплообменники:] Охлаждение протекает через катушки, установленные на задней части серверных стоек. Теплый воздух, выдыхаемый из стойки, проходит через катушки, где тепло передается жидкости, а не выбрасывается в помещение центра обработки данных. Это гибридный подход, который работает с существующим оборудованием с воздушным охлаждением.
- Двухфазное охлаждение:] Использует скрытое тепло испарения — кипения охлаждающего вещества в источнике тепла и конденсации в других местах — достигая чрезвычайно высоких коэффициентов теплопередачи. Двухфазные системы могут обрабатывать тепловые потоки, превышающие 300 Вт/см2, что делает их идеальными для чипов ускорителей следующего поколения.
Преимущества жидкого охлаждения в кластерах HPC
Жидкое охлаждение обеспечивает измеримые преимущества по производительности, экономике и эксплуатационной надежности. Ниже мы подробно расскажем о основных преимуществах, поддерживаемых реальными данными и инженерными принципами.
Повышение эффективности охлаждения и устойчивая производительность
Теплопроводность воды составляет примерно 0,6 Вт/м·К, по сравнению с 0,026 Вт/м·К для воздуха — коэффициент более 20. Это несоответствие означает, что жидкое охлаждение может удалять тепло гораздо эффективнее, позволяя процессорам поддерживать более высокие тактовые частоты в течение более длительных периодов времени без теплового дросселирования. В кластерах HPC, работающих в тесно связанных симуляциях, устойчивая производительность имеет решающее значение; любое снижение частоты из-за горячих точек может каскадироваться в значительное увеличение времени до решения. Испытания, проводимые ведущими интеграторами HPC, показывают, что узлы с жидкостным охлаждением могут поддерживать на 15-25% более высокий средний расход энергии на розетку, чем эквивалентные системы с воздушным охлаждением, непосредственно переводя на более плавающие операции в секунду (FLOPS).
Снижение потребления энергии и более низкий PUE
В счетах за электроэнергию в центрах обработки данных доминируют два потребителя: вычислительное оборудование и инфраструктура охлаждения. Традиционные объекты с воздушным охлаждением требуют массивных установок для охлаждения воздуха, блоков обработчика воздуха в компьютерных комнатах (CRAH) и высокоскоростных вентиляторов, которые вместе могут составлять 30-40% от общей мощности объекта. Жидкое охлаждение резко снижает эти накладные расходы. Например, охлаждение с использованием теплой воды с температурой подачи 40-50 ° C полностью устраняет необходимость в чиллерах на основе компрессора, позволяя отклонять тепло через сухие охладители или охлаждающие вышки. Организации, которые развертывают погруженное или прямое жидкое охлаждение, обычно сообщают значения PUE от 1,03 до 1,08, по сравнению с 1,3-1,6 для типичных объектов с воздушным охлаждением. В течение срока службы кластера HPC (обычно 3-5 лет), эта экономия энергии может компенсировать более высокие первоначальные капитальные затраты оборудования для жидкого охлаждения.
Экономия пространства и увеличение плотности вычислений
Воздушное охлаждение накладывает серьезные ограничения на плотность стойки из-за необходимости в адекватных каналах воздушного потока, хладнокровном содержании прохода и интервале между лопастями. При жидком охлаждении тепло удаляется у источника с использованием трубок малого диаметра, что позволяет более плотно укладывать серверные лопасти. Развертывание высокой плотности, превышающее 100 кВт на стойку, возможно при жидком охлаждении, тогда как воздушное охлаждение обычно достигает 30–40 кВт на стойку до того, как появятся горячие точки. Эта плотность позволяет меньшим отпечаткам центров обработки данных или позволяет существующим этажам размещать более мощные кластеры без расширения.
Улучшенная долговечность и надежность аппаратного обеспечения
Температурный цикл — повторное расширение и сокращение материалов при колебаниях температур — является ведущей причиной усталости припоя и образования микротрещин в процессорах. Жидкое охлаждение поддерживает стабильные температуры соединения, часто варьирующиеся менее чем на 2 ° C при полной нагрузке, по сравнению с 10 ° C или более колебаниями, наблюдаемыми при агрессивном воздушном охлаждении на основе вентилятора. Более низкие и более стабильные температуры уменьшают электромиграцию и диэлектрический полом, продлевая среднее время между отказами (MTBF) вычислительных узлов. Полевые исследования от гипермасштабных операторов показывают, что серверы с жидкостным охлаждением испытывают на 20-30% меньше аппаратных сбоев в течение трехлетнего периода по сравнению с эквивалентами с воздушным охлаждением в той же рабочей нагрузке.
Снижение шума
Рев тысяч вентиляторов с высокой РПМ в ЦОД HPC может превышать 85 дБ — достаточно громко, чтобы требовать защиты слуха и мешать инженерным работам на месте. Жидкие системы охлаждения устраняют большинство вентиляторов; погружение охлаждения не требует ничего, а системы с прямым погружением используют только низкоскоростные насосы и дополнительные вентиляторы с низким уровнем шума. Уровень шума может опускаться ниже 50 дБ, создавая более продуктивную среду для персонала, которому нужен доступ к машинному отделению для диагностики или исследований.
Масштабируемость для будущих поколений
По мере того, как мощность теплового проектирования чипов (TDP) продолжает расти - недавние графические процессоры превышают 600 Вт на устройство, а будущие конструкции могут приближаться к 1 кВт - охлаждение воздуха становится физически непрактичным. Жидкостная система охлаждения по своей сути: система замкнутого цикла может быть постепенно расширена путем добавления большего количества холодных пластин и расширения трубопровода, без перепроектирования всего объекта. Это облегчает модернизацию кластеров с процессорами следующего поколения при повторном использовании существующей тепловой инфраструктуры.
Сравнение жидкого охлаждения с воздушным: количественная перспектива
Для иллюстрации различий в следующей таблице приведены ключевые показатели эффективности на основе отраслевых эталонов (значения репрезентативны для среднего кластера HPC с вычислительной нагрузкой 100 кВт):
- Охлаждающая мощность над головой (воздух): 40-50 кВт (чиллеры, вентиляторы, насосы). Жидкость: 5-10 кВт (насосы, вентиляторы для сухого охлаждения).
- Типичный ПУЭ (воздух): 1.35-1.50. Жидкость: 1.03-1.10.
- Максимальная плотность стойки (воздух): 35 кВт. Жидкость: > 100 кВт.
- Уровень шума на 1 метр (воздух): 85 дБ. Жидкость: <50 дБ.
- Изменение температуры ЦПУ при нагрузке (воздух): ±5°C. Жидкость: ±1°C.
- Скорость отказов оборудования (нормализована до уровня базовой линии): Жидкость <0,7×.
В то время как воздушное охлаждение остается жизнеспособным для конфигураций с более низкой плотностью и устаревших модификаций, преимущества жидкого охлаждения становятся решающими, поскольку плотность мощности превышает 20–30 кВт на стойку.
Рассмотрение вопросов осуществления и проблемы
Переход от воздушного охлаждения к жидкостному требует тщательного планирования в нескольких областях, чтобы избежать операционных рисков и максимизировать отдачу от инвестиций.
Анализ затрат: первоначальные и операционные расходы
Первоначальная стоимость жидкостного охлаждающего решения, включая холодильные плиты, трубопроводы, насосы, теплообменники, системы управления и монтажные работы, обычно добавляет 10-25% к общей стоимости оборудования кластера. Для системы HPC стоимостью 5 миллионов долларов США это эквивалентно дополнительным 500 000-1,25 миллионам долларов США. Однако операционная экономия электроэнергии (часто 100 000-300 000 долларов США в год в умеренном климате) и снижение затрат на замену оборудования означают, что период окупаемости обычно составляет 18-36 месяцев. Для кластеров, работающих почти со 100% нагрузкой 24/7, окупаемость еще быстрее.
Меры надежности и безопасности
Обнаружение и смягчение утечки имеют первостепенное значение. Современные системы жидкостного охлаждения включают избыточные уплотнения, датчики давления, фитильные влаги и автоматические запорные клапаны, которые изолируют утечку в один сегмент стойки. Выбор охлаждающей жидкости имеет значение: системы прямого отсчета часто используют деионизированную воду с ингибиторами коррозии и биоцидами, в то время как системы погружения требуют диэлектрических жидкостей, которые непроводящие и химически инертные. Регулярное обслуживание включает проверки качества охлаждающей жидкости (рН, проводимость, количество частиц) и обслуживание насоса. При правильной конструкции частота отказа жидких охлаждающих петель чрезвычайно низкая - коммерческие развертывания зарегистрировали миллионы часов без единого инцидента утечки.
Совместимость с существующей инфраструктурой
Модернизация центра обработки данных с воздушным охлаждением для жидкостного охлаждения требует планирования трубопроводов подачи и возврата жидкости, управления конденсацией (если температура охлаждающей жидкости падает ниже точки росы) и структурного усиления для поддержки более тяжелых стоек. Многие операторы выбирают поэтапный подход: начните с охлаждения с прямым к чипу на самых энергоемких узлах, оставляя менее плотные стойки на воздухе. Более новые объекты могут быть построены с жидкостным охлаждением в качестве основного метода, снижая сложность строительства и стоимость. Проект Open Compute (OCP) и ASHRAE опубликовали стандарты для интерфейсов жидкостного охлаждения, обеспечивая совместимость между поставщиками.
Реальные приложения и тематические исследования
Несколько известных центров HPC приняли жидкостное охлаждение и сообщили о значительных преимуществах. Например, Швейцарский национальный суперкомпьютерный центр (CSCS) развернул прямое жидкостное охлаждение в своем суперкомпьютере «Piz Daint», достигнув PUE 1,04 при сохранении системы в числе самых быстрых в мире. Аналогично, суперкомпьютер «Summit» в Национальной лаборатории Ок-Ридж использует гибридный подход с холодными пластинами на графических процессорах, позволяя ему выдерживать 200 петафлопс. В гипермасштабном секторе Microsoft протестировала погружение охлаждения в своих центрах обработки данных Azure, демонстрируя резкое снижение энергии охлаждения и путь к водоположительным операциям. Эти примеры подтверждают, что жидкое охлаждение не является экспериментальной технологией, а проверенным решением для требовательных производственных сред.
Будущие тенденции: где идет охлаждение жидкости
Эволюция жидкостного охлаждения продолжает ускоряться, что обусловлено неустанным спросом на более высокие показатели вычислительной эффективности и цели устойчивого развития.
- Двухфазное погружение охлаждения: Использование жидкостей, которые испаряются при низких температурах (например, Novec 7000) может достигать коэффициентов теплопередачи до 10 000 Вт/м2·К, что позволяет пассивное охлаждение чрезвычайно мощных чипов без насосов.
- Повторное использование тепла для отходов:] Теплая охлаждающая жидкость, выходящая из системы HPC, может использоваться для нагрева зданий, теплиц или промышленных процессов. Это превращает тепло центра обработки данных из обязательства в ресурс, согласуясь с принципами круговой экономики.
- Стандартизация и зрелость экосистем: Консорциумы, такие как Open Compute Project и Альянс систем охлаждения жидкостей, разрабатывают открытые стандарты для разъемов, композиций охлаждающей жидкости и протоколов мониторинга, уменьшая блокировку поставщиков и снижая барьеры для внедрения.
- Интеграция с возобновляемой энергией: Жидкое охлаждение снижает пиковую потребляемую мощность охлаждающего оборудования, что облегчает сопряжение кластеров HPC с солнечной или ветровой генерацией на месте за счет сглаживания профилей нагрузки.
По мере того, как отрасль будет продвигаться к экзафлопсным вычислениям и дальше, жидкостное охлаждение перейдет от нишевой специализации к требованию по умолчанию. Технология уже является конкурентоспособной по стоимости для новых сборок и все более жизнеспособной для модернизации.
Заключение
Жидкостное охлаждение вышло за рамки экспериментальной стадии и теперь является основным вариантом для высокопроизводительных вычислительных кластеров. Его способность эффективно удалять высокие тепловые нагрузки, снижать потребление энергии, повышать надежность оборудования и обеспечивать более плотные системные архитектуры непосредственно решает самые насущные проблемы, стоящие перед операторами HPC сегодня. В то время как первоначальные требования к инвестициям и планированию нетривиальны, долгосрочные эксплуатационные сбережения, повышение производительности и преимущества устойчивости делают убедительный бизнес-кейс. Для любой организации строительство или модернизация объекта HPC с плотностью мощности выше 30 кВт на стойку, жидкое охлаждение должно быть первым выбором - не последним средством. Поскольку технология продолжает созревать и стандарты затвердевать, принятие будет только ускоряться, делая жидкое охлаждение основой самых мощных вычислительных инфраструктур завтрашнего дня.
Для дальнейшего чтения о лучших методах охлаждения см. Тепловые руководящие принципы ASHRAE , Инициатива по охлаждению жидкостей Open Compute Project и тематические исследования Национального научного вычислительного центра энергетических исследований (NERSC) .