Серверное оборудование для бизнеса — надёжные решения для любых задач Подробнее →
Статья

Жидкостное охлаждение серверов: когда это имеет смысл

Тепловыделение современных серверных процессоров и GPU давно перевалило за отметку, при которой воздушное охлаждение остаётся эффективным. H100 от NVIDIA рассеивает 700 Вт на один ускоритель, а сервер с восемью такими картами выдаёт 5,6 кВт тепла в одном юните стойки. Воздух с этим просто не справляется.

Почему воздух перестаёт справляться

Воздушное охлаждение ЦОД достигло своего практического предела около 20–25 кВт на стойку. Типичный сервер с двумя CPU по 350 Вт TDP и четырьмя GPU по 400 Вт — это уже 3,5 кВт только от GPU. При стандартной компоновке GPU-стойки (8 серверов) получаем 28+ кВт, что требует специализированного воздушного охлаждения с огромными объёмами холодного воздуха.

Проблемы воздушного охлаждения при высокой плотности:

  • Горячие коридоры между рядами стоек достигают 45–50°C
  • Неравномерное распределение воздуха создаёт горячие точки
  • Шум от сотен вентиляторов — 80–90 дБ в машинном зале
  • PUE (Power Usage Effectiveness) в лучшем случае 1.4–1.5

Direct-to-Chip: охлаждение процессора напрямую

Direct-to-chip (DTC) или liquid cooling — подача холодной воды непосредственно к холодной пластине на процессоре или GPU. Остальные компоненты (память, материнская плата, диски) по-прежнему охлаждаются воздухом.

Схема работы:

  1. Coolant Distribution Unit (CDU) охлаждает воду до 20–25°C
  2. Вода поступает по трубкам к серверам в стойке
  3. Холодная пластина на CPU/GPU поглощает тепло
  4. Нагретая вода (35–45°C) возвращается в CDU
  5. CDU отдаёт тепло в систему водоснабжения здания или чиллер

CDU — ключевой элемент инфраструктуры. Он обеспечивает давление, температуру и расход теплоносителя. Производители: Vertiv, Schneider Electric, CoolIT Systems, Asetek.

Преимущества DTC:

  • PUE снижается до 1.15–1.2
  • CPU/GPU работают холоднее → выше буст-частоты и надёжность
  • Шум в зале заметно снижается (меньше нагрузка на вентиляторы)
  • Не нужен специальный чиллированный воздух

Недостатки:

  • Необходимость водяной инфраструктуры в стойках
  • Риск протечек (хотя современные quick-connect коннекторы практически его исключают)
  • Более высокая стоимость серверов с поддержкой DTC
  • Обслуживание требует квалифицированных специалистов

Immersion Cooling: сервер в ванне с диэлектриком

Immersion cooling — погружение сервера целиком в диэлектрическую жидкость. Бывает двух видов:

Single-phase immersion: жидкость (обычно синтетическое масло или специальные флюиды типа Novec) не кипит, просто циркулирует. Теплообменник отводит тепло наружу.

Two-phase immersion: жидкость кипит при низкой температуре (~50°C), пары конденсируются на крышке ванны и стекают обратно. Более эффективно, но дороже.

PUE при immersion — 1.02–1.05, что практически недостижимо при воздушном охлаждении.

Реальные внедрения: Microsoft Project Natick (подводные ЦОД), ряд HPC-кластеров для расчётов нефтяных месторождений, некоторые криптоферермы.

Ограничения:

  • Не все серверы совместимы: нужны специальные вентиляторы или их отсутствие
  • Обслуживание неудобно — нужно вытаскивать сервер из ванны
  • Высокая начальная стоимость
  • Жидкость нужно периодически менять или доливать

Стоимость внедрения

Примерные цифры для DTC на стойку 30 кВт:

  • CDU: 15 000–40 000 $
  • Трубная разводка по стойке: 3 000–8 000 $
  • Серверы с поддержкой DTC: наценка 10–20% к обычной цене
  • Монтаж и подключение: 5 000–15 000 $

Итого инвестиции окупаются за счёт экономии на электроэнергии (меньше PUE), повышения плотности стоек и увеличения срока службы оборудования.

Когда жидкостное охлаждение НЕ нужно

Для стандартных серверов с TDP 150–250 Вт жидкостное охлаждение — это лишние затраты и сложность. Воздушное охлаждение прекрасно справляется при плотности до 15–20 кВт на стойку.

Не стоит внедрять, если:

  • Стандартные 1U/2U серверы с обычными CPU без GPU
  • Плотность стойки ниже 15 кВт
  • Нет планов роста мощности
  • Небольшой ЦОД без специалистов по водяным системам

Имеет смысл, если:

  • GPU-кластеры для AI/ML (H100, A100, MI300X)
  • HPC для научных вычислений
  • Высокая стоимость электроэнергии
  • Цели по PUE и sustainability

Реальный кейс: GPU-кластер для AI

Крупные облачные провайдеры и AI-компании (CoreWeave, Lambda Labs, некоторые российские площадки) уже строят GPU-кластеры исключительно с DTC или immersion. H100 в воздушном исполнении (SXM5) требует специального сервера, но в кластерах с жидкостным охлаждением плотность можно удвоить.

На практике это означает: вместо двух залов с воздушным охлаждением — один зал с DTC при той же вычислительной мощности. Экономия на аренде площади, электроэнергии и чиллерах существенная.

Жидкостное охлаждение — не экзотика, а необходимость для современных высокоплотных вычислительных нагрузок. Вопрос не «стоит ли», а «когда».

3 Ответа

  1. PUE 1.03 — это мечта любого датацентра. У нас пока 1.45 с воздухом, и каждые 0.1 единицы — это ощутимые деньги на масштабе. Переходим на DTC для GPU-секции, посмотрим что выйдет в итоге.

  1. Для H100-кластеров DTC это уже не опция, а необходимость. Мы смотрели воздушное решение — просто не влезает в разумные размеры зала при нужной мощности.

  1. А что с шумом при immersion? Вентиляторов же нет совсем, я так понимаю? Интересно как вообще звучит такой зал.