Жидкостное охлаждение серверов: когда это имеет смысл
Тепловыделение современных серверных процессоров и GPU давно перевалило за отметку, при которой воздушное охлаждение остаётся эффективным. H100 от NVIDIA рассеивает 700 Вт на один ускоритель, а сервер с восемью такими картами выдаёт 5,6 кВт тепла в одном юните стойки. Воздух с этим просто не справляется.
Почему воздух перестаёт справляться
Воздушное охлаждение ЦОД достигло своего практического предела около 20–25 кВт на стойку. Типичный сервер с двумя CPU по 350 Вт TDP и четырьмя GPU по 400 Вт — это уже 3,5 кВт только от GPU. При стандартной компоновке GPU-стойки (8 серверов) получаем 28+ кВт, что требует специализированного воздушного охлаждения с огромными объёмами холодного воздуха.
Проблемы воздушного охлаждения при высокой плотности:
- Горячие коридоры между рядами стоек достигают 45–50°C
- Неравномерное распределение воздуха создаёт горячие точки
- Шум от сотен вентиляторов — 80–90 дБ в машинном зале
- PUE (Power Usage Effectiveness) в лучшем случае 1.4–1.5
Direct-to-Chip: охлаждение процессора напрямую
Direct-to-chip (DTC) или liquid cooling — подача холодной воды непосредственно к холодной пластине на процессоре или GPU. Остальные компоненты (память, материнская плата, диски) по-прежнему охлаждаются воздухом.
Схема работы:
- Coolant Distribution Unit (CDU) охлаждает воду до 20–25°C
- Вода поступает по трубкам к серверам в стойке
- Холодная пластина на CPU/GPU поглощает тепло
- Нагретая вода (35–45°C) возвращается в CDU
- CDU отдаёт тепло в систему водоснабжения здания или чиллер
CDU — ключевой элемент инфраструктуры. Он обеспечивает давление, температуру и расход теплоносителя. Производители: Vertiv, Schneider Electric, CoolIT Systems, Asetek.
Преимущества DTC:
- PUE снижается до 1.15–1.2
- CPU/GPU работают холоднее → выше буст-частоты и надёжность
- Шум в зале заметно снижается (меньше нагрузка на вентиляторы)
- Не нужен специальный чиллированный воздух
Недостатки:
- Необходимость водяной инфраструктуры в стойках
- Риск протечек (хотя современные quick-connect коннекторы практически его исключают)
- Более высокая стоимость серверов с поддержкой DTC
- Обслуживание требует квалифицированных специалистов
Immersion Cooling: сервер в ванне с диэлектриком
Immersion cooling — погружение сервера целиком в диэлектрическую жидкость. Бывает двух видов:
Single-phase immersion: жидкость (обычно синтетическое масло или специальные флюиды типа Novec) не кипит, просто циркулирует. Теплообменник отводит тепло наружу.
Two-phase immersion: жидкость кипит при низкой температуре (~50°C), пары конденсируются на крышке ванны и стекают обратно. Более эффективно, но дороже.
PUE при immersion — 1.02–1.05, что практически недостижимо при воздушном охлаждении.
Реальные внедрения: Microsoft Project Natick (подводные ЦОД), ряд HPC-кластеров для расчётов нефтяных месторождений, некоторые криптоферермы.
Ограничения:
- Не все серверы совместимы: нужны специальные вентиляторы или их отсутствие
- Обслуживание неудобно — нужно вытаскивать сервер из ванны
- Высокая начальная стоимость
- Жидкость нужно периодически менять или доливать
Стоимость внедрения
Примерные цифры для DTC на стойку 30 кВт:
- CDU: 15 000–40 000 $
- Трубная разводка по стойке: 3 000–8 000 $
- Серверы с поддержкой DTC: наценка 10–20% к обычной цене
- Монтаж и подключение: 5 000–15 000 $
Итого инвестиции окупаются за счёт экономии на электроэнергии (меньше PUE), повышения плотности стоек и увеличения срока службы оборудования.
Когда жидкостное охлаждение НЕ нужно
Для стандартных серверов с TDP 150–250 Вт жидкостное охлаждение — это лишние затраты и сложность. Воздушное охлаждение прекрасно справляется при плотности до 15–20 кВт на стойку.
Не стоит внедрять, если:
- Стандартные 1U/2U серверы с обычными CPU без GPU
- Плотность стойки ниже 15 кВт
- Нет планов роста мощности
- Небольшой ЦОД без специалистов по водяным системам
Имеет смысл, если:
- GPU-кластеры для AI/ML (H100, A100, MI300X)
- HPC для научных вычислений
- Высокая стоимость электроэнергии
- Цели по PUE и sustainability
Реальный кейс: GPU-кластер для AI
Крупные облачные провайдеры и AI-компании (CoreWeave, Lambda Labs, некоторые российские площадки) уже строят GPU-кластеры исключительно с DTC или immersion. H100 в воздушном исполнении (SXM5) требует специального сервера, но в кластерах с жидкостным охлаждением плотность можно удвоить.
На практике это означает: вместо двух залов с воздушным охлаждением — один зал с DTC при той же вычислительной мощности. Экономия на аренде площади, электроэнергии и чиллерах существенная.
Жидкостное охлаждение — не экзотика, а необходимость для современных высокоплотных вычислительных нагрузок. Вопрос не «стоит ли», а «когда».
PUE 1.03 — это мечта любого датацентра. У нас пока 1.45 с воздухом, и каждые 0.1 единицы — это ощутимые деньги на масштабе. Переходим на DTC для GPU-секции, посмотрим что выйдет в итоге.