Статья
GPU-кластеры для AI: как собрать и не разориться
▶ Показать содержание 6 разделов~1 мин
Привет! Я Мария Волкова, AI/ML-инженер. Специализируюсь на инфраструктуре для обучения нейросетей — GPU-кластеры, NVIDIA-стек, оптимизация. Расскажу про экономику GPU.
GPU — это дорого. Но можно оптимизировать затраты в 3−5 раз, если знать как.
Выбор GPU в 2025
| GPU | VRAM | Цена | Для чего |
|---|---|---|---|
| RTX 4090 | 24GB | $1,600 | Dev/test, файнтюнинг малых моделей |
| A100 80GB | 80GB | $15,000 | Production training |
| H100 | 80GB | $30,000 | Крупные LLM, максимальная скорость |
| L40S | 48GB | $7,000 | Inference, средний training |
Экономия #1: б/у оборудование
A100 PCIe на вторичном рынке — $5,000−7,000 вместо $15,000. Проверяйте memory health через nvidia-smi.
Экономия #2: правильная утилизация
Средняя утилизация GPU в компаниях — 30−40%. Это выброшенные деньги. Решения:
- Kubernetes + GPU time-slicing — несколько подов делят одну GPU
- Очереди задач (SLURM) — GPU работает 24/7
- Spot/preemptible instances — для некритичных тренировок
Экономия #3: mixed precision
FP16/BF16 training ускоряет в 2x и снижает потребление памяти. С 2025 — FP8 на H100.
Наш кластер
- 8x A100 80GB (2 ноды по 4 GPU)
- NVLink внутри ноды, InfiniBand между нодами
- Kubernetes + NVIDIA GPU Operator
- Storage: NFS over 100GbE для датасетов
- Стоимость: ~$150k
- Окупаемость vs cloud: 10 месяцев
Мониторинг GPU
- DCGM Exporter → Prometheus → Grafana
- Ключевые метрики: GPU utilization, memory used, temperature, power draw
- Алерт на >85°C — значит проблемы с охлаждением
Планируете GPU-кластер? Помогу с архитектурой — пишите!
35