datacenter_oleg

Инженер ЦОД, охлаждение, питание

30 Апреля
Комментарии datacenter_oleg
Статья
Миграция VM между гипервизорами: практический гайд

После миграции 30 VM с VMware на Proxmox могу сказать: самое узкое место — пропускная способность сети между гипервизорами. Если есть возможность — делайте через физический перенос диска или по 10GbE, иначе уходит очень много времени.

Статья
Proxmox Backup Server: бэкапы VM правильно

PBS реально меняет жизнь. До него бэкап 20 VM занимал полночи и 4 ТБ места, после перехода — 40 минут и 900 ГБ с учётом дедупликации. Шифрование на клиенте — отдельный плюс для соответствия требованиям.

Статья
LVM: управление дисками без головной боли

Про thin provisioning написано правильно, но я бы добавил: обязательно настройте алерт на заполнение pool хотя бы на 80%, иначе при переполнении все thin-тома моментально уходят в read-only.

Статья
Hot-swap дисков в Linux: mdadm и MegaRAID

Отличная статья, именно так и нужно объяснять этот процесс. Добавлю только что перед rebuild желательно сделать снапшот или бэкап — деградированный RAID это уже один шаг до потери данных.

Статья
Выбираем серверную стойку: 19 дюймов здравого смысла

Хороший разбор, особенно по глубине стойки — это больная тема. Однажды закупили стойки 800мм, а потом выяснилось что новые серверы туда не влезают, пришлось всё переделывать.

Статья
Uptime Kuma: мониторинг доступности для маленьких команд

Используем Uptime Kuma уже больше года, очень доволен — особенно радует что публичная страница статуса настраивается в два клика. Клиенты перестали звонить с вопросом «а у вас всё работает?».

Статья
RAID уровни: что выбрать и почему RAID 5 уже не торт

У нас в датацентре до сих пор куча старых массивов на RAID 5 с дисками по 8 ТБ — страшно смотреть. Руководство не хочет тратиться на миграцию пока не случится беда.

Статья
Makefile для DevOps: автоматизация рутины

Трюк с grep для автогенерации help — просто огонь, сразу добавил к себе в шаблон. Теперь все новые проекты начинаю именно с такого Makefile.

Статья
Выбираем серверный процессор: Xeon vs EPYC в 2026

Важный момент про Oracle — многие забывают посчитать стоимость лицензий при выборе CPU, а там разница может перекрыть всю экономию от более дешёвого железа.

Статья
Серверные блоки питания: redundancy и hot-swap

Хорошая статья. На практике ещё важно проверять реальный КПД при той нагрузке, которая будет в вашем случае — у некоторых бюджетных БП «platinum» только на бумаге.

Статья
IPMI и BMC: удалённое управление сервером без ОС

С iDRAC работаю каждый день, незаменимая вещь. Особенно выручает виртуальная консоль когда нужно поймать ошибку при загрузке — без неё пришлось бы ехать в ЦОД.

Статья
Логирование в Linux: journald, rsyslog, Loki

Хорошее сравнение. Добавлю, что для journald критически важно настроить ротацию через SystemMaxUse, иначе на нагруженных серверах он спокойно съедает весь диск.

Статья
Ceph на SSD: тюнинг производительности для продакшена

NVMe wear на Ceph WAL — реально надо следить. У нас через год интенсивной работы один WAL-диск показал 12% ресурса, при том что основные данные на SSD были в норме. Теперь мониторим S.M.A.R.T. через Prometheus node exporter, алерт при < 50% remaining.

Статья
ECC RAM: почему серверная память стоит каждого рубля

Про LRDIMM добавлю: у нас в стойках стоят серверы с 6 ТБ RAM на ноду, там без LRDIMM вообще никак. Да, латентность чуть выше, но для in-memory OLAP нагрузки это не критично, зато объём памяти решает всё.

Статья
Жидкостное охлаждение серверов: когда это имеет смысл

PUE 1.03 — это мечта любого датацентра. У нас пока 1.45 с воздухом, и каждые 0.1 единицы — это ощутимые деньги на масштабе. Переходим на DTC для GPU-секции, посмотрим что выйдет в итоге.