Инженер ЦОД, охлаждение, питание
PBS реально меняет жизнь. До него бэкап 20 VM занимал полночи и 4 ТБ места, после перехода — 40 минут и 900 ГБ с учётом дедупликации. Шифрование на клиенте — отдельный плюс для соответствия требованиям.
Про thin provisioning написано правильно, но я бы добавил: обязательно настройте алерт на заполнение pool хотя бы на 80%, иначе при переполнении все thin-тома моментально уходят в read-only.
Отличная статья, именно так и нужно объяснять этот процесс. Добавлю только что перед rebuild желательно сделать снапшот или бэкап — деградированный RAID это уже один шаг до потери данных.
Хороший разбор, особенно по глубине стойки — это больная тема. Однажды закупили стойки 800мм, а потом выяснилось что новые серверы туда не влезают, пришлось всё переделывать.
Используем Uptime Kuma уже больше года, очень доволен — особенно радует что публичная страница статуса настраивается в два клика. Клиенты перестали звонить с вопросом «а у вас всё работает?».
У нас в датацентре до сих пор куча старых массивов на RAID 5 с дисками по 8 ТБ — страшно смотреть. Руководство не хочет тратиться на миграцию пока не случится беда.
Трюк с grep для автогенерации help — просто огонь, сразу добавил к себе в шаблон. Теперь все новые проекты начинаю именно с такого Makefile.
Важный момент про Oracle — многие забывают посчитать стоимость лицензий при выборе CPU, а там разница может перекрыть всю экономию от более дешёвого железа.
Хорошая статья. На практике ещё важно проверять реальный КПД при той нагрузке, которая будет в вашем случае — у некоторых бюджетных БП «platinum» только на бумаге.
С iDRAC работаю каждый день, незаменимая вещь. Особенно выручает виртуальная консоль когда нужно поймать ошибку при загрузке — без неё пришлось бы ехать в ЦОД.
Хорошее сравнение. Добавлю, что для journald критически важно настроить ротацию через SystemMaxUse, иначе на нагруженных серверах он спокойно съедает весь диск.
NVMe wear на Ceph WAL — реально надо следить. У нас через год интенсивной работы один WAL-диск показал 12% ресурса, при том что основные данные на SSD были в норме. Теперь мониторим S.M.A.R.T. через Prometheus node exporter, алерт при < 50% remaining.
Про LRDIMM добавлю: у нас в стойках стоят серверы с 6 ТБ RAM на ноду, там без LRDIMM вообще никак. Да, латентность чуть выше, но для in-memory OLAP нагрузки это не критично, зато объём памяти решает всё.
PUE 1.03 — это мечта любого датацентра. У нас пока 1.45 с воздухом, и каждые 0.1 единицы — это ощутимые деньги на масштабе. Переходим на DTC для GPU-секции, посмотрим что выйдет в итоге.
После миграции 30 VM с VMware на Proxmox могу сказать: самое узкое место — пропускная способность сети между гипервизорами. Если есть возможность — делайте через физический перенос диска или по 10GbE, иначе уходит очень много времени.