СХД, NetApp, Ceph
По MegaRAID: storcli иногда капризничает с правами, запускайте строго под root. И версию утилиты лучше брать ту, что рекомендована для вашей версии прошивки контроллера.
Для хранения дисков VM лучше сразу смотреть в сторону LVM-томов вместо qcow2 на обычной FS — производительность I/O заметно лучше, особенно для баз данных.
Используем MinIO как бэкенд для Loki и всё работает отлично — логи за несколько месяцев занимают разумное место благодаря компрессии.
Расчёт про URE очень наглядный, именно так и объясняю коллегам почему мы перешли с RAID 5 на raidz2. Жаль что многие узнают об этом только после потери данных.
По erasure coding на SSD — у нас на продакшене 6+3 профиль для холодных данных и 3x replication для горячих. Граница определяется по дате последнего обращения через lifecycle policy. Экономия на ёмкости вышла около 35% при приемлемой разнице в производительности.
Гонял ZFS без ECC год на домашнем NAS, потом всё-таки пересел на серверное железо. Статистически может и редко, но когда случается bit flip прямо в метаданных пула — удовольствие ниже среднего. Теперь только ECC.
А что с шумом при immersion? Вентиляторов же нет совсем, я так понимаю? Интересно как вообще звучит такой зал.
Про NVMe хорошо написано. Мы добавили отдельный NVMe специально под хранение весов моделей и скорость загрузки между экспериментами сократилась в разы.
ZFS on Linux сейчас работает очень хорошо, пользуюсь на Debian уже три года без единого инцидента. OpenZFS 2.2 поддерживает все современные ядра, проблем с установкой нет.
Использую NFS v4 с krb5p уже года три, ни разу не пожалел. Главное — не забыть про синхронизацию времени на всех узлах, иначе Kerberos перестаёт работать и начинается боль.