Linux-админ, Proxmox, HA
Хорошая статья для начинающих. Не хватает раздела про метаданные VG — при большом количестве снапшотов они могут неожиданно занять много места.
Не забудьте ещё про fail2ban — он хорошо дополняет всё перечисленное, особенно защиту SSH. У нас на продакшене связка ufw + fail2ban работает уже два года без нареканий.
Советую держать user-data в git-репозитории вместе с остальной инфраструктурой — так всегда видно кто и когда менял конфигурацию начального запуска машин.
repeat_interval лучше ставить побольше, 3−4 часа как минимум — иначе всё равно задолбают повторными уведомлениями посреди ночи. Проверено на собственном опыте.
Флаг --atomic реально спас нас несколько раз, когда деплой падал на этапе readiness probe — релиз сам откатывался и кластер оставался в рабочем состоянии.
Про CLOSE_WAIT важный момент — у нас была проблема с Java-приложением, которое не закрывало соединения, и ss сразу показал несколько тысяч сокетов в этом состоянии.
Пользуюсь fail2ban уже несколько лет, всё работает отлично. Единственное — советую сразу выставлять bantime не меньше суток, иначе боты просто возвращаются через час.
Про роллбэк: мы пошли другим путём — версионируем каждый релиз через тег и при откате просто пересоздаём окружение из проверенного образа. Быстрее чем git revert и не тащит за собой историю неудачных коммитов в основную ветку.
Мигрировали с 6.0 на 7.0 на прошлой неделе, около 800 хостов. Миграция базы заняла минут 40, всё прошло штатно. Главный совет — проверьте совместимость версии MySQL заранее, у нас была 5.7 и пришлось сначала обновить её.
В Proxmox LXC просто незаменимы для инфраструктуры — DNS, мониторинг, небольшие сервисы. Запускается мгновенно, ест минимум памяти. Под базы данных тоже отлично работает.
Раздел про hardening очень ценный. systemd-analyze security — отличная штука, показывает что именно надо добавить. Мы прогнали все наши сервисы и половина оказалась вообще без ограничений.
А как у тебя с AppArmor в итоге получилось? Я пробовала переходить, на nginx профиль постоянно что-то блокировал, пришлось долго разбираться с путями к логам.
Снапшоты в ZFS — просто магия. Делаем перед каждым обновлением системы, и если что-то пошло не так — откат за секунды. Btrfs тоже умеет, но в ZFS как-то привычнее.
Работаю с Zabbix лет восемь, но Prometheus с Grafana реально удобнее для современной инфры. Zabbix хорош когда много legacy и Windows, а для Linux-кластеров — Prometheus однозначно.
Про inode — золотые слова. Один раз у нас упал почтовый сервер именно по этой причине: место на диске было, а файлы создавать нельзя. С тех пор иноды в обязательном мониторинге.