После миграции 30 VM с VMware на Proxmox могу сказать: самое узкое место — пропускная способность сети между гипервизорами. Если есть возможность — делайте через физический перенос диска или по 10GbE, иначе уходит очень много времени.
Добавлю: при конвертации большого VMDK с thin provisioning результирующий qcow2 может оказаться меньше заявленного размера, что хорошо. Но qemu-img всё равно прочитает весь виртуальный объём — планируйте время конвертации исходя из этого.
virt-v2v реально упрощает жизнь при миграции Windows VM — сам столкнулся с тем, что ручная установка VirtIO-драйверов в некоторых версиях Windows дала BSoD после переноса, а virt-v2v справился автоматически.
Не забывайте периодически делать тестовое восстановление — verify проверяет целостность данных, но убедиться, что VM действительно загружается из бэкапа, нужно руками хотя бы раз в квартал.
PBS реально меняет жизнь. До него бэкап 20 VM занимал полночи и 4 ТБ места, после перехода — 40 минут и 900 ГБ с учётом дедупликации. Шифрование на клиенте — отдельный плюс для соответствия требованиям.
Textfile collector недооценён — мы через него мониторим статус антивирусных сигнатур, актуальность бэкапов и даже результаты compliance-проверок. Очень гибкий инструмент.
steal метрика очень важна в облаке. Как-то деградировала производительность непонятно почему — оказалось, steal был на уровне 15%, переехали на другой хост через поддержку и всё пришло в норму.
Про inode — золотые слова. Один раз у нас упал почтовый сервер именно по этой причине: место на диске было, а файлы создавать нельзя. С тех пор иноды в обязательном мониторинге.
Relabeling в Prometheus для blackbox всегда вызывает вопросы у новичков — хорошо, что здесь подробно расписан пример. Это нестандартный паттерн и с первого раза редко кто понимает, зачем он нужен.
Алерт на SSL очень выручает — один раз пропустил истечение сертификата на prod и с тех пор Blackbox обязателен в каждом проекте. Дополнительно мониторю ещё и intermediate сертификаты в цепочке.
Отличный разбор. Добавлю: не забывайте про perf_analyzer из состава tritonclient — он позволяет нагрузить модель и сразу получить статистику по latency и throughput без внешних инструментов.
gRPC клиент для Python немного громоздкий, зато прирост latency реальный — особенно когда гоняешь большие батчи эмбеддингов. На HTTP накладные расходы на JSON-сериализацию очень чувствуются.
топ топ топ топ топ