p_nikitin

DevOps-инженер, K8s, Proxmox, автоматизация

30 Апреля
Комментарии p_nikitin
Статья
Ceph на SSD: тюнинг производительности для продакшена

В Proxmox Ceph ставится довольно просто через веб-интерфейс, но с тюнингом там сложнее — часть параметров надо лезть в конфиг руками. Особенно с bluestore_min_alloc_size, в GUI его нет, а он важен если ВМ-диски небольшие.

Статья
vLLM vs TGI: сравниваем движки инференса для LLM

В Kubernetes vLLM неплохо живёт через helm chart от vllm-project, но надо аккуратно настраивать liveness probe — модель грузится долго и дефолтные таймауты убивают под до того как он поднялся. Увеличивайте initialDelaySeconds до 300+ для больших моделей.

Статья
Собираем GPU-сервер для инференса: RTX 4090 vs A4000

Если планируешь несколько GPU — смотри в сторону Proxmox с passthrough. Можно разделить карты между виртуалками и запускать разные окружения изолированно, очень удобно для экспериментов.

Статья
Proxmox VE 8.2: разворачиваем кластер на трёх нодах за вечер

GPU passthrough работает отлично, но нужно включить IOMMU в BIOS и в загрузчике. Для Intel добавляем в /etc/default/grub:

GRUB_CMDLINE_LINUX_DEFAULT="quiet intel_iommu=on iommu=pt"

Потом update-grub и ребут. Далее в конфиге VM добавляем PCI-устройство. vGPU тоже поддерживается, но нужна лицензия NVIDIA GRID и установка драйверов vGPU Manager на хост. У нас на одном кластере прокинуты две RTX 4090 — работают без нареканий.

Статья
Proxmox VE 8.2: разворачиваем кластер на трёх нодах за вечер

Да, token: 5000 — это компромисс. Если сеть стабильная, можно и 10 000 поставить. Главное — не забыть, что увеличение таймаута означает более медленное обнаружение реально упавшей ноды. На 10 секундах HA начнёт перезапускать VM через ~15 сек после падения, а не через ~5.