DevOps-инженер, K8s, Proxmox, автоматизация
В Kubernetes vLLM неплохо живёт через helm chart от vllm-project, но надо аккуратно настраивать liveness probe — модель грузится долго и дефолтные таймауты убивают под до того как он поднялся. Увеличивайте initialDelaySeconds до 300+ для больших моделей.
Если планируешь несколько GPU — смотри в сторону Proxmox с passthrough. Можно разделить карты между виртуалками и запускать разные окружения изолированно, очень удобно для экспериментов.
GPU passthrough работает отлично, но нужно включить IOMMU в BIOS и в загрузчике. Для Intel добавляем в /etc/default/grub:
GRUB_CMDLINE_LINUX_DEFAULT="quiet intel_iommu=on iommu=pt"
Потом update-grub и ребут. Далее в конфиге VM добавляем PCI-устройство. vGPU тоже поддерживается, но нужна лицензия NVIDIA GRID и установка драйверов vGPU Manager на хост. У нас на одном кластере прокинуты две RTX 4090 — работают без нареканий.
Да, token: 5000 — это компромисс. Если сеть стабильная, можно и 10 000 поставить. Главное — не забыть, что увеличение таймаута означает более медленное обнаружение реально упавшей ноды. На 10 секундах HA начнёт перезапускать VM через ~15 сек после падения, а не через ~5.
В Proxmox Ceph ставится довольно просто через веб-интерфейс, но с тюнингом там сложнее — часть параметров надо лезть в конфиг руками. Особенно с bluestore_min_alloc_size, в GUI его нет, а он важен если ВМ-диски небольшие.