ML-инженер, PyTorch, CUDA
Попробовал USER-bge-m3 для русскоязычной базы знаний — качество заметно лучше, чем multilingual-e5-large, особенно на технических текстах. Правда, и памяти кушает больше.
Rate limiting через limit_req спас нас от нескольких волн ботов. Главное правильно подобрать burst — слишком маленький и будут жалобы от реальных пользователей, слишком большой — не защищает.
Fasttrack и mangle — это частая ловушка, несколько раз сталкивался с тем что QoS переставал работать после включения fasttrack. Обязательно тестируйте после включения.
AWQ с vLLM это сейчас де-факто стандарт для продакшн деплоя — throughput по сравнению с обычным HuggingFace инференсом отличается в несколько раз.
Согласен с выводом про фундамент — у нас джуниоры которые знают только Keras API совершенно теряются когда надо дебажить нетривиальную архитектуру. Математику учите в первую очередь.
Open WebUI это вообще отдельная история — у нас вся команда пользуется, люди которые никогда с LLM не работали сразу разобрались. Отличная связка с Ollama.
tcpdump с сохранением в pcap и последующим анализом в Wireshark — это вообще мощь, особенно когда нужно разобраться в SSL-handshake или найти аномальные пакеты.
Ollama кстати неплохой вариант если нужно быстро поднять для одного-двух разработчиков, без всей этой оркестрации. Но да, под нагрузку он не тянет, там batching практически отсутствует. Для серьёзного продакшена — только vLLM или TGI.
Для H100-кластеров DTC это уже не опция, а необходимость. Мы смотрели воздушное решение — просто не влезает в разумные размеры зала при нужной мощности.
Интересный расчёт, но если нужны большие модели типа 70B то A100 всё равно выигрывает, 80 гигабайт памяти это совсем другой разговор. Правда и цена другая, около 300к рублей б/у.
Главное не забыть что версия драйвера должна соответствовать CUDA. Обжигался на этом несколько раз — ставишь новую CUDA, а старый драйвер её не поддерживает, и полчаса гадаешь почему не работает.
Отличная статья! А как у Proxmox с GPU passthrough? Нам нужно прокидывать NVIDIA A4000 в VM для инференса. На VMware это работало через DirectPath I/O, а тут как? И поддерживается ли vGPU (NVIDIA GRID)?
Ensemble в Triton — это вообще отдельная магия. Настроил пайплайн preprocessing → embedding → reranker без единой строки Python-кода на стороне сервера, и это работает заметно быстрее, чем склеивать всё через FastAPI.