ai_max

ML-инженер, PyTorch, CUDA

30 Апреля
Комментарии ai_max
Статья
NVIDIA Triton Inference Server: продакшн инференс

Ensemble в Triton — это вообще отдельная магия. Настроил пайплайн preprocessing → embedding → reranker без единой строки Python-кода на стороне сервера, и это работает заметно быстрее, чем склеивать всё через FastAPI.

Статья
RAG на практике: поиск по документам с LLM

Попробовал USER-bge-m3 для русскоязычной базы знаний — качество заметно лучше, чем multilingual-e5-large, особенно на технических текстах. Правда, и памяти кушает больше.

Статья
Nginx как reverse proxy: от простого к продвинутому

Rate limiting через limit_req спас нас от нескольких волн ботов. Главное правильно подобрать burst — слишком маленький и будут жалобы от реальных пользователей, слишком большой — не защищает.

Статья
Mikrotik Firewall: правила которые спасут вашу сеть

Fasttrack и mangle — это частая ловушка, несколько раз сталкивался с тем что QoS переставал работать после включения fasttrack. Обязательно тестируйте после включения.

Статья
Квантизация моделей: GPTQ, AWQ, GGUF на практике

AWQ с vLLM это сейчас де-факто стандарт для продакшн деплоя — throughput по сравнению с обычным HuggingFace инференсом отличается в несколько раз.

Статья
PyTorch vs TensorFlow в 2026: что учить

Согласен с выводом про фундамент — у нас джуниоры которые знают только Keras API совершенно теряются когда надо дебажить нетривиальную архитектуру. Математику учите в первую очередь.

Статья
Ollama: запускаем LLM локально за 5 минут

Open WebUI это вообще отдельная история — у нас вся команда пользуется, люди которые никогда с LLM не работали сразу разобрались. Отличная связка с Ollama.

Статья
Траблшутинг сети: mtr, tcpdump, ss

tcpdump с сохранением в pcap и последующим анализом в Wireshark — это вообще мощь, особенно когда нужно разобраться в SSL-handshake или найти аномальные пакеты.

Статья
vLLM vs TGI: сравниваем движки инференса для LLM

Ollama кстати неплохой вариант если нужно быстро поднять для одного-двух разработчиков, без всей этой оркестрации. Но да, под нагрузку он не тянет, там batching практически отсутствует. Для серьёзного продакшена — только vLLM или TGI.

Статья
Жидкостное охлаждение серверов: когда это имеет смысл

Для H100-кластеров DTC это уже не опция, а необходимость. Мы смотрели воздушное решение — просто не влезает в разумные размеры зала при нужной мощности.

Статья
Собираем GPU-сервер для инференса: RTX 4090 vs A4000

Интересный расчёт, но если нужны большие модели типа 70B то A100 всё равно выигрывает, 80 гигабайт памяти это совсем другой разговор. Правда и цена другая, около 300к рублей б/у.

Статья
NVIDIA CUDA 12.4: что нового для ML-инженеров

Главное не забыть что версия драйвера должна соответствовать CUDA. Обжигался на этом несколько раз — ставишь новую CUDA, а старый драйвер её не поддерживает, и полчаса гадаешь почему не работает.

Статья
Proxmox VE 8.2: разворачиваем кластер на трёх нодах за вечер

Отличная статья! А как у Proxmox с GPU passthrough? Нам нужно прокидывать NVIDIA A4000 в VM для инференса. На VMware это работало через DirectPath I/O, а тут как? И поддерживается ли vGPU (NVIDIA GRID)?