m_volkova

AI/ML-инженер, GPU-кластеры, NVIDIA

30 Апреля
Публикации m_volkova

GPU-кластеры для AI: как собрать и не разориться

Статья AI/ML

Привет! Я Мария Волкова, AI/ML-инженер. Специализируюсь на инфраструктуре для обучения нейросетей — GPU-кластеры, NVIDIA-стек, оптимизация. Расскажу про экономику GPU.

GPU — это дорого. Но можно оптимизировать затраты в 3−5 раз, если знать как.

Выбор GPU в 2025

| GPU | VRAM | Цена | Для чего…

36

Собираем GPU-сервер для инференса: RTX 4090 vs A4000

Статья AI/MLСерверы

Я занимаюсь инференсом языковых моделей и Stable Diffusion. Долго гнала всё в облаке — RunPod, Lambda Labs, иногда AWS. В определённый момент посчитала цифры и поняла: собственный сервер окупается примерно за восемь месяцев при моей нагрузке. Собрала сборку, делюсь опытом.

572

NVIDIA CUDA 12.4: что нового для ML-инженеров

Статья AI/ML

NVIDIA выпустила CUDA 12.4 в начале 2024 года, и с тех пор это стало стандартным окружением для большинства ML-команд. Если вы ещё на 11.x или ранних версиях 12.x — самое время разобраться, что изменилось и стоит ли переходить прямо сейчас.

398

Жидкостное охлаждение серверов: когда это имеет смысл

Статья Серверы

Тепловыделение современных серверных процессоров и GPU давно перевалило за отметку, при которой воздушное охлаждение остаётся эффективным. H100 от NVIDIA рассеивает 700 Вт на один ускоритель, а сервер с восемью такими картами выдаёт 5,6 кВт тепла в одном юните стойки. Воздух с этим просто не справляется.

356

vLLM vs TGI: сравниваем движки инференса для LLM

Статья AI/ML

Запустить LLM локально через ollama run может каждый. Но когда нужно отдавать модель сотням пользователей по API с минимальной задержкой — начинается настоящая инженерия. Разбираем два главных движка инференса: vLLM и TGI.

596
✍️
Публикуйте, отвечайте, комментируйте
Присоединяйтесь к сообществу KVAN.AI

Выбираем серверный процессор: Xeon vs EPYC в 2026

Статья Серверы

Выбираем серверный процессор: Xeon vs EPYC в 2026

Выбор серверного процессора — одно из ключевых решений при проектировании инфраструктуры. В 2026 году рынок серверных CPU фактически поделён между двумя игроками: Intel Xeon и AMD EPYC. Оба семейства прошли долгий путь, и сегодня конкуренция между ними как никогда острая.

407

Ollama: запускаем LLM локально за 5 минут

Статья AI/ML

Ollama: запускаем LLM локально за 5 минут

ChatGPT удобен, но есть случаи когда отправлять данные во внешнее API нельзя: медицинские записи, юридические документы, внутренний код компании. Или просто хочется не зависеть от чужих серверов и платить только за электричество. Ollama — это инструмент, который делает запуск больших языковых моделей на собственном железе буквально задачей пяти минут.

528

PyTorch vs TensorFlow в 2026: что учить

Статья AI/ML

PyTorch vs TensorFlow в 2026: что учить

Несколько лет назад этот вопрос был дискуссионным. В 2026 году ситуация значительно прояснилась: у PyTorch и TensorFlow разные ниши, разные сильные стороны и разная аудитория. Вместо того чтобы выбирать «что лучше», правильнее спросить «что подходит для моих задач». Разберём честно, без фанатизма.

351

Квантизация моделей: GPTQ, AWQ, GGUF на практике

Статья AI/ML

Квантизация моделей: GPTQ, AWQ, GGUF на практике

Llama 3.1 70B в полной точности (fp16) занимает около 140 ГБ VRAM — два A100 80GB впритык. После квантизации до 4 бит тот же самый 70B поместится в 40 ГБ, а качество просядет совсем немного. Квантизация — это искусство делать большие модели доступными без значительной потери качества. Разберём три главных формата: GPTQ, AWQ и GGUF.

391

RAG на практике: поиск по документам с LLM

Статья AI/ML

RAG (Retrieval-Augmented Generation) — архитектурный паттерн, который решает одну из главных проблем LLM: они не знают о ваших внутренних документах. Вместо дорогостоящего fine-tuning мы учим модель искать нужную информацию в базе знаний прямо во время запроса.

461

NVIDIA Triton Inference Server: продакшн инференс

Статья AI/ML

Запустить модель машинного обучения через Flask — это быстро и просто. Но когда нагрузка растёт, а задержки становятся критичны, Flask начинает задыхаться. NVIDIA Triton Inference Server создан именно для production: он умеет то, что Flask никогда не умел из коробки.

313