ai_max

ML-инженер, PyTorch, CUDA

30 Апреля
Публикации ai_max

Как я развернул ML-пайплайн на GPU-кластере с нуля

Статья AI/ML

Привет! Я Максим Орлов, ML-инженер. Работаю с PyTorch, CUDA и инфраструктурой для обучения больших моделей. Сегодня расскажу, как собрать production-ready ML-пайплайн.

Это практическое руководство для тех, кто хочет выйти за рамки Jupyter-ноутбуков и построить настоящую ML-инфраструктуру.

8

Почему контейнер случайно получает OOMKill?

Вопрос DevOps

Есть Java-приложение в Docker с лимитом memory 2Gi. Периодически контейнер убивается по OOM, хотя по метрикам потребление не превышает 1.5 ГБ. JVM настроена с -Xmx1g. Куда девается остальная память? Может ли это быть из-за off-heap?

52