Kubernetes в production: 30 уроков за 3 года эксплуатации

Статья DevOps

Всем привет! Меня зовут Павел Никитин, и я занимаюсь DevOps-инженерией — Kubernetes, Proxmox, автоматизация CI/CD. За 3 года эксплуатации K8s в production накопил много граблей. Делюсь.

Kubernetes — мощный инструмент, но он наказывает за небрежность. Вот главные уроки.

Ресурсы

  1. **Всегда ставьте…
33

GPU-кластеры для AI: как собрать и не разориться

Статья AI/ML

Привет! Я Мария Волкова, AI/ML-инженер. Специализируюсь на инфраструктуре для обучения нейросетей — GPU-кластеры, NVIDIA-стек, оптимизация. Расскажу про экономику GPU.

GPU — это дорого. Но можно оптимизировать затраты в 3−5 раз, если знать как.

Выбор GPU в 2025

| GPU | VRAM | Цена | Для чего…

35

Подбор серверного железа в 2025: на что обращать внимание

Статья Серверы

Привет! Я Сергей Петров, Linux-инженер с 10+ годами опыта. Занимаюсь подбором и настройкой серверного оборудования. Расскажу, как не ошибиться с выбором в 2025 году.

Серверное железо — это инвестиция на 5−7 лет. Ошибка при выборе дорого обходится.

Процессоры

Intel vs AMD в 2025

  • **AMD EPYC 9004…
28

Проектирование корпоративной сети: от 50 до 5000 пользователей

Статья Сети

Привет! Я Анна Королёва, сетевой архитектор. Работаю с Cisco и Juniper, проектирую сети для средних и крупных компаний. Поделюсь подходом к масштабированию.

Как спроектировать сеть, которая вырастет вместе с компанией и не развалится?

Принципы проектирования

  1. Иерархия: Access → Distribution →…
28

NVIDIA представила Fleet Intelligence для мониторинга ИИ-кластеров

NVIDIA представила управляемую платформу Fleet Intelligence, предназначенную для мониторинга состояния крупных кластеров ускорителей, используемых в ИИ-инфраструктуре. Сервис уже доступен бесплатно для клиентов, применяющих продукты NVIDIA на базе ускорителей семейств Hopper, Blackwell и Vera…

8
✍️
Публикуйте, отвечайте, комментируйте
Присоединяйтесь к сообществу KVAN.AI

Рост выручки китайских компаний корректирует их планы

Планы Alibaba Cloud: десятикратный рост мощностей

Генеральный директор Alibaba Cloud Эдди Ву (Eddie Wu) в ходе отчёта за IV квартал 2026 финансового года заявил, что компания намерена увеличить вычислительные ресурсы своих ЦОД в десять раз по сравнению с 2022 годом, планируя достичь этого рубежа к 2033 году,…

6

Астра объявляет о запуске Astra Store

Статья Linux

Астра сообщила о коммерческом запуске корпоративного магазина приложений Astra Store. Решение ориентировано на предприятия, государственные учреждения и образовательные организации, которые переносят свои системы на российское программное обеспечение либо уже работают в среде Astra Linux.

По сути, Astra Store…

8

Corning и NVIDIA стали долгосрочными партнерами в производстве компонентов для ИИ-инфраструктуры

NVIDIA и Corning заключили долгосрочное соглашение, цель которого наращивание выпуска в США компонентов для оптических коммуникаций в составе ИИ-инфраструктуры. Для этого Corning возведёт в Северной Каролине и Техасе три производственных площадки, ориентированных на оптические решения для дата-центров.

Глава…

8

Acronis представила альтернативу продуктам VMware

Компания Acronis представила решение Acronis Cyber Frame — гиперконвергентную IaaS-платформу, ориентированную на поставщиков управляемых услуг, облачных провайдеров, хостинговые компании и операторов связи. С её помощью партнёры могут самостоятельно формировать, защищать, администрировать и монетизировать…

7

Samsung гототив петабайтные SSD для датацентров

Речь идёт об устройствах класса Nearline SSD, рассчитанных на работу в дата-центрах и способных вмещать колоссальные объёмы данных. Такие устройства проектирует не только Samsung — аналогичные разработки ведёт Solidigm, и образцы уже проходят испытания в лабораториях.

Главная цель Samsung, на текущий момент…

7

Разработан мини-ПК для ИИ DX-AIPlayer

Статья AI/MLСерверы

Южнокорейский стартап Deepx, представил мини-компьютер DX-AIPlayer для периферийных ИИ-задач. Новинка сочетает процессор Intel поколения Alder Lake-N и фирменный ускоритель DX-M1.

Корпус размерами 95×95×55 мм весит около 450 г. Внутри установлен четырёхъядерный Intel Processor N97 без…

9

Анонсирован новый сетевой протокол MRC для ИИ-кластеров

Статья AI/MLСети

OpenAI совместно с AMD, Broadcom, Intel, Microsoft и NVIDIA представила сетевой протокол Multipath Reliable Connection (MRC), нацеленный на повышение производительности и отказоустойчивости крупных GPU-кластеров для задач ИИ. Он уже работает в кластерах с NVIDIA GB200, включая первый ЦОД Stargate и…

5

AMD показала скорости новых ускорителей Instinct MI430X

Статья AI/MLСерверы

AMD рассказала, на что способен её новый чип Instinct MI430X. Важно отметить, это не ускоритель для ИИ, а решение, заточенное под серьёзные высокопроизводительные вычисления. Вычисления с двойной точностью (FP64) остаются критически важными для науки, моделирования и массы других задач. Официально о выходе…

8

Red Hat добавляет в свой портфель ИИ-платформу Red Hat AI 3.4

Статья AI/MLLinux

Red Hat выпустила Red Hat AI 3.4 — обновлённую платформу для корпоративного ИИ, заточенную под крупномасштабный инференс и развёртывание агентного интеллекта в гибридных облаках. Ключевая фича релиза — модель как услуга (MaaS). Разработчики получают единый управляемый интерфейс с доступом к отобранным моделям…

19