cloud_artem

Cloud architect, AWS/GCP

30 Апреля
Комментарии cloud_artem
Статья
Миграция VM между гипервизорами: практический гайд

virt-v2v реально упрощает жизнь при миграции Windows VM — сам столкнулся с тем, что ручная установка VirtIO-драйверов в некоторых версиях Windows дала BSoD после переноса, а virt-v2v справился автоматически.

Статья
Node Exporter: какие метрики реально важны

steal метрика очень важна в облаке. Как-то деградировала производительность непонятно почему — оказалось, steal был на уровне 15%, переехали на другой хост через поддержку и всё пришло в норму.

Статья
Секреты в DevOps: HashiCorp Vault на практике

Vault Agent Injector в Kubernetes это очень удобно, но у нас были проблемы с производительностью когда много подов стартуют одновременно — Vault не справлялся с нагрузкой. Решили через горизонтальное масштабирование Vault с Raft.

Статья
Nginx как reverse proxy: от простого к продвинутому

По кэшированию важно добавить: не кэшируйте запросы с авторизацией без явной проверки — можно случайно отдать одному пользователю кэш с данными другого. Используйте proxy_cache_bypass $http_authorization.

Статья
Выбираем серверную стойку: 19 дюймов здравого смысла

По PDU добавлю: switched PDU окупается очень быстро, когда нужно удалённо ребутнуть зависший сервер без физического доступа к стойке. Это must-have для любого серьёзного объекта.

Статья
Cloud-init: автоматическая настройка VM при первом запуске

Очень полезная статья, особенно раздел про NoCloud ISO — большинство туториалов рассчитаны на AWS и совсем не объясняют как использовать cloud-init локально с KVM.

Статья
KVM и libvirt: виртуализация без GUI

Снапшоты через virsh удобны, но с qcow2 они заметно замедляют дисковые операции при большой глубине цепочки — старайтесь не накапливать больше 3−4 снапшотов на машину.

Статья
Grafana Loki: логирование без Elasticsearch

Мигрировали с ELK на Loki полгода назад — потребление оперативки упало с 24 ГБ до 3 ГБ на том же объёме логов. Единственный минус это отсутствие нормального полнотекстового поиска, но для большинства задач хватает.

Статья
Restic и Borg: бэкапы которые реально работают

Restic с MinIO как бэкендом — отличная связка для self-hosted, у нас так работает уже полтора года без единой проблемы. Главное не забыть пароль от репозитория — без него данные не достать.

Статья
Terraform state: как не потерять инфраструктуру

А ещё советую смотреть на Terragrunt — он добавляет нормальную DRY-структуру поверх Terraform и помогает управлять несколькими state без боли.

Статья
Выбираем серверный процессор: Xeon vs EPYC в 2026

Перешли на EPYC два года назад и очень довольны — на тех же физических серверах влезает примерно в полтора раза больше виртуалок по сравнению со старыми Xeon.

Статья
Серверные блоки питания: redundancy и hot-swap

Схема 2N кажется избыточной, но когда в первый раз видишь как сервер переживает отключение целого фидера без единого моргания — понимаешь, зачем это нужно.

Статья
Логирование в Linux: journald, rsyslog, Loki

Loki — огонь, особенно в связке с Grafana. Перешли на него полгода назад и не жалеем, ресурсов жрёт в разы меньше чем ELK при сопоставимом функционале.

Статья
vLLM vs TGI: сравниваем движки инференса для LLM

GPU в облаке под инференс — отдельная боль по деньгам. A100 80GB стоит прилично в час, на 70B модели без квантизации нужно минимум две штуки. AWQ квантизация реально спасает, одна A100 вытягивает 70B в приемлемом качестве.

Статья
GitLab CI/CD: пайплайн для деплоя на 50 серверов

Self-hosted runners — отдельная история. Запускать их в Kubernetes через gitlab-runner helm chart реально удобно, автоскейлинг по нагрузке работает хорошо. Только надо правильно настроить лимиты ресурсов иначе джобы начинают конкурировать с продом.