Cloud architect, AWS/GCP
steal метрика очень важна в облаке. Как-то деградировала производительность непонятно почему — оказалось, steal был на уровне 15%, переехали на другой хост через поддержку и всё пришло в норму.
Vault Agent Injector в Kubernetes это очень удобно, но у нас были проблемы с производительностью когда много подов стартуют одновременно — Vault не справлялся с нагрузкой. Решили через горизонтальное масштабирование Vault с Raft.
По кэшированию важно добавить: не кэшируйте запросы с авторизацией без явной проверки — можно случайно отдать одному пользователю кэш с данными другого. Используйте proxy_cache_bypass $http_authorization.
По PDU добавлю: switched PDU окупается очень быстро, когда нужно удалённо ребутнуть зависший сервер без физического доступа к стойке. Это must-have для любого серьёзного объекта.
Очень полезная статья, особенно раздел про NoCloud ISO — большинство туториалов рассчитаны на AWS и совсем не объясняют как использовать cloud-init локально с KVM.
Снапшоты через virsh удобны, но с qcow2 они заметно замедляют дисковые операции при большой глубине цепочки — старайтесь не накапливать больше 3−4 снапшотов на машину.
Мигрировали с ELK на Loki полгода назад — потребление оперативки упало с 24 ГБ до 3 ГБ на том же объёме логов. Единственный минус это отсутствие нормального полнотекстового поиска, но для большинства задач хватает.
Restic с MinIO как бэкендом — отличная связка для self-hosted, у нас так работает уже полтора года без единой проблемы. Главное не забыть пароль от репозитория — без него данные не достать.
А ещё советую смотреть на Terragrunt — он добавляет нормальную DRY-структуру поверх Terraform и помогает управлять несколькими state без боли.
Перешли на EPYC два года назад и очень довольны — на тех же физических серверах влезает примерно в полтора раза больше виртуалок по сравнению со старыми Xeon.
Схема 2N кажется избыточной, но когда в первый раз видишь как сервер переживает отключение целого фидера без единого моргания — понимаешь, зачем это нужно.
Loki — огонь, особенно в связке с Grafana. Перешли на него полгода назад и не жалеем, ресурсов жрёт в разы меньше чем ELK при сопоставимом функционале.
GPU в облаке под инференс — отдельная боль по деньгам. A100 80GB стоит прилично в час, на 70B модели без квантизации нужно минимум две штуки. AWQ квантизация реально спасает, одна A100 вытягивает 70B в приемлемом качестве.
Self-hosted runners — отдельная история. Запускать их в Kubernetes через gitlab-runner helm chart реально удобно, автоскейлинг по нагрузке работает хорошо. Только надо правильно настроить лимиты ресурсов иначе джобы начинают конкурировать с продом.
virt-v2v реально упрощает жизнь при миграции Windows VM — сам столкнулся с тем, что ручная установка VirtIO-драйверов в некоторых версиях Windows дала BSoD после переноса, а virt-v2v справился автоматически.