python_vera

Python-разработчик, автоматизация

30 Апреля
Комментарии python_vera
Статья
NVIDIA Triton Inference Server: продакшн инференс

gRPC клиент для Python немного громоздкий, зато прирост latency реальный — особенно когда гоняешь большие батчи эмбеддингов. На HTTP накладные расходы на JSON-сериализацию очень чувствуются.

Статья
RAG на практике: поиск по документам с LLM

Хорошая статья! Единственное — RAGAS для оценки требует внешний LLM-судью, что добавляет стоимость и задержку. Для быстрой оценки качества retrieval можно просто смотреть на cosine similarity найденных чанков.

Статья
Секреты в DevOps: HashiCorp Vault на практике

Не забудьте настроить audit log в Vault — без него весь смысл централизованного управления секретами теряется. vault audit enable file file_path=/var/log/vault/audit.log и вы видите каждое обращение к секрету.

Статья
Настройка 802.1X: аутентификация в проводной сети

Dynamic VLAN assignment это очень удобно когда есть BYOD политика. Подключил рабочий ноут — попал в рабочий VLAN, подключил личное устройство — автоматически в гостевой. Всё без участия администратора.

Статья
Grafana Loki: логирование без Elasticsearch

Советую сразу разобраться с pipeline_stages в Promtail — правильный парсинг логов на этапе сбора сильно ускоряет последующие запросы. Без этого LogQL начинает работать заметно медленнее на больших объёмах.

Статья
Квантизация моделей: GPTQ, AWQ, GGUF на практике

IQ4_XS квантизация в GGUF реально лучше обычного Q4_K_M при том же размере файла, стоит попробовать если раньше не видели такой суффикс.

Статья
PyTorch vs TensorFlow в 2026: что учить

JAX ещё мало кто упоминает в таких обзорах, а зря — попробовала на задаче оптимизации и скорость по сравнению с PyTorch впечатляет, особенно с vmap и jit вместе.

Статья
Ollama: запускаем LLM локально за 5 минут

Попробовала Qwen 2.5 7B для написания кода — результат лучше чем ожидала, особенно для Python. На старой RTX 3080 летает нормально.

Статья
MinIO: свой S3-совместимый объектный сторадж

Интеграция с boto3 вообще без каких-либо изменений в коде кроме endpoint_url — перешли с настоящего S3 на локальный MinIO за полчаса.

Статья
Логирование в Linux: journald, rsyslog, Loki

Статья хорошая, но не хватает упоминания Vector как альтернативы Promtail — он более универсален и умеет трансформировать логи на лету.

Статья
vLLM vs TGI: сравниваем движки инференса для LLM

По OpenAI совместимости: vLLM реально работает как дроп-ин замена, менял base_url в конфиге клиента и всё. С TGI пришлось чуть поправить обработку stream=True ответов, небольшие отличия в формате всё же есть.

Статья
GitLab CI/CD: пайплайн для деплоя на 50 серверов

По кэшированию pip добавлю: ключ лучше делать по файлу requirements.txt плюс версии Python. Иначе при смене питона кэш не инвалидируется и потом ловишь странные ошибки несовместимости пакетов.

Статья
systemd за 30 минут: от юнитов до таймеров

А для Python-сервисов лучше использовать Type=exec или Type=simple? И стоит ли добавлять gunicorn в тот же юнит или делать отдельный?

Статья
Ansible vs Terraform: когда что использовать

Про коллекции спасибо что упомянул, многие вообще не знают что community.postgresql существует и пишут кучу shell-задач руками там где можно использовать готовый модуль.

Статья
NVIDIA CUDA 12.4: что нового для ML-инженеров

С PyTorch 2.2 и CUDA 12.4 torch.compile реально ускоряет инференс, особенно заметно на небольших моделях. Рекомендую попробовать если ещё не пробовали.