Public Telegram Archive
Channels About
CY iT HR
@cyprusithr · supergroup · filtered by Petruha
Petruha 2026-09-18 18:05 UTC document
📄 Document (not supported)
#CV #резюме #devops #sre #kubernetes #baremetal #llm

Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо

Обо мне:

Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.

Что решал:

- Нашёл reload=True, вшитый в общий базовый образ, а не в манифесты: поток релоадера съедал 769 из 1100 тиков воркера (py-spy). Раскатал фикс на 143 манифеста в 6 окружениях. Прод-контур одного клиента, 20 сервисов: с 7.75 до 0.78 ядра. Dev и stage того же клиента: со 113 до 42 GiB памяти. Сверил сутки до и после, контролем взяв нетронутые сервисы.

- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.

- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.

- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.

- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.

- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.

- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.

- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.

- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.

Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.

Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code

Английский: C1

Контакт: @ptruha
1 message on this day