Channels / User Profile
User Info
Petruha
| ID | 1828075445 |
|---|---|
| Type | user |
| Username | @Ptruha |
| First Name | Petruha |
| First Seen | 2026-06-02 16:06 UTC |
| Updated | 2026-06-02 16:06 UTC |
Statistics
Total Messages: 15
Active in: 1 channel(s)
Activity by Channel
Recent Messages
📄 Document (not supported)
#CV #резюме #devops #sre #kubernetes #baremetal #llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Нашёл reload=True, вшитый в общий базовый образ, а не в манифесты: поток релоадера съедал 769 из 1100 тиков воркера (py-spy). Раскатал фикс на 143 манифеста в 6 окружениях. Прод-контур одного клиента, 20 сервисов: с 7.75 до 0.78 ядра. Dev и stage того же клиента: со 113 до 42 GiB памяти. Сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Нашёл reload=True, вшитый в общий базовый образ, а не в манифесты: поток релоадера съедал 769 из 1100 тиков воркера (py-spy). Раскатал фикс на 143 манифеста в 6 окружениях. Прод-контур одного клиента, 20 сервисов: с 7.75 до 0.78 ядра. Dev и stage того же клиента: со 113 до 42 GiB памяти. Сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha
📄 Document (not supported)
#CV #резюме #devops #sre #kubernetes #baremetal #llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Нашёл reload=True, вшитый в общий базовый образ, а не в манифесты: поток релоадера съедал 769 из 1100 тиков воркера (py-spy). Раскатал фикс на 143 манифеста в 6 окружениях. Прод-контур одного клиента, 20 сервисов: с 7.75 до 0.78 ядра. Dev и stage того же клиента: со 113 до 42 GiB памяти. Сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Нашёл reload=True, вшитый в общий базовый образ, а не в манифесты: поток релоадера съедал 769 из 1100 тиков воркера (py-spy). Раскатал фикс на 143 манифеста в 6 окружениях. Прод-контур одного клиента, 20 сервисов: с 7.75 до 0.78 ядра. Dev и stage того же клиента: со 113 до 42 GiB памяти. Сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha
📄 Document (not supported)
#CV #резюме #devops #sre #kubernetes #baremetal #llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Срезал CPU в проде на 90% (7.75 -> 0.78 ядра) и память на dev/stage на 64%, докопавшись до reload=True, вшитого в общий базовый образ, а не в манифесты. Доказал через py-spy: поток релоадера съедал 769 из 1100 тиков воркера. Раскатал на 143 манифеста в 6 окружениях, сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Срезал CPU в проде на 90% (7.75 -> 0.78 ядра) и память на dev/stage на 64%, докопавшись до reload=True, вшитого в общий базовый образ, а не в манифесты. Доказал через py-spy: поток релоадера съедал 769 из 1100 тиков воркера. Раскатал на 143 манифеста в 6 окружениях, сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha
📄 Document (not supported)
#CV #резюме #devops #sre #kubernetes #baremetal #llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Срезал CPU в проде на 90% (7.75 -> 0.78 ядра) и память на dev/stage на 64%, докопавшись до reload=True, вшитого в общий базовый образ, а не в манифесты. Доказал через py-spy: поток релоадера съедал 769 из 1100 тиков воркера. Раскатал на 143 манифеста в 6 окружениях, сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Срезал CPU в проде на 90% (7.75 -> 0.78 ядра) и память на dev/stage на 64%, докопавшись до reload=True, вшитого в общий базовый образ, а не в манифесты. Доказал через py-spy: поток релоадера съедал 769 из 1100 тиков воркера. Раскатал на 143 манифеста в 6 окружениях, сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: SSHub, опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha
📄 Document (not supported)
#CV #резюме #devops #sre #baremetal #llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре.
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре.
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant
Английский: C1
Контакт: @ptruha
📄 Document (not supported)
#CV #резюме #devops #sre #baremetal #llm
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре.
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре.
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant
Английский: C1
Контакт: @ptruha
📄 Document (not supported)
#резюме #devops #sre #baremetal #llm
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре.
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре.
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant
Английский: C1
Контакт: @ptruha
📄 Document (not supported)
#резюме #devops #sre #baremetal #llm
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-систему аналитики инфраструктуры с нуля: CPU-only inference (llama.cpp + Ray), корреляция событий K8s, метрик Prometheus и алертов, отчёты в Telegram. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · Ray · Qdrant
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-систему аналитики инфраструктуры с нуля: CPU-only inference (llama.cpp + Ray), корреляция событий K8s, метрик Prometheus и алертов, отчёты в Telegram. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · Ray · Qdrant
Английский: C1
Контакт: @ptruha
CY iT HR
2026-07-15 17:46 UTC
#резюме #devops #sre #baremetal #llm
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-систему аналитики инфраструктуры с нуля: CPU-only inference (llama.cpp + Ray), корреляция событий K8s, метрик Prometheus и алертов, отчёты в Telegram. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Ответственен за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · Ray · Qdrant
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-систему аналитики инфраструктуры с нуля: CPU-only inference (llama.cpp + Ray), корреляция событий K8s, метрик Prometheus и алертов, отчёты в Telegram. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Ответственен за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · Ray · Qdrant
Английский: C1
Контакт: @ptruha
CY iT HR
2026-07-08 06:09 UTC
#резюме #devops #sre #baremetal #llm
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-систему аналитики инфраструктуры с нуля: CPU-only inference (llama.cpp + Ray), корреляция событий K8s, метрик Prometheus и алертов, отчёты в Telegram. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Ответственен за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · Ray · Qdrant
Английский: C1
Контакт: @ptruha
Позиция: Platform / Infrastructure Engineer (Middle)
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.)
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-систему аналитики инфраструктуры с нуля: CPU-only inference (llama.cpp + Ray), корреляция событий K8s, метрик Prometheus и алертов, отчёты в Telegram. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Ответственен за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · Ray · Qdrant
Английский: C1
Контакт: @ptruha