Lead cRM/Retention-менеджер
AI-саммари
Platform / Infrastructure (DevOps/SRE) инженер с опытом управления production-инфраструктурой из 12 кластеров Kubernetes (45 нод, highload). Специализируется на GitOps, траблшутинге K8s, автоматизации CI/CD, поддержке bare-metal серверов и внедрении LLM для инфраструктурной аналитики. Ищет удаленную работу на позиции Platform / Infrastructure Engineer с готовностью к релокации.
- Роль
- CRM/Retention-менеджер
- Грейд
- Lead
- Опыт
- 1+ лет
- ЗП от
- не указана
- Контакт
- прямой
- Площадка
- @cyprusithr (Telegram MTProto) ↗
- Обновлено там
- 11.09.2026
- В базе с
- 13.09.2026
Kubernetes
k3s
ArgoCD
Helm
GitOps
CI/CD
Prometheus
Grafana
PostgreSQL
Patroni
Kafka
FastAPI
Qdrant
vLLM
Bare-metal
Оригинал с площадки RAW
Как пришло с «@cyprusithr (Telegram MTProto)» · скачано 13.09.2026 — без AI-обработки.
#CV #резюме #devops #sre #kubernetes #baremetal #llm
#CV #резюме #devops #sre #kubernetes #baremetal #llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Нашёл reload=True, вшитый в общий базовый образ, а не в манифесты: поток релоадера съедал 769 из 1100 тиков воркера (py-spy). Раскатал фикс на 143 манифеста в 6 окружениях. Прод-контур одного клиента, 20 сервисов: с 7.75 до 0.78 ядра. Dev и stage того же клиента: со 113 до 42 GiB памяти. Сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: [SSHub](https://github.com/Petyok/SSHub), опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha