Lead cRM/Retention-менеджер
AI-саммари
Platform/Infrastructure инженер с опытом полного цикла эксплуатации enterprise-инфраструктуры (12 кластеров Kubernetes, on-prem/bare-metal, 10K RPS). Специализируется на GitOps, траблшутинге высокой сложности, оптимизации ресурсов и развертывании ML/LLM-инфраструктуры. Ищет удаленную позицию Platform или Infrastructure Engineer с готовностью к релокации.
- Роль
- CRM/Retention-менеджер
- Грейд
- Lead
- Опыт
- 1+ лет
- ЗП от
- не указана
- Контакт
- прямой
- Площадка
- @cyprusithr (Telegram MTProto) ↗
- Обновлено там
- 04.09.2026
- В базе с
- 13.09.2026
Kubernetes
k3s
ArgoCD
Helm
GitOps
Prometheus
Grafana
PostgreSQL
Patroni
Kafka
CI/CD
Docker
FastAPI
Qdrant
WireGuard
Оригинал с площадки RAW
Как пришло с «@cyprusithr (Telegram MTProto)» · скачано 13.09.2026 — без AI-обработки.
#CV #резюме #devops #sre #kubernetes #baremetal #llm
#CV #резюме #devops #sre #kubernetes #baremetal #llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Оформление: обсуждаемо
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 кластеров Kubernetes, 45 нод, ~10K RPS, uptime 99.85%. Пришёл стажёром DevOps без инфраструктурного бэкграунда в октябре 2024, за 22 месяца четыре повышения. Архитектуру разбираем вдвоём с тимлидом, реализация и эксплуатация на мне: от сборки сервера и монтажа в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Что решал:
- Срезал CPU в проде на 90% (7.75 -> 0.78 ядра) и память на dev/stage на 64%, докопавшись до reload=True, вшитого в общий базовый образ, а не в манифесты. Доказал через py-spy: поток релоадера съедал 769 из 1100 тиков воркера. Раскатал на 143 манифеста в 6 окружениях, сверил сутки до и после, контролем взяв нетронутые сервисы.
- Нашёл и закрыл обход аутентификации на четырёх дев-кластерах: ingress-allowlist по IP обходился клиентским заголовком X-Forwarded-For, наружу торчали ArgoCD, Kafka UI, EMQX и админка Django. Починил на периметре, не трогая конфиги кластеров.
- Разобрал восьмидневный тихий отказ контента на клиентском сайте: Helm lookup возвращал nil под ArgoCD, на каждом синке регенерировалась соль токена Strapi, API-токены протухали, фронт глотал 401 и отдавал пустой каталог. Ни одного алерта. Воспроизвёл, починил одной строкой, пофиксил тот же чарт ещё в пяти окружениях.
- Принял бэкапы и DR всех продовых кластеров и обнаружил, что полные бэкапы падали до 107 дней: бакеты не создавались, retention-политики не было. Починил пайплайн, добавил алертинг. При отказе ноды у провайдера Patroni поднял PostgreSQL сам, Kafka потребовала рук, по итогу написал runbook.
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: события K8s и метрики Prometheus в Qdrant, RAG на Nomic Embed Text v2 с реранкером, бенчмарк llama.cpp, vLLM и Transformers перед выбором Qwen 3.5, fallback-роутинг между провайдерами моделей, sanity-проверки на каждой стадии. Спам из warning-ов перестал быть спамом: платформа сопоставляет алерт с событиями кластера и метриками за тот же интервал и отдаёт объяснение вместо пересылки. Команда пользуется ежедневно.
- Развил CI/CD от одной сборочной джобы до полного цикла (линт, тесты, сборка образов, интеграционные тесты, деплой через ArgoCD, откат) и перевёз 25 микросервисов с ручных VMware-виртуалок на self-hosted k3s. Релизы с недельных на ежедневные, ручных деплоев в прод ноль.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Собрал on-prem кластер у security-sensitive клиента: сам собрал Supermicro, смонтировал в его ЦОДе, вывел в закрытую сеть через WireGuard. После ухода MinIO из open source перевёл хранилище на Rook/Ceph, прототипировав на k3s в AWS через Terraform.
- Менторю джуна-девопса, пишу онбординг-лабу для стажёров, держу доступы 13 инженеров. Нашёл и онбордил полевого инженера под кампус из 55 корпусов.
Своё, вне работы: [SSHub](https://github.com/Petyok/SSHub), опенсурсный TUI для SSH на Rust: ~59k строк, 100+ звёзд на GitHub, crates.io и npm, есть внешние контрибьюторы. Плюс пара системных утилит для Linux.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Rook/Ceph · Cilium · MetalLB · BGP на OPNsense · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL (PITR) · ClickHouse · Kafka · Python · Bash · llama.cpp · vLLM · Qdrant · MCP · Claude Code
Английский: C1
Контакт: @ptruha