Lead team Lead
AI-саммари
Platform / Infrastructure Engineer, отвечающий за production-инфраструктуру enterprise-платформы: 12 Kubernetes-кластеров, 45 нод, около 10K RPS и uptime 99,85%. Самостоятельно строит on-prem и bare-metal окружения, GitOps CI/CD, disaster recovery, мониторинг и LLM-платформы для анализа инфраструктуры; ищет удалённую работу с возможностью релокации.
- Роль
- Team Lead
- Грейд
- Lead
- ЗП от
- не указана
- Контакт
- прямой
- Площадка
- @cyprusithr (Telegram MTProto) ↗
- Обновлено там
- 13.08.2026
- В базе с
- 15.08.2026
Оригинал с площадки RAW
Как пришло с «@cyprusithr (Telegram MTProto)» · скачано 15.08.2026 — без AI-обработки.
#CV #резюме #devops #sre #baremetal #llm
#CV #резюме #devops #sre #baremetal #llm
Позиция: Platform / Infrastructure Engineer
Формат: удалённо (нахожусь в Грузии, готов к релокации)
Занятость: полная
Ожидания: обсуждаемо
Обо мне:
Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call.
Ключевое:
- Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно.
- Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard.
- Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели.
- Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль
- Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ".
- Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре.
- Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах.
- После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры.
Стек:
Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant
Английский: C1
Контакт: @ptruha