Lead team Lead

Lead· @cyprusithr (Telegram MTProto) · 2 дня назад
AI-саммари
Platform / Infrastructure Engineer, отвечающий за production-инфраструктуру enterprise-платформы: 12 Kubernetes-кластеров, 45 нод, около 10K RPS и uptime 99,85%. Самостоятельно строит on-prem и bare-metal окружения, GitOps CI/CD, disaster recovery, мониторинг и LLM-платформы для анализа инфраструктуры; ищет удалённую работу с возможностью релокации.
Роль
Team Lead
Грейд
Lead
ЗП от
не указана
Контакт
прямой
Площадка
@cyprusithr (Telegram MTProto) ↗
Обновлено там
13.08.2026
В базе с
15.08.2026
Оригинал с площадки RAW
Как пришло с «@cyprusithr (Telegram MTProto)» · скачано 15.08.2026 — без AI-обработки.
#CV #резюме #devops #sre #baremetal #llm
#CV #резюме #devops #sre #baremetal #llm Позиция: Platform / Infrastructure Engineer Формат: удалённо (нахожусь в Грузии, готов к релокации) Занятость: полная Ожидания: обсуждаемо Обо мне: Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call. Ключевое: - Построил внутреннюю LLM-платформу аналитики инфраструктуры с нуля: пайплайн нормализации событий K8s и метрик Prometheus в Qdrant, RAG-слой (Nomic Embed Text v2 + reranker, тюнинг chunk sizing), LLM-based sanity checks на каждом этапе (DeepSeek primary, Gemini fallback). Бенчил llama.cpp, vLLM, Transformers, остановился на Qwen 3.5 на llama.cpp. Автоматические аномалии, графики, новые варнинги за неделю. Перевёл мониторинг с реактивного (только critical) на проактивный: поймали деградирующий диск в проде до отказа. Используется ежедневно. - Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard. - Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели. - Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль - Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ". - Нашёл и онбордил полевого инженера для деплоя на кампусе из 55 корпусов, менторил по сетевой инфраструктуре. - Отвечаю за бэкапы и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах. - После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры. Стек: Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · vLLM · Ray · Qdrant Английский: C1 Контакт: @ptruha
свежие базы — в канале Подписаться на канал