Сбер
TechLead DevOps/SRE
О роли
Создаем поисковый сервис для ответов на запросы пользователей на естественном языке. Предоставляем GigaChat и другим LLM доступ к актуальной информации из интернета, чтобы пользователи получали точные и свежие ответы на разные вопросы. Ищем технического лидера инфраструктурной команды (лид + 2 инженера), который отвечает за надежность, производительность и наблюдаемость всей инфраструктуры поискового сервиса. Основной фокус – на технической экспертизе, архитектурных решениях по SRE/Kubernetes и хендс-он разработке внутренних инструментов автоматизации. Весь парк виртуальных машин настраивается через Ansible. Помимо Kubernetes+Helm и GitLab CI, мы эксплуатируеем значительный объем инфраструктуры под данные: кластеры OpenSearch, PostgreSQL и Redis Sentinel. Наблюдаемость построена на VictoriaMetrics и Grafana, ELK, OpenTelemetry/Jaeger, базовый инфраструктурный мониторинг – на Zabbix. Всё это работает в облаке cloud.ru.
Чем ты будешь заниматься
отвечать за надежность, производительность и наблюдаемость инфраструктуры поискового сервиса: определять и отслеживать SLO/SLI, error budgets, проводить capacity planning
проектировать и развивать инфраструктуру в Kubernetes: Helm-чарты, стратегии деплоя, автоскейлинг, устойчивость к сбоям
развивать и поддерживать инфраструктуру как код и базу Ansible playbooks для развертывания сервисов облаке
строить и поддерживать CI/CD пайплайны в GitLab CI: автоматизация сборки, тестирования и деплоя сервисов
развивать observability-стек: метрики (VictoriaMetrics, Grafana), логи (ELK), распределенную трассировку (OpenTelemetry/OTLP, Jaeger)
писать код для внутренних инструментов и автоматизации: self-service тулинг для команды разработки, операторы и утилиты для Kubernetes
быть технической точкой эскалации по продакшен-инцидентам, участвовать в дежурствах (on-call), проводить разбор инцидентов (post-mortem)
определять техническую стратегию инфраструктуры и участвовать в архитектурных решениях вместе с командой разработки поиска
проводить код-ревью, менторить инженеров команды, растить их экспертизу в SRE/DevOps-практиках.
Мы ожидаем, что ты имеешь
5+ лет опыта в DevOps/SRE/infrastructure engineering, включая опыт технического лидерства в небольшой команде
опыт эксплуатации инфраструктуры под поисковые или data-intensive сервисы (OpenSearch, Kafka, распределенные БД).
глубокая экспертиза в Kubernetes: проектирование и эксплуатация кластеров, Helm, сетевые политики, troubleshooting в production
продвинутый опыт с Ansible: структурирование playbooks и ролей, идемпотентность, управление инвентарем под множественные окружения
опыт построения и поддержки CI/CD, желательно на GitLab CI
опыт построения observability: VictoriaMetrics + Grafana для метрик, ELK для логов, OpenTelemetry/Jaeger для distributed tracing
практическое владение SRE-подходами: SLO/SLI, error budgets, capacity planning, incident management, культура post-mortem
умение писать production-код на Python для автоматизации и внутренних инструментов
опыт работы с облачными платформами (cloud.ru или аналоги – Yandex Cloud, SberCloud, AWS)
уверенное понимание сетевых основ, Linux, принципов безопасности инфраструктуры
опыт менторства инженеров и технического лидерства.
Работа в Сбере — это
стабильный оклад и премии по результатам работы, ежегодный пересмотр зарплаты
комфортный современный офис рядом с м.Кутузовская
гибридный формат работы: встречаемся очно в офисе 1 раз в неделю
корпоративный спортзал и зоны отдыха
уникальная система обучения Сбера для профессионального и карьерного развития
программа адаптации и помощь руководителя на старте
расширенный ДМС и льготное страхование семьи
гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
бесплатная подписка СберПрайм, скидки на продукты компаний-партнеров
вознаграждение за рекомендацию друзей в команду Сбера
корпоративная пенсионная программа
