Сбер
Инженер сопровождения
О роли
Мы ищем SRE-инженера в команду сопровождения Платформы. Вы будете отвечать за стабильность, отказоустойчивость и бесперебойную работу высоконагруженных интеграционных систем. Вам предстоит обеспечивать приемку новых версий продуктов на эксплуатационные контуры, а также выступать в роли эксперта 2-й линии технической поддержки для решения сложных инцидентов.
Чем ты будешь заниматься
сопровождение и эксплуатация высоконагруженных систем с применением методологий Site Reliability Engineering (SRE)
участие в тестировании, приемке и внедрению в промышленную эксплуатацию релизов и доработок от команд разработки
обеспечение бесперебойности сервиса: проектирование метрик уровня обслуживания, управление мониторингом, алертингом, эскалацией и решением инцидентов согласно методологиям Банка
поддержание работоспособности сопровождаемых систем, участие в их восстановлении в случае сбоев, расследование корневых причин и разработка планов предотвращения повторения инцидентов
участие во внедрении и аудите отказоустойчивых решений, проверка реализации паттернов высокой доступности (Rate Limiting, ByPass и т.д.)
взаимодействие со смежными командами в рамках процессов тестирования, приемки, внедрений и устранения инцидентов.
Мы ожидаем, что ты имеешь
уверенное владение ОС Linux на уровне администратора
навыки автоматизации рутинных задач на скриптовых языках (Bash, Python)
опыт диагностики комплексных проблем в распределенных системах, поиска корневых причин
понимание современных сетевых технологий: TCP/IP (IPv4/IPv6), DNS, DHCP, TLS/mTLS, Ingress-контроллеры, service mesh
CI/CD: сопровождение пайплайнов доставки (GitLab CI, Jenkins, GitHub Actions) с точки зрения инфраструктуры
глубокое знание контейнеризации и оркестрации: Docker, Kubernetes (Helm, Operators)
опыт создания AI-агентов и использования их в работе будет преимуществом.
**Будет плюсом:**
опыт применения методик SRE: понимание концепций Service Level Indicators (SLIs), Objectives (SLOs) и Error Budget.
опыт эксплуатация АИ-Агентов: контроль потребления ресурсов, аудит логов принятия решений ИИ-моделей, мониторинг качества их работы (_Model Drift_)
опыт Infrastructure as Code (IaC): уверенная работа с Terraform и Ansible.
навыки настройки и организации мониторинга: Prometheus, Grafana, ELK Stack (Elasticsearch, Logstash, Kibana) или EFK
знание языка запросов SQL, понимание принципов работы реляционных СУБД (PostgreSQL/Postgres Pro) и NoSQL-хранилищ.
Работа в Сбере — это
гибридный формат работы, после испытательного срока 4 дня в офисе/1 день удаленно) на период испытательного срока - офис.
офис располагается по адресу : Москва, ул. 2-я Южнопортовая, 12Ак1с1
годовой бонус и ежегодный пересмотр зарплаты
расширенный ДМС с первого дня и льготное страхование для семьи
корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях
90 дней удаленной работы из любого региона РФ
льготная ипотека в Сбере
подписка Прайм с возможностью совместного использования на трёх близких.
