2ГИС
Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)
Описание
2ГИС — технологическая компания и часть экосистемы Сбера. Нашими сервисами ежедневно пользуются миллионы людей. Мы активно растём, а ИТ-ландшафт становится всё более масштабным и сложным. Поэтому создаём выделенную SRE-команду — центр экспертизы по надёжности сервисов. Она поможет перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой. Ищем инженера, который поможет выстроить процессы и инструменты обеспечения надёжности, будет влиять на стандарты компании и работать в тесной связке с продуктовыми и инфраструктурными командами.
Чем предстоит заниматься
Развивать Incident & Problem Management - внедрять и развивать единый процесс управления инцидентами; - формировать культуру postmortem-разборов без поиска виноватых; - контролировать выполнение action items, направленных на предотвращение повторных сбоев; - улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования. Развивать observability - стандартизировать внедрение OpenTelemetry: трассировок, метрик и логов; - участвовать в создании единой платформы мониторинга и визуализации; - разрабатывать стандарты логирования; - контролировать объём и качество данных, поступающих в системы телеметрии. Трансформировать подход к алертингу - проводить аудит существующих алертов и снижать число ложных срабатываний; - формировать единые принципы приоритизации алертов с учётом критичности сервисов; - помогать командам настраивать полезные, своевременные и понятные уведомления. Внедрять SRE-практики и повышать зрелость команд - участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP; - помогать командам определять и внедрять SLO/SLA; - создавать дашборды для контроля Error Budget; - разрабатывать и поддерживать runbooks, которые сокращают время восстановления сервисов; - консультировать продуктовые команды по вопросам стабильности и надёжности. Автоматизировать процессы - формировать требования к развитию платформы дежурств и интеллектуальной эскалации; - внедрять практики безопасных релизов: canary deployment, автоматический откат изменений и другие подходы к снижению рисков.
Мы ожидаем, что ты
- Работаешь в SRE или DevOps от 3 лет. - Хорошо понимаешь принципы SRE: SLO, SLA, Error Budget, Incident Management и Observability. - Имеешь практический опыт работы с системами мониторинга и алертинга — например, Prometheus и Grafana. - Работал с OpenTelemetry или аналогичными инструментами. - Автоматизируешь процессы на Python, Go, Bash или другом языке. - Понимаешь принципы работы on-call-ротаций и систем управления инцидентами. - Умеешь анализировать метрики производительности, находить первопричины сбоев и предлагать устойчивые решения. - Знаком с CI/CD, Kubernetes и контейнеризацией.
Будет плюсом, если ты
- Внедрял SRE-практики с нуля или участвовал в их масштабировании в растущей компании. - Проводил воркшопы, обучал или менторил продуктовые команды по вопросам надёжности.
Что предлагаем
- Возможность стать одним из первых участников нового стратегического направления и напрямую влиять на его развитие. - Масштабные технические задачи: ты будешь работать над стабильностью сервисов, которыми пользуются миллионы людей. - Реальное влияние на процессы: поможешь снизить уровень хаоса, сделать реагирование на инциденты и релизы более предсказуемыми. - Пространство для инженерных решений: команда формируется сейчас, поэтому можно участвовать в выборе подходов, стандартов и инструментов. - ИТ-акредитацию - Удаленную работу по РФ или гибрид в городах, где есть офис (Новосибирск, Москва, Санкт-Петербург).