Сбер

Сбер

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

Senior
Гибрид
Москва
backend

О роли

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели. Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.

Чем ты будешь заниматься

  • разрабатывать и улучшать методы online RL

  • реализовывать и дорабатывать подходы post-training и online RL

  • проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин

  • разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач

  • следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру

  • строить и развивать инфраструктуру обучения

  • разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели

  • обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций

  • оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест

  • выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять

  • работать с данными и системой оценки качества

  • участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки

  • строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек

  • анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения

  • тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры

  • брать на себя ответственность за целые куски системы: от идеи до результата в проде

  • делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.

Мы ожидаем, что ты имеешь

  • отличное владение Python и PyTorch

  • практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях

  • опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы

  • понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.

  • Умение писать чистый, надёжный, production-ready код

  • способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.

  • **Будет плюсом:**

  • опыт работы с reward-моделями, process reward models, LLM-as-a-judge

  • опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач

  • опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.)

  • понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.)

  • публикации, open-source вклад или сильный прикладной track record.

Работа в Сбере — это

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Запрос рекомендации

Загрузите резюме под эту вакансию, заполните контакты и отправьте запрос сотруднику компании.

Компания

Сбер

Формат

Гибрид

Локация

Москва

Грейд

Senior

Направление

backend

Открыть источник вакансии