Сбер

Сбер

Руководитель направления ML Pretrain Multimodal LLM

Lead–Head
Гибрид
Москва
backend

О роли

Мы развиваем GigaChat и ищем сильного руководителя направления ML pretrain больших языковых моделей. Недавно мы обучили MoE-модель на 700 миллиардов параметров и не собираемся останавливаться — обучение идёт на кластерах H100 и B200, а pretrain является ядром самого быстрорастущего AI-проекта Сбера. Это роль для человека, который возьмёт на себя архитектурную часть pretrain: design моделей, законы масштабирования, выбор и адаптация attention / MoE / позиционных схем, а также все архитектурные решения, которые определяют, какой именно будет следующая флагманская модель GigaChat.

Чем ты будешь заниматься

  • развивать архитектуру моделей GigaChat

  • определять, как должна развиваться архитектура pretrain-моделей: какие направления наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели

  • проектировать архитектуру флагманских моделей и отвечать за ключевые архитектурные решения: attention, позиционные схемы (RoPE и варианты), нормализации, активации, инициализация

  • развивать MoE-архитектуру: маршрутизация, балансировка экспертов, устойчивость маршрутизатора, влияние на качество и производительность

  • работать с long-context и мультимодальностью на уровне архитектуры: что именно нужно менять в модели, чтобы эти возможности работали стабильно

  • изучать и применять законы масштабирования

  • проводить scaling-эксперименты и на их основе принимать решения по размеру модели, ширине / глубине, числу и размеру экспертов, размерам батча и длительности обучения

  • предсказывать, как архитектурные изменения поведут себя при переходе с небольших абляций на полный масштаб

  • определять и развивать метрики, которые корректно отражают архитектурные изменения в обучении моделей

  • определять, в каких случаях архитектурные изменения действительно дают прирост качества по сравнению с более простыми baseline'ами, а в каких — нет

  • анализировать стабильность архитектурных решений

  • разбираться с нестабильностью на больших прогонах со стороны архитектуры: почему конкретная конфигурация расходится, где проявляются артефакты маршрутизации, коллапс энтропии, неустойчивости в attention

  • предлагать изменения в нормализациях, клиппинге, точности вычислений и структуре блоков, которые делают обучение более предсказуемым

  • обеспечивать безопасное масштабирование при внедрении крупных архитектурных изменений в основной трейн

  • писать ключевой код и оставаться сильным исследователем

  • самостоятельно писать и дорабатывать архитектурные компоненты и абляции.

  • Делать надёжные и воспроизводимые эксперименты: понятные версии данных, конфиги, сравнение запусков, контроль деградаций

  • читать статьи, воспроизводить ключевые результаты и адаптировать лучшие идеи под наши задачи и инфраструктуру

  • руководить сильной технической командой

  • руководить командой исследователей и инженеров, работающих над архитектурой, задавать высокую планку по качеству решений, скорости работы и глубине проработки

  • Паомогать команде превращать архитектурные идеи в работающие решения, которые можно встроить в основной цикл обучения

  • удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.

Мы ожидаем, что ты имеешь

  • отличное владение Python и PyTorch

  • глубокое понимание устройства обучения нейросетей: не на уровне обзоров, а на уровне, где вы можете объяснить, почему конкретная архитектурная конфигурация расходится, глядя на кривые функции потерь, нормы градиентов и энтропии

  • глубокое понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), RoPE и варианты позиционных эмбеддингов, нормализации, инициализации, long-context, MoE

  • практический опыт с обучением больших моделей (а не только инференсом) и проведением архитектурных абляций

  • способность самостоятельно взять направление и довести его до результата: от чтения статей и постановки гипотез до внедрения в основной трейн

  • умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов

  • опыт руководства сильной технической командой и готовность лично писать важные части системы руками.

Работа в Сбере — это

  • возможность выбрать удобный формат работы: гибрид или офис

  • ежегодный пересмотр зарплаты, годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • ипотека выгоднее до 7% для каждого сотрудника

  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера.

Запрос рекомендации

Загрузите резюме под эту вакансию, заполните контакты и отправьте запрос сотруднику компании.

Компания

Сбер

Формат

Гибрид

Локация

Москва

Грейд

Lead–Head

Направление

backend

Открыть источник вакансии