Сбер

Сбер

ML Research Engineer – Image & Video Generation (Модельные риски генеративных моделей)

Middle–Senior
Гибрид
Москва
Data Science и ML

О роли

============= Мы занимаемся независимой оценкой качества и модельных рисков Kandinsky – семейства генеративных моделей для создания и редактирования изображений, видео и аудиовизуального контента, а также моделей мира (world models). Наша задача – находить слабые места моделей, проверять выбранные подходы к оценке и готовить рекомендации, которые помогают принимать решения о релизе и возможных сценариях применения моделей. Мы работаем с новыми версиями Kandinsky до их выхода к пользователям. Разрабатываем собственные методологии, бенчмарки и инструменты полного цикла, объединяя автоматические метрики, human evaluation и подходы LLM/VLM-as-a-judge. ========== Мы ищем специалиста на стыке исследований и инженерной разработки. В этой работе не всегда существует готовая методология или универсальная метрика. Нужно определить, из чего складывается качество модели, спроектировать проверяемый эксперимент и реализовать воспроизводимый evaluation-пайплайн. Роль охватывает весь цикл оценки: от формулирования критериев и подготовки тестовых данных до анализа результатов и рекомендаций для команды разработки. Важно не только измерить качество модели, но и понять, насколько она подходит для реальных пользовательских и бизнес-сценариев, какие ограничения критичны и что осталось непроверенным.

  • **О команде**

  • **О роли**

Чем ты будешь заниматься

  • **Проектировать оценку с нуля**

  • декомпозировать качество на измеримые критерии и собирать под них тестовые сценарии, промпты и выборки

  • проектировать оценку там, где готовой методологии ещё нет.

  • **Разрабатывать evaluation-пайплайны**

  • реализовывать на Python инструменты для запуска моделей, сбора результатов и расчёта метрик

  • обеспечивать воспроизводимость экспериментов и развивать внутреннюю библиотеку оценки

  • готовить инструкции для асессоров и контролировать качество разметки.

  • **Строить VLM-as-a-judge**

  • разрабатывать судей под конкретные критерии, учитывать их bias и ограничения

  • понимать, где автоматическая оценка работает, а где без человека нельзя.

  • **Разбираться в ошибках моделей**

  • понимать ограничения diffusion-моделей и причины типовых артефактов

  • отличать реальную проблему модели от ошибки методологии или замера.

  • **Формировать заключение по модельному риску**

  • анализировать качество по отдельным сценариям, типам промптов и срезам, а не только по среднему значению

  • формулировать условия релиза, ограничения и явно фиксировать то, что осталось непроверенным.

Мы ожидаем, что ты имеешь

================

  • **Хорошее понимание устройства генеративных моделей**:

  • понимание принципов работы Transformers, diffusion- и мультимодальных моделей и основных задач: T2I, Image Editing, T2V, Audio, Video-Audio.;

  • понимание типовых ограничений, ошибок и артефактов моделей; способность разбираться в причинах ошибок и способах их проверки.

  • **Способность проектировать оценку качества моделей**:

  • декомпозировать качество на измеримые критерии и проектировать тестовые сценарии, промпты и выборки.

  • выбирать корректный подход к оценке: human evaluation, автоматические метрики, LLM/VLM-as-a-judge, а также подходящие модели для сравнения;

  • проверять валидность метрик и уметь проектировать оценку для новых задач и модальностей, где ещё нет готовой методологии.

  • **Навыки работы с LLM и VLM:**

  • prompt engineering, structured output, tool calling и работа с контекстом и ограничениями моделей;

  • построение и валидация LLM/VLM-as-a-judge, включая проверку автоматической оценки относительно человеческой;

  • понимание нестабильности, bias и галлюцинаций моделей; умение подбирать модель под конкретную исследовательскую задачу.

  • **Понимание AI-агентов и агентных систем**:

  • понимать, чем агент отличается от обычного вызова LLM;

  • знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация;

  • понимать, когда агентный подход действительно полезен, а когда создаёт лишнюю сложность;

  • уметь оценивать надёжность и ограничения агентных решений.

  • **Умение проводить технический и научный ресерч**:

  • находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации;

  • сравнивать решения с актуальными подходами и оценивать достоверность результатов;

  • переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов.

  • **Будет плюсом**

  • **Умение работать с агентами и субагентами**:

  • декомпозировать задачи между агентами, задавая им чёткие роли и зоны ответственности;

  • управлять контекстом и изоляцией субагентов, организовывать проверку результатов;

  • собирать результаты нескольких агентов в единое решение и критически оценивать их выводы.

  • **Навыки вайбкодинга и AI-assisted coding**:

  • уверенно работать с Codex, Claude Code и другими coding-агентами

  • проверять и дорабатывать сгенерированный код, использовать агентов для тестирования;

  • понимать архитектуру создаваемого решения

  • **Продуктовое мышление**:

  • связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта;

  • приоритизировать направления проверки и переводить результаты оценки в рекомендации для разработки;

  • понимать влияние результатов на релиз и дальнейшее развитие модели.

  • **Дополнительный релевантный опыт**:

  • оценка Image, Video, Audio и мультимодальных моделей; разработка собственных бенчмарков и методологий;

  • работа с асессорами, большими массивами пользовательских запросов и построение аналитических пайплайнов/отчётов;

  • понимание GPU-инфраструктуры и инференса; практический опыт построения multi-agent систем.

Работа в Сбере — это

  • комфортный современный офис рядом с м. Кутузовская

  • возможность выбрать удобный график - офис / гибрид

  • ежегодный пересмотр зарплаты и годовая премия

  • корпоративный спортзал и зоны отдыха

  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ

  • подписка Прайм с возможностью совместного использования на трёх близких

  • скидки на продукты компаний-партнеров

  • вознаграждение за рекомендацию друзей в команду Сбера

Запрос рекомендации

Загрузите резюме под эту вакансию, заполните контакты и отправьте запрос сотруднику компании.

Компания

Сбер

Формат

Гибрид

Локация

Москва

Грейд

Middle–Senior

Направление

Data Science и ML

Открыть источник вакансии