ML Research Engineer / Evaluation Scientist – Image & Video Generation (Модельные риски генеративных моделей)

ПАО «Сбербанк»

СтранаРоссия
ОтрасльИТ, интернет, телеком
СпециализацияМашинное обучение и ИИ
ЗанятостьПолный день
Формат работыОфис
Опубликовано 16 сентября 2026 г.

О команде ============= Мы занимаемся независимой оценкой качества и модельных рисков Kandinsky – семейства генеративных моделей для создания и редактирования изображений, видео и аудиовизуального контента, а также моделей мира (world models). Наша задача – находить слабые места моделей, проверять выбранные подходы к оценке и готовить рекомендации, которые помогают принимать решения о релизе и возможных сценариях применения моделей. Мы работаем с новыми версиями Kandinsky до их выхода к пользователям. Разрабатываем собственные методологии, бенчмарки и инструменты полного цикла, объединяя автоматические метрики, human evaluation и подходы LLM/VLM-as-a-judge. О роли ========== Мы ищем специалиста на стыке исследований и инженерной разработки. В этой работе не всегда существует готовая методология или универсальная метрика. Нужно определить, из чего складывается качество модели, спроектировать проверяемый эксперимент и реализовать воспроизводимый evaluation-пайплайн. Роль охватывает весь цикл оценки: от формулирования критериев и подготовки тестовых данных до анализа результатов и рекомендаций для команды разработки. Важно не только измерить качество модели, но и понять, насколько она подходит для реальных пользовательских и бизнес-сценариев, какие ограничения критичны и что осталось непроверенным. Место работы: г Москва Требуемый опыт: От 3 до 6 лет Обязанности: Проектировать оценку с нуля * декомпозировать качество на измеримые критерии и собирать под них тестовые сценарии, промпты и выборки * проектировать оценку там, где готовой методологии ещё нет. Разрабатывать evaluation-пайплайны * реализовывать на Python инструменты для запуска моделей, сбора результатов и расчёта метрик * обеспечивать воспроизводимость экспериментов и развивать внутреннюю библиотеку оценки * готовить инструкции для асессоров и контролировать качество разметки. Строить VLM-as-a-judge * разрабатывать судей под конкретные критерии, учитывать их bias и ограничения * понимать, где автоматическая оценка работает, а где без человека нельзя. Разбираться в ошибках моделей * понимать ограничения diffusion-моделей и причины типовых артефактов * отличать реальную проблему модели от ошибки методологии или замера. Формировать заключение по модельному риску * анализировать качество по отдельным сценариям, типам промптов и срезам, а не только по среднему значению * формулировать условия релиза, ограничения и явно фиксировать то, что осталось непроверенным. Требования: Хорошее понимание устройства генеративных моделей: * понимание принципов работы Transformers, diffusion- и мультимодальных моделей и основных задач: T2I, Image Editing, T2V, Audio, Video-Audio.; * понимание типовых ограничений, ошибок и артефактов моделей; способность разбираться в причинах ошибок и способах их проверки. Способность проектировать оценку качества моделей: * декомпозировать качество на измеримые критерии и проектировать тестовые сценарии, промпты и выборки. * выбирать корректный подход к оценке: human evaluation, автоматические метрики, LLM/VLM-as-a-judge, а также подходящие модели для сравнения; * проверять валидность метрик и уметь проектировать оценку для новых задач и модальностей, где ещё нет готовой методологии. Навыки работы с LLM и VLM: * prompt engineering, structured output, tool calling и работа с контекстом и ограничениями моделей; * построение и валидация LLM/VLM-as-a-judge, включая проверку автоматической оценки относительно человеческой; * понимание нестабильности, bias и галлюцинаций моделей; умение подбирать модель под конкретную исследовательскую задачу. Понимание AI-агентов и агентных систем: * понимать, чем агент отличается от обычного вызова LLM; * знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация; * понимать, когда агентный подход действительно полезен, а когда создаёт лишнюю сложность; * уметь оценивать надёжность и ограничения агентных решений. Умение проводить технический и научный ресерч: * находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации; * сравнивать решения с актуальными подходами и оценивать достоверность результатов; * переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов. Будет плюсом ================ Умение работать с агентами и субагентами: * декомпозировать задачи между агентами, задавая им чёткие роли и зоны ответственности; * управлять контекстом и изоляцией субагентов, организовывать проверку результатов; * собирать результаты нескольких агентов в единое решение и критически оценивать их выводы. Навыки вайбкодинга и AI-assisted coding: * уверенно работать с Codex, Claude Code и другими coding-агентами * проверять и дорабатывать сгенерированный код, использовать агентов для тестирования; * понимать архитектуру создаваемого решения Продуктовое мышление: * связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта; * приоритизировать направления проверки и переводить результаты оценки в рекомендации для разработки; * понимать влияние результатов на релиз и дальнейшее развитие модели. Дополнительный релевантный опыт: * оценка Image, Video, Audio и мультимодальных моделей; разработка собственных бенчмарков и методологий; * работа с асессорами, большими массивами пользовательских запросов и построение аналитических пайплайнов/отчётов; * понимание GPU-инфраструктуры и инференса; практический опыт построения multi-agent систем. Условия: * комфортный современный офис рядом с м. Кутузовская * возможность выбрать удобный график - офис / гибрид * ежегодный пересмотр зарплаты и годовая премия * корпоративный спортзал и зоны отдыха * более 400 образовательных программ СберУниверситета для профессионального и карьерного развития * расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа * гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ * подписка Прайм с возможностью совместного использования на трёх близких * скидки на продукты компаний-партнеров * вознаграждение за рекомендацию друзей в команду Сбера

Зарплата

Не указано