ПАО «Сбербанк»
Оптимизируем наши модели под форматы популярных инференсных фреймворков. Задача создание инфраструктуры для эффективного инференса наших моделях во всех популярных фреймворках: Diffusers, FastVideo, SGLang, vLLM, Comfy-UI. А также создание воркеров для доступа к инференсу наших моделей на fal.ai, Arena.ai и др. Место работы: г Москва Требуемый опыт: От 3 до 6 лет Обязанности: * Разработка и оптимизация high-load пайплайнов распределенного инференса (PyTorch) с использованием FSDP, Tensor/Sequence Parallelism. * Имплементация моделей в популярных фреймворках: Diffusers, SGLang, vLLM, FastVideo, Comfy-UI, Transformers * Развертывание воркеров для инференса моделей Требования: * Экспертный уровень Python, PyTorch, torch.distributed. * Опыт масштабного инференса моделей с FSDP/TP/PP. * Понимание работы разных типов данных (bf16, fp8). * Опыт работы с SGLang, vLLM, Transformers * Понимание принципов работы диффузионных моделей * Английский язык B2+ Условия: * комфортный современный офис рядом с м. Кутузовская * ежегодный пересмотр зарплаты, годовая премия * корпоративный спортзал и зоны отдыха * система обучения для профессионального и карьерного развития * расширенный полис ДМС с первого дня работы и страхование для семьи * льготная программа ипотеки для сотрудников * бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров * вознаграждение за рекомендацию друзей в команду Сбера.
Зарплата
Не указано