Deep Learning/CUDA Engineer (GigaChat)

ПАО «Сбербанк»

СтранаРоссия
ОтрасльИТ, интернет, телеком
СпециализацияИнфраструктура и DevOps
ЗанятостьПолный день
Формат работыОфис
Опубликовано 25 августа 2026 г.

Мы - команда инференса GigaChat. Всё, что модель отвечает пользователю, проходит через наш движок - и наша работа в том, чтобы это происходило быстро, дёшево и не падало никогда.У нас нет опции «подождём, пока это появится в vLLM». GigaChat - это свои архитектуры и свои мультимодальные модели, и когда исследователи приносят новую архитектуру, именно мы делаем так, чтобы она летала на проде: пишем ядра, придумываем, как разложить её по GPU, выжимаем токены в секунду там, где, казалось бы, выжимать уже нечего.Это работа, где результат меряется в миллисекундах и мегаваттах: каждый процент ускорения - это тысячи GPU-часов и реальные деньги. И где между «прочитал свежую статью» и «это крутится на проде под нагрузкой» проходят недели, а не годы. Место работы: г Москва Требуемый опыт: От 3 до 6 лет Обязанности: Чем предстоит заниматься: * Заставлять новые архитектуры GigaChat (включая мультимодальные) работать на проде быстро * Ускорять всё, что можно ускорить: кастомные CUDA-ядра, квантизация, speculative decoding, оптимизации KV-cache, continuous batching — и то, чему ещё нет устоявшегося названия * Придумывать, как разложить большую модель по GPU и по кластеру так, чтобы ни один FLOPS не простаивал: тензорный/пайплайн-параллелизм, disaggregated prefill/decode, шедулинг запросов * Профилировать честно и глубоко: находить, куда на самом деле уходят миллисекунды — в ядре, в раскладке памяти, в сети или в планировщике — и убирать это * Держать прод: движок, через который проходят все запросы к GigaChat, должен успешно переживать абсолютно всё * Читать свежие статьи и код лучших движков (vLLM, SGLang, TensorRT-LLM) не как пользователь, а как конкурент: понимать, что у них хорошо, и делать у себя лучше — с поправкой на наши архитектуры Требования: * опыт работы в области глубокого обучения, в том числе с LLM * глубокое знание CUDA и Python * опыт использования GigaChat, Kandinsky и аналогов в продуктах * навыки создания и использования AI-агентов. Условия: * комфортный современный офис рядом с м. Кутузовская * возможность выбрать удобный график – офис/гибрид/удаленка (в РФ) * годовая премия * корпоративный спортзал и зоны отдыха * более 400 образовательных программ СберУниверситета для профессионального и карьерного развития * расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа * ипотека для сотрудников по дисконтной прогамме * бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров * вознаграждение за рекомендацию друзей в команду Сбера.

Зарплата

Не указано