VICTORY IT
Ищем Senior DevOps / MLOps в команду больших языковых моделей и машинного обучения в VICTORY IT. Будем строить платформу распределённых вычислений, которая объединит CPU/GPU и другие вычислительные ресурсы в единую инфраструктуру для ML-задач. Над чем предстоит работать: • проектировать и с нуля строить распределённую вычислительную платформу на ~1000 машин; • развивать инфраструктуру на Kubernetes / Nomad для запуска и управления ML workload'ами; • работать с GPU-кластерами и вычислительными ресурсами разных типов — GPU, CPU, MPS; • развивать распределённые вычисления на Ray и инфраструктуру для distributed training; • автоматизировать размещение и запуск задач, управление ресурсами и их загрузкой; • заниматься масштабированием, производительностью, отказоустойчивостью, CI/CD и мониторингом; • тесно работать с ML-командой над инфраструктурой для обучения и запуска нейросетей. Что ожидаем от кандидата: • 3–5+ лет опыта в DevOps / MLOps / Platform Engineering; • уверенный Kubernetes и/или Nomad; • опыт работы с большими production-кластерами и распределёнными системами; • практический опыт с GPU-инфраструктурой; • понимание обучения нейросетей и distributed training; • опыт с Docker / Docker Registry, CI/CD, Linux, мониторингом; • опыт проектирования и создания инфраструктуры с нуля. • будет большим плюсом опыт с HPC, суперкомпьютерами, GPU-фермами, Ray и крупными вычислительными кластерами. PS: это не классический DevOps про поддержку готовой инфраструктуры. Здесь предстоит строить распределённую платформу практически с нуля и работать с GPU/ ML на большом масштабе.
⚠️ Будьте внимательны: вакансия размещена из открытых источников и может быть недостоверна.
Зарплата
5 000 – 10 000 $