Cloudru
– Анализировать загрузку GPU-кластера: находить причины простоя ресурсов, фрагментации нод, длительного ожидания задач и частых вытеснений нагрузки; – Собирать и формализовывать требования пользователей к аллокациям, очередям, приоритетам, гарантиям ресурсов и размещению задач; – Проектировать сценарии совместного использования ресурсов: закреплённые и эластичные аллокации, shared-нагрузка, заимствование свободной ёмкости и возврат ресурсов владельцу; – Исследовать и сравнивать подходы Kubernetes-, batch- и GPU-планировщиков, включая Volcano, Kueue, NVIDIA KAI Scheduler и Slurm; – Определять метрики эффективности планирования: утилизация, время ожидания, количество вытеснений, потерянные вычисления, доля заимствованных ресурсов и успешность запуска gang jobs; – Проверять предлагаемые алгоритмы на исторических данных, моделировать граничные сценарии и оценивать влияние изменений до запуска в production; – Готовить функциональные и нефункциональные требования, схемы процессов, RFC и постановки для команды разработки; – Сопровождать реализацию на всех этапах: от проработки решения и тестирования до поэтапного запуска и анализа результатов; – Работать с обратной связью пользователей, разбирать спорные сценарии распределения ресурсов и превращать их в прозрачные правила работы платформы. – Опыт работы системным или продуктовым аналитиком в инфраструктурных, облачных либо платформенных командах; – Обладаете системным мышлением и умеете формализовывать сложные процессы с большим количеством ограничений и участников; – Понимаете основные принципы работы Kubernetes: nodes, pods, requests и limits, affinity, taints, priorities, queues и preemption; – Понимаете принципы планирования ресурсов: квоты, приоритеты, fairness, gang scheduling, bin packing и resource borrowing; – Умеете отделять физическое размещение нагрузки от её логического владельца, гарантированной квоты и временно заимствованных ресурсов; – Имеете опыт анализа метрик, событий и логов распределённых систем; – Умеете работать с SQL и одним из инструментов анализа данных, например Python; – Знакомы с Prometheus, Grafana и PromQL либо аналогичными инструментами мониторинга; – Умеете готовить техническую документацию и переводить пользовательские проблемы в требования, метрики и проверяемые гипотезы; – Способны аргументированно защищать предложения и эффективно взаимодействовать с разработчиками, архитекторами, владельцами платформы и пользовательскими командами; – Владеете английским языком на уровне чтения технической документации.
Зарплата
Не указано