АО «Альфа-Банк»
Задачи – Обеспечивать отказоустойчивость работы платформы искусственного интеллекта, формировать планы аварийных переключений, применять технологии для обеспечения отказоустойчивой работы – Анализировать метрики производительности, проводить анализ причин инцидентов и ошибок работы платформы искусственного интеллекта, разрабатывать меры по недопущению повторений сбоев – Автоматизировать рутинные действия, внедрять и применять лучшие практики подхода "инфраструктура как код" – Принимать участие в проектировании и организации вычислительных ресурсов для решения новых функциональных задач и внедрения в эксплуатациют технологий, в части касающейся системного программного обеспечения оркестрации микросервисов и аппаратно-технических средств используемых в средах с применением графических ускорителей платформ искусственного интеллекта – Осуществлять администрирование системного программного обеспечения платформ искусственного интеллекта, включая операционные системы, оркестратор микросервисов, модули управления и мониторинга и другие компоненты Требования – Опыт сопровождения Kubernetes от 3 лет – Опыт внедрения кластеров виртуализации, частных/публичных облаков с использованием GPU Nvidia для AI/ML, в т.ч. LLM – Опыт использования и развертывания Istio, haproxy, opensearch, vector, kafka, victoria metrics, vault, kyverno, calico, Kserve, multus, sriov, rdma, infiniband, patroni, postgresql, , multi-tenant k8s, nvidia gpu-operator, network operator, dcgm, grafana, argo workflow, argo cd – Опыт внедрения и сопровождения систем с использованием сети Infiniband на базе коммутаторов Mellanox – Понимание работы, тюнинг и настройка OpenSM (настройка фабрик Infiniband) Навыки использования Go\Python (создание скриптов, операторов K8S) – Знание и применение Ansible/Terraform – Понимание принципов работы NFS, S3 (опыт работы приветствуется)
Зарплата
Не указано