Site Reliability Engineer(SRE)

ПАО «Сбербанк»

СтранаРоссия
ОтрасльИТ, интернет, телеком
СпециализацияРазработка ПО
ЗанятостьПолный день
Формат работыОфис
Опубликовано 7 октября 2026 г.

AI-платформа корпоративного уровня — аналог AI Hub. Реализован чат-интерфейс (аналог ChatGPT) и сценарии сбора аналитики по собственным базам знаний (RAG на базе Qdrant) и по открытым источникам в интернете. В качестве LLM используются современные модели, задействован LLM-шлюз с маршрутизацией запросов. Проект введён в промышленную эксплуатацию: работают реальные пользователи, нагрузка стабилизирована, требования к доступности согласованы. Технологический стек: ·       PostgreSQL — основное хранилище данных ·       Kubernetes — оркестрация ·       Kafka — обмен событиями ·       Redis — кэширование ·       S3 (совместимое объектное хранилище) — данные и бэкапы ·       Qdrant — векторная база знаний ·       Prometheus + Grafana — мониторинг ·       OpenSearch — логи Место работы: г Москва Требуемый опыт: От 3 до 6 лет Твои задачи: * обеспечение доступности и отказоустойчивости платформы в проде: определение и контроль SLO/SLI, дежурства, разбор инцидентов, проведение postmortem * разработка и сопровождение CI/CD-конвейеров, инфраструктуры как кода (IaC) * управление Kubernetes: кластеры и версии, admission-контроллеры, network policies, resource limits/requests, HPA, автоскейлинг * диагностика и оптимизация производительности (CPU / memory / I/O), профилирование нагрузки LLM-инференса * настройка и развитие наблюдаемости: метрики, логи, трассировки, алертинг, дашборды * управление секретами и доступом, выполнение требований безопасности * работа с Kafka, Redis, PostgreSQL и S3: настройка, тюнинг, резервное копирование и восстановление, DR-планы * участие в архитектурных решениях для новых сервисов платформы. Мы ожидаем, что у тебя есть: * 3+ года опыта в SRE / DevOps / платформенной инфраструктуре * глубокий опыт работы с Kubernetes в промышленной эксплуатации * PostgreSQL: планирование запросов, индексы, репликация, бэкапы и восстановление * Kafka, Redis, S3-совместимые объектные хранилища * CI/CD, Linux, Bash * мониторинг и логирование: Prometheus / Grafana, OpenSearch, алертинг * понимание принципов SLO / SLI / Error Budgets * опыт работы с облачной и on-premise инфраструктурой, сетевой уровень, TLS * опыт создания AI-агентов и использования их в работе будет преимуществом. Будет плюсом: * опыт эксплуатации ML/LLM-инференса (vLLM, Triton, KServe), понимание нагрузочных профилей GPU * опыт работы с векторными БД (Qdrant, Milvus, pgvector) * знание IaC (Terraform, Ansible) * опыт участия в RAG / AI-платформенных проектах * навыки написания postmortem и улучшения процессов эксплуатации. Работа в СберТехе - это: * гибридный формат работы * годовой бонус и ежегодный пересмотр зарплаты * статус аккредитованной ИТ-компании * расширенный ДМС с первого дня и льготное страхование для семьи * корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях * 90 дней удаленной работы из любого региона РФ * льготная ипотека в Сбере * бесплатная подписка СберПрайм, которой можно поделиться с 3 близкими.

Зарплата

Не указано