Aston
Задачи – развёртывать, настраивать и сопровождать Langfuse в защищённых контурах Банка, включая настройку зависимых компонентов: PostgreSQL, ClickHouse, Redis и объектного хранилища; – организовывать интеграцию с Apache Kafka: создавать и сопровождать топики, настраивать ACL, consumer groups, retention, репликацию, DLQ/retry-механизмы, мониторить Kafka lag; – поддерживать потоки телеметрии моделей: результаты работы классических ML-моделей, LLM traces, события RAG-пайплайнов, метрики качества, технические логи и алерты; – развёртывать и эксплуатировать сервисы в Kubernetes/OpenShift: namespaces, RBAC, Secrets, ConfigMaps, Ingress, resource limits/requests, autoscaling и сетевые политики разрабатывать и сопровождать Helm-чарты, Kubernetes-манифесты и шаблоны конфигурации для dev/test/preprod/prod-контуров; – строить и поддерживать CI/CD- и GitOps-конвейеры: сборка, тестирование, сканирование, публикация артефактов, деплой и rollback; – автоматизировать инфраструктуру и конфигурации с использованием Ansible, Terraform или аналогичных средств; – настраивать мониторинг, централизованное логирование и алертинг: Prometheus, Grafana, Alertmanager, ELK/Opensearch или аналоги; – сопровождать и проводить первичную оптимизацию PostgreSQL, ClickHouse, Redis, Kafka, Nginx/Ingress и смежных инфраструктурных компонентов; – обеспечивать отказоустойчивость, резервное копирование, восстановление и планирование ресурсов платформы; – участвовать в разборе инцидентов, готовить RCA, runbook’и и мероприятия по предотвращению повторных сбоев; – обеспечивать требования ИБ: управление доступами, секретами, сертификатами, сетевой сегментацией, аудитом и устранением уязвимостей; – вести эксплуатационную и техническую документацию по сервисам, интеграциям и процедурам сопровождения. Требования – опыт работы DevOps/SRE-инженером от 5-ти лет; практический опыт эксплуатации Kubernetes или OpenShift в production-среде: Helm, RBAC, networking, autoscaling, диагностика и настройка ресурсов; – уверенное знание Linux, Docker, Git, Bash и основ сетевого взаимодействия: TCP/IP, DNS, HTTP(S), TLS, reverse proxy; – практический опыт работы с Apache Kafka: топики, партиции, репликация, consumer groups, ACL, retention, мониторинг и устранение инцидентов; – опыт построения и сопровождения CI/CD-пайплайнов на Jenkins, GitLab CI, TeamCity, Argo CD или аналогичных инструментах; – знание и практическое применение Ansible, Terraform либо других IaC-инструментов; – опыт настройки мониторинга и observability: Prometheus, Grafana, Alertmanager, централизованное логирование, трассировка; – опыт эксплуатации PostgreSQL; понимание принципов работы ClickHouse и Redis; – умение автоматизировать рутинные операции с помощью Python и Bash; – понимание принципов высоконагруженных и распределенных систем; – знание подходов к безопасной эксплуатации: управление секретами, сертификатами, доступами, уязвимостями и журналированием действий; – навыки технической коммуникации: взаимодействие с командами разработки, архитекторами, ИБ, администраторами платформы и владельцами интеграций.
⚠️ Будьте внимательны: вакансия размещена из открытых источников и может быть недостоверна.
Зарплата
Не указано