ПАО «Сбербанк»
Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании. Мы предлагаем: · Интересные задачи по построению Data Lakehouse на базе Apache Spark и Apache Iceberg. · Работу с большими объемами данных и современным стеком технологий. · Возможность влиять на архитектурные решения. Ключевые технологии в вакансии: SQL, Java, Scala, Python, Apache Spark, Apache Iceberg, Apache Hadoop, Greenplum, Gluten, Velox, Oozie, Jenkins, Doker. Место работы: г Москва Требуемый опыт: Более 6 лет Обязанности: Разработка и оптимизация витрин данных: * проектирование и реализация эффективных ETL и ELT процессов для витрин данных с использованием Apache Spark и Greenplum. Обеспечение высокой производительности и отказоустойчивости пайплайнов. Архитектура данных: * поддержание и развитие текущих пайплайнов обработки данных на Hadoop с использованием Apache Spark. * разработка предложений по развитию Data Lakehouse, внедрение best practices работы с Apache Iceberg (оптимизация партиционирования, compaction, time travel). Инженерные практики: * реализация механизмов инкрементальной загрузки данных для минимизации времени обработки и нагрузки на источники. * разработка и документирование API (на Java или Scala) для доступа к данным витрин и сервисам семантического слоя. Производительность и качество: * глубокая оптимизация Spark-приложений, включая использование векторного движка Gluten/Velox для ускорения рабочих нагрузок. * разработка решений для сверки и контроля качества данных (Data Quality) с использованием Spark и Python. * DevOps и CI/CD: Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в Jenkins, управление зависимостями задач в Oozie или современных оркестраторах. Коммуникация: Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса Требования: * уверенное владение языками: SQL, Java (или Scala), Python (как вспомогательный для ad-hoc анализа и DQ). * глубокое понимание экосистемы Apache Hadoop (HDFS, YARN) и опыт работы с ней в продакшене. * опыт разработки пайплайнов на Apache Spark (Core, SQL, Structured Streaming) уровня не ниже middle. * понимание форматов хранения данных (Parquet, ORC, Avro) и современных подходов к управлению Data Lakehouse (обязательно знание Apache Iceberg). * опыт оптимизации производительности Apache Spark (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle). Будет большим плюсом: * опыт внедрения промышленных пайплайнов пакетной передачи данных. * опыт внедрения Gluten/Velox или аналогичных векторизованных движков. * навыки сборки и развертывания Doker\-образов приложений. Условия: * офисный формат работы (м Кутузовская) * корпоративный спортзал и зоны отдыха * более 400 образовательных программ СберУниверситета для профессионального и карьерного развития * регулярные митапы и развитое DS-community * расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа * гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ * подписка Прайм с возможностью совместного использования на трёх близких * вознаграждение за рекомендацию друзей в команду Сбер.
Зарплата
540 000 ₽