Всем привет! Мы ищем талантливого Data Engineer, который готов столкнуться с непростыми задачами в области хранения и обработки больших данных в масштабах петабайт! У вас будет уникальная возможность поучаствовать в развитии платформы данных для работы с телеметрией автономного транспорта Москвы - трамваев и метро, в том числе: в разработке архитектуры DWH, подключении новых сервисов, повышении производительности и стабильности работы платфонмы. Что предстоит делать: - Превращать телеметрию автономного транспорта в данные, удобные для анализа: разрабатывать и запускать Spark-пайплайны, продумывать преобразования и проверки качества - Подключать новые источники данных: разрабатывать интеграции с различными системами и обеспечивать надёжную загрузку данных в хранилище - Развивать архитектуру Data Lake / DWH - Вместе с командой формировать общие подходы к разработке, мониторингу и сопровождению пайплайнов Что ожидаем: - Практический опыт разработки и сопровождения пайплайнов данных - Опыт работы с PySpark, Python и SQL - Опыт работы с Data Lake / DWH и понимание принципов построения ETL/ELT-процессов - Понимание принципов распределённой обработки данных Будет плюсом: - Опыт работы с Trino+S3 - Опыт оркестрации пайплайнов с помощью Airflow - Знакомство с Data Vault 2.0 - Знание Scala и опыт её использования для обработки данных - Опыт развития платформы данных на ранних этапах: от выбора решений до их внедрения и сопровождения
⚠️ Будьте внимательны: вакансия размещена из открытых источников и может быть недостоверна.
Зарплата
Не указано