Tech Lead Data engineer
до 500 000₽ до вычета налогов
06 октября 2026 • г Москва • ПАО Сбербанк • Информационные технологии:Программист, разработчик
Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных.
Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.
Обязанности
- разработка и оптимизация витрин данных: Проектирование и реализация эффективных ETL и ELT процессов для витрин данных с использованием Apache Spark и Greenplum. Обеспечение высокой производительности и отказоустойчивости пайплайнов.
- потоковая обработка данных (RT и NRT): Разработка и поддержка стриминговых пайплайнов. Построение NRT пайплайнов обработки данных из Kafka в Apache Iceberg (Kafka2Iceberg) и RT пайплайнов между Kafka (Kafka2Kafka) с использованием Apache Flink и Spark Structured Streaming.
Архитектура данных:
- активное участие в разработке архитектуры решения потоковой обработки данных Data Streamhouse для обеспечения
- разработка предложений по развитию Data Lakehouse, внедрение best practices работы с Apache Iceberg (оптимизация партиционирования, compaction, time travel).
Инженерные практики:
- реализация механизмов инкрементальной загрузки данных для минимизации времени обработки и нагрузки на источники
- разработка и документирование API (на Java или Scala) для доступа к данным витрин и сервисам семантического слоя
Производительность и качество:
- глубокая оптимизация Spark-приложений, включая использование векторного движка Gluten/Velox для ускорения рабочих нагрузок
- разработка решений для проверки и контроля качества данных (Data Quality) с использованием Spark и Python.
DevOps и CI/CD:
Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в Jenkins, управление зависимостями задач в Oozie.
Коммуникация:
Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса.
Требования
- Уверенное владение языками: SQL, Java (или Scala), Python (как вспомогательный для ad-hoc анализа и DQ).
- Глубокое понимание экосистемы Apache Hadoop (HDFS, YARN) и опыт работы с ней в продакшене.
- Опыт разработки пайплайнов на Apache Spark (Core, SQL, Structured Streaming) уровня не ниже middle.
- Опыт работы с потоковыми данными: Apache Kafka (как источник/приемник) и хотя бы одним фреймворком стриминговой обработки (Apache Flink или Spark Streaming).
- Понимание форматов хранения данных (Parquet, ORC, Avro) и современных подходов к управлению Data Lakehouse (обязательно знание Apache Iceberg).
- Опыт оптимизации производительности Apache Spark (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle).
Будет большим плюсом:
- Опыт внедрения промышленных пайплайнов пакетной передачи данных.
- Опыт внедрения промышленных пайплайнов потоковой передачи данных.
- Опыт внедрения Gluten/Velox или аналогичных векторизованных движков.
- Навыки сборки и развертывания Doker-образов приложений.
Условия
- офисный формат работы (м Кутузовская ул. Поклонная 3)
- годовая премия
- корпоративный спортзал и зоны отдыха
- более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
- регулярные митапы и развитое DS-community
- расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
- подписка Прайм с возможностью совместного использования на трёх близких
- вознаграждение за рекомендацию друзей в команду Сбер.