Мы — аутсорсинговая IT-компания, специализирующаяся на Data Engineering, DevOps и поддержке сложных корпоративных систем. Работаем с крупными заказчиками из банковского сектора, телекома, ритейла, промышленности и других отраслей.
У нас регулярно приходят запросы на Data Engineer и ETL-разработчиков для долгосрочных проектов российских компаний, формируем пул специалистов, которых сможем оперативно подключать к подходящим проектам.
Чем предстоит заниматься
В зависимости от проекта задачи могут включать:
- проектирование, разработку и поддержку ETL/ELT-процессов;
- создание и развитие корпоративных хранилищ данных, Data Lake и витрин данных;
- разработку DAG и настройку оркестрации процессов;
- написание сложных SQL-запросов и их оптимизацию;
- разработку трансформаций и процедур на SQL, Python или PySpark;
- проектирование моделей данных и потоков движения данных;
- контроль качества, полноты и согласованности данных;
- анализ и устранение ошибок;
- оптимизацию производительности обработки больших объёмов данных;
- подготовку технической документации и описание разработанных решений;
- взаимодействие с аналитиками, архитекторами, разработчиками и представителями заказчика.
Основные требования
- Коммерческий опыт работы Data Engineer, ETL-разработчиком или DWH-разработчиком от 4 лет;
- Уверенное знание SQL;
- Опыт разработки на Python;
- Опыт разработки и поддержки ETL/ELT-пайплайнов;
- Практический опыт работы с Apache Airflow или другим инструментом оркестрации;
- Понимание принципов построения DWH, Data Lake и витрин данных;
- Опыт работы с реляционными базами данных;
- Опыт работы с большими объёмами данных;
- Понимание принципов моделирования данных;
- Опыт работы с Git;
- Умение разбираться в существующем коде и чужих пайплайнах;
- Самостоятельность, ответственность и готовность доводить задачи до результата;
- Умение работать в распределённой команде.
Будет преимуществом
Не требуется знание всего перечисленного — конкретный стек зависит от проекта:
- Apache Spark и PySpark;
- Hadoop-экосистема: HDFS, YARN, Hive, Kafka, NiFi, Sqoop;
- ClickHouse;
- Greenplum;
- PostgreSQL и PL/pgSQL;
- MinIO или другие S3-совместимые хранилища;
- dbt;
- Apache Iceberg, Trino и современные Lakehouse-подходы;
- Data Vault, Kimball, модели «звезда» и «снежинка»;
- Azure Data Factory;
- Azure, Yandex Cloud или другие облачные платформы;
- инструменты Data Quality, например Great Expectations;
- SAS Data Integration Studio или Informatica PowerCenter;
- Kafka и потоковая обработка данных;
- Docker и Kubernetes;
- CI/CD;
- Jira и Confluence;
- опыт мониторинга и сопровождения продуктивных data-платформ;
- опыт работы в банковской сфере, телекоме, ритейле или промышленности.
Что важно отразить в отклике
Пожалуйста, укажите:
- ваш основной стек;
- опыт работы с SQL и Python;
- какие ETL/ELT-пайплайны вы разрабатывали;
- с какими DWH, Data Lake и Big Data-технологиями работали;
- используемые базы данных и инструменты оркестрации;
- объёмы данных и примерные нагрузки на последних проектах;
- текущую загрузку и возможную дату подключения;
- желаемую ставку;
- гражданство и текущую страну нахождения.
Даже если вы не соответствуете всему дополнительному стеку, присылайте резюме. Мы подбираем проект с учётом вашей основной специализации и практического опыта.
Формат работы
- Полностью удалённая работа;
- Проекты российских корпоративных заказчиков;
- Работа преимущественно по московскому времени;
- Загрузка — как правило, full-time;
- Продолжительность проектов — обычно от 6 месяцев с возможностью продления;
- Оформление и формат сотрудничества обсуждаются индивидуально;