развитие ядра платформы: фреймворка Data Vault, обвязки Airflow, lineage-инструментов; проектирование API для использования другими инженерами и ответственность за их развитие;
разработка библиотек и фреймворков на Python: клиентов к источникам данных, инструментов тестирования пайплайнов, оберток над инфраструктурными компонентами; обеспечение качества кода через типизацию, тестирование и code review;
работа с lakehouse-архитектурой: Iceberg maintenance, оптимизация layout'а таблиц, тюнинг Trino, разработка Spark-джоб для тяжелых трансформаций;
построение интеграций с источниками данных: OLTP-базы, REST/gRPC API, Kafka, файловые хранилища, SaaS-системы; проектирование унифицированных интерфейсов подключения новых источников;
внедрение AI-инструментов в инженерные процессы: разработка агентов для расследования инцидентов, анализа качества данных, поддержки DAG'ов и code review;
участие в архитектурных решениях: выбор технологий, проектирование интерфейсов между компонентами, формирование и внедрение best practices в команде;
проведение code review и менторинг менее опытных коллег.
Требования
Промышленный опыт от 5 лет в data engineering или backend-разработке с сильным дата-уклоном: production-системы под реальной нагрузкой, ответственность за их эксплуатацию, а не только за написание кода.
Python — главное требование. Уровень senior разработчика: ООП, проектирование API библиотек, типизация, тесты, опыт написания переиспользуемых компонентов, которыми пользовались другие люди.
Lakehouse-стек на практике. Apache Iceberg (или Delta/Hudi с готовностью быстро переключиться): устройство таблиц, snapshots, компакция, schema evolution. Понимание, чем lakehouse отличается от классического DWH не на уровне статьи на Medium.
Trino или другой MPP-движок: архитектура распределённого выполнения, чтение планов запросов, оптимизация, опыт работы с коннекторами.
Apache Airflow глубоко: не только разработка DAG'ов, но и внутреннее устройство (scheduler, executors, метаданные), опыт написания собственных операторов и хуков.
Apache Spark: PySpark, Spark SQL, понимание модели выполнения.
SQL продвинутого уровня: оконные функции, CTE, оптимизация, чтение планов исполнения, работа с большими объёмами.
Git, CI/CD — уверенно.
Условия
полная занятость;
оформление: трудовой договор;
график: 5/2
удаленный формат работы;
уровень дохода обсуждается на этапах найма.
Что приятного мы делаем для сотрудников
предлагаем ДМС со стоматологией или компенсацию на медицинское обслуживание, а также сервис психологической поддержки;
заботимся о физическом здоровье — компенсируем расходы на занятия спортом или покупку спортивного оборудования;
компенсируем стоимость техники, которую вы приобретаете для работы;
создаем условия для развития: оплачиваем обучение, конференции и митапы, нужные для работы;
подключаем к корпоративной программе лояльности: персональным скидкам на Flowwow и предложениям от партнеров.
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.