О проекте:
Мы разрабатываем и внедряем DS-модели и AI-агентов в Департаменте по работе с проблемными активами (NPL). Мы понимаем, что их эффективность напрямую зависит от фундамента — качественно проанализированных, подготовленных и высокопроизводительных данных.
Обязанности
- разработка высоконагруженных пайплайнов обработки больших данных исключительно на Scala API DataFrame Apache Spark (без SQL), включая оптимизацию производительности (Performance Tuning) и устранение data skew
- проектирование архитектуры хранения: моделирование данных с применением подходов Data Vault или Dimensional Modeling, участие в проектировании DWH
- подготовка и предоставление чистых, структурированных фичей (feature engineering) для команд DS/ML, понимание жизненного цикла внедрения ML-моделей
- обработка больших объемов неструктурированных данных и интеграция результатов работы генеративного ИИ в аналитические процессы
- работа с ядром Spark: анализ планов выполнения запросов через Catalyst Optimizer, выявление и решение проблем производительности на уровне кода
- участие в код-ревью, ведение разработки в Git, написание модульных тестов и поддержание высокого качества кодовой базы команды
- трансляция бизнес-задач от стейкхолдеров в технические требования к данным и архитектуре потоков.
Требования
- релевантный опыт от 3 лет на позиции Data-аналитика/Data-инженера или Аналитика DWH с фокусом на разработку production-ready решений
- экспертное владение Scala API для работы с DataFrame Apache Spark. Опыт реализации проектов исключительно на Scala без использования SQL
- глубокое понимание этапов оптимизации Catalyst, умение читать планы выполнения (Explain) и проводить Performance Tuning
- практический опыт участия во внедрении ML-моделей и уверенное знание этапов их жизненного цикла (от подготовки данных до мониторинга)
- навыки проектирования высоконагруженных систем и знакомство с архитектурными подходами Data Vault или Dimensional Modeling
- уверенная работа с большими объемами неструктурированных данных и применение инструментов генеративного ИИ для автоматизации задач
- высшее техническое образование, владение Git и опытом прохождения код-ревью.
Будет плюсом:
- опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов.
Условия
- офисный формат работы: г. Москва, Кутузовский проспект, д. 32, к.1
- ежегодный пересмотр зарплаты и годовая премия
- более 400 образовательных программ в СберУниверситете для твоего развития
- спортзал и зоны отдыха
- расширенный ДМС, льготное страхование для семьи
- гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
- подписка Прайм с возможностью совместного использования на трёх близких
- вознаграждение за рекомендацию друзей в команду Сбера.