Capnexus — это комплексный поставщик услуг. Наша команда состоит из выдающихся профессионалов с большим опытом проектирования, создания и поддержки программного обеспечения для розничной торговли. Мы рассматриваем себя как поставщика услуг по созданию решений, который следует повторяемой бизнес-модели, применимой к различным платформам и вертикалям. Имея культуру, основанную на результатах и доставке в основе бизнеса, Capnexus предоставляет своим клиентам полный набор услуг по разработке программного обеспечения, системному анализу, интеграции, внедрению и поддержке, а также возможность привлечь одну команду для выполнения всех необходимых им услуг.
Кто вы и чем будете заниматься:
Capnexus ищет высококвалифицированного старшего инженера данных AWS (Senior AWS Data Engineer) для руководства архитектурой данных, разработкой конвейеров и интеграцией данных. Это захватывающая возможность применить продвинутые навыки облачной инженерии данных на платформе, которая использует генеративный ИИ для автоматизации и модернизации корпоративных рабочих процессов.
Обязанности:
- Участвовать в воркшопах по исследованию данных для инвентаризации исходных систем, включая платформы управления недвижимостью, маркетинговые каналы и данные CRM, и переводить результаты в требования к архитектуре озера данных.
- Проектировать и внедрять многоуровневое корпоративное озеро данных на Amazon S3 (raw, conformed, enriched, aggregated) с уровнями загрузки, очистки и бизнес-логики, включая версионирование схем, проверку контрольных сумм, проверку бизнес-правил и рабочие процессы карантина/уведомления при сбоях.
- Создавать пакетные и потоковые конвейеры загрузки данных с использованием AWS Glue, Amazon Kinesis и контейнеризованных приложений загрузки данных из источников CDP, маркетинга и управления недвижимостью.
- Писать код ETL на PySpark и Python для заданий AWS Glue для трансформации, очистки и обогащения данных в масштабе; применять формат таблиц Apache Iceberg для таблиц озера данных с поддержкой ACID и эволюцией схем.
- Внедрять фреймворки трансформации данных и оркестрации с использованием AWS Glue ETL и AWS Step Functions; настраивать AWS Glue Data Catalog с краулерами для автоматического управления метаданными и их обнаружения.
- Реализовывать AWS Lake Formation для тонкой настройки управления доступом к данным, включая разрешения на уровне таблиц и столбцов, фильтры данных и ссылки на ресурсы — не только управление доступом на уровне IAM.
- Настраивать Amazon Athena для безсерверного SQL-запроса по озеру данных с оптимизацией производительности (формат Parquet, партиционирование, отсечение столбцов, управление размером файлов, кэширование); внедрять Amazon DynamoDB для поиска профилей клиентов с задержкой менее секунды, с использованием DAX при необходимости низкой задержки.
- Разрабатывать и развертывать функции AWS Lambda с использованием AWS Lambda Powertools для структурированного логирования, маршрутизации обработчиков и наблюдаемости; реализовывать шаблоны обработки ошибок, включая экспоненциальное повторное ожидание, повторные попытки, очереди мертвых писем и оповещения CloudWatch.
- Писать и поддерживать модули Terraform (или CloudFormation/CDK) для развертывания инфраструктуры данных AWS в рамках CI/CD пайплайна — инженеры данных отвечают за развертывание своей инфраструктуры, а не DevOps.
- Интегрировать CI/CD пайплайны с использованием GitHub Actions для автоматического развертывания заданий Glue, функций Lambda и рабочих процессов Step Functions с проверками lint и валидационными воротами.
- Поддерживать миграцию Azure Data Lake: проводить исследование активов ADLS, схем и логики трансформации; создавать целевые среды AWS; выполнять миграцию с помощью AWS DataSync; проводить сверку количества строк, проверку схем и сравнение контрольных сумм после миграции.
- Проектировать и внедрять конвейеры разрешения сущностей для идентификации, удаления дубликатов и объединения записей клиентов в единые золотые записи с использованием детерминированного и нечеткого сопоставления с отслеживанием происхождения и путями ручного обзора.
- Создавать и поддерживать модели данных для поддержки обзоров Customer 360 и аналитических панелей для руководства через Amazon QuickSight.
- Обеспечивать качество данных, валидацию и целостность на всех этапах конвейера; поддерживать UAT для функций, зависящих от данных.
- Сотрудничать с членами команд Full Stack, DevOps/MLOps и AI/ML, работающими с Bedrock и SageMaker; вносить вклад в документацию архитектуры, руководства по запуску конвейеров и документацию по управлению данными.
Требования:
- Опыт работы в области инженерии данных не менее 5 лет, из которых не менее 2 лет — в облачных средах AWS.
- Высокий уровень владения Python и SQL; практический опыт программирования на PySpark или Scala для AWS Glue ETL — это роль, связанная с кодированием, а не только конфигурацией.
- Практический опыт работы с AWS Glue (задания, краулеры, Data Catalog), AWS Step Functions, AWS Lambda и архитектурой озера данных Amazon S3.
- Знание AWS Lambda Powertools для структурированного логирования, управления обработчиками и наблюдаемости в производственных безсерверных нагрузках.
- Рабочие знания формата таблиц Apache Iceberg, включая эволюцию схем, временной переход и управление партициями.
- Практический опыт работы с Terraform, AWS CloudFormation или AWS CDK для инфраструктуры как кода, интегрированной в CI/CD пайплайны — кандидаты, которые только использовали готовые шаблоны DevOps, не соответствуют этому требованию.
- Опыт работы с AWS Lake Formation для тонкой настройки контроля доступа, включая разрешения на уровне таблиц и столбцов, фильтры данных и ссылки на ресурсы.
- Хорошее понимание моделирования данных DynamoDB и ключевых шаблонов проектирования для поиска с задержкой менее секунды; знакомство с DAX для кэширования.
- Опыт оптимизации производительности Amazon Athena: форматы файлов, стратегии партиционирования, оптимизация запросов и понимание, когда Athena подходит, а когда нет.
- Опыт работы с GitHub Actions или аналогичными инструментами CI/CD для автоматического развертывания кода конвейеров данных.
- Глубокое понимание паттернов качества данных: проверка схем, проверка контрольных сумм, проверка бизнес-правил, рабочие процессы карантина и отслеживание происхождения данных.
- Сильные аналитические, проблемно-решающие и коммуникативные навыки; комфортная работа в Agile/Scrum командах вместе с AWS Professional Services.
Желательно иметь:
- Опыт работы с Azure Data Lake Storage (ADLS) и миграцией из Azure в AWS с использованием AWS DataSync.
- Знакомство с сервисом AWS Entity Resolution — в частности, рабочими процессами сопоставления, сопоставлением на основе правил и машинного обучения, а также особенностями выходной схемы.
- Опыт работы с Amazon Bedrock или Amazon SageMaker в роли поддержки инженерии данных (интеграция конвейеров, хранилища признаков, подготовка данных для вывода).
- Знание Amazon QuickSight для подготовки наборов данных, оптимизации SPICE и разработки встроенных панелей мониторинга.
- Знакомство с Kiro CLI или инструментами разработки с поддержкой ИИ для автоматизации конвейеров.
- Сертификация AWS (специалист по аналитике данных, специалист по базам данных или архитектор решений).
- Опыт работы в сфере недвижимости, управления недвижимостью, маркетинговых технологий или платформ данных CRM.
«Наша культура»:
В Capstone центральные принципы, которым мы все следуем, и клей, который нас объединяет, — это наши краеугольные камни. Наши четыре краеугольных камня:
«Культура, ориентированная на клиента и результат»
- Мы стремимся превзойти ожидания наших клиентов, слушая, ведя, решая проблемы и выполняя обещанное
- Мы стремимся быть самым надежным и доверенным партнером для наших клиентов. ДОВЕРИЕ = ПОСТОЯНСТВО × ВРЕМЯ
«Культура обучения и обмена»
- Мы ценим «учащихся на всю жизнь»; тех, кто голоден, конкурентоспособен, любопытен и самомотивирован в своем стремлении к знаниям.
- Личный и профессиональный рост зависит от командной работы и непрерывного обучения. Обмениваясь знаниями, навыками, идеями и усилиями, мы приносим пользу нашим клиентам, себе и нашим сообществам.
- Мы признаем, что мысли, чувства и опыт других так же важны, как и наши собственные. Каждый может чему-то научиться, и каждый может чему-то научить.
- Знания и способности ценятся. Обмен знаниями и помощь другим в освоении новых навыков ценятся вдвойне.
«Культура роста и масштабируемости»
- Рост происходит, когда в вашей роли не устанавливаются барьеры. «Кросс-функциональные навыки ценятся и помогают нам действительно гибко обслуживать наших клиентов. Это сопровождается пониманием того, что при просьбе сделать что-то новое вам потребуется поддержка, возникнут вопросы и будут допущены ошибки.
- Самое элегантное решение — простое решение. Простое не значит легкое. Часто сложнее всего разбить сложную проблему на простые, масштабируемые части. Мы не ценим и не приветствуем чрезмерно сложные решения или избыточное кодирование.
- Время — один из наших самых ценных ресурсов. Масштабируемость подразумевает уважение к этому и страсть к максимально эффективному использованию времени каждого члена нашей команды.
«Вся работа стратегична»
- Независимо от того, насколько мал проект или задание, каждое взаимодействие — это возможность доказать себя, построить доверие и развивать долгосрочные отношения.
- Каждое задание, взаимодействие и обязательство имеют значение.
- Большие или маленькие, мы выполняем наши планы и стратегии с фокусом, обязательством и страстью.
Мы предлагаем:
Тип занятости: Полная занятость, 1099
Преимущества:
Capnexus является работодателем, предоставляющим равные возможности. Мы принимаем и празднуем разнообразие и стремимся создать инклюзивную и безопасную среду для всех сотрудников. Опыт бывает разным, и мы нацелены на привлечение новых взглядов в команду. Мы поощряем вас подавать заявку, даже если ваш опыт не полностью совпадает с указанным. Мы с нетерпением ждем вашего отклика.
Пожалуйста, без агентств!