Команда разрабатывает сложные программно-аппаратные системы и ML/CV-решения. Ищем Инженера данных, который будет отвечать за построение и автоматизацию пайплайнов подготовки больших объемов фото- и видеоданных для последующей разметки и обучения ML-моделей.
Обязанности:
- разрабатывать на Python пайплайны для сбора, обработки и подготовки данных;
- автоматизировать поиск, фильтрацию и передачу больших файлов с удаленных серверов;
- извлекать и обрабатывать фото- и видеоданные из ROS bag;
- автоматизировать отбор и подготовку данных для разметки;
- организовывать загрузку данных и метаинформации в S3-совместимое объектное хранилище;
- интегрировать пайплайны с CVAT и другими инструментами разметки через API;
- вести каталог обработанных данных и метаданных;
- оптимизировать обработку больших объемов данных, в том числе не помещающихся в оперативную память.
Требования: - уверенное владение Python;
- опыт разработки ETL/data pipelines;
- опыт работы с большими файлами и объемами данных;
- понимание асинхронного и многопоточного программирования;
- опыт работы в Linux-среде.
Будет плюсом:
- опыт с ROS 1/2 и rosbag: топики, сообщения, извлечение и синхронизация данных с камер и других сенсоров;
- опыт работы с S3-совместимыми хранилищами и boto3;
OpenCV и/или ffmpeg; - опыт обработки изображений и видео;
- понимание подходов к хранению и организации метаданных: JSON/JSONL, Parquet и др.;
- опыт интеграции с CVAT, Label Studio, Supervisely или другими платформами разметки;
- опыт работы с данными для Computer Vision/ML.
Условия: - оформление в соответствии с ТК РФ;
- конкурентный уровень заработной платы - на уровне лидеров ИТ/телеком-индустрии;
- комфортный современный офис.