Присоединяйтесь к основной команде Eclipse, где мы создаём маркетплейс с приоритетом на AI-агентов, который связывает интеллект с реальными задачами, начиная с сбора и разметки данных. Мы ищем Data Scientist, который заложит основу для того, как наши данные размечаются, обрабатываются и подготавливаются для использования следующими поколениями больших языковых моделей (LLM). Ваша работа будет критически важна для преобразования наших сырых коллекций данных в ценные наборы данных, готовые для AI.
Квалификации
- Подтверждённый опыт работы Data Scientist или инженером машинного обучения с акцентом на качество данных и их подготовку.
- Глубокое понимание методологий разметки данных и практический опыт работы с платформами и рабочими процессами аннотирования данных.
- Доказанный опыт подготовки наборов данных для обучения и дообучения больших языковых моделей (LLM), включая знание таких техник, как токенизация, эмбеддинги и распознавание именованных сущностей (NER).
- Владение Python и распространёнными библиотеками для науки о данных (например, Pandas, NumPy, Scikit-learn, spaCy, Hugging Face).
- Опыт использования API/SDK для автоматизации аннотирования данных и циклов активного обучения.
- Отличные коммуникативные навыки, способность создавать понятную документацию для технической и нетехнической аудитории.
Обязанности
- Разработка стратегий разметки данных: проектирование и документирование формальной стратегии аннотирования данных, включая чёткие, масштабируемые и эффективные руководства по разметке наших данных. Определение и соблюдение метрик качества, включая согласованность между аннотаторами.
- Оптимизация для потребления LLM: исследование, определение и прототипирование оптимальных форматов данных, структур и этапов предварительной обработки, необходимых для дообучения и обучения LLM на наших наборах данных.
- Анализ качества данных: создание автоматизированных процессов и метрик для анализа качества как сырых, так и размеченных данных, предоставление обратной связи для улучшения наших процессов сбора и разметки данных.
- Сотрудничество с инженерной командой: тесная работа с инженерами для руководства внедрением конвейеров обработки данных и обеспечения того, чтобы инфраструктура данных соответствовала требованиям ML-приложений.
Желательные навыки
- Опыт обработки аудиоданных и работы с соответствующими библиотеками.
- Знакомство с платформами и инструментами аннотирования данных.
- Знание современных принципов и практик MLOps.
- Опыт курирования данных для больших языковых моделей и работы с пайплайнами обучения с подкреплением на основе обратной связи от человека (RLHF).
Присоединяйтесь к команде Eclipse!
Eclipse создаёт самый быстрый Ethereum Layer 2, работающий на базе Solana VM. Наш универсальный L2 сочетает лучшее из модульного стека без ущерба для удобства использования и без фрагментации ликвидности. На этой основе мы разрабатываем приложения внутри компании и быстро итеративно ищем прорывные потребительские и AI-решения. Нас поддерживают ведущие инвесторы, включая Polychain, Tribe Capital, Placeholder и DBA.
- Возможности. Мы считаем, что блокчейны должны быть быстрыми И удобными. Вы будете выполнять работу с высоким воздействием, улучшая масштабируемость Ethereum и формируя будущее криптовалют.
- Гибкость. Мы сотрудничаем как синхронно, так и асинхронно, через еженедельные общие собрания, сообщения в Slack и ежеквартальные личные встречи.
- Команда. Наша основная команда имеет опыт запуска и масштабирования проектов уровня blue-chip, таких как dYdX, Uniswap и zkSync. Нас поддерживают ведущие фонды и лидеры, включая Polychain, Tribe, Placeholder, DBA, Мустафу Аль-Бассама, Таруна Читру, Мельтем Демирорс и других.
- Культура. Как ранний член нашей команды, вы получите уникальную возможность помочь формировать нашу культуру. Мы ценим интеллектуальную честность, склонность к действию и верим, что каждый участник играет ключевую роль в достижении наших амбициозных целей.
- Компенсация. Вы получите конкурентоспособную зарплату + акции + пакет льгот.
Eclipse Laboratories является работодателем, предоставляющим равные возможности. Мы не допускаем дискриминации по признаку расы, цвета кожи, религии, пола (включая беременность, гендерную идентичность и сексуальную ориентацию), национального происхождения, возраста, инвалидности, генетической информации, статуса ветерана или любого другого статуса, защищённого применимыми законами или нормативными актами. Все решения о приёме на работу принимаются на основе квалификации, заслуг и бизнес-потребностей.