Адаптируем резюме под ATS-фильтры, подготовим сопроводительное на основе резюме и вакансии, соберём гайд подготовки к собеседованию, найдём контакты HR и нанимающих
Команда робототехники занимается всем, что связано с автономными роботами и роботизированными системами: от исследований, прототипирования и разработки первых образцов до интеграции ML-моделей в реальные устройства и подготовки решений к серийному производству.
Мы создаём нейросетевые компоненты для роботов: восприятие, принятие решений, управление поведением, обучение в симуляции и на реальных данных, пайплайны дообучения и инфраструктуру для экспериментов. В команде работают специалисты по machine learning, reinforcement learning, computer vision, vision-language-action-моделям, MLOps и робототехнике.
Сейчас мы ищем ML Engineer, который будет развивать методы post-training и fine-tuning для VLA- и других robot policy. Вам предстоит применять reinforcement learning, imitation learning и recovery-oriented-подходы, чтобы улучшать качество выполнения задач, устойчивость к OOD-состояниям, способность к восстановлению после ошибок и обобщение на реальные робототехнические сценарии.
Вы будете развивать пайплайны дообучения VLA на данных реальных роботов, симуляции и демонстрациях. В фокусе — повышение success rate, стабильности и обобщающей способности моделей, адаптация к конкретным робототехническим платформам, задачам, сенсорам и интерфейсам управления.
Вы будете исследовать и внедрять RL-подходы для улучшения VLA-политик после предобучения и supervised fine-tuning. В зоне ответственности — offline RL на логах взаимодействий и демонстрациях, offline-to-online RL, RL fine-tuning и residual RL. Будет уделяться внимание тому, как безопасно использовать данные реальных rollout’ов, строить reward’ы и success-сигналы, улучшать политики без потери исходных навыков и находить баланс между качеством, устойчивостью и sample efficiency.
Вам предстоит развивать ML-часть обучения роботов на их собственных ошибках. Робот может попасть в OOD-состояние, начать неуспешно выполнять навык или потерять уверенность; в таких случаях оператор или другой механизм восстановления формирует корректирующую траекторию. Эти эпизоды становятся данными для следующей итерации обучения. Вы будете работать с подходами уровня DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и dataset aggregation. Основная задача — превращать всё это в улучшение VLA-policy. Сбор данных, teleoperation и операционные процессы находятся на стороне других команд; с вашей стороны — требования к данным, методы обучения, оценка качества и интеграция результатов в training pipeline.
Вы будете улучшать качество моделей в сложных, редких и нештатных сценариях: при распределительном сдвиге, изменении условий сцены, ошибках восприятия, накоплении ошибок управления и неполных или шумных наблюдениях. В фокусе — анализ failure modes, OOD robustness, uncertainty-aware и recovery-oriented learning, работа с hard examples и long-tail-данными. Важно строить понятные метрики качества: success rate, recovery rate, intervention rate, устойчивость к возмущениям и безопасность выполнения задач.
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.
ЖмитеГайд по безопасности