Team Lead в команду ML-инфраструктуры R&D
Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Эти модели используют в Алисе, Поиске, Рекламе и других сервисах Яндекса. Для обучения таких моделей нужны десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать систему максимально эффективной: рационально использовать вычислительные ресурсы и снизить риски сбоев.
Какие задачи вас ждут
- Оптимизация инфраструктуры RL-обучения
Вы будете улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, а также коммуникации между блоками обучения; повышать эффективность работы внутри блоков.
- Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы.
- Обеспечение отказоустойчивости инфраструктуры
Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к разным ошибкам и сбоям.
- Исследование решений
Вы будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать, насколько они эффективны, и внедрять их в реальные проекты.
Мы ждём, что вы:
- Знаете Python и работали в системном программировании, разработке библиотек или фреймворков
- Умеете работать с фреймворком PyTorch и распределённым обучением через torch.distributed
- Владеете подходами параллелизации: понимаете Data Parallelism, Tensor Parallelism, Pipeline Parallelism, Expert Parallelism для распределённого инференса или обучения
- Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшене
- Можете эффективно работать в команде и делиться знаниями
Будет плюсом, если вы:
- Участвовали в создании инфраструктуры обучения ML-моделей
- Внедряли и оптимизировали RL-решения
- Использовали библиотеки RL-обучения для LLM (veRL, slime, NeMo-RL, SkyRL) и библиотеки инференса (vLLM, SGLang и TRT-LLM)
- Работали с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton
- Владеете C++ и работали с низкоуровневым программированием и оптимизацией
Бенефиты работы в Яндексе
- Здоровье
Расширенная медицинская страховка начинает работать с первого месяца в Яндексе. В неё входят: плановая помощь и неотложная за рубежом, страхование от несчастных случаев для любителей активного отдыха и лечение критических заболеваний.
- Ментальное здоровье
Врачи в клиниках по ДМС, онлайн-консультации с психологами, а также психотерапия в офисах, где есть кабинет психотерапевта.
- Ежегодные чекапы
Мы за превентивную заботу о здоровье, поэтому по ДМС можно проходить чекапы и регулярно вакцинироваться.
- Больничный
30 дней в году оплачиваются — вы получите полную зарплату, как будто не болели.
- Стоматология
Плановые процедуры, профессиональная чистка и экстренная помощь за рубежом.
- Коррекция зрения
После года работы ДМС покрывает коррекцию зрения и хирургическое лечение косоглазия.
- Терапевты в офисах
Если почувствовали себя неважно, можно обратиться в кабинет врача-терапевта, такие есть во всех крупных офисах Яндекса.
- Ведение беременности и роды
Оплачиваем ведение беременности и роды для сотрудниц и жён сотрудников, которые с нами более двух лет.
Страховка для родственников по системе 80/20: мы оплачиваем 80% стоимости ДМС для детей и супругов, вы — остальные 20%. В страховку входит всё то же самое, что и у вас.
Больше о бенефитах