Мы развиваем команду Больших языковых моделей и машинного обучения и ищем сильного Senior DevOps / MLOps, которому интересно не просто поддерживать существующую инфраструктуру, а создавать сложную распределённую систему с нуля.
Сейчас мы создаём собственную платформу распределённых вычислений, которая позволит объединить большое количество вычислительных ресурсов — CPU, GPU и другие мощности — в единую систему.
Стек: Linux, Nomad, Kubernetes, Docker, Docker Registry, CI/CD, Monitoring, Ray, GPU, ML infrastructure.
Чем предстоит заниматься:
- Проектировать и развивать архитектуру распределённой вычислительной платформы
- Объединять различные вычислительные ресурсы в единую систему
- Работать с большими CPU/GPU-кластерами
- Автоматизировать распределение вычислительных задач
- Разворачивать и поддерживать инфраструктуру для ML-нагрузок
- Обеспечивать стабильность и масштабируемость production-системы
- Работать с контейнеризацией и оркестрацией
- Развивать CI/CD и мониторинг
- Взаимодействовать с ML-разработчиками и командой R&D.
Это не классический DevOps-проект, где основная задача — поддерживать уже существующую инфраструктуру. Здесь предстоит много проектировать, экспериментировать, принимать архитектурные решения и строить систему с нуля.
Мы ищем специалиста, который:
- Имеет 4–5+ лет опыта в DevOps / MLOps
- Работал с распределёнными вычислительными системами
- Имеет реальный опыт работы с большими production-кластерами
- Понимает особенности GPU-инфраструктуры
- Понимает, как устроен процесс обучения нейронных сетей и распределённого обучения
- Умеет работать с Kubernetes и/или Nomad
- Уверенно работает с Docker и Docker Registry
- Имеет опыт построения и развития инфраструктуры с нуля, а не только её поддержки
- Понимает, как обеспечить надёжность, масштабируемость и производительность распределённой системы.
Будет большим плюсом:
- Опыт работы в крупном технологическом проекте;
- Опыт работы с GPU-фермами, суперкомпьютерами или крупными вычислительными кластерами;
- Опыт с внутренними ML-платформами;
- Опыт работы с Ray;
- Опыт построения распределённых вычислительных систем.
Что предлагаем:
- Возможность работать со сложной и масштабной инфраструктурой
- Высокая степень влияния на технические решения и развитие направления
- Современный стек и архитектурная свобода
- Просторный офис в Екатеринбурге с кофейней
- Гибрид 50/50 (офис Восточная 7Г + удалёнка)
- Спортивные активности, корпоративы
- Карьерный рост и обучение.