🤩 Удалённо
📸 AI-инфраструктура для inference, fine-tuning и GPU-кластеров
Задачи:
- Решать сложные технические проблемы клиентов в Kubernetes GPU-кластерах;
- Работать как customer-facing SRE и поддерживать стабильность кластеров;
- Мониторить здоровье GPU-инфраструктуры и сообщать клиентам о hardware-инцидентах;
- Поддерживать production-инфраструктуру: Slurm, node repair, миграции и Kubernetes workloads.
Требования:
- 3+ года в customer-facing technical roles, включая поддержку AI-сервиса или критичного SaaS API;
- Опыт SRE или DevOps-инженера с Kubernetes;
- Знание AI, ML, GPU-технологий и HPC-сред;
- Опыт с Slurm, InfiniBand или RDMA, сетями и distributed storage.