Компания SKAI - развиваем production-платформу на базе микросервисов (IoT / мониторинг / видеоаналитика) и ищем инженера, который будет отвечать за инфраструктуру, автоматизировать процессы и выстраивать DevOps-практики в команде.
Чем предстоит заниматься:
- Поддерживать и развивать production-кластеры Kubernetes (15+ нод): релизы, масштабирование, устранение инцидентов;
- Настроить и вести мониторинг и алертинг: Prometheus, Grafana, Alertmanager, ELK-stack;
- Разворачивать новые окружения (dev/staging/prod) и выводить сервисы в прод;
- Автоматизировать деплой 20+ микросервисов на Helm + ArgoCD;
- Развивать CI/CD: стандартизировать шаблоны пайплайнов (GitLab CI), сокращать время onboarding новых проектов;
- Переводить инфраструктуру на IaC: Ansible + Terraform + Helm + ArgoCD, выстраивать стратегию администрирования серверов;
- Интегрировать GPU-ресурсы в кластер (NVIDIA GPU Operator) под задачи ML / компьютерного зрения;
- Вести on-call: диагностировать и устранять инциденты, проводить RCA;
- Консультировать продуктовые команды по DevOps-практикам и инструментам.
Требования
- Опыт в DevOps/SRE от 5 лет;
- Уверенное владение Kubernetes: администрирование, Helm, GitOps (ArgoCD), troubleshooting в production;
- Сильный CI/CD опыт (GitLab CI) и умение стандартизировать пайплайны.
- Практический опыт Infrastructure as Code: Terraform, Ansible;
- Опыт построения мониторинга и алертинга: Prometheus, Grafana, Alertmanager, ELK;
- Понимание сетевых и системных тем (Linux, сети, безопасность);
- Навыки менторства и работы с командой.
Будет плюсом
- Опыт с GPU-кластерами (NVIDIA GPU Operator, ML/CV-нагрузки);
- Работа с IoT / высокочастотными потоковыми нагрузками, видео;
- Опыт построения DevOps-практик «с нуля» и кросс-командного внедрения.
Что мы предлагаем?
- Работа в ИТ аккредитованной компании;
- Корпоративный ДМС;
- График 5/2, гибкое начало рабочего дня с 8.00 до 10.00;
- Формат работы: гибрид (раз в неделю встреча с командой в офисе)
- Дополнительные дни "Day Off", с сохранением заработной платы;
- Обучение и наставничество. У нас разработана программа обучения на все 3 месяца испытательного срока, также за каждым новым сотрудником закрепляется наставник;
- Реальные возможности карьерного роста. Мы всегда приветствуем желание наших сотрудников развиваться внутри компании, и активно помогаем им в этом;
- Интересная и перспективная сфера: IoT для транспорта, BigData, Видеоаналитика, нейронные сети и геймификация.