Что вы будете делать
- Работать в команде специалистов DevOps и DBA
- Улучшать существующую инфраструктуру и процессы в странах, где мы уже работаем, а также оптимизировать процессы для развертывания в новых странах в будущем
- Постоянно улучшать стабильность и эффективность платформы Kubernetes, с акцентом на оптимизацию использования ресурсов, снижение затрат и упрощение предоставления окружений через практики GitOps-first
- Мониторить и поддерживать облачную инфраструктуру с помощью автоскейлинга, конвейеров оповещений и панелей Grafana, охватывающих метрики, логи, трассировки и мониторинг реальных пользователей (RUM)
- Отвечать за работу в режиме дежурства по выходным, проводить сортировку и реагирование на инциденты в продакшене, выполнять анализ первопричин и организовывать обзоры после инцидентов
- Проектировать и управлять конвейерами оповещений для обеспечения качества сигналов, уделяя внимание предотвращению усталости от оповещений, каскадных оповещений и избыточного уведомления
- Определять и поддерживать SLIs и SLOs для критически важных сервисов и использовать их для повышения надежности и приоритизации дежурств
- Брать на себя ответственность за операции в облаке
- Взаимодействовать с внешними службами безопасности для ежегодных аудитов, а также проводить внутренние проверки безопасности
- Помогать в перенастройке существующей архитектуры для быстрого развертывания в новых странах
- Наставлять менее опытных членов команды
Что вы принесёте с собой
- Опыт работы в DevOps / SRE / платформенной инженерии не менее 3 лет
- Обязательное проживание в Европе
- Опыт самостоятельного планирования и развертывания проектов
- Опыт работы с облачными платформами, особенно AWS, включая глубокие знания по использованию облачных ресурсов для удовлетворения потребностей других команд и продакшена
- Хорошее понимание Kubernetes и оркестрации контейнеров, опыт работы с EKS и инструментами GitOps, такими как ArgoCD и Helm, будет большим плюсом
- Опыт работы с Infrastructure-as-Code, особенно Terraform
- Умение писать скрипты и автоматизировать процессы на Bash, Python или Golang; опыт с Rust приветствуется
- Практический опыт работы с системами наблюдаемости, охватывающими метрики, логи, распределённые трассировки и профилирование, например Prometheus, Loki, Tempo, Pyroscope и OpenTelemetry
- Опыт работы с мониторингом реальных пользователей (RUM), знание Grafana Faro или инструментов OpenTelemetry SDK будет плюсом
- Подтверждённый опыт дежурств и реагирования на инциденты, умение быстро сортировать проблемы в продакшене под давлением, проводить постмортемы и инициировать последующие действия
- Способность проектировать и поддерживать системы оповещений, минимизирующие шум, предотвращающие усталость от оповещений и каскадные паттерны оповещений
- Опыт определения SLIs и SLOs и использования их для повышения надежности
- Знание концепций service mesh будет плюсом, так как мы активно оцениваем сервис-меш на базе Cilium в непроизводственных средах
- Хорошие знания сетевых технологий, особенно стека TCP / IP и протокола HTTP
- Опыт работы с высокими нагрузками HTTP-запросов и проектирования систем для высокодоступных и высоконагруженных сред
- Глубокое понимание кэширования, включая CDN, HTTP-кэш, Redis / Memcached
- Отличные навыки устранения неполадок, включая диагностику проблем Linux OS и оптимизацию параметров ОС, оптимизация JVM будет большим преимуществом
Наш стек
- Языки: Java / Spring Boot, Node.js, Python, JavaScript
- Базы данных: Aurora MySQL & PostgreSQL, MongoDB, MySQL Community
- Кэш: ElastiCache, Redis, Valkey
- Месседжинг: Apache RocketMQ, AutoMQ, Kafka
- Сетевые технологии и прокси: Nginx, Kong, Cilium, eBPF
- Оркестрация и GitOps: Docker, Kubernetes (EKS), ArgoCD, Helm
- Вычисления и хранение: AWS EC2, VPC, AWS Lambda, EBS, S3
- CI/CD: Jenkins, GitHub Actions
- Метрики: Prometheus, Mimir, Grafana, Alertmanager
- Логи: Loki, Vector
- Трассировки: Tempo, OpenTelemetry, Alloy
- Профилирование: Pyroscope
- RUM: Grafana Faro, OpenTelemetry SDK
- Infrastructure as Code: Terraform
- CDN и Edge: Cloudflare, AWS CloudFront
- AWS CloudWatch
Что вы получите
- Sporty — компания с приоритетом удалённой работы и стремлением к устойчивому развитию
- Конкурентоспособная зарплата + индивидуальные бонусы по результатам работы каждый квартал
- 28 дней оплачиваемого ежегодного отпуска
- Основные рабочие часы с 10:00 до 15:00 по вашему местному часовому поясу с гибкостью вне этого времени
- Бонусы за рекомендации и мгновенные бонусы
- Современное оборудование
- Ежегодные корпоративные выезды для отличных возможностей внутреннего нетворкинга
Процесс собеседования
- Удалённый видеоскрининг с нашей командой по подбору персонала
- Онлайн-тестирование через Hackerrank
- Удалённое видеособеседование с 3 членами команды (по 45 минут каждое, не в разные дни)
Если вы заинтересованы, мы приглашаем вас подать заявку! Каждое резюме рассматривается членом нашей команды (в нашем процессе найма не используется ИИ), и мы стремимся ответить в течение 48 часов.