Мы - аккредитованная IT-компания Aéza Group, молодой и динамично развивающийся хостинг провайдер, который ежегодно расширяет спектр услуг и функционал, которыми пользуются более сотни тысяч клиентов по всему миру. Ищем DevOps-инженера в нашу команду.
Твои обязанности:
- Проектирование и сопровождение инфраструктуры из трёх сред: dev / stage / prod с изолированными конфигурациями и политиками продвижения релизов
- Управление географически распределённым кластером Kubernetes (multi-region / multi-site), обеспечение отказоустойчивости и минимальной latency для конечных пользователей
- Развитие и поддержка CI/CD-пайплайнов в GitLab CI и TeamCity: автоматизация сборки, тестирования, доставки артефактов и деплоя
- Управление инфраструктурой как кодом с помощью Terraform: написание модулей, поддержка state-файлов, управление изменениями через MR/PR
- Развёртывание и сопровождение Argo CD (GitOps): настройка Application / ApplicationSet, синхронизация манифестов, rollback, управление drift
- Организация безопасного хранения и ротации секретов (HashiCorp Vault / Sealed Secrets / External Secrets Operator / SOPS и др.), интеграция с CI/CD-пайплайнами и Kubernetes
- Мониторинг, алертинг и устранение инцидентов в распределённой инфраструктуре
- Взаимодействие с командами разработки для выстраивания эффективного процесса доставки ПО
Наши требования:
- Контейнеризация и оркестрация:
- Kubernetes: уверенный опыт эксплуатации (деплой, масштабирование, networking, хелм-чарты, RBAC, network policies, resource quotas). Понимание архитектуры control plane и моделей мультитенантности
- Argo CD: практический опыт GitOps-деплоя, настройка Application/ApplicationSet, sync policies, rollback, управление конфигурациями через Helm/Kustomize
- Helm / Kustomize: templating и параметризация манифестов для повторного использования между средами
- Контейнерные реестры: настройка и эксплуатация (Harbor, Nexus, ECR, GCR), управление политиками доступа и сканированием образов
- CI/CD и доставка:
- GitLab CI: написание и оптимизация .gitlab-ci.yml, использование кэшей, артефактов, environments, review apps, protected environments, переменных окружения
- TeamCity: настройка build configurations, build chains, триггеров, артефактных зависимостей, интеграция с VCS
- Изолированные среды (dev / staging / prod): опыт настройки promotion-процесса между средами (dev → staging → production) с различными политиками деплоя и уровнем доступа
- Инфраструктура как код:
- Terraform: написание переиспользуемых модулей, управление state (remote backend), работа с провайдерами облачных платформ, понимение lifecycle-правил и зависимостей
- Ansible: написание playbooks и ролей для конфигурации серверов и сервисов
- Облачные платформы: AWS / GCP / Azure / Яндекс.Облако / Selectel — понимание базовых сервисов (compute, network, IAM, storage)
- Инфраструктура и сети:
- Географически распределённая инфраструктура: опыт работы с multi-region / multi-site окружениями, понимание специфики DNS-маршрутизации, latency, replication, disaster recovery
- Service Mesh: опыт с Istio / Linkerd — traffic management, mutual TLS, observability на уровне mesh
- Linux и сети: уверенное владение Linux, понимание TCP/IP, DNS, BGP, VPN, систем инициализации
- Безопасность:
- Управление секретами: опыт внедрения и эксплуатации систем хранения и ротации секретов (Vault, Sealed Secrets, External Secrets Operator, SOPS и т.д.), интеграция с CI/CD и Kubernetes, понимание принципов least privilege и audit
- Мониторинг:
- Observability: Prometheus, Grafana, Loki, Jaeger, OpenTelemetry — сбор метрик, логов, трейсов, настройка алертинга и дашбордов
- Программирование:
- Скриптинг: Bash / Python / Go для автоматизации рутинных задач и написания утилит
- Организационные требования:
- Доступность для контакта: готовность оперативно реагировать на инциденты и запросы в любое время
- Ежедневные статус-созвоны (дейли-митинги): по рабочим дням в 12:00 (MSK)
- Soft skills:
- Ответственность: полное владение зоной своей ответственности, способность самостоятельно доводить задачи до результата
- Проактивная позиция: стремление не только поддерживать, но и улучшать текущую инфраструктуру — инициировать оптимизации, предлагать архитектурные улучшения, автоматизировать ручные процессы