Аккредитованная ИТ-компания реализует динамично развивающийся проект в сфере здравоохранения. Легаси-кода и готовой инфраструктуры нет — всё предстоит построить. Нам нужен эксперт, который силён в Kubernetes и готов взять на себя работы по настройке всей инфраструктуры.
Чем предстоит заниматься
- Проектирование, развёртывание и эксплуатация Kubernetes-кластера.
- Настройка и поддержка автоскейлинга компонентов: KEDA (autoscaling по метрикам конкурентности запросов) и Kueue (admission control, квоты, PriorityClass).
- Организация совместного использования GPU-ресурсов.
- Развёртывание и поддержка служебной инфраструктуры платформы: PostgreSQL, RabbitMQ, MinIO (S3-совместимое хранилище), Keycloak (OIDC).
- Поддержка CI/CD-процессов.
- Обеспечение безопасности инфраструктуры: сетевые политики, управление секретами.
- Оптимизация затрат на вычислительные ресурсы (GPU/CPU) и планирование capacity.
- Разработка и поддержка внутренней документации по эксплуатации платформы, участие в расследовании инцидентов.
Ключевые требования
Обязательные
- Опыт эксплуатации production-кластеров Kubernetes от 2 лет.
- Опыт настройки автоскейлинга в Kubernetes (HPA, KEDA или аналогичные event-driven решения).
- Практический опыт работы с системами очередей сообщений (RabbitMQ или аналоги) на уровне эксплуатации: кластеризация, отказоустойчивость, мониторинг.
- Опыт эксплуатации PostgreSQL и объектных хранилищ S3-совместимого типа (MinIO, Ceph, AWS S3 и т. п.).
- Уверенное владение Helm и написанием/поддержкой Kubernetes-манифестов.
- Опыт построения и поддержки CI/CD-пайплайнов.
- Понимание принципов работы GPU-планирования в Kubernetes (device plugins, ресурсные лимиты/квоты).
- Понимание основ сетевой безопасности, TLS, работы с секретами (Vault, Kubernetes Secrets и т. п.).
- Опыт написания скриптов автоматизации (Bash, Python).
Желательные
- Опыт работы с Kueue или аналогичными системами.
- Опыт эксплуатации GPU-кластеров для инференса/обучения ML-моделей.
- Опыт работы с Keycloak или другими OIDC-провайдерами на уровне администрирования.
- Опыт написания Kubernetes-операторов или взаимодействия с Kubernetes API из кода (kubernetes-client).
Стэк
- Оркестрация: Kubernetes, Helm
- Автоскейлинг и очереди задач: KEDA, Kueue
- Инфраструктурные компоненты: PostgreSQL, RabbitMQ, MinIO (S3 API), Keycloak (OIDC)
- Наблюдаемость: Prometheus, Loki, Grafana
- CI/CD: GitLab CI
Условия работы
- Удалённый формат;
- Фиксированный проект, но с возможностью дальнейшего продолжения сотрудничества.