Ищем DevOps / SRE Engineer для развития и сопровождения инфраструктуры AI/ML-сервисов в защищённых контурах банка.
Задачи
- Развёртывание и сопровождение Langfuse и связанных компонентов: PostgreSQL, ClickHouse, Redis, object storage.
- Эксплуатация Kubernetes/OpenShift, разработка Helm-чартов и Kubernetes-манифестов.
- Настройка и сопровождение Apache Kafka: топики, ACL, consumer groups, retention, DLQ/retry, мониторинг lag.
- Построение и поддержка CI/CD и GitOps.
- Автоматизация инфраструктуры с помощью Ansible / Terraform.
- Настройка мониторинга и observability: Prometheus, Grafana, Alertmanager, ELK/OpenSearch.
- Обеспечение отказоустойчивости, резервного копирования и восстановления.
- Участие в разборе инцидентов и подготовке RCA.
- Соблюдение требований ИБ и ведение технической документации.
Требования
- От 3 лет опыта в DevOps / SRE, желательно в крупной компании или финансовой организации.
- Уверенное знание Linux, Docker, Git, Bash.
- Production-опыт с Kubernetes/OpenShift.
- Практический опыт с Kafka.
- Опыт работы с CI/CD: Jenkins, GitLab CI, TeamCity, Argo CD или аналоги.
- Знание Ansible / Terraform.
- Опыт с Prometheus, Grafana и системами централизованного логирования.
- Опыт эксплуатации PostgreSQL, понимание ClickHouse и Redis.
- Навыки автоматизации на Python/Bash.
- Понимание высоконагруженных систем, отказоустойчивости и disaster recovery.
- Навыки взаимодействия с командами разработки, архитекторами и ИБ.
Будет плюсом: опыт работы с Langfuse, LLM/RAG и ML-инфраструктурой.
Мы предлагаем: - Стабильную заработную плату;
- Удаленный формат работы;
- Возможность напрямую влиять на развитие продукта;
- Полностью собственный продукт без аутсорса и внешних подрядчиков;
- Сильную продуктовую команду: разработка, дизайн, тестирование, продукт и собственное AI-направление;
- Минимум бюрократии и быстрые решения;
- Возможность участвовать в развитии продукта федерального масштаба;
- Профессиональный рост вместе с развитием платформы.