Создаем поисковый сервис для ответов на запросы пользователей на естественном языке. Предоставляем GigaChat и другим LLM доступ к актуальной информации из интернета, чтобы пользователи получали точные и свежие ответы на разные вопросы.
Ищем технического лидера инфраструктурной команды (лид + 2 инженера), который отвечает за надежность, производительность и наблюдаемость всей инфраструктуры поискового сервиса. Основной фокус – на технической экспертизе, архитектурных решениях по SRE/Kubernetes и хендс-он разработке внутренних инструментов автоматизации.
Весь парк виртуальных машин настраивается через Ansible. Помимо Kubernetes+Helm и GitLab CI, мы эксплуатируеем значительный объем инфраструктуры под данные: кластеры OpenSearch, PostgreSQL и Redis Sentinel. Наблюдаемость построена на VictoriaMetrics и Grafana, ELK, OpenTelemetry/Jaeger, базовый инфраструктурный мониторинг – на Zabbix. Всё это работает в облаке cloud.ru.
Обязанности
- отвечать за надежность, производительность и наблюдаемость инфраструктуры поискового сервиса: определять и отслеживать SLO/SLI, error budgets, проводить capacity planning
- проектировать и развивать инфраструктуру в Kubernetes: Helm-чарты, стратегии деплоя, автоскейлинг, устойчивость к сбоям
- развивать и поддерживать инфраструктуру как код и базу Ansible playbooks для развертывания сервисов облаке
- строить и поддерживать CI/CD пайплайны в GitLab CI: автоматизация сборки, тестирования и деплоя сервисов
- развивать observability-стек: метрики (VictoriaMetrics, Grafana), логи (ELK), распределенную трассировку (OpenTelemetry/OTLP, Jaeger)
- писать код для внутренних инструментов и автоматизации: self-service тулинг для команды разработки, операторы и утилиты для Kubernetes
- быть технической точкой эскалации по продакшен-инцидентам, участвовать в дежурствах (on-call), проводить разбор инцидентов (post-mortem)
- определять техническую стратегию инфраструктуры и участвовать в архитектурных решениях вместе с командой разработки поиска
- проводить код-ревью, менторить инженеров команды, растить их экспертизу в SRE/DevOps-практиках.
Требования
- 5+ лет опыта в DevOps/SRE/infrastructure engineering, включая опыт технического лидерства в небольшой команде
- опыт эксплуатации инфраструктуры под поисковые или data-intensive сервисы (OpenSearch, Kafka, распределенные БД).
- глубокая экспертиза в Kubernetes: проектирование и эксплуатация кластеров, Helm, сетевые политики, troubleshooting в production
- продвинутый опыт с Ansible: структурирование playbooks и ролей, идемпотентность, управление инвентарем под множественные окружения
- опыт построения и поддержки CI/CD, желательно на GitLab CI
- опыт построения observability: VictoriaMetrics + Grafana для метрик, ELK для логов, OpenTelemetry/Jaeger для distributed tracing
- практическое владение SRE-подходами: SLO/SLI, error budgets, capacity planning, incident management, культура post-mortem
- умение писать production-код на Python для автоматизации и внутренних инструментов
- опыт работы с облачными платформами (cloud.ru или аналоги – Yandex Cloud, SberCloud, AWS)
- уверенное понимание сетевых основ, Linux, принципов безопасности инфраструктуры
- опыт менторства инженеров и технического лидерства.
Условия
- стабильный оклад и премии по результатам работы, ежегодный пересмотр зарплаты
- комфортный современный офис рядом с м.Кутузовская
- гибридный формат работы: встречаемся очно в офисе 1 раз в неделю
- корпоративный спортзал и зоны отдыха
- уникальная система обучения Сбера для профессионального и карьерного развития
- программа адаптации и помощь руководителя на старте
- расширенный ДМС и льготное страхование семьи
- гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
- бесплатная подписка СберПрайм, скидки на продукты компаний-партнеров
- вознаграждение за рекомендацию друзей в команду Сбера
- корпоративная пенсионная программа