☑️ Ключевые обязанности
- Определять и поддерживать SLO, SLI и бюджеты ошибок, а также наблюдаемость (метрики, логи, трейсы, алерты), которая выявляет регрессии раньше пользователей
- Создавать повторяемую инфраструктуру самообслуживания через infrastructure-as-code, CI/CD и «золотые пути»
- Отвечать за выкаты end-to-end: прогрессивная доставка, канареечные релизы, безопасные миграции и чистые откаты
- Эксплуатировать системы за нодами Somnia, валидаторами, RPC и индексированием, настраивая производительность и стоимость в разных регионах
- Руководить реагированием на инциденты и дежурствами, проводить постмортемы без поиска виноватых, непрерывно укреплять платформу
- Сотрудничать с продуктовыми и протокольными командами при проектировании и эксплуатации сервисов, готовых к продакшену
☑️ Требования
- Большой опыт эксплуатации продакшен-инфраструктуры в масштабе (облако и/или bare metal), с глубоким пониманием Linux
- Опыт работы с infrastructure-as-code, например Terraform или Pulumi, а также с управлением конфигурацией
- Опыт запуска контейнеров и платформ оркестрации (Docker, Kubernetes) в продакшене
- Сильные навыки программирования, желательно на Go и/или TypeScript, для автоматизации и внутренних инструментов
- Опыт со стеками наблюдаемости (Prometheus, Grafana, OpenTelemetry или аналоги)
- Опыт эксплуатации и мониторинга распределённых систем, включая планирование ёмкости и настройку производительности
- Искренний интерес к криптовалютам и on-chain системам
☑️ Будет плюсом: опыт эксплуатации инфраструктуры блокчейн-нод (валидаторы, RPC, archive nodes); высокопроизводительные сети или балансировка нагрузки в масштабе; мультирегиональные развёртывания с failover; безопасность и управление ключами (HSM, управление секретами)