Ищем опытного Incident Commander — человека, который управляет самыми сложными авариями в нашей сети и сервисах. Это не роль «дежурного инженера». Это роль лидера, принимающего решения в условиях неопределённости и высокой цены ошибки.
Что тебе предстоит:
- Управлять критическими инцидентами уровня P1/P2, выполняя роль Incident Commander по модели IC-DC-SMC и координируя работу кросс-функциональных команд.
- За 2–3 минуты оценивать severity, организовывать WAR Room, определять стратегию реагирования и приоритеты: stop the bleed → stabilization → RCA → root cause remediation.
- Координировать выполнение мероприятий по восстановлению сервисов, принимая совместно с инженерными командами решения об откате релизов, failover ЦОДа, переключении трафика, частичной деградации сервисов и других мерах по снижению влияния инцидента.
- Вести incident timeline (detection → response → mitigation → resolution) в Jira, PagerDuty, Opsgenie и обеспечивать регулярную коммуникацию со стейкхолдерами и бизнесом.
- Организовывать проведение blameless postmortem, выполнять RCA и контролировать реализацию action items.
- Развивать процессы Incident Management: совершенствовать runbooks, playbooks, процессы on-call-ротации, организовывать Game Days и chaos engineering, анализировать и улучшать показатели MTTD, MTTR, MTBF, SLI/SLO attainment.
- Обучать новых Incident Commander, проводить ретроспективы и внедрять лучшие практики управления инцидентами.
Что для нас важно:
- Опыт управления критическими инцидентами (P1/P2) в высоконагруженной или распределенной ИТ-инфраструктуре.
- Уверенное понимание сетевых технологий (TCP/IP, BGP, MPLS, DNS, HTTP/S), архитектуры LTE/5G Core, принципов работы Linux и инженерных инструментов диагностики (strace, tcpdump, iostat, journalctl).
- Опыт работы с инструментами Observability: Prometheus, Grafana, Zabbix, ELK/OpenSearch, Jaeger/Zipkin.
- Понимание процессов CI/CD, стратегий релизов (Canary, Blue-Green), жизненного цикла Kubernetes Pods, Helm, а также принципов работы PostgreSQL (connection pool, replication lag), Redis и Kafka.
- Знание процессов ITIL/ITSM (Event → Incident → Problem → Change Management).
- Умение принимать решения в условиях высокой неопределенности, эффективно управлять несколькими потоками работ (debug, escalation, communications, stakeholders, timeline), выстраивать коммуникацию с бизнесом и техническими командами, демонстрировать leadership without authority и придерживаться blameless mindset.
Будет преимуществом: - Опыт работы в telecom или крупных распределенных сервисах (e-commerce, cloud provider, CDN).
- Практический опыт проведения Game Days, chaos engineering и fault injection (Gremlin, Chaos Mesh, Litmus).
- Знакомство с требованиями РКН, 152-ФЗ, СОРМ.
- Опыт подготовки RCA или postmortem, повлиявших на архитектуру сервиса и повышение его надежности.
Что мы предлагаем:
- Реальная ответственность и влияние на надёжность сервисов миллионов абонентов
- Обучение: бюджеты на конференции, курсы, сертификации (CKA, AWS SAA, SRE Foundation)
- Современный стек: k8s, Terraform, GitOps, собственный observability platform
- Полис добровольного медицинского страхования, обслуживаемый в лучших клиниках, а также чек-ап для сотрудников 40+.
- Страхование жизни, страхование от несчастных случаев и критических заболеваний, страхование выезжающих за рубеж.
- Материальную помощь.
- Детские подарки.
- Доплату по листу нетрудоспособности
- Корпоративные скидки на товары и услуги от партнеров компании.
- Служебную сотовую связь.
- Кафетерий льгот — возможность самостоятельно выбрать дополнительные корпоративные льготы и бонусы (спорт, здоровье, обучение, путешествия, транспорт и др.). Доступно после испытательного срока.
- Удалёнка / гибрид / офис — на выбор.