Middle SRE в команде сопровождения Интеграционных Платформ: Linux, Kafka, мониторинг, CI/CD и траблшутинг в финтехе
Фишка: Команда сопровождения Интеграционных Платформ Банка: в зоне ответственности промышленная и тестовые среды, логирование, мониторинг, траблшутинг и доставка приложений — типичный SRE-фокус в крупном финтехе с миллионами пользователей
| Этап | Длительность | Что проверяют |
|---|---|---|
| HR / первичный скрининг | 30–45 мин | Мотивация, опыт 3–5 лет, формат работы (удалённо/гибрид), зарплатные ожидания, готовность к on-call и работе с интеграционными платформами |
| Техническое интервью с командой | 60–90 мин | Глубокий разбор опыта с Kafka, Linux, ELK/Prometheus/Zabbix/Grafana, Jenkins, Ansible; теория контейнеризации и Kubernetes; сценарии траблшутинга и доставки приложений по средам |
| Практика / кейс | 45–60 мин | Разбор реального инцидента, проектирование мониторинга или CI/CD-пайплайна, иногда — архитектурный кейс по высокой доступности |
| Финальная встреча с лидом / тимлидом | 30–45 мин | Софт-скиллы, fit в команду сопровождения, ожидания по росту, обсуждение условий и KPI-премии |
Обязательный минимум
Плюсом будет
Расскажи про свой опыт работы с Linux
Структура: дистрибутивы, администрирование серверов, hardening, пакеты, systemd, типичные задачи (деплой, мониторинг, траблшутинг). Акцент на prod-опыте.
Что такое cgroups в Linux
Control Groups — механизм ограничения ресурсов (CPU, memory, IO) для процессов. Основа контейнеризации вместе с namespaces.
Что такое Load Average в Linux
Среднее число runnable и uninterruptible процессов за 1/5/15 мин. Высокий LA при низком CPU — часто IO wait или блокировки.
В чем разница между потоком и процессом
Процесс — изолированное адресное пространство; поток — легковесная единица выполнения внутри процесса, разделяет память.
Что такое inode
Структура метаданных файла (права, размер, указатели на блоки). Лимит inode — частая причина «диск не полон, но не могу создать файл».
Как найти информацию о процессе в Linux
ps, top/htop, /proc/PID/, lsof, strace, pmap. Для IO — iotop, iostat; для сети — ss, netstat, tcpdump.
Совет: На собесе в Альфа-Банк часто просят рассказать про конкретный кейс траблшутинга на Linux — подготовь 2–3 истории с метриками до/после.
Ловушка: Load Average ≠ CPU utilization. Не путай LA с процентом использования CPU.
Расскажи про опыт работы с Kafka
Топики, партиции, репликация (ISR), consumer groups, offset, at-least-once/exactly-once. Укажи кейсы: тюнинг, отказоустойчивость, мониторинг lag.
Как обеспечить отказоустойчивость Kafka-кластера
replication.factor ≥ 3, min.insync.replicas=2, acks=all, распределение брокеров по rack/DC, мониторинг under-replicated partitions и consumer lag.
Что происходит при падении брокера Kafka
Leader election для затронутых партиций; ISR определяет нового leader; producers/consumers переподключаются. При недостатке реплик — недоступность партиций.
Как диагностировать рост consumer lag
Проверить скорость consumer, число партиций vs consumer instances, rebalance, GC pauses, broker latency, размер сообщений, backpressure.
Фишка: Kafka — ключевое требование вакансии. Без конкретного опыта с Kafka отклик, скорее всего, не пройдёт HR-фильтр.
Ловушка: Не говори только про «отправлял сообщения». Покажи понимание эксплуатации: retention, compaction, rebalance, ISR, мониторинг.
Для чего нужен Elasticsearch
Поисковая и аналитическая СУБД для логов и метрик. В ELK — хранение и индексация логов, full-text search, агрегации в Kibana.
Как настроить алертинг в Prometheus
Prometheus rules (recording/alerting) → Alertmanager → routing (severity, team), inhibition, silences. Алерт на симптом, не на причину.
Разница между Prometheus и Zabbix
Prometheus — pull-модель, time-series, PromQL, cloud-native. Zabbix — agent/trap, шаблоны, классический enterprise-мониторинг. В банках часто coexist.
Был ли доступ к логам у разработчиков на последнем проекте
Покажи понимание RBAC в логах: self-service через Kibana/Grafana Loki, разделение prod/non-prod, маскирование PII в финтехе.
Какие метрики важны для интеграционной платформы
Latency p50/p95/p99, throughput, error rate, queue depth, broker lag, JVM heap/GC, connection pool, circuit breaker state, SLA compliance.
Совет: Стек вакансии: ELK + Prometheus + Zabbix + Grafana. Подготовь пример дашборда и алерта, который вы настраивали.
Ловушка: Не перечисляй инструменты без контекста. Объясни: что мониторите, какой threshold, какой runbook при алерте.
Что такое Ansible
Agentless automation: inventory, playbooks, modules, YAML. Push-модель через SSH. Идемпотентность — ключевое свойство.
В чем разница между Roles и Playbooks в Ansible
Playbook — сценарий выполнения задач; Role — структурированный набор tasks/handlers/templates/vars для переиспользования.
Писал ли роли для Ansible
Опиши структуру role (tasks, handlers, templates, defaults), тестирование (molecule), версионирование.
Что такое идемпотентность
Повторный запуск даёт тот же результат. Критично для Ansible, Terraform, CI/CD — безопасные ретраи.
Есть ли опыт работы с Jenkins
Pipelines (declarative/scripted), stages, agents, credentials, blue-green/canary deploy, promotion между средами.
Что такое GitFlow
Модель ветвления: main, develop, feature, release, hotfix. В банках часто адаптированный GitFlow с approval gates для prod.
Что такое факты в Ansible
Автоматически собираемые данные о хосте (ansible_facts). Используются в шаблонах и conditions. setup module.
Фишка: Вакансия явно указывает Jenkins и Ansible — подготовь пример пайплайна доставки приложения из test в prod.
Ловушка: Не путай CI (build/test) и CD (deploy). В SRE-роли важно понимать promotion, rollback и approval для prod.
Расскажи про свой опыт работы с Docker
Image/layer, Dockerfile best practices (multi-stage, non-root), registry, networking, volumes, resource limits.
В чем разница между CMD и ENTRYPOINT в Docker
ENTRYPOINT — основная команда контейнера; CMD — дефолтные аргументы. При docker run аргументы заменяют CMD, но дополняют ENTRYPOINT.
В чем разница между контейнеризацией и виртуализацией
VM — полная изоляция через гипервизор, свой kernel. Контейнер — shared kernel, namespaces + cgroups, быстрее и легче.
В чем разница между pod и контейнером
Pod — минимальная deployable unit в K8s, может содержать несколько контейнеров с shared network/IPC/volumes.
Что такое сервис в Kubernetes
Абстракция для стабильного endpoint: ClusterIP, NodePort, LoadBalancer. kube-proxy или CNI обеспечивает маршрутизацию к pod.
Чем отличаются Deployment и ReplicaSet
ReplicaSet поддерживает число реплик; Deployment добавляет rolling update, rollback, revision history.
Какие основные компоненты есть в Kubernetes
Control plane: API server, etcd, scheduler, controller manager. Worker: kubelet, kube-proxy, container runtime.
Что такое etcd в Kubernetes
Distributed key-value store — source of truth для всего состояния кластера. Критичен для HA — обычно 3/5 нод.
Какой опыт с ограничением ресурсов в Kubernetes
requests/limits для CPU/memory, LimitRange, ResourceQuota, HPA/VPA, QoS classes (Guaranteed/Burstable/BestEffort).
Знакомы ли вы с Kubernetes и контейнеризацией?
Покажи практику: деплой, scaling, troubleshooting (kubectl describe/logs/events), networking, storage, RBAC.
Совет: Helm и Terraform — nice-to-have в Альфа-Банк. Если есть опыт — упомяни, но не подменяй must-have стек.
Ловушка: При вопросе про ресурсы не забудь: requests влияют на scheduling, limits — на OOMKill/throttling.
Как действовать при падении интеграционной платформы в prod
Assess impact → communicate → mitigate (rollback/scale/failover) → root cause → postmortem. USE/RED методология.
Что такое SLO и error budget
SLO — целевой уровень надёжности (напр. 99.9% uptime). Error budget = допустимый объём ошибок; при исчерпании — freeze на фичи, фокус на stability.
Как организовать on-call
Ротация, escalation policy, runbooks, alert fatigue management, blameless postmortems, MTTR/MTTD метрики.
Твои действия, если приложение потребляет слишком много ОЗУ
top/htop, /proc, heap dump, limits в K8s, leak vs legitimate growth, restart policy, profiling (py-spy, jmap).
В чем разница между HTTP и HTTPS
HTTPS = HTTP + TLS: шифрование, аутентификация сервера (сертификаты), integrity. В банке — обязательно для всех внешних API.
Фишка: Роль SRE в Альфа-Банк — сопровождение, не разработка. Покажи мышление reliability engineer: метрики, автоматизация toil, incident management.
Совет: Подготовь STAR-историю про инцидент: что сломалось, как диагностировали, как починили, что улучшили после.
Диагностика высокого consumer lag в Kafka
Интеграционная платформа банка использует Kafka для обмена сообщениями между системами. В 14:00 Grafana показывает рост consumer lag на топике payments-events с 1000 до 500000 за 30 минут. Error rate сервиса-потребителя растёт, клиенты жалуются на задержки платежей. Опишите пошаговый план диагностики и действий.
1) Проверить dashboard: lag по partition, consumer group members, rebalance events. 2) Consumer: CPU/memory/GC, thread count, processing time per message, exceptions в логах. 3) Broker: disk IO, network, under-replicated partitions, leader election. 4) Сообщения: рост размера payload, poison messages. 5) Mitigation: scale consumers (если partition > consumers), pause/replay, skip bad offset, temporary rate limit upstream. 6) Post-incident: auto-scaling consumers, lag alerts, DLQ для poison messages.
Сложность: O(n) по числу partition для анализа lag
Проектирование мониторинга для интеграционной платформы
Вы SRE в команде сопровождения Интеграционных Платформ. Нужно спроектировать систему мониторинга: Prometheus + Grafana + Zabbix + ELK уже есть в стеке. Какие метрики, алерты и дашборды вы создадите? Как разделите ответственность между инструментами?
Метрики (Prometheus): RED для API (rate, errors, duration), Kafka (lag, throughput, ISR), JVM (heap, GC), infra (CPU, memory, disk). Алерты: lag > threshold, error rate > 1%, p99 latency, disk < 15%, under-replicated partitions. Zabbix: legacy infra, network devices, OS-level checks. ELK: centralized logs, correlation IDs для трейсинга запросов через платформу. Grafana: unified dashboards per service + golden signals. Runbooks для каждого алерта. SLO dashboard с error budget.
Сложность: Архитектурный кейс
Подробная архитектура инфраструктуры сервиса — аналога Dropbox
Некоторая компания разрабатывает альтернативу DropBox. 10 микросервисов, PostgreSQL, S3-compatible storage, message queue. docker-compose для локальной разработки. Требования: SLA 99.99%, high/peak load tolerance, low latency globally, security, cost efficiency, DR при отказе DC. Как DevOps/SRE: спроектируйте prod и staging, подход к IaC, мониторинг и performance.
Prod: multi-region K8s, CDN для файлов, S3 с cross-region replication, PostgreSQL HA (Patroni/async replica), message queue cluster (Kafka), API gateway, WAF. Staging: scaled-down (1 region, fewer replicas), shared DB с snapshot restore, same topology. IaC: Terraform + Ansible/Helm, GitOps. Monitoring: Prometheus/Grafana, ELK, synthetic probes, SLO tracking. Performance: load testing (k6), profiling, autoscaling HPA, caching layer. DR: RPO/RTO targets, backup automation, failover runbooks.
Сложность: Архитектурный кейс
Каркас ответа
3 дня
7 дней
14 дней
| Блок | Готов, если... |
|---|---|
| Kafka | можешь объяснить ISR, consumer lag диагностику и план действий при падении брокера |
| Linux | можешь диагностировать high load, OOM, disk full и описать инструменты (/proc, ss, iostat) |
| Мониторинг | можешь спроектировать дашборд и алерт для интеграционного сервиса с RED-метриками |
| ELK | можешь описать pipeline сбора логов и поиск по correlation ID |
| Jenkins/Ansible | можешь нарисовать pipeline доставки app из test в prod с rollback |
| Kubernetes/Docker | можешь объяснить pod vs container, deployment vs replicaset, requests/limits |
| SRE | можешь рассказать STAR-историю инцидента с MTTR и postmortem |
| Behavioral | готов чётко ответить «расскажи о себе» за 2 минуты с фокусом на SRE-опыт |
В день собеседования