MEDvidi — это платформа психиатрической помощи на базе ИИ, задающая новый стандарт безопасного, эффективного и масштабируемого психиатрического лечения в Соединённых Штатах.
Мы объединяем лицензированных специалистов с собственными инструментами ИИ, чтобы обеспечивать последовательное лечение, ориентированное на результаты, при таких состояниях, как СДВГ, тревожность, депрессия и другие. Технологии MEDvidi автоматизируют ведение медицинской документации, последующее наблюдение и планирование лечения, освобождая специалистов, чтобы они могли сосредоточиться на работе с пациентами, и одновременно повышая эффективность и качество клинической помощи.
В роли Staff DevOps Engineer вы будете определять, куда дальше пойдёт наша инфраструктура, и вести за собой всю инженерную команду. Это роль с практической работой в самом полном смысле: вы задаёте техническое направление, реализуете его своими руками и несёте ответственность за результаты в области надёжности, стоимости, безопасности и опыта разработчиков по всей компании. Вы будете напрямую сотрудничать с командами продуктовой разработки, встраиваясь в то, что они создают, устраняя инфраструктурные трения и формируя инфраструктуру вокруг реальных потребностей продукта.
Почему эта роль
- Реальная ответственность от начала до конца. Вы отвечаете за результаты, а не за задачи, включая свои метрики. Надёжность, стоимость, производительность, здоровье деплоев и скорость разработчиков — ваша зона ответственности: вы сами ставите цели и проактивно выносите цифры на обсуждение.
- Техническое лидерство без управленческой нагрузки. Лидируйте за счёт экспертизы и инициативы в среде, где самые старшие инженеры сами пишут код. Вы задаёте направление и поднимаете планку, оставаясь при этом практикующим инженером.
- ИИ — по умолчанию. Агентный ИИ — полноценная часть того, как мы работаем. Вы будете делегировать задачи автономным агентам, интегрировать их результаты в изменения на продакшене и помогать формировать то, как вся организация разрабатывает с помощью ИИ.
Обязанности
- Проактивно задавать и продвигать техническое видение и квартальный роадмап нашей инфраструктуры с понятными компромиссами и измеримыми целями.
- Эксплуатировать и развивать нашу инфраструктуру AWS + Kubernetes (EKS): управление кластерами, автомасштабирование (Karpenter), применение политик (Kyverno) и операции без простоев.
- Владеть Infrastructure as Code от начала до конца (Terraform, AWS CDK на TypeScript) и нашим GitLab CI/CD (переиспользуемые/общие шаблоны, OIDC, self-managed GitLab).
- Строить и развивать наблюдаемость, которой команды действительно пользуются (Prometheus, Grafana, OpenTelemetry, OpenSearch, CloudWatch; пайплайны логов, APM) — общая картина здоровья системы, а не дашборд, который никто не открывает.
- Поддерживать blue-green деплои и автоматический откат по проверкам здоровья быстрыми и предсказуемыми; отвечать за миграции схем PostgreSQL без простоев (expand/contract) и гейтинг миграций в CI.
- Владеть инженерией безопасности в среде HIPAA: гигиена секретов (ротация, короткоживущие учётные данные, сканирование утечек), обработка логов и данных с учётом PHI, а также Vault, управляемый как код.
- Напрямую сотрудничать с продуктовыми командами, чтобы устранять инфраструктурные трения и улучшать опыт разработчиков на уровне дизайна.
- Использовать агентный ИИ как ключевую часть своего рабочего процесса, интегрируя результаты автономных агентов в продакшен.
Требования
- 6+ лет в DevOps/инфраструктурной инженерии, с сильными системными основами и уверенным администрированием и устранением неполадок в Linux (анализ производительности, управление ресурсами, отладка процессов).
- Практический опыт с AWS (EC2, EKS, RDS, ElastiCache, Lambda, SQS, EventBridge, API Gateway, ALB, S3) и продакшен Kubernetes/EKS (управление кластерами, масштабирование нод, применение политик; Karpenter, Kyverno или аналоги).
- Сильный Infrastructure as Code (Terraform и AWS CDK на TypeScript) и владение CI/CD (GitLab CI/CD: переиспользуемые/общие шаблоны, OIDC id_tokens, self-managed GitLab).
- Мониторинг и наблюдаемость на практике (Prometheus, Grafana, OpenTelemetry, OpenSearch, CloudWatch; доставка логов и отслеживание ошибок/APM).
- Практическая инженерия безопасности (ротация секретов, короткоживущие учётные данные, сканирование утечек, логирование с учётом PHI) и HashiCorp Vault как код (KV, JWT/OIDC-аутентификация для CI, po