Higgsfield AI — самая быстрорастущая компания в истории генеративного ИИ, достигшая $500 млн годового дохода, более 25 млн пользователей по всему миру, более 6 млн генераций в день и обслуживающая 390 брендов из списка Fortune 500.
Мы работаем на самом переднем крае создания видео с помощью ИИ и инструментов следующего поколения для творчества. Присоединение к Higgsfield означает стать частью команды с высоким влиянием, формирующей будущее ИИ-нативных опытов, в компании, которая не просто движется быстро, а переписывает понятие скорости.
О роли
Вы будете отвечать за GPU-платформу, лежащую в основе наших продуктов генеративного видео/изображений — как за кластер инференса, обслуживающий производственный трафик, так и за тренировочные кластеры, где создаются наши модели. Инфраструктура охватывает нескольких провайдеров, оркеструемых с помощью Kubernetes на Talos Linux, управляемом Sidero Omni. Цель по загрузке флота — >95% использования GPU; каждый простой час GPU — это сожжённые деньги. Вы будете тем человеком, кто поддерживает тренировки быстрыми, а инференс — дешёвым и рутинным.
Что вы будете делать
Оптимизировать тренировочные кластеры: распределённое обучение в масштабе — настройка NCCL, здоровье fabric InfiniBand/RoCE, планирование с учётом топологии и групповое размещение, пропускная способность GPU/сети, быстрое создание контрольных точек, прерывание и восстановление заданий. Делать так, чтобы каждая тренировка использовала оплаченный за неё железо.
Отвечать за жизненный цикл кластера Talos / Sidero Omni по всему GPU-флоту: загрузка и обновления узлов, драйверы GPU / NVIDIA GPU Operator / DCGM на неизменяемой ОС, развертывания без простоя.
Управлять мультипровайдерским GPU-флотом: планирование ёмкости по регионам Nebius и пулам bare-metal RTX Pro, эскалация аппаратных инцидентов провайдерам, жизненный цикл узлов (триаж NotReady, ошибки XID, обновления драйверов).
Отвечать за автоскейлинг инференса: масштабирование GPU-потребителей на основе KEDA и очередей Kafka; планирование с учётом GPU; тёплые пулы и снижение холодного старта; настройка спроса и предложения нашего внутреннего автоскейлера (higgscaler).
GitOps для всего: ArgoCD мультикластер (10+ кластеров из одного репозитория), Helm, Terraform (HCP). Ни одного вручную настроенного узла, никакого дрейфа в консоли — если этого нет в git, этого не существует.
Наблюдаемость и SLO: VictoriaMetrics/логи/трейсы, Prometheus, DCGM экспортеры; честные дашборды по загрузке, пропускной способности тренировок, задержкам в очереди, стоимости за генерацию.
Эффективность GPU как дисциплина: поиск простаивающих выделений, несоответствий ёмкости и спроса, голодающих очередей — наша платформа AIOps (Mycelium) автоматически фиксирует эти проблемы; вы замыкаете цикл реальными исправлениями.
Сотрудничать с ML-инженерами по тренировочным запускам и развертываниям моделей (время выполнения, батчинг, размер памяти) и с основной командой по AWS EKS (Karpenter, Istio, Bottlerocket, песочницы gVisor).
Наш стек
Talos Linux + Sidero Omni, EKS · Nebius, BoostRun, AWS · NVIDIA GPU Operator, DCGM, CUDA, NCCL, InfiniBand/RoCE · ArgoCD, Helm, Terraform Cloud · KEDA, Karpenter, Kafka · VictoriaMetrics/логи/трейсы, Prometheus, Grafana · Istio, Cloudflare · Python/Go.
У вас есть
3+ года опыта эксплуатации Kubernetes в продакшене как SRE/Platform/MLOps, включая GPU-нагрузки.
Практический опыт работы с распределённым обучением: NCCL, высокоскоростные межсоединения (InfiniBand/RoCE), планирование многозвенных заданий, стратегии создания контрольных точек — и привычка измерять пропускную способность до и после каждого изменения.
Опыт работы с bare-metal Kubernetes: Talos или аналогичные неизменяемые ОС; жизненный цикл узлов без облачной страховки.
Знание стека NVIDIA: драйверы, контейнерный тулкит, GPU Operator, метрики DCGM; вы умеете отлаживать проблему «GPU виден, но не доступен» в 3 часа ночи.
Свободное владение GitOps (ArgoCD/Flux + Helm) и Terraform; сильные навыки Linux и сетей (мультикластер, топологии VPN/TGW).
Опыт автоскейлинга на основе очередей (KEDA/HPA) и достаточное понимание Kafka для анализа отставания потребителей.
Python или Go для автоматизации; вы документируете процессы.
Будет плюсом
Программирование на C++ и CUDA: кастомные ядра, настройка памяти/загрузки, профилирование с Nsight Systems/Compute.
Опыт работы с Sidero Omni в продакшене; мультипровайдерские GPU-облака (Nebius, CoreWeave, Lambda).
Рантаймы инференса (Triton, vLLM, TensorRT) и экономика батчинга.
FinOps для GPU-флотов: стоимость за генерацию, планирование обязательств.
Опыт создания внутренних платформ или инструментов AIOps.
Успех через 6 месяцев
Пропускная способность тренировок заметно выросла (токены/шаги на GPU-час), восстановление после сбоев занимает минуты, а не часы.
Загрузка флота стабильно >95%; количество простаивающих выделений стремится к нулю.
Среднее время восстановления GPU-узла сокращено вдвое; каждое изменение ёмкости отслеживается через git.
Новая GPU-ёмкость — от провайдера до обслуживания трафика — вводится за считанные дни, полностью через GitOps.
Конкурентоспособную базовую зарплату в USD
Акции: участие в программе опционов компании, дающей возможность разделить долгосрочный рост компании.
Работу в офисе в Алматы (мы обеспечим переезд из любой точки).
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.