Мы развиваем внутреннюю корпоративную платформу для запуска open-weight LLM и агентных решений на собственной GPU-инфраструктуре.
Ищем опытного инженера, готового работать на стыке эксплуатации LLM, распределённых систем, платформенной архитектуры и быстро развивающихся агентных технологий.
Мы не ожидаем, что один человек будет одинаково глубоко разбираться во всех перечисленных областях. Важно иметь сильную экспертизу как минимум в двух-трёх направлениях и быть готовым погружаться в смежные задачи.
Чем предстоит заниматься:
- Следить за развитием open-weight LLM, систем инференса, coding agents и связанной инфраструктуры.
- Находить перспективные модели и технологии, оценивать их зрелость и принимать решение о целесообразности тестирования и внедрения.
- Проводить тестирование и сравнительную оценку моделей на GPU-серверах.
- Сравнивать модели по качеству, скорости генерации, задержкам, пропускной способности, поддерживаемой конкурентной нагрузке, потреблению памяти, сложности эксплуатации и стоимости инференса.
- Переводить успешные прототипы и эксперименты в надёжные промышленные решения.
- Повышать производительность, отказоустойчивость, наблюдаемость и эксплуатационную надёжность платформы инференса.
- Проектировать компоненты внутренней AI-платформы, в том числе собственный LLM-роутер, механизмы управления нагрузкой, приоритизации, квотирования, кэширования, отказоустойчивости и выбора моделей.
- Прототипировать агентов, MCP-серверы, скиллов, интеграции с агентными фреймворками, системы оценки качества и другие компоненты AI-платформы.
- Разрабатывать архитектурные и организационные подходы к корпоративному использованию MCP-серверов, скиллов, моделей, харнессов и других расширений платформы.
- Формировать инженерные стандарты в области безопасности, разграничения прав, версионирования, тестирования, публикации, аудита, сопровождения и жизненного цикла компонентов AI-платформы.
- Взаимодействовать с внутренними пользователями и инженерными командами, превращая неформализованные потребности в работающие платформенные решения.
- Использовать кодовых агентов и другие инструменты AI-assisted development для ускорения разработки, тестирования, исследований и подготовки документации, сохраняя полную ответственность за качество результата.
Основные требования:
- Сильная инженерная база и опыт проектирования промышленных программных систем.
- Опыт работы с LLM, ML-инфраструктурой, распределёнными системами, высокопроизводительными вычислениями или близкими по сложности технологическими областями.
- Понимание основных компромиссов при инференсе LLM: latency, throughput, batching, concurrency, длина контекста, потребление памяти, квантизация, параллелизм и управление KV-кэшем.
- Опыт эксплуатации сервисов под Linux с использованием контейнеров, систем мониторинга и современных практик развёртывания.
- Понимание принципов построения распределённых систем: маршрутизации, балансировки нагрузки, backpressure, admission control, повторных запросов, тайм-аутов, отказоустойчивости, планирования ресурсов и graceful degradation.
- Умение проектировать понятные API, границы сервисов, потоки данных и эксплуатационные интерфейсы.
- Уверенное владение как минимум одним универсальным языком программирования. Опыт работы с Python будет преимуществом, но мы не привязаны к конкретному технологическому стеку.
- Умение диагностировать проблемы производительности и надёжности на уровне приложения, инфраструктуры, операционной системы, сети и GPU.
- Опыт разработки сопровождаемых систем с автоматизированным тестированием, code review, документацией, мониторингом и контролируемым процессом выпуска изменений.
- Самостоятельность, умение работать с неопределёнными требованиями, находить недостающую информацию и принимать прагматичные инженерные решения.
- Практический опыт использования coding agents или других инструментов разработки с применением LLM: декомпозиция задач, подготовка контекста, проверка сгенерированного кода, тестирование, отладка и валидация результата.
Будет преимуществом:
- Опыт промышленного запуска open-weight LLM с использованием SGLang, vLLM, TensorRT-LLM, TGI или аналогичных решений.
- Опыт эксплуатации крупных dense- или mixture-of-experts-моделей на многопроцессорных GPU-системах.
- Понимание tensor, pipeline, data, expert или sequence parallelism.
- Опыт работы с квантизацией моделей, speculative decoding, prefix caching, многоуровневым KV-кэшем, disaggregated inference или другими технологиями оптимизации инференса.
- Опыт проектирования или эксплуатации OpenAI-совместимых API.
- Опыт работы с tool calling, structured output, reasoning-моделями, потоковой генерацией и продолжительными агентными сценариями.
- Опыт разработки систем маршрутизации между моделями, cache-aware routing, динамического выбора модели, управления квотами, приоритетами и многопользовательской нагрузкой.
- Опыт оценки coding-моделей, coding agents, систем использования инструментов или многошаговых агентных сценариев.
- Опыт разработки агентов, агентных рантаймов, MCP-клиентов или серверов, портируемых скиллов, workflow-движков или интеграций с агентными фреймворками.
- Опыт обеспечения безопасности агентных систем: управление учётными данными, права на вызов инструментов, sandboxing, изоляция данных, approval flows, аудит и контроль цепочки поставки.
- Опыт внедрения решений в крупных корпоративных или изолированных средах с повышенными требованиями к безопасности, соответствию внутренним регламентам, идентификации пользователей и сетевому доступу.
- Опыт работы с Kubernetes, Docker Compose, Docker Swarm, Prometheus, Grafana, OpenTelemetry или аналогичными технологиями.
- Участие в профильных open-source-проектах, публикация технических материалов, создание публичных бенчмарков или значительный опыт разработки внутренних платформенных решений.
Что для нас важно:
- Инженерное мышление и отсутствие привязки к конкретному фреймворку, вендору или технологическому стеку.
- Принятие технических решений на основании измерений и проверяемых данных.
- Интерес к новым технологиям в сочетании со здоровым скептицизмом.
- Готовность быстро создавать прототипы и затем качественно переводить успешные решения в промышленную эксплуатацию.
- Понимание, что полноценная AI-платформа — это не только запуск моделей, но и API, маршрутизация, безопасность, управление доступом, governance, developer experience, оценка качества, мониторинг и эксплуатация.
- Готовность переключаться между исследованиями, архитектурой, разработкой, оптимизацией производительности и решением производственных проблем.
- Умение работать в команде, делиться знаниями и участвовать в формировании общих инженерных практик.
Что мы предлагаем:
- Сплоченную команду профессионалов, в которой можно не только успешно реализовывать проекты, но и перенимать опыт и развиваться.
- Обучение, участие в интересных проектах и расширение профессиональной экспертизы: мы участвуем в конференциях, митапах, публикуемся на Хабр и т.д.
- Конструктивную и открытую рабочую атмосферу.
- Полис добровольного медицинского страхования, обслуживаемый в лучших клиниках, а также чек-ап для сотрудников 40+.
- Страхование жизни, страхование от несчастных случаев и критических заболеваний, страхование выезжающих за рубеж.
- Материальную помощь.
- Детские подарки.
- Доплату по листу нетрудоспособности.
- Корпоративные скидки на товары и услуги от партнеров компании.
- Служебную сотовую связь.
- Кафетерий льгот — возможность самостоятельно выбрать дополнительные корпоративные льготы и бонусы (спорт, здоровье, обучение, путешествия, транспорт и др.). Доступно после испытательного срока.
- Формат работы удалённый на территории РФ. Работа по московскому часовому поясу.