ТехВилл – IT-компания и партнёр ВкусВилл по развитию цифровых решений.
Мы отвечаем за разработку мобильных и web- приложений, автоматизацию бизнес-процессов, искусственный интеллект, devops, инфобез ВкусВилла.
Нашими решениями пользуется свыше 1 000 000 клиентов и сотрудников ВкусВилла.
Мы строим кластер, где GPU - основной ресурс, и SRE должен уметь его эксплуатировать так же хорошо, как и агентскую часть.
Обязанности:
- практический опыт эксплуатации LLM-агентов: фреймворки, оркестрация многошаговых пайплайнов (LangGraph, LangChain или аналоги), жизненный цикл агентного запроса: planning → tool calling → validation
- опыт с Model Context Protocol: MCP-серверы и шлюзы, регистрация/проксирование инструментов, маршрутизация tool-calling между сервисами
- понимание tool/function calling, оркестрации инструментов (tool bus), RBAC на инструменты
- управление промптами: версионирование, A/B, выкатка без релиза сервиса
- RAG / семантический поиск как часть агентного пайплайна (recall → rerank → генерация)
- оценка качества агентов: eval-пайплайны, LLM-as-judge, Ragas — на уровне эксплуатации
- надёжность агентных систем: недетерминизм ответов, «тяжёлый хвост» latency, стоимость токенов, guardrails, graceful degradatio
- трассировка LLM/агентных вызовов (Langfuse или аналоги: LangSmith): развёртывание, отдельная БД, сэмплирование трейсов, сквозной trace-id между сервисами
- распределённая трассировка на базе OpenTelemetry (OTLP), корреляция логов и трейсов
- метрики и алерты по токенам и стоимости инференса (Prometheus), контроль бюджетов и лимитов
- асинхронные Python 3.13 сервисы (FastAPI/Uvicorn/Gunicorn): multiprocess-метрики Prometheus, graceful shutdown, liveness/readiness/deep-health
- пакетный менеджер uv, сборка с приватными зависимостями (внутренний GitLab, Nexus PyPI proxy)
- паттерны устойчивости: circuit breaker (pybreaker), retry (tenacity), rate limiting, семафоры на конкуррентность
- Kafka + Avro + Schema Registry, потребление CDC-топиков (синхронизация каталога/PIM), паттерны DLQ
- очереди задач на Celery + Flower с брокером Redis
- Redis в режимах Cluster и Sentinel (кэш, rate-limit, чекпойнты), не только standalone
Требования:
- понимание/опыт развёртывания и эксплуатации LLM‑моделей на GPU (Triton Inference Server, vLLM, TensorRT‑LLM или аналоги)
- знание GPU‑мониторинга: DCGM, Prometheus, метрики по использованию памяти, ядер, температуры, NVLink
- опыт профилирования инференса: оптимизация latency (TTFT, TPS), throughput, работа с KV‑cache.
- управление ресурсами GPU в K8s: HAMi, MIG, time‑slicing, квотирование
понимание работы с NVDEC/NVENC.
Условия:
Будьте осторожны: если работодатель просит войти через Google, iCloud или Госуслуги, прислать код или пароль, запустить ПО или перевести деньги — это мошенники.