Добрый день!
Мы — Sasha AI, пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов.
Мы выросли в 5 раз за год, а наша цель на 2026-й — оборот 400 млн ₽.
Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу.
Наша большая цель — за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России.
Каждый звонок проходит через речевой пайплайн: распознавание речи, определение автоответчика, синтез голоса. От качества и скорости этих моделей зависит, будет ли разговор звучать естественно. В эту команду мы ищем junior ML-инженера.
Чем предстоит заниматься
- ASR: дообучать и оценивать модели распознавания русской речи на телефонном аудио (8 кГц, шумы, перебивания). Считать WER/CER и разбирать ошибки.
- TTS: улучшать естественность и скорость синтеза, работать с голосами, ударениями и нормализацией текста (числа, адреса, телефоны).
- AMD (Answering Machine Detection): отличать живого человека от автоответчика, голосовой почты и IVR за первые секунды звонка.
- VAD и turn-taking: определять конец реплики и перебивания, чтобы агент не молчал и не говорил поверх собеседника.
- Собирать и размечать датасеты из реальных звонков, строить пайплайны предобработки аудио.
- Оптимизировать инференс (latency, стриминг, ONNX/TensorRT, квантизация) вместе с backend-командой.
- Ставить эксперименты, сравнивать open-source модели и честно докладывать результаты.
Что мы ждём
- Уверенный Python и опыт с PyTorch.
- Понимание основ ML/DL: функции потерь, переобучение, метрики, валидация.
- Базовые знания цифровой обработки звука: частота дискретизации, спектрограммы, mel, MFCC.
- Опыт хотя бы с одной речевой моделью или фреймворком: Whisper, GigaAM, NeMo, ESPnet, wav2vec2, Vosk, VITS, XTTS, Silero или похожие. Подойдут и пет-проекты, курсовые, Kaggle.
- Умение работать с Linux, git и GPU-окружением.
Будет плюсом
- Опыт стримингового ASR или TTS с низкой задержкой.
- Знакомство с телефонией: SIP, кодеки G.711/Opus, особенности 8 кГц аудио.
- Опыт классификации аудио: AMD, VAD, speaker/emotion recognition.
- Опыт с ONNX Runtime, TensorRT, Triton, vLLM.
- Понимание LLM-агентов и того, как ASR → LLM → TTS складывается в диалоговую систему.
- Публичные проекты на GitHub, статьи, хорошие места в соревнованиях.
Что мы предлагаем
- Реальные задачи в продакшене: ваши модели будут работать в тысячах живых звонков, а эффект будет виден в метриках.
- Доступ к GPU и реальным данным для обучения.
- Небольшая команда без лишней бюрократии: идеи быстро доходят до продакшена.