Голосовой агент — это не просто чат-бот + TTS. Это эволюция от текстового бота через полудуплекс к full-duplex, где на каждом уровне появляются свои проблемы. Пройдем этот путь на реальном production-стеке (Rust, ~1600 строк).
Как построить голосового AI-агента, экономящего время пользователя, рассказывает Виктор Загускин — руководитель центра компетенций голосового ИИ в MWS.AI.
В программе:
→ Голос, файловое распознавание: offline ASR, 3-7с roundtrip, SSML для склонений, LLM-нормализация услуг
→ Стриминг, полудуплекс: streaming ASR, VAD, гибридное EPD, порог тишины
→ Полный дуплекс: AEC (WebRTC AEC3), barge-in, tool calls в асинхронном потоке, pipeline parallelism
→ Метрики: покомпонентная latency, эволюция метрик, бенчмарки (Full-Duplex-Bench v1.5, EVA-Bench)
→ Native Audio LLM: speech-native модели, DuplexSLA, Moshi, MiniMind-O
🎥 Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Post #83
477