Qwen3.8-Omni-Flash-Realtime 上架,Live Harness 1.0 发布
阿里云官方上架表将 qwen3.8-omni-flash-realtime 列为 9 月 21 日的新模型服务。它与 9 月 17 日已上架、接收多模态输入但只输出文字的普通 Omni-Flash API 不同:实时版可连续接收音频和视频帧,同时输出文字与语音,支持 WebSocket、WebRTC 和 AOQ 接入。模型还支持工具调用、远程 MCP、视频聚合以及单、双、四声道输入,面向实时对话和持续感知场景。
Qwen 同日发布配套的 Qwen-Live-Harness 1.0 正式版。开源客户端由本地 daemon 与 macOS Host 组成,可使用麦克风、屏幕或摄像头上下文进行实时交互,也支持后台智能体委托、主动监测和本地记忆。项目提供 Apple Silicon 与 Intel 的 DMG、ZIP 安装包和 npm 1.0.0 包;源码采用 Apache-2.0 许可,云端模型调用仍需要 DashScope API key。
官方给出 6 秒音频输入的服务延迟样例:首个文字 token 为 591.26 毫秒,首个音频包为 978.36 毫秒。实时模型在北京的音频输入、输出价格分别为每百万 token 0.848 和 1.696 美元;新加坡为 0.93 和 1.87 美元,且有面向当地服务的 90 天、100 万 token 免费额度。新加坡公开限额为每分钟 60 次请求、200 万 token。
模型规格与价格:https://www.alibabacloud.com/help/en/model-studio/qwen3-8-omni-flash-realtime
Harness 正式版:https://github.com/QwenLM/Qwen-Live-Harness/releases/tag/qwen-live-harness-host-v1.0.0
Post #7720
742