字节发布 SeedRealtime 音视频全双工大模型
字节跳动 Seed 宣布正式推出原生音视频全双工大模型 SeedRealtime。该模型采用统一架构,原生融合音频、视频与文本,可在连续的多模态信息流上实时交互,实现“边看、边听、边说”的体验。目前 SeedRealtime 已在豆包 App 全量上线。
官方称其实现三项核心突破:音视频联合理解,原生支持声音、画面与时序信息的协同处理;全双工实时交互,支持低延迟的流式对话;统一架构设计,以单一模型同时处理多模态输入输出。
对开发者而言,这意味着多模态实时交互能力从实验走向可用,可直接在豆包生态中体验,也为后续开放 API 或开源预留了想象空间。
GitHub
#GitHub #开源 #字节跳动 #SeedRealtime #多模态大模型 #音视频交互 #豆包
@GitHubTrendingHub
Post #656
17