德国人工智能初创公司黑森林实验室(Black Forest Labs)正式推出多模态基础模型 Flux3。该模型基于 Self-Flow 架构,配备图像、视频、音频及动作编解码器,实现对物理与数字环境的统一理解与生成。
作为首款支持原生音频生成的模型,Flux3 可一次性输出长达 20 秒的音视频同步片段,涵盖文本/图像/视频转视频、视频补帧、超分辨率及内容修复等功能。官方宣称其在多项基准测试中超越同类开源模型,同时保持较好的推理效率。
模型目前已在 GitHub 开源,提供多种预训练权重,社区可基于其进行二次训练与部署。黑森林实验室表示后续将发布更大参数版本与专用 LoRA 微调工具。
Flux3 的发布标志着多模态模型在原生音频生成和统一理解方向上迈出关键一步,降低了音视频内容生成的准入门槛。
#GitHub #开源 #Flux3 #黑森林实验室 #BlackForestLabs #多模态模型 #SelfFlow #AI生成 #音视频 #OSCHINA
@GitHubTrendingHub