MiniMax 发布全模态生成模型 H3,官方承诺数日内开源权重。这是继上月文本模型 M3 之后,MiniMax 在视频生成方向的新动作。
H3 支持文本、图像、视频、声音任意组合作为输入,官方称之为多模态上下文。输出为带原生双声道音频的视频,最高支持 15 秒 2K 分辨率。例如,可输入一段参考视频提取其运镜风格,再配合其他模态内容生成新视频。
模型能力细节
H3 接受文本、图像、视频、声音任意组合作为输入,输出带原生双声道音频的视频,最高 15 秒 2K 分辨率。
典型用法:输入参考视频提取运镜风格,再叠加其他模态内容生成新视频。
对视频生成开发者和内容创作者而言,H3 将多模态输入与视频输出打通,并计划开源权重,意味着可本地部署和二次开发的门槛进一步降低。
#GitHub #开源 #MiniMax #H3 #视频生成 #多模态 #AI模型
@GitHubTrendingHub