围绕真实生产流程整理的实用价值。
优势
01
一个上下文,而非四条管线
文本、图像、视频、音频作为同一个上下文输入,因此可以直接说「参考这段视频的运镜,让这张图里的人唱歌,声音对上这段音频」,模型将其理解为一条指令,而不是分发给多个专家模型。
优势
02
声音与画面一同生成
音频与视频联合生成,输出为原生立体声,对白、音效和环境声天然与画面对齐,无需事后叠加。
优势
03
更低的 2K 每秒成本
2K 是默认档位而非加价档。MiniMax 称 H3 在 2K 下的每秒价格不到主流模型的三分之一,在 768p 下不到主流 720p 的一半——这直接改变了批量迭代的成本结构。
从原始素材到可复用结果,只需三个步骤。
步骤 1
组装上下文
把手头的参考素材放进来:一段视频定运镜、一张图片定主体、一段音频定声音。
步骤 2
描述它们的关系
用自然语言说明这些参考与目标视频的关系,跨模态的理解交给 H3 自己完成。
步骤 3
生成并迭代
生成最长 15 秒、2K、带立体声的结果,然后反复迭代——正是每秒成本让多轮尝试变得可行。