MiniMax 在 2026 年 7 月 31 日以 API 产品的形式发布 H3,三天后把权重传上了 Hugging Face。这是一个 33B 参数、原生出音频的系统,目前 SGLang、vLLM、diffusers 和 ComfyUI 都能跑。
但"开源权重"这四个字承担得有点多。H3 是一个三模块系统,真正开源的只有中间那一块。下面讲清楚三件事:哪些能在你自己的机器上跑,哪些仍然要调 MiniMax 的服务器,以及那条决定你到底能不能用的许可条款。
H3 是一个全模态生成系统:文本、图像、视频、音频作为一整段多模态上下文输入,输出带原生立体声的视频——视频与音频的 latent 由同一个 transformer 联合预测,而不是生成完再配上去。
| 参数 | 规格 |
|---|---|
| 时长 | 4–15 秒 |
| 帧率 | 24 fps |
| 分辨率 | 默认 768p;2K 需经 H3-Regenerate-2K |
| 音频 | 32 kHz 立体声,与画面同时生成 |
| 画幅 | 21:9、16:9、4:3、1:1、3:4、9:16 等 |
| 对白语言 | 11 种稳定支持,含中文、英语、日语、韩语、阿拉伯语、西班牙语 |
输入分为两种互斥形态,这是大多数简介会漏掉的细节:
二选一。首尾帧和参考素材不能出现在同一次请求里——它们是两个模型变体,跑在两个独立的服务上。
一次 H3 API 请求会经过三段:
模块 1 和 3 不在开源范围内。MiniMax 明确说明了模块 1 缺席的原因——它"依赖多阶段工作流以及多个托管模型与服务"——也同样明确地说了代价:H3-Context-IR"对最终输出质量至关重要,我们强烈建议把它纳入你的生成管线"。
这句建议不是客套。那份 IR 不是"改写过的 prompt",而是一份结构化文档:命名主体、说明每个参考素材哪些部分必须保留的 retention analysis、逐镜头描述(对白内嵌其中)、以及整段声场说明。官方公开的一个示例里,五秒片段的 prompt token 数超过 33,000。你当然可以照着 MiniMax 给的两份 prompt 编写指南自建一套,但那等于在重造一个被原作者认定为"决定输出质量的主要因素"的部件。
分辨率同理。模型卡自己的"Full 2K Workflow",是在本地 SGLang 部署的外面套两个 MiniMax 托管 API。纯自托管、完全离线的情况下,H3 是一个 768p 模型。
这一节决定了前面那些内容对你是否成立。MiniMax H3 Community License Agreement 原文:
"Applicable Territory" means worldwide, excluding the Excluded Territories. … "Excluded Territories" means the European Union, the United Kingdom, the Republic of Korea and the United States of America.
("适用地区"指全球,但不包括"排除地区";"排除地区"指欧盟、英国、韩国和美国。)
开源权重的授权不覆盖这四个地区。有三点需要说准:
API 则是全球可用的。MiniMax 划的线是分发方式而不是地理位置:服务由他们自己运行时,安全管控可以强制执行,所以在权重不可用的地区,托管模型依然可用。
H3-Omni-Transformer 是一个 33B 稠密单流 transformer。有两个细节让实际数字比 33B 小:
MiniMax 给出的 SGLang 参考配置是每个变体跑在四张 GPU 上,采用 Ulysses 序列并行,两个变体作为两个服务跑在不同端口。SGLang、vLLM、diffusers、ComfyUI 都有官方文档路径;仓库同时提供原始 checkpoint 和 diffusers 格式,按框架只下需要的那份即可。
自托管的前提是:你不在排除地区,每个变体能拿出四张 GPU,并且 768p 确实够用,或者你愿意自建上下文处理层。微调是最有说服力的理由——完整权重,且许可在适用地区内允许衍生模型。
走 API 的情形是:你在欧盟、英国、韩国或美国且未申请许可;你需要 2K;你想要官方 IR 的质量但不想重造它;或者你的量还撑不起常驻 GPU。它也是唯一一个"就是一个模型"而不是"一个模型加一个集成项目"的 H3。
H3 已经在 Imgo 的视频生成器里,名字是 MiniMax H3,走 MiniMax 官方 v2 API——完整三模块链路,2K 和官方 IR 都包含在内,地区问题也不存在。我们的模型注册表强制两条约束,都来自模型本身而非我们附加:
H3 没有随机种子,所以当你需要某个镜头下个季度还能渲染出同样结果时,它不是那个选择——三个主力模型里只有 Veo 3.1 给种子。H3 给你的是我们路由到的所有模型里最宽的输入面:一次请求里 9 张参考图 + 3 段参考视频 + 3 段参考音频,而且声音和画面一起生成。
如果想在接管线之前先跟 Seedance 2.5、Veo 3.1 比一比:三者只隔一个下拉框,共用同一套请求结构和同一个积分余额。
No image
Seedance 2.5 的招牌数字——三十秒、五十张参考——是注册表里的事实。它们在实际工作里买到什么、Veo 3.1 什么时候仍该接手,就是这篇评测要回答的。
No image
H3 的权重已经在 Hugging Face 上,但 H3 是三模块系统,开源的只有 H3-Base。本文讲清楚哪些能本地跑、为什么 2K 与上下文编排仍是托管的、四张 GPU 能换来什么,以及大多数报道略过的地区条款。
No image
OpenAI 将于 2026 年 9 月 24 日关闭 Sora API——面向消费者的 App 早在 4 月就已下线。本文说明真正结束的是什么、Sora 2 的能力如何映射到 Seedance 2.5 与 Veo 3.1,以及这一周的迁移清单。