跳到内容
ImgoAI 图像与视频工作台
首页定价博客
ImgoAI 图像与视频工作台

Imgo 是通用 AI 创作平台,覆盖视频、图像、提示词、素材与 Canvas 工作流。可在同一工作台组合脚本、分镜、镜头提示词、渲染、图像生成、素材库与 Canvas Agent 工具。

AI 创作平台

平台

  • 视频生成器
  • 工作台
  • 全部工具
  • 定价

AI 模型

  • Sora 2
  • Veo 3
  • Kling
  • Seedance 2.0
  • Seedance 2.5
  • MiniMax H3
  • Nano Banana Pro
  • 全部模型

图像工具

  • AI生成器
  • AI 图片编辑器
  • 头像制作
  • AI放大
  • 背景移除
  • 图片矢量化
  • 图片压缩
  • 图片提示词构建器
  • 视频提示词构建器
  • LoRA模型

资源

  • 关于我们
  • 帮助中心
  • 应用案例
  • 模型对比
  • 替代方案
  • 画廊
  • 应用

© 2026 Imgo. All rights reserved.

隐私政策服务条款覆盖视频、图像、提示词与 Canvas 工作流的 AI 工作台
    视频生成

    MiniMax H3

    2K 视频与原生立体声,基于文本、图像、视频、音频的统一上下文

    MiniMax H3 是通用多模态生成模型:把文本、图像、视频和音频作为统一上下文理解,输出带原生立体声的视频,最长 15 秒、默认 2K。MiniMax 以性价比定位该模型,称其 2K 每秒价格不到主流模型的三分之一,并表示计划开放模型权重。

    进入视频生成对比模型
    一个上下文,而非四条管线声音与画面一同生成更低的 2K 每秒成本

    能力概览

    2K

    默认分辨率

    15 秒

    单条最长时长

    立体声

    原生音频

    核心优势

    围绕真实生产流程整理的实用价值。

    优势

    01

    一个上下文,而非四条管线

    文本、图像、视频、音频作为同一个上下文输入,因此可以直接说「参考这段视频的运镜,让这张图里的人唱歌,声音对上这段音频」,模型将其理解为一条指令,而不是分发给多个专家模型。

    优势

    02

    声音与画面一同生成

    音频与视频联合生成,输出为原生立体声,对白、音效和环境声天然与画面对齐,无需事后叠加。

    优势

    03

    更低的 2K 每秒成本

    2K 是默认档位而非加价档。MiniMax 称 H3 在 2K 下的每秒价格不到主流模型的三分之一,在 768p 下不到主流 720p 的一半——这直接改变了批量迭代的成本结构。

    推荐工作流

    从原始素材到可复用结果,只需三个步骤。

    步骤 1

    组装上下文

    把手头的参考素材放进来:一段视频定运镜、一张图片定主体、一段音频定声音。

    1

    步骤 2

    描述它们的关系

    用自然语言说明这些参考与目标视频的关系,跨模态的理解交给 H3 自己完成。

    2

    步骤 3

    生成并迭代

    生成最长 15 秒、2K、带立体声的结果,然后反复迭代——正是每秒成本让多轮尝试变得可行。

    3

    常见问题

    输出的分辨率和时长是多少?

    最长 15 秒,默认提供 2K 分辨率。同时提供 768p 档位,MiniMax 给出的最低每秒价格即基于该档位。

    音频是它生成的,还是要后期添加?

    H3 与视频联合生成音频,输出是原生立体声,而不是事后混入的单声道音轨。

    MiniMax H3 是开源的吗?

    MiniMax 宣布计划开放模型权重,并将硬件兼容性和可定制性列为设计目标。在权重实际发布前,请将其视为待发布状态,而非当前已具备的能力。

    下一步

    准备把这项能力用于实际生产了吗?

    用真实图片打开工具、比较结果,并保留最适合的版本。

    进入视频生成返回功能中心