MiniMax H3 は汎用のマルチモーダル生成モデルです。テキスト、画像、動画、音声をひとつの文脈として読み取り、ネイティブステレオ音声付きの動画を最長 15 秒、2K で返します。MiniMax はコストパフォーマンスを訴求しており、2K の 1 秒あたり単価を主流モデルの 3 分の 1 未満と説明し、モデルの重み公開も予定していると表明しています。
機能のスナップショット
2K
既定の解像度
15s
最大クリップ長
stereo
ネイティブ音声
ワークフロー、主なメリット、成果物を 27 秒で紹介します。
実際の制作ワークフローにマッピングされた実践的な価値。
メリット
01
4 本のパイプラインではなく、ひとつの文脈
テキスト、画像、動画、音声がひとつの文脈として入力されます。「このクリップのカメラワークを使い、この画像の人物に歌わせ、この声に合わせて」というプロンプトが、専門モデルへ振り分けられるのではなく、ひとつの指示として理解されます。
メリット
02
音は映像と一緒に生成される
音声は映像と同時に生成され、ネイティブステレオで出力されます。セリフ、効果音、環境音が後から重ねるのではなく、最初からショットに合った状態で得られます。
メリット
03
2K を、より低い秒単価で
2K は上位プランではなく既定です。MiniMax は H3 の 2K における秒単価を主流モデルの 3 分の 1 未満、768p 実行時は主流の 720p の半分未満としています。これは量を回して試すときのコスト感を変えます。
ソース素材から再利用可能な結果までのシンプルな 3 ステップのパス。
ステップ 1
文脈を組み立てる
手元にある参照素材を用意します。カメラの動きなら動画クリップ、被写体なら画像、声なら音声です。
ステップ 2
関係を説明する
参照素材が目的の動画とどう関係するかを普通の言葉で書きます。モダリティをまたぐ推論は H3 自身が解きます。
ステップ 3
生成して反復する
2K・ステレオ音声で最長 15 秒をレンダリングし、そこから反復します。何度も試せるのは秒単価があってこそです。
最長 15 秒で、既定の解像度として 2K が提供されます。768p のティアもあり、MiniMax が最も低い秒単価を示しているのはこちらです。
H3 は音声を映像と同時に生成します。出力は後からミックスしたモノラルではなく、ネイティブステレオです。
MiniMax はハードウェア互換性とカスタマイズを設計目標に挙げ、モデルの重みを公開する意向を表明しています。実際の公開が行われるまでは、現時点の保証ではなく予定として扱ってください。