中国のAI開発企業であるMiniMaxが動画生成AI「MiniMax H3」を発表しました。MiniMax H3は最大15秒の音声付き動画を生成可能でテキスト・動画・画像・音声の入力に対応しています。また、近日中にモデルそのものが無料公開される予定です。

MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities - MiniMax Research | MiniMax

https://www.minimax.io/blog/minimax-h3

MiniMax H3はテキスト・動画・画像・音声の入力に対応しており、「画像を入力して登場人物を指定する」「歌声を入力してリップシンク動画を作成する」といった操作が可能。複数のメディアを同時に入力して1本の動画を生成することもできます。動画の解像度は768pもしくは2Kで、最大15秒の動画を生成できます。



MiniMaxの公式ページに掲載されているMiniMax H3の生成例が以下。

動画生成AI「MiniMax H3」の生成例その1 - YouTube

ゲーム画面風の動画もあります。

動画生成AI「MiniMax H3」の生成例その2 - YouTube

第三者機関のArtificial Analysisによるテスト結果もすでに公開されています。「AIモデルの名前を伏せた状態で同じプロンプトから動画を生成して優劣を決める」という方法で「テキストから音声付きの動画を生成する」というタスクの品質をランキング化したものが以下。MiniMax H3はGemini Omni Flashに続いて2位にランクインしました。高品質なことで知られているSeedance 2.0を超えています。



「画像から音声付きの動画を生成する」というタスクの場合、1位はSeedance 2.0、2位はGemini Omni Flashで、3位がMiniMax H3でした。



MiniMax H3は記事作成時点ではAPI経由で利用可能となっており、近日中にモデルがオープンウェイトとして公開される予定です。APIのドキュメントは以下のリンク先で確認できます。

Create Video Generation Task - MiniMax API Docs

https://platform.minimax.io/docs/api-reference/video-generation-v2-create

また、ComfyUIなどのサードパーティーサービスでもMiniMax H3のAPIを用いた動画生成が可能です。





◆2026年8月3日12時01分追記:

モデルがHugging FaceとModelScopeで公開されました。

MiniMaxAI/MiniMax-H3 · Hugging Face

https://huggingface.co/MiniMaxAI/MiniMax-H3



MiniMax-H3 · 模型库

https://modelscope.cn/models/MiniMax/MiniMax-H3



ComfyUI開発チームの管理するHugging Faceリポジトリでも公開されています。ファイルサイズはint8_convrot版のdiffusionモデルが21GBで、int8_convrot版のテキストエンコーダーが27.1GBです。VAEはFP16版が5.21GBで、FP32版が605MBです。

Comfy-Org/MiniMax-H3 · Hugging Face

https://huggingface.co/Comfy-Org/MiniMax-H3