
ネイティブ音声生成
H3はセリフ、環境音、効果音を映像と同じ工程で生成します。無音の下書きも手動での同期作業も不要で、音が付いた状態のクリップが仕上がります。
ネイティブオーディオ付き2K出力。失敗したタスクは自動返金されます。
MiniMax H3は、テキスト、最初または最後のフレーム、画像・動画・音声を含むマルチモーダルリファレンスから、4〜15秒の2K動画を生成します。
2K出力 · ネイティブ音声 · 失敗したタスクは自動返金
MiniMax H3は、Hailuo動画シリーズを開発した上海のAI企業MiniMaxによる最新のAI動画モデルです。2026年7月末に公開され、最大2K解像度で、音声(セリフ・環境音・効果音)を映像と同時に生成します。
この組み合わせが重要です。多くの動画モデルは無音のクリップを出力するため、音声を別工程で追加する必要があります。H3は1回の生成で音付きの完成カットを出力します。そのため、今夏公開されたSeedance 2.5やFlux 3と並ぶ最前線のモデルとして注目されています。
H3とMiniMax M3を混同しないでください。M3はMiniMaxの言語モデル系統で、H3はHailuoの動画系統(Hファミリー)を受け継ぐモデルです。音声付き2Kクリップを生成する新しい動画ジェネレーターをお探しなら、MiniMax H3が該当します。

今回のリリース内容と、クリエイターが注目している理由。

H3はセリフ、環境音、効果音を映像と同じ工程で生成します。無音の下書きも手動での同期作業も不要で、音が付いた状態のクリップが仕上がります。

最大2Kで書き出せるため、商品のクローズアップ、文字が潰れないSNS向けの切り抜き、1080pに縮小しても鮮明な納品素材に対応できます。

水、布、髪、身体の動きが自然に振る舞います。H3は、リアルな物理表現で評価されてきたHailuoシリーズの流れを受け継いでいます。
カットが切り替わってもキャラクターと照明が保たれるため、短い物語シーンがカットごとにリセットされることなくつながります。
プロンプトから2K動画の保存まで、3ステップ。

MiniMax H3で作りたいシーン、音、雰囲気を記述します。プロンプトライブラリから事例を読み込んで調整することもできます。

4〜15秒の間で1秒単位の長さと、対応する6種類のアスペクト比から選択します。H3は現在2Kで生成されます。

非同期タスクを開始します。ページを再読み込みしても進行中のタスクは復元され、完成したMP4は履歴に保存されます。
MiniMaxファミリー内での位置づけと、今夏公開された他モデルとの違い。
| 項目 | MiniMax H3 | Hailuo 2.3 | Seedance 2.5 | Flux 3 |
|---|---|---|---|---|
| ネイティブ音声 | 対応 | 非対応 | 未発表 | 対応(セリフを含む) |
| 最大解像度 | 2K | 1080p | 4K | 未発表 |
| 入力 | テキスト、フレーム、画像・動画・音声 | 画像から動画 | 最大50件のリファレンス | テキスト、画像、音声 |
| 強み | 1回の生成で音声と2Kを両立 | 高速な画像アニメーション | 30秒のワンカット4K | マルチモーダルなリアリティ |
| 提供状況 | Tryonrで公開中 | Tryonrで公開中 | 順次提供中 | 早期アクセス |
仕様は2026年8月時点で公開されている情報にもとづきます。公式情報が確定しだい、この表を更新します。Hailuo 2.3とSeedance 2.0はTryonrで現在ご利用いただけます。
音声を前提とした動画生成は、無音モデルでは扱えない表現を可能にします。
音楽、効果音、ナレーションが揃った状態で仕上がる商品広告。動画制作と音声収録を分ける必要がありません。
キャラクターが実際に話す縦型クリップ。TikTok、Reels、Shorts向けのリアクション動画、ミニVlog、ショートコントに。
回転する商品カットやマクロディテールを、細部まで耐えられる画質で。2Kで生成するため切り抜いても鮮明です。
窓を打つ雨、カフェのざわめき、夜明けの森など、音そのものが主役になる雰囲気重視の映像に。
H3は公開されたばかりで、実際の出力を確認する最も早い方法は、Xでテスト結果を公開しているクリエイターコミュニティです。音声同期のセリフクリップ、2Kの商品カット、物理表現の検証動画が次々と投稿されています。
Tryonrでは架空のサンプルを掲載していません。生成結果はすべて、実際に実行されたH3タスクに紐づいています。完成した動画は非公開の生成履歴からいつでも確認できます。
外部リンクが開き、Xのコミュニティ投稿を表示します。
提供状況、音声、解像度、料金についての回答。
はい。MiniMax H3のテキストから動画、最初/最後のフレームからの画像から動画、マルチモーダルなリファレンスから動画のすべてが、EvoLink経由でTryonrにて利用できます。
1回の生成でネイティブ音声と2Kを両立している点です。多くのモデルは無音の動画を生成し、音声を別途追加する必要がありますが、H3はセリフ、環境音、効果音を映像と同時に出力します。
はい。音声は後から別のモデルで追加されるのではなく、フレームと同時にネイティブに生成されます。セリフも含まれます。
最大2Kです。一般的な1080pモデルより余裕があり、各プラットフォームの配信サイズに縮小しても鮮明さを保てます。
M3はMiniMaxの言語モデル系統です。H3はHailuoの流れを汲む新しい動画生成モデルで、音声付きの2Kクリップを生成します。
Hailuo 2.3はMiniMaxの従来の画像アニメーション向けモデルです。H3では2K出力、ネイティブ音声、4〜15秒の長さ、最初/最後のフレーム指定、画像・動画・音声のマルチモーダルリファレンスが追加されています。
H3は出力1秒あたり40 Tryonrクレジットを使用します。リファレンス動画の秒数も課金対象で、6枚目以降のリファレンス画像は1枚につき13クレジットが加算されます。プロバイダー側で失敗したタスクは自動的に返金されます。
はい。ログインして、テキスト、最初/最後のフレーム、リファレンスのいずれかのモードを選び、必要な素材を追加すれば、このページから直接H3の生成を開始できます。
詳細なプロンプトから、ネイティブ音声付きの2Kクリップを生成します。タスクはバックグラウンドで処理が続き、完成した結果はTryonrの履歴に保存されます。
非同期処理 · 失敗時は返金 · 結果は履歴に保存
新世代のモデルを比較する、または今すぐ生成を始める。