MiniMax H3長尺動画プランナー
H3で一度に生成できるのは4〜15秒です。それより長い動画は、短い区間をつないで作ります。このプランナーは区間分けと各プロンプトの作成を行い、間違えやすいつなぎの指示も整理。生成を始める前に必要クレジットを確認できます。
まず結論
MiniMax H3で60秒の動画を作れますか?
1回の生成では作れません。ホスト型H3の生成時間は4〜15秒で、整数秒のみ指定できます。60秒や120秒の動画は、前の動画の最終フレームから次の区間を始め、複数のクリップをつなぐ構成です。「動画の延長」と呼ばれる方法ですが、1本を連続で生成するのではなく、別々の生成処理をつなげています。
- 1回の生成は4〜15秒。同期した音声も同時に生成します。
- 60秒なら15秒×4区間、120秒なら15秒×8区間です。
- 2区間目以降は、直前のクリップの最終フレームを入力画像にした画像から動画の生成です。
このページで行うのは構成とプロンプトの作成です。各区間の生成とファイルの結合は、利用者自身で順番に行います。動画全体を自動生成・結合するボタンはありません。
プランナー
H3で生成できる長さに区間分けする
完成動画の長さ、被写体、場所を決め、各区間に動作を一つずつ割り当てます。下のプロンプトは、このツールが使う英語形式でそのままコピーできます。
英語のプロンプト例です。説明は必要に応じて編集できます。出力のフィールド名と構文は英語のままです。
各区間に動作を一つ
その区間で何が変わるかを書きます。あらすじではなく動作を指定しましょう。やることが曖昧だと、画が変質したり同じ動きを繰り返したりします。
作成した区間
4区間・合計60秒・目安804クレジット
順番に生成してください。各クリップが完成したら最終フレームを取り出し、次の区間の入力画像にします。
区間1・0〜15秒・15秒
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, matching the position, framing, and lighting established by <Picture 1>. she pushes off the kerb and threads between two stalls, checking the address on her phone. overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance. non_diegetic_music: N/A
区間2・15〜30秒・15秒
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she slows at a crossing as a tram passes, rain beading on the jacket. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening. overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance. non_diegetic_music: N/A
区間3・30〜45秒・15秒
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she lifts the parcel from the crate and scans the shopfront numbers. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening. overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance. non_diegetic_music: N/A
区間4・45〜60秒・15秒
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she hands the parcel over at a lit doorway and steps back into the rain. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening. overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance. non_diegetic_music: N/A
プロンプトを読み込んだ状態で画像から動画の生成画面を開きます。生成にはログインとクレジットが必要です。
クレジットを使う前に
現時点で注意項目はありません。生成後もつなぎ目を確認してください。
仕組み
「動画の延長」は何をしているのか
H3のAPIにはextendパラメーターはありません。延長は専用機能ではなく、前のクリップの最終フレームを次の生成に渡して続きを描かせるワークフローです。
- 1
最初の区間を生成
テキストから、または参照画像から動画を生成します。この区間が、その後の人物、色調、レンズ表現の基準になります。
- 2
最終フレームを書き出す
完成したクリップの最後で停止し、そのフレームを画像として保存します。動画編集ソフトで取り出しても構いません。これを次の区間の入力画像にします。
- 3
次の区間をI2VAで生成
最終フレームを入力画像にし、プランナーのつなぎ用プロンプトで画像から動画を生成します。2枚目の画像がないので、首尾フレーム指定のモードではありません。
- 4
繰り返してファイルを結合
目標時間に達するまで繰り返し、編集ソフトでクリップをつなぎます。結合するまでは、区間ごとに別のMP4ファイルです。
つなぎ目を越えて引き継げるもの
- カット位置の構図とフレーミング。同じフレームを渡すためです。
- プロンプトで同じ文を繰り返す要素:被写体、服装、場所、スタイル指定。
- 受け渡す画像の露出が適切なら、大まかな色調と照明。
つなぎ目で失われるもの
- 動き。静止画には速度の情報がなく、モデルが動きを推定し直すため、速い動作はカット位置で止まったように見えることがあります。
- 音。音声は区間ごとに別生成されます。同じ指示を繰り返さないと、環境音や音楽が切り替わります。
- 画面の外の情報。受け渡したフレームに写っていないものは、次の区間には伝わりません。
重要なのは画像の枚数です。開始・終了の両画像を指定する区間ではFL2VAを使い、前の最終フレーム1枚だけで続きを作る区間ではI2VAを使います。指示文も異なります。画像1枚にFL2VA用の文を使うと、意図した参照が反映されないおそれがあります。
期待値
どこまで一貫性を保てるか
各区間が受け取るのは直前の1フレームとプロンプトだけです。この制約を理解すると、何が崩れやすいかを見通せます。
| 区間数 | 比較的保ちやすいもの | 変わり始めるもの |
|---|---|---|
| 1〜2区間目 | 人物、服装、色調、場所。 | 速い動作では、最初のつなぎ目で動きのテンポ。 |
| 3〜4区間目 | 固定情報を繰り返せば、人物と場所。 | 色温度のずれ、小物の形。 |
| 5〜6区間目 | 場面の大枠と、明記した固定情報。 | 顔がぼやけたり形が変わったりし、服の細部が変化。 |
| 7〜8区間目 | スタイル指定と大まかな場所。 | 最初の区間と並べると、累積したずれが目立ちやすい。 |
これは仕組みから予想され、コミュニティでも報告されている崩れ方の目安です。独自ベンチマークで測定した発生率ではありません。数値を公開する場合は、測定方法も明記します。
費用
このサイトで長尺H3動画を作る費用
H3の費用は生成秒数に応じて計算されるため、合計時間に加え、作り直した区間の分が必要です。予算を左右するのは区間分け自体ではなく、再生成の回数です。
| 完成時間 | 15秒ごとの区間数 | クレジット | 2区間を作り直す場合 |
|---|---|---|---|
| 30s | 2 | 402 | 804 |
| 60s | 4 | 804 | 1206 |
| 90s | 6 | 1206 | 1608 |
| 120s | 8 | 1608 | 2010 |
数値は、このサイトの現在のH3料金計算を使っています。生成失敗時は自動返還されますが、完成した結果が好みに合わない場合は対象外です。
作成手順
60秒のH3動画を作る
- 1
区間を計画
60秒と15秒区間を選ぶと4区間になります。それぞれに動作を割り当て、何も起こらない時間を作らないようにします。
- 2
人物の固定情報を決める
被写体を一度具体的に説明すれば、プランナーが同じ文を4区間に繰り返します。見た目のずれを抑えるための重要な準備です。
- 3
参照画像から最初の区間を生成
画像から動画の生成画面を開き、開始画像を添付。最初のプロンプトを貼り付け、15秒で生成します。
- 4
残りの区間をつなぐ
各クリップの最終フレームを保存し、次の区間の入力画像にします。対応するプロンプトを貼り付け、目標時間まで繰り返します。
- 5
クリップを結合
編集ソフトで4本のMP4をつなぎます。動きの再始動が目立つ箇所は、つなぎ目の数フレームをカットして調整します。
言葉を区別
「長尺H3動画」が指す三つの方法
混同しやすい方法ですが、このプランナーが扱うのは複数の短い区間をつなぐ方式です。
| 方法 | 仕組み | 現在の提供状況 |
|---|---|---|
| 1回の生成 | 1回の推論で1ファイル。音声も同時に生成。 | 利用可能。最大15秒。 |
| 区間をつなぐ | 前の最終フレームから、複数回に分けて生成。 | 現在利用可能。このページで計画し、生成と結合は自分で行います。 |
| ストリーミング・因果的生成 | 固定のクリップ長を持たず、再生に合わせて連続生成。 | 研究段階。ホスト型H3 APIやこのページでは提供していません。 |
よくある質問
H3の長尺動画について
MiniMax H3の動画は最長何秒ですか?
1回の生成は最短4秒、最長15秒で、整数秒のみ指定できます。テキスト、画像、参照画像からの生成で共通です。それ以上の長さは複数の区間をつないで作ります。
MiniMax H3で2分の動画を作るには?
15秒×8区間で計画します。最初は参照画像から生成し、以降は前の最終フレームを入力画像にして、同じ人物の特徴を繰り返したプロンプトを使います。最後に8本を結合します。1〜2区間程度の作り直しも見込んでください。
H3には延長専用の機能がありますか?
ホスト型APIにextendパラメーターはありません。前の最終フレームを次の入力画像にして続きを作ります。そのため、つなぎ用プロンプトは首尾フレーム指定ではなく、画像から動画の形式になります。
自分の動画をアップロードして続きを作れますか?
現在、このサイトの生成画面が受け取るのは画像で、動画ではありません。伸ばしたい動画がある場合は、最終フレームを画像として書き出し、そこから始めてください。
つなぎ目で動きがぎくしゃくするのはなぜですか?
静止画に速度の情報がないためです。次の区間が動きを推定し直すので、速い動作ほど一瞬止まったように見えます。つなぎ目付近の動きを穏やかにし、結合時に数フレームを調整すると改善しやすくなります。
音声も自然につながりますか?
自動的につながるわけではありません。区間ごとに生成するため、同じ環境音の指示を繰り返す必要があります。プランナーはその文を各区間に入れます。BGMは、結合後に編集ソフトで付けるほうが安定します。
MiniMax公式の機能ですか?
いいえ。4〜15秒という制限はMiniMaxの仕様ですが、区間をつなぐのはコミュニティのワークフローで、このプランナーは当サイトによる実装です。当サイトはMiniMaxと提携していません。