
<Subject N>再利用する、目に見える内容。人物、動物、物体、シーン、衣装、小道具、スタイル、動作、ポーズのいずれかです。1つのサブジェクトが複数のファイルを参照することも、1つのファイルから複数のサブジェクトを作ることもできます。
リファレンスから動画・プロンプト作成ツール
MiniMax H3に参照画像や動画クリップ、音声を渡すと、ほかのモードで使う3項目のプロンプトは読まれなくなり、代わりに6つのセクションが求められます。このページはその6セクションを書き出し、参照ラベルに番号を振り、参照が気づかないうちに無視される原因となる形式ミスを検出します。
参照ファイル

<Picture 1>
<Picture 2>
<Video 1><Audio 1>プロンプト作成
アップロードする予定のファイルごとに1行追加し、それぞれの用途を選びます。この選択ひとつで、そのファイルが専用のラベル行を持つのか、サブジェクト定義の中で引用されるのかが決まります。MiniMax H3のリファレンスから動画のプロンプトで、最も間違えやすいポイントです。まずプリセットを選び、そこから編集してください。
構成ごとにファイルの組み合わせと役割が違うため、要約の接頭辞もそれぞれ異なります。いちばん近いものを選び、そこから編集してください。
サンプル画像は、アップロードするファイルの見本として生成したもので、モデルの出力ではありません。
reference generationアップロードするファイルごとに1行。Picture、Video、Audioの番号はそれぞれ独立していて、追加した順に振られます。

fully_preserved<Subject N> の行になり、ファイルのラベルはその中で引用されます。専用の行は作りません。これが最もよく破られるルールです。

fully_preserved<Subject N> の行になり、ファイルのラベルはその中で引用されます。専用の行は作りません。これが最もよく破られるルールです。
H3の想定に合わせて英語で出力します。台詞、歌詞、画面内の文字は、<d> タグの中で元の言語のまま残ります。
subject_definitions: <Subject 1> is the young woman in <Picture 1>, with shoulder-length auburn hair, a grey knit sweater and a thin gold chain at the collar. <Subject 2> is the narrow bookshop interior in <Picture 2>, with floor-to-ceiling oak shelves, a brass desk lamp on the counter and a rolling ladder. summary: [reference generation] <Subject 1> takes a clothbound volume down from the upper shelves of <Subject 2> and carries it to the counter, where she settles and looks up toward the door. retention_analysis: <Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - her face, auburn hair length, grey knit sweater and gold chain are carried into both shots without change. <Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the oak shelving, brass desk lamp and rolling ladder remain the only set, and no additional room or exit is introduced. detailed_description: The target video is in a warm, realistic style with soft practical lighting and a shallow depth of field. [Shot 1] A medium-wide shot establishes <Subject 2>, the narrow bookshop, with floor-to-ceiling oak shelves running the length of the frame and a brass desk lamp burning at the counter on the right. Late-afternoon light enters from a window off-frame left and falls in a soft band across the middle shelves, leaving the upper rows in shadow. <Subject 1>, the young woman with shoulder-length auburn hair and a grey knit sweater, stands on the second rung of the rolling ladder with her left hand flat against a shelf edge for balance. She tilts her head back to read the spines above her, then draws a clothbound volume free with two fingers, and the books on either side tip inward to fill the gap it leaves. She turns the volume over to read the spine, and a thin line of dust lifts off the top edge and drifts through the band of light. The camera pushes in with small amplitude at slow speed toward the book in her hands. [Shot 2] At 00:04.000, the shot cuts to a close-up of <Subject 1> at the counter of <Subject 2>, with the brass desk lamp just inside the right edge of frame throwing warm light across one side of her face and leaving the other in shadow. She sets the clothbound volume down on the wood, flattens the cover with her palm, and holds it there a moment longer than she needs to. Her thumb moves once across the corner of the boards. She lets out a short breath and her shoulders drop as it leaves her. The thin gold chain at her collar catches the lamp as she shifts her weight onto her other foot. She lifts her eyes from the book and looks up and past the camera toward the door, her expression settling into something closer to expectation than surprise. The camera holds a static shot throughout, letting her come to rest inside a frame that does not move with her. overall_soundscape: A quiet indoor room tone runs throughout, with the creak of the ladder under a shifting weight, pages riffling under a thumb, and the soft knock of board covers meeting the counter. non_diegetic_music: A sparse nylon-string guitar figure at a slow tempo, with a sustained low string underneath and no swell.
このプロンプトを読み込んだ状態で、ジェネレーターを「参照画像から動画」モードで開きます。ファイルはそちらで追加してください。
形式の問題は見つかりませんでした。
グレー表示のタスク種別は、素材の設定から決まります。それ以外をクリックすると、素材からは読み取れない関係を追加できます。
形式
テキストから動画、画像から動画、キーフレーム系のモードは、どれも同じ3つの基本項目を使います。ところがリクエストに参照素材が含まれた時点で、MiniMax H3のリファレンスから動画は、別の、より長い構造を求めます。ほかのモードで使ってきた3項目のプロンプトは、ここでは形が合いません。
subject_definitions追跡する対象ごとに1行。ラベル、そのラベルが指すもの、再現させたい特徴を書きます。
summary短い1段落。冒頭に角括弧で囲んだタスク種別の接頭辞を付け、どんな種類の作業かを示します。
retention_analysisラベルごとに1行。決められた関係マーカーと、何が保たれるかの説明を書きます。
detailed_description本文にあたる部分。ショットを再生順に書き、該当する箇所にラベルを入れます。
overall_soundscapeクリップ全体に流れる環境音と物音。基本モードと同じ意味です。
non_diegetic_music視聴者だけに聞こえる劇伴。基本モードと同じ意味です。
ショット、カメラワークの用語、話者ID、台詞タグは基本モードと共通なので、それらについて知っていることは、リファレンスから動画でもそのまま使えます。変わるのは次の4点です。
最後の2つは基本ガイドから変わっていません。最初の4つはリファレンスから動画にしかないため、テキストから動画のテンプレートからコピーしたプロンプトでは、エラーが一切表示されないまま参照が失われます。
画像がキャラクターの参照ではなく最初と最後のフレームなら、それは別のモードで、画像対応文も変わります。その文は最初と最後のフレーム用のプロンプト作成ツールで書き出せます。
カメラワークの書き方はどちらも同じなので、カメラ制御ページで紹介している20種類の動きは、ここでもそのまま使えます。
ラベル
リファレンスから動画では、すべての素材をラベルで指し、同じラベルは6つのセクションを通じて同じ意味を持ちます。Picture、Video、Audioの番号はそれぞれ独立して振られるため、<Video 1> と <Audio 2> が同じファイルということもあります。

<Subject N>再利用する、目に見える内容。人物、動物、物体、シーン、衣装、小道具、スタイル、動作、ポーズのいずれかです。1つのサブジェクトが複数のファイルを参照することも、1つのファイルから複数のサブジェクトを作ることもできます。

<Picture N>特定のフレームとして使う画像(最初のフレーム、キーフレーム、最後のフレーム)、または絵コンテとしてカット割りの基準にする画像。

<Video N>動画全体に関わる関係。編集するクリップ、続きを作るクリップ、またはカット・テンポ・カメラワークの構成を借りる元の動画。
<Audio N>コピーまたは参照する音声信号。単体の音声ファイルでも、参照動画の同期音声トラックでもかまいません。
キャラクター、シーン、衣装、スタイルを定義するためだけの画像には、独立した <Picture N> の行を作りません。そのラベルは <Subject N> の定義の中で引用し、retention_analysis には一切登場させません。ファイルが専用の行を持つのは、フレームを固定する、編集される、続きを作る元になる、音声を運ぶ、といった構造上の役割を担うときだけです。
誤った例
<Picture 1> is a reference image of the young woman. <Subject 1> is the young woman.
正しい例
<Subject 1> is the young woman in <Picture 1>, with long dark hair, a blue cardigan and a thin silver necklace.
保持マーカー
retention_analysis の各行には、リファレンスから動画がその素材をどれだけ強く保持するかを示す、決められた英語のマーカーを付けます。映像トラックと音声トラックでは、使うセットが異なります。よく引用されるのが映像用の4つであるため、この違いは第三者の解説記事のほとんどで抜け落ちています。両方に含まれるのは weak_reference だけです。
fully_preserved定義した参照の役割を、完全に保持します。
キャラクターが、すべてのショットで顔、髪型、衣装を保ちます。
partially_preserved参照は使われますが、定義した特徴の一部が変わるか、一部しか保持されません。
部屋のレイアウトは保ったまま、壁の仕上げが変わります。
attribute_transfer特徴が、はっきり識別できる別の対象へ移ります。
ある人物の服を、別の人物に着せます。
weak_reference残るのは、スタイル、種類、構図、雰囲気のおおまかな類似だけです。
クリップからテンポだけを借り、ほかは何も使いません。
fully_copy元の音声全体が、そのまま動画の最終的な音声トラック全体になります。
編集後も、元のインタビュー音声に一切手を加えずに残します。
partially_copyタイムラインの一部や選んだレイヤーだけをコピーするか、コピー後にレイヤーを追加・差し替えます。
台詞はコピーし、環境音は作り直します。
reference何もコピーせず、音色、リズム、音楽スタイル、台詞の内容、質感だけを参照します。
話し手の声を参照音声に寄せますが、その音声自体は再利用しません。
weak_reference残るのは、種類や雰囲気のおおまかな類似だけです。
トラックから全体的な雰囲気だけを借ります。
マーカーは、そのラベルが subject_definitions ですでに持っている役割の範囲内で選びます。生成する動画に新しく加えた動作、背景、出来事は再現度の低下ではないため、マーカーを格下げする理由にはなりません。
要約の接頭辞
リファレンスから動画の要約は、どれも作業の種類を示す角括弧付きの接頭辞で始まります。ファイルの種類ではなく、各素材が実際に果たす役割で選んでください。テンポだけを借りる参照動画は reference generation で、video editing ではありません。
keyframe completion画像で特定のフレームを固定する場合。最初のフレーム、キーフレーム、最後のフレーム、またはその他の固定フレームです。
reference generation素材が特定のフレームや編集元にはならず、キャラクター、シーン、スタイル、動作、カメラワーク、絵コンテとして生成を導く場合。
video editing既存の元動画を直接変更する場合。静止画のキーフレームの間を生成するのは該当しません。
video continuation既存の元動画を起点に、新しい内容で続きを作る、延長する、再開する、または別の場面へ移る場合。
audio reuse同じ音声信号を、全部または一部再利用する場合。
audio reference信号はコピーせず、スタイル、音色、台詞の内容、質感、ビート、連続性だけを参照する場合。
種別は「+」でつなぎ、同じものを重複させません。画像を最後のフレームにしてクリップの続きを作るなら [video continuation + keyframe completion]。元の音声が聞こえる状態でクリップを編集するなら [video editing + audio reuse] です。音声側は、書き忘れても見た目には何も壊れないため、見落としがちです。
編集の場合、要約は接頭辞の直後を「The target video is an edited version of <Video 1>.」で始める必要があります。素材を編集元に指定すると、作成ツールがこの一文を自動で書き込みます。
トラブル対処
リファレンスから動画は、失敗してもエラーになりません。クリップは生成され、クレジットも消費されます。症状は、アップロードしたファイルにモデルが従わなかったことだけです。まず確認したい形式上の原因を挙げます。
ここまでの方法では、クリップを15秒より長くはできません。15秒を超えるには区間を計画し、最後のフレームを次へ引き継ぎます。その作業は長尺動画プランナーで行えます。
よくある質問
はい。リクエストに参照素材が含まれ、リファレンスから動画モードになった時点で、6つすべてが必要です。最後の2つは書くことがなければN/Aでかまいませんが、セクション自体は残ります。参照ファイルが1つもない場合はこのモードには当たらないので、代わりに3項目のプロンプトを使ってください。
リファレンスから動画の6つのセクションは英語で書きます。ガイドが認める唯一の例外は、台詞、歌詞、シーン内に見える文字で、これらは <d> タグの中で元の言語のまま残します。つまり中国語の台詞は中国語のままで、周りの説明だけを英語にします。
当サイトのジェネレーターの「参照画像から動画」モードでは、参照画像を最大3枚まで使えます。プロンプト内の番号は追加した順に振られるため、作成ツールの行もアップロードと同じ順に並べてください。
<Picture 1> はファイルそのものを指し、<Subject 1> はそのファイルから再利用したい内容を指します。ファイルが人物の見た目を示すためだけにあるなら、使うべきはサブジェクトです。画像のラベルは単独の行にせず、サブジェクトの定義の中で引用します。
はい。ガイドには、見た目を画像から、動きを動画から取り、それぞれのファイルが何を担うかを明記して1つのサブジェクトにまとめる例があります。その場合は定義に直接書いてください。作成ツールの1行1ファイルの形式は、よくあるケース向けです。
話者IDは、生成する動画の中で声が出る順に割り振られ、説明文の中に書くものです。ガイドには、音声の参照が話者に紐づいている場合でも retention_analysis には一切書かないと明記されています。その紐づけは subject_definitions に書きます。
いいえ。音声入りの参照動画でも、それだけで音声ラベルが作られることはありません。<Audio N> を追加するのは、その音声トラックを実際にコピーまたは参照する場合だけです。また、VideoとAudioの番号は独立しているため、同じファイルが <Video 1> と <Audio 2> になることもあります。
ガイドの目安は、生成タスクで英語およそ350〜500語です。また、情報量に応じて細部を各ショットに配分するよう求めています。台詞の多い作品は語数を満たすことより、話す時間の流れに収めることを優先し、編集タスクは元クリップに合わせて長さが変わります。
作成ツールは、完成したプロンプトを「参照画像から動画」モードのジェネレーターに渡します。ラベルが指すファイルは、そちらで添付してください。
操作手順ではなく、この形式の背景にある考え方を知りたい方は、H3プロンプト形式ガイドをご覧ください。1つの完全な例を、最初から最後まで解説しています。
ほかのモード向けの、すぐに使えるプロンプトはプロンプト集にあります。
MiniMax H3 Full-Reference Mode Rewrite Output Format Guide · September 2026