リファレンスから動画・プロンプト作成ツール

MiniMax H3 リファレンスから動画プロンプト作成ツール

MiniMax H3に参照画像や動画クリップ、音声を渡すと、ほかのモードで使う3項目のプロンプトは読まれなくなり、代わりに6つのセクションが求められます。このページはその6セクションを書き出し、参照ラベルに番号を振り、参照が気づかないうちに無視される原因となる形式ミスを検出します。

公式の6セクションを網羅映像と音声でマーカーを区別ジェネレーターで直接生成

参照ファイル

参照写真の例:肩までの長さの赤褐色の髪に、グレーのニットセーターを着た女性<Picture 1>
参照写真の例:オーク材の書棚、移動式のはしご、真鍮のデスクランプがある細長い書店<Picture 2>
元クリップの静止画の例:無地のグレーの壁の前に座り、インタビューに答える人物<Video 1>
<Audio 1>
6つのプロンプトセクションに変換
  1. 1subject_definitionsRef2VAのみ
  2. 2summaryRef2VAのみ
  3. 3retention_analysisRef2VAのみ
  4. 4detailed_descriptionRef2VAのみ
  5. 5overall_soundscape
  6. 6non_diegetic_music
説明用のサンプルファイルです。アップロードする素材の見本として生成したもので、MiniMax H3の出力ではありません。

プロンプト作成

参照素材を説明して、6つのセクションを作る

アップロードする予定のファイルごとに1行追加し、それぞれの用途を選びます。この選択ひとつで、そのファイルが専用のラベル行を持つのか、サブジェクト定義の中で引用されるのかが決まります。MiniMax H3のリファレンスから動画のプロンプトで、最も間違えやすいポイントです。まずプリセットを選び、そこから編集してください。

実際の構成から始める

構成ごとにファイルの組み合わせと役割が違うため、要約の接頭辞もそれぞれ異なります。いちばん近いものを選び、そこから編集してください。

サンプル画像は、アップロードするファイルの見本として生成したもので、モデルの出力ではありません。

要約の接頭辞reference generation

アップロードするファイルごとに1行。Picture、Video、Audioの番号はそれぞれ独立していて、追加した順に振られます。

参照写真の例:肩までの長さの赤褐色の髪に、グレーのニットセーターを着た女性
<Subject 1><Picture 1>
保持マーカーとショットfully_preserved

<Subject N> の行になり、ファイルのラベルはその中で引用されます。専用の行は作りません。これが最もよく破られるルールです。

登場するショット
参照写真の例:オーク材の書棚、移動式のはしご、真鍮のデスクランプがある細長い書店
<Subject 2><Picture 2>
保持マーカーとショットfully_preserved

<Subject N> の行になり、ファイルのラベルはその中で引用されます。専用の行は作りません。これが最もよく破られるルールです。

登場するショット

Ref2VAプロンプト

344語・目安350〜500語

H3の想定に合わせて英語で出力します。台詞、歌詞、画面内の文字は、<d> タグの中で元の言語のまま残ります。

subject_definitions:
<Subject 1> is the young woman in <Picture 1>, with shoulder-length auburn hair, a grey knit sweater and a thin gold chain at the collar.
<Subject 2> is the narrow bookshop interior in <Picture 2>, with floor-to-ceiling oak shelves, a brass desk lamp on the counter and a rolling ladder.

summary:
[reference generation] <Subject 1> takes a clothbound volume down from the upper shelves of <Subject 2> and carries it to the counter, where she settles and looks up toward the door.

retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - her face, auburn hair length, grey knit sweater and gold chain are carried into both shots without change.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the oak shelving, brass desk lamp and rolling ladder remain the only set, and no additional room or exit is introduced.

detailed_description:
The target video is in a warm, realistic style with soft practical lighting and a shallow depth of field.
[Shot 1] A medium-wide shot establishes <Subject 2>, the narrow bookshop, with floor-to-ceiling oak shelves running the length of the frame and a brass desk lamp burning at the counter on the right. Late-afternoon light enters from a window off-frame left and falls in a soft band across the middle shelves, leaving the upper rows in shadow. <Subject 1>, the young woman with shoulder-length auburn hair and a grey knit sweater, stands on the second rung of the rolling ladder with her left hand flat against a shelf edge for balance. She tilts her head back to read the spines above her, then draws a clothbound volume free with two fingers, and the books on either side tip inward to fill the gap it leaves. She turns the volume over to read the spine, and a thin line of dust lifts off the top edge and drifts through the band of light. The camera pushes in with small amplitude at slow speed toward the book in her hands.
[Shot 2] At 00:04.000, the shot cuts to a close-up of <Subject 1> at the counter of <Subject 2>, with the brass desk lamp just inside the right edge of frame throwing warm light across one side of her face and leaving the other in shadow. She sets the clothbound volume down on the wood, flattens the cover with her palm, and holds it there a moment longer than she needs to. Her thumb moves once across the corner of the boards. She lets out a short breath and her shoulders drop as it leaves her. The thin gold chain at her collar catches the lamp as she shifts her weight onto her other foot. She lifts her eyes from the book and looks up and past the camera toward the door, her expression settling into something closer to expectation than surprise. The camera holds a static shot throughout, letting her come to rest inside a frame that does not move with her.

overall_soundscape:
A quiet indoor room tone runs throughout, with the creak of the ladder under a shifting weight, pages riffling under a thumb, and the soft knock of board covers meeting the counter.

non_diegetic_music:
A sparse nylon-string guitar figure at a slow tempo, with a sustained low string underneath and no swell.
このサイトで生成

このプロンプトを読み込んだ状態で、ジェネレーターを「参照画像から動画」モードで開きます。ファイルはそちらで追加してください。

形式チェック

形式の問題は見つかりませんでした。

要約の接頭辞を調整

グレー表示のタスク種別は、素材の設定から決まります。それ以外をクリックすると、素材からは読み取れない関係を追加できます。

形式

3項目ではなく、6セクション

テキストから動画、画像から動画、キーフレーム系のモードは、どれも同じ3つの基本項目を使います。ところがリクエストに参照素材が含まれた時点で、MiniMax H3のリファレンスから動画は、別の、より長い構造を求めます。ほかのモードで使ってきた3項目のプロンプトは、ここでは形が合いません。

  1. 1
    subject_definitions

    追跡する対象ごとに1行。ラベル、そのラベルが指すもの、再現させたい特徴を書きます。

  2. 2
    summary

    短い1段落。冒頭に角括弧で囲んだタスク種別の接頭辞を付け、どんな種類の作業かを示します。

  3. 3
    retention_analysis

    ラベルごとに1行。決められた関係マーカーと、何が保たれるかの説明を書きます。

  4. 4
    detailed_description

    本文にあたる部分。ショットを再生順に書き、該当する箇所にラベルを入れます。

  5. 5
    overall_soundscape

    クリップ全体に流れる環境音と物音。基本モードと同じ意味です。

  6. 6
    non_diegetic_music

    視聴者だけに聞こえる劇伴。基本モードと同じ意味です。

リファレンスから動画で変わること、変わらないこと

ショット、カメラワークの用語、話者ID、台詞タグは基本モードと共通なので、それらについて知っていることは、リファレンスから動画でもそのまま使えます。変わるのは次の4点です。

本文の項目
基本モードintegrated_multimodal_descriptionリファレンスから動画detailed_description
スタイル文
基本モード[Shot 1] の後に書くリファレンスから動画[Shot 1] の前に独立した行で書く
参照ラベル
基本モード使わないリファレンスから動画初登場の箇所と、その役割が効くすべての箇所に入れる
音声
基本モード動画自体の音を書くリファレンスから動画引用した各信号がコピーか参照かも明記する

最後の2つは基本ガイドから変わっていません。最初の4つはリファレンスから動画にしかないため、テキストから動画のテンプレートからコピーしたプロンプトでは、エラーが一切表示されないまま参照が失われます。

画像がキャラクターの参照ではなく最初と最後のフレームなら、それは別のモードで、画像対応文も変わります。その文は最初と最後のフレーム用のプロンプト作成ツールで書き出せます。

カメラワークの書き方はどちらも同じなので、カメラ制御ページで紹介している20種類の動きは、ここでもそのまま使えます。

ラベル

4種類のラベルと、どれになるかを決めるルール

リファレンスから動画では、すべての素材をラベルで指し、同じラベルは6つのセクションを通じて同じ意味を持ちます。Picture、Video、Audioの番号はそれぞれ独立して振られるため、<Video 1> と <Audio 2> が同じファイルということもあります。

参照写真の例:肩までの長さの赤褐色の髪に、グレーのニットセーターを着た女性<Subject N>

再利用する、目に見える内容。人物、動物、物体、シーン、衣装、小道具、スタイル、動作、ポーズのいずれかです。1つのサブジェクトが複数のファイルを参照することも、1つのファイルから複数のサブジェクトを作ることもできます。

最初のフレームの例:夜明けの魚市場で、砕いた氷を敷いたカウンターの奥に立つ魚屋<Picture N>

特定のフレームとして使う画像(最初のフレーム、キーフレーム、最後のフレーム)、または絵コンテとしてカット割りの基準にする画像。

元クリップの最後のフレームの例:黄色いレインジャケットを着て、赤信号で止まっているサイクリスト<Video N>

動画全体に関わる関係。編集するクリップ、続きを作るクリップ、またはカット・テンポ・カメラワークの構成を借りる元の動画。

<Audio N>

コピーまたは参照する音声信号。単体の音声ファイルでも、参照動画の同期音声トラックでもかまいません。

リファレンスから動画のプロンプトで、最もよく破られるルール

キャラクター、シーン、衣装、スタイルを定義するためだけの画像には、独立した <Picture N> の行を作りません。そのラベルは <Subject N> の定義の中で引用し、retention_analysis には一切登場させません。ファイルが専用の行を持つのは、フレームを固定する、編集される、続きを作る元になる、音声を運ぶ、といった構造上の役割を担うときだけです。

誤った例

<Picture 1> is a reference image of the young woman.
<Subject 1> is the young woman.

正しい例

<Subject 1> is the young woman in <Picture 1>, with long dark hair, a blue cardigan and a thin silver necklace.

保持マーカー

2組のマーカーは、互いに代用できない

retention_analysis の各行には、リファレンスから動画がその素材をどれだけ強く保持するかを示す、決められた英語のマーカーを付けます。映像トラックと音声トラックでは、使うセットが異なります。よく引用されるのが映像用の4つであるため、この違いは第三者の解説記事のほとんどで抜け落ちています。両方に含まれるのは weak_reference だけです。

<Subject N>、<Picture N>、<Video N> 用

  • fully_preserved

    定義した参照の役割を、完全に保持します。

    キャラクターが、すべてのショットで顔、髪型、衣装を保ちます。

  • partially_preserved

    参照は使われますが、定義した特徴の一部が変わるか、一部しか保持されません。

    部屋のレイアウトは保ったまま、壁の仕上げが変わります。

  • attribute_transfer

    特徴が、はっきり識別できる別の対象へ移ります。

    ある人物の服を、別の人物に着せます。

  • weak_reference

    残るのは、スタイル、種類、構図、雰囲気のおおまかな類似だけです。

    クリップからテンポだけを借り、ほかは何も使いません。

<Audio N> 用

  • fully_copy

    元の音声全体が、そのまま動画の最終的な音声トラック全体になります。

    編集後も、元のインタビュー音声に一切手を加えずに残します。

  • partially_copy

    タイムラインの一部や選んだレイヤーだけをコピーするか、コピー後にレイヤーを追加・差し替えます。

    台詞はコピーし、環境音は作り直します。

  • reference

    何もコピーせず、音色、リズム、音楽スタイル、台詞の内容、質感だけを参照します。

    話し手の声を参照音声に寄せますが、その音声自体は再利用しません。

  • weak_reference

    残るのは、種類や雰囲気のおおまかな類似だけです。

    トラックから全体的な雰囲気だけを借ります。

マーカーは、そのラベルが subject_definitions ですでに持っている役割の範囲内で選びます。生成する動画に新しく加えた動作、背景、出来事は再現度の低下ではないため、マーカーを格下げする理由にはなりません。

要約の接頭辞

6つのタスク種別を「+」で組み合わせる

リファレンスから動画の要約は、どれも作業の種類を示す角括弧付きの接頭辞で始まります。ファイルの種類ではなく、各素材が実際に果たす役割で選んでください。テンポだけを借りる参照動画は reference generation で、video editing ではありません。

keyframe completion

画像で特定のフレームを固定する場合。最初のフレーム、キーフレーム、最後のフレーム、またはその他の固定フレームです。

reference generation

素材が特定のフレームや編集元にはならず、キャラクター、シーン、スタイル、動作、カメラワーク、絵コンテとして生成を導く場合。

video editing

既存の元動画を直接変更する場合。静止画のキーフレームの間を生成するのは該当しません。

video continuation

既存の元動画を起点に、新しい内容で続きを作る、延長する、再開する、または別の場面へ移る場合。

audio reuse

同じ音声信号を、全部または一部再利用する場合。

audio reference

信号はコピーせず、スタイル、音色、台詞の内容、質感、ビート、連続性だけを参照する場合。

組み合わせ方

種別は「+」でつなぎ、同じものを重複させません。画像を最後のフレームにしてクリップの続きを作るなら [video continuation + keyframe completion]。元の音声が聞こえる状態でクリップを編集するなら [video editing + audio reuse] です。音声側は、書き忘れても見た目には何も壊れないため、見落としがちです。

決まった一文

編集の場合、要約は接頭辞の直後を「The target video is an edited version of <Video 1>.」で始める必要があります。素材を編集元に指定すると、作成ツールがこの一文を自動で書き込みます。

トラブル対処

リファレンスから動画がファイルを無視するとき

リファレンスから動画は、失敗してもエラーになりません。クリップは生成され、クレジットも消費されます。症状は、アップロードしたファイルにモデルが従わなかったことだけです。まず確認したい形式上の原因を挙げます。

キャラクターがアップロード画像と違ってくる

考えられる原因
画像に独立した <Picture N> の行を作ったため、再現すべきサブジェクトではなく、フレームを固定する画像として読まれています。
対処法
画像を <Subject N> の定義の中で引用し、独立した行を削除します。

参照がまったく反映されない

考えられる原因
ラベルは定義されているものの detailed_description で一度も引用されておらず、どこで効かせるのかがモデルに伝わっていません。
対処法
各ラベルを最初にはっきり登場する箇所で導入し、以降のショットでも使い続けます。

再利用した音声が、コピーではなく作り直されて出てくる

考えられる原因
音声の行に映像用のマーカーが付いているか、信号をコピーしたいのに reference になっています。
対処法
fully_copy か partially_copy を使い、聞こえるレイヤーに対応するセクションでも、そのことを明記します。

編集すると元の台詞が消える

考えられる原因
接頭辞が video editing だけで audio reuse がないため、元の音声を残すことがどこにも示されていません。
対処法
[video editing + audio reuse] と書き、同期している音声トラック用に <Audio N> の行を追加します。

最初のフレームが再現されない

考えられる原因
1枚の画像を、フレームを固定するものではなく参照として記述しています。フレームの固定は画像から動画が担う役割で、サブジェクト定義の役割ではありません。
対処法
その画像をショットの最初のフレームに指定すると、<Picture N> の行になり、keyframe completion が加わります。

ここまでの方法では、クリップを15秒より長くはできません。15秒を超えるには区間を計画し、最後のフレームを次へ引き継ぎます。その作業は長尺動画プランナーで行えます。

よくある質問

リファレンスから動画のプロンプトに関する質問

6つのセクションはすべて必要ですか?

はい。リクエストに参照素材が含まれ、リファレンスから動画モードになった時点で、6つすべてが必要です。最後の2つは書くことがなければN/Aでかまいませんが、セクション自体は残ります。参照ファイルが1つもない場合はこのモードには当たらないので、代わりに3項目のプロンプトを使ってください。

プロンプトは英語で書くべきですか?

リファレンスから動画の6つのセクションは英語で書きます。ガイドが認める唯一の例外は、台詞、歌詞、シーン内に見える文字で、これらは <d> タグの中で元の言語のまま残します。つまり中国語の台詞は中国語のままで、周りの説明だけを英語にします。

参照画像は何枚までアップロードできますか?

当サイトのジェネレーターの「参照画像から動画」モードでは、参照画像を最大3枚まで使えます。プロンプト内の番号は追加した順に振られるため、作成ツールの行もアップロードと同じ順に並べてください。

<Subject 1> と <Picture 1> はどう違いますか?

<Picture 1> はファイルそのものを指し、<Subject 1> はそのファイルから再利用したい内容を指します。ファイルが人物の見た目を示すためだけにあるなら、使うべきはサブジェクトです。画像のラベルは単独の行にせず、サブジェクトの定義の中で引用します。

1つのサブジェクトを2つのファイルから作れますか?

はい。ガイドには、見た目を画像から、動きを動画から取り、それぞれのファイルが何を担うかを明記して1つのサブジェクトにまとめる例があります。その場合は定義に直接書いてください。作成ツールの1行1ファイルの形式は、よくあるケース向けです。

retention_analysis に (S1) がないのはなぜですか?

話者IDは、生成する動画の中で声が出る順に割り振られ、説明文の中に書くものです。ガイドには、音声の参照が話者に紐づいている場合でも retention_analysis には一切書かないと明記されています。その紐づけは subject_definitions に書きます。

参照動画から <Audio N> が自動で作られますか?

いいえ。音声入りの参照動画でも、それだけで音声ラベルが作られることはありません。<Audio N> を追加するのは、その音声トラックを実際にコピーまたは参照する場合だけです。また、VideoとAudioの番号は独立しているため、同じファイルが <Video 1> と <Audio 2> になることもあります。

detailed_description はどのくらいの長さにすべきですか?

ガイドの目安は、生成タスクで英語およそ350〜500語です。また、情報量に応じて細部を各ショットに配分するよう求めています。台詞の多い作品は語数を満たすことより、話す時間の流れに収めることを優先し、編集タスクは元クリップに合わせて長さが変わります。

リファレンスから動画の6セクションを書いて、そのまま生成

作成ツールは、完成したプロンプトを「参照画像から動画」モードのジェネレーターに渡します。ラベルが指すファイルは、そちらで添付してください。

操作手順ではなく、この形式の背景にある考え方を知りたい方は、H3プロンプト形式ガイドをご覧ください。1つの完全な例を、最初から最後まで解説しています。

ほかのモード向けの、すぐに使えるプロンプトはプロンプト集にあります。

MiniMax H3 Full-Reference Mode Rewrite Output Format Guide · September 2026