Referenz zu Video · Prompt-Baukasten

MiniMax H3 Prompt-Baukasten für Referenz zu Video

Sobald du MiniMax H3 Referenzbilder, Clips oder Audio übergibst, liest das Modell nicht mehr den Drei-Felder-Prompt der anderen Modi, sondern erwartet sechs Abschnitte. Diese Seite schreibt sie für dich, nummeriert jedes Referenz-Label und fängt die Formatfehler ab, durch die eine Referenz stillschweigend ignoriert wird.

Alle sechs offiziellen AbschnitteGetrennte Marker für Bild und AudioStartet direkt im Generator

Deine Referenzdateien

Beispiel-Referenzfoto: eine Frau mit schulterlangem rotbraunem Haar in einem grauen Strickpullover<Picture 1>
Beispiel-Referenzfoto: eine schmale Buchhandlung mit Eichenregalen, einer Rollleiter und einer Schreibtischlampe aus Messing<Picture 2>
Beispiel-Standbild eines Quellclips: ein sitzender Interviewpartner vor einer schlichten grauen Wand<Video 1>
<Audio 1>
werden zu sechs Prompt-Abschnitten
  1. 1subject_definitionsNur Ref2VA
  2. 2summaryNur Ref2VA
  3. 3retention_analysisNur Ref2VA
  4. 4detailed_descriptionNur Ref2VA
  5. 5overall_soundscape
  6. 6non_diegetic_music
Beispieldateien zur Veranschaulichung – generierte Platzhalter für das, was du hochladen würdest, kein MiniMax-H3-Ergebnis.

Prompt-Baukasten

Beschreibe deine Referenzdateien und erhalte die sechs Abschnitte

Lege für jede Datei, die du hochladen willst, eine Zeile an und gib an, wofür sie gedacht ist. Genau diese Wahl entscheidet, ob die Datei eine eigene Label-Zeile bekommt oder in einer Motivdefinition genannt wird – die Unterscheidung, die in Referenz-zu-Video-Prompts für MiniMax H3 am häufigsten falsch gemacht wird. Starte mit einer Vorlage und passe sie an.

Starte mit einem Setup aus der Praxis

Jedes Setup kombiniert andere Dateien mit anderen Aufgaben und ergibt daher ein anderes Präfix der Zusammenfassung. Wähle das passendste und passe es an.

Die Beispielbilder sind generierte Platzhalter für Dateien, die du hochladen würdest – keine Modellausgabe.

Präfix der Zusammenfassungreference generation

Eine Zeile pro hochgeladener Datei. Die Nummern für Picture, Video und Audio laufen unabhängig voneinander, jeweils in der Reihenfolge, in der du sie hinzufügst.

Beispiel-Referenzfoto: eine Frau mit schulterlangem rotbraunem Haar in einem grauen Strickpullover
<Subject 1><Picture 1>
Erhaltung und Einstellungenfully_preserved

Wird zu einer <Subject N>-Zeile, in der das Datei-Label genannt wird. Eine eigene Zeile bekommt die Datei nicht – gegen genau diese Regel wird am häufigsten verstoßen.

Erscheint in
Beispiel-Referenzfoto: eine schmale Buchhandlung mit Eichenregalen, einer Rollleiter und einer Schreibtischlampe aus Messing
<Subject 2><Picture 2>
Erhaltung und Einstellungenfully_preserved

Wird zu einer <Subject N>-Zeile, in der das Datei-Label genannt wird. Eine eigene Zeile bekommt die Datei nicht – gegen genau diese Regel wird am häufigsten verstoßen.

Erscheint in

Ref2VA-Prompt

344 Wörter · Bereich 350–500

Auf Englisch, wie H3 es erwartet. Dialoge, Liedtexte und Text im Bild bleiben in <d>-Tags in ihrer Originalsprache.

subject_definitions:
<Subject 1> is the young woman in <Picture 1>, with shoulder-length auburn hair, a grey knit sweater and a thin gold chain at the collar.
<Subject 2> is the narrow bookshop interior in <Picture 2>, with floor-to-ceiling oak shelves, a brass desk lamp on the counter and a rolling ladder.

summary:
[reference generation] <Subject 1> takes a clothbound volume down from the upper shelves of <Subject 2> and carries it to the counter, where she settles and looks up toward the door.

retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - her face, auburn hair length, grey knit sweater and gold chain are carried into both shots without change.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the oak shelving, brass desk lamp and rolling ladder remain the only set, and no additional room or exit is introduced.

detailed_description:
The target video is in a warm, realistic style with soft practical lighting and a shallow depth of field.
[Shot 1] A medium-wide shot establishes <Subject 2>, the narrow bookshop, with floor-to-ceiling oak shelves running the length of the frame and a brass desk lamp burning at the counter on the right. Late-afternoon light enters from a window off-frame left and falls in a soft band across the middle shelves, leaving the upper rows in shadow. <Subject 1>, the young woman with shoulder-length auburn hair and a grey knit sweater, stands on the second rung of the rolling ladder with her left hand flat against a shelf edge for balance. She tilts her head back to read the spines above her, then draws a clothbound volume free with two fingers, and the books on either side tip inward to fill the gap it leaves. She turns the volume over to read the spine, and a thin line of dust lifts off the top edge and drifts through the band of light. The camera pushes in with small amplitude at slow speed toward the book in her hands.
[Shot 2] At 00:04.000, the shot cuts to a close-up of <Subject 1> at the counter of <Subject 2>, with the brass desk lamp just inside the right edge of frame throwing warm light across one side of her face and leaving the other in shadow. She sets the clothbound volume down on the wood, flattens the cover with her palm, and holds it there a moment longer than she needs to. Her thumb moves once across the corner of the boards. She lets out a short breath and her shoulders drop as it leaves her. The thin gold chain at her collar catches the lamp as she shifts her weight onto her other foot. She lifts her eyes from the book and looks up and past the camera toward the door, her expression settling into something closer to expectation than surprise. The camera holds a static shot throughout, letting her come to rest inside a frame that does not move with her.

overall_soundscape:
A quiet indoor room tone runs throughout, with the creak of the ladder under a shifting weight, pages riffling under a thumb, and the soft knock of board covers meeting the counter.

non_diegetic_music:
A sparse nylon-string guitar figure at a slow tempo, with a sustained low string underneath and no swell.
Hier generieren

Öffnet den Generator mit diesem Prompt im Modus „Referenz zu Video“. Füge dort deine Dateien hinzu.

Formatprüfung

Keine Formatprobleme gefunden.

Präfix der Zusammenfassung anpassen

Ausgegraute Typen sind durch deine Dateien festgelegt. Klicke die übrigen an, um eine Beziehung zu ergänzen, die sich nicht aus den Dateien ergibt.

Das Format

Sechs Abschnitte statt drei

Text-zu-Video, Bild-zu-Video und die Keyframe-Modi teilen sich dieselben drei Kernfelder. Sobald eine Anfrage Referenzdateien enthält, erwartet MiniMax H3 bei Referenz zu Video eine andere, längere Struktur – und der Drei-Felder-Prompt, den du überall sonst verwendest, hat hier nicht mehr die richtige Form.

  1. 1
    subject_definitions

    Eine Zeile pro verfolgtem Element: sein Label, wofür das Label steht und an welche Merkmale sich das Modell halten soll.

  2. 2
    summary

    Ein kurzer Absatz, eingeleitet von einem Aufgabentyp-Präfix in eckigen Klammern, das angibt, um welche Art von Aufgabe es sich handelt.

  3. 3
    retention_analysis

    Eine Zeile pro Label, jeweils mit einem festen Beziehungsmarker und einer Notiz dazu, was erhalten bleibt.

  4. 4
    detailed_description

    Der Hauptteil: die Einstellungen in Wiedergabereihenfolge, mit Labels an den Stellen, an denen sie greifen.

  5. 5
    overall_soundscape

    Umgebungs- und Handlungsgeräusche im gesamten Clip. Gleiche Bedeutung wie in den Basismodi.

  6. 6
    non_diegetic_music

    Filmmusik, die nur das Publikum hört. Gleiche Bedeutung wie in den Basismodi.

Was sich bei Referenz zu Video ändert – und was bleibt

Einstellungen, Kameravokabular, Sprecher-IDs und Dialog-Tags teilt Referenz zu Video mit den Basismodi – alles, was du darüber schon weißt, gilt hier weiter. Vier Dinge ändern sich.

Hauptfeld
Basismodiintegrated_multimodal_descriptionReferenz zu Videodetailed_description
Stilsatz
BasismodiSteht nach [Shot 1]Referenz zu VideoSteht in einer eigenen Zeile vor [Shot 1]
Referenz-Labels
BasismodiNicht verwendetReferenz zu VideoBeim ersten Auftreten eingefügt und überall, wo die Rolle greift
Ton
BasismodiBeschreibt den eigenen Ton des VideosReferenz zu VideoGibt zusätzlich an, ob jedes genannte Signal kopiert oder referenziert wird

Die letzten beiden sind gegenüber dem Basis-Leitfaden unverändert. Die ersten vier gibt es nur bei Referenz zu Video – deshalb verliert ein Prompt, der aus einer Text-zu-Video-Vorlage kopiert wurde, seine Referenzen, ohne dass ein Fehler sichtbar wird.

Sind deine Bilder ein Start- und ein Endbild statt Figurenreferenzen, ist das ein anderer Modus mit einem anderen Zuordnungssatz – den schreibt stattdessen das Prompt-Tool für Start- und Endbild.

Kamerabewegungen werden in beiden Modi gleich formuliert – die zwanzig Bewegungsarten auf der Seite zur Kamerasteuerung gelten hier also unverändert.

Labels

Vier Label-Typen – und die Regel, die entscheidet, welchen du bekommst

In Referenz zu Video wird jede Datei über ein Label angesprochen, und dasselbe Label behält in allen sechs Abschnitten seine Bedeutung. Picture-, Video- und Audio-Nummern werden unabhängig voneinander vergeben, daher können <Video 1> und <Audio 2> aus derselben Datei stammen.

Beispiel-Referenzfoto: eine Frau mit schulterlangem rotbraunem Haar in einem grauen Strickpullover<Subject N>

Wiederverwendbarer sichtbarer Inhalt: eine Person, ein Tier, ein Objekt, eine Szene, ein Kostüm, ein Requisit, ein Stil, eine Handlung oder eine Pose. Ein Motiv kann auf mehreren Dateien beruhen, und eine Datei kann mehrere Motive liefern.

Beispiel-Startbild: ein Fischhändler hinter einer Theke mit Crushed Ice auf einem Fischmarkt im Morgengrauen<Picture N>

Ein Bild, das als konkreter Frame dient – Startbild, Keyframe, Endbild – oder als Storyboard-Anker für die Planung der Einstellungen.

Beispiel-Endbild eines Quellclips: ein Radfahrer in einer gelben Regenjacke, der an einer roten Ampel hält<Video N>

Eine Beziehung auf Ebene des ganzen Videos: der Clip, der bearbeitet wird, der Clip, der fortgesetzt wird, oder eine Quelle für Schnitte, Tempo und Kameraführung.

<Audio N>

Ein Audiosignal, das kopiert oder referenziert wird – als eigene Datei oder als synchrone Tonspur eines Referenzvideos.

Die Regel, gegen die die meisten Referenz-zu-Video-Prompts verstoßen

Dient ein Bild nur dazu, eine Figur, eine Szene, ein Kostüm oder einen Stil festzulegen, bekommt es keinen eigenständigen <Picture N>-Eintrag. Sein Label wird stattdessen in der <Subject N>-Definition genannt und taucht in retention_analysis nie auf. Eine eigene Zeile bekommt eine Datei nur, wenn sie eine strukturelle Rolle spielt: als Frame-Anker, als bearbeitete oder fortgesetzte Quelle oder als Träger von Audio.

Falsch

<Picture 1> is a reference image of the young woman.
<Subject 1> is the young woman.

Richtig

<Subject 1> is the young woman in <Picture 1>, with long dark hair, a blue cardigan and a thin silver necklace.

Erhaltungsmarker

Zwei Marker-Sets – und sie sind nicht austauschbar

Jede Zeile in retention_analysis trägt einen festen englischen Marker, der angibt, wie stark Referenz zu Video an dieser Datei festhält. Bild- und Tonspur verwenden unterschiedliche Sets – ein Unterschied, den fast alle Anleitungen von Dritten weglassen, weil meist nur die vier visuellen Marker zitiert werden. Nur weak_reference gehört zu beiden.

Für <Subject N>, <Picture N> und <Video N>

  • fully_preserved

    Die definierte Rolle der Referenz bleibt vollständig erhalten.

    Eine Figur behält Gesicht, Frisur und Kleidung in jeder Einstellung.

  • partially_preserved

    Wird weiterhin verwendet, aber einige definierte Merkmale ändern sich oder bleiben nur teilweise erhalten.

    Ein Raum behält seine Aufteilung, während sich die Wandgestaltung ändert.

  • attribute_transfer

    Merkmale gehen auf ein anderes, klar erkennbares Zielmotiv über.

    Eine Person trägt das Outfit einer anderen.

  • weak_reference

    Erhalten bleibt nur eine grobe Ähnlichkeit in Stil, Kategorie, Bildaufbau oder Atmosphäre.

    Ein Clip liefert nur das Tempo, sonst nichts.

Für <Audio N>

  • fully_copy

    Das vollständige Quell-Audio wird zur vollständigen finalen Tonspur des Videos.

    Bei einer Bearbeitung bleibt der Originalton des Interviews unangetastet.

  • partially_copy

    Ein Teil der Timeline oder ausgewählte Ebenen werden kopiert, oder es werden danach Ebenen hinzugefügt oder ersetzt.

    Der Dialog wird kopiert, die Umgebungsgeräusche entstehen neu.

  • reference

    Nichts wird kopiert: Referenziert werden nur Klangfarbe, Rhythmus, Musikstil, Dialoginhalt oder Klangtextur.

    Ein Sprecher orientiert sich an einer Referenzstimme, ohne sie wiederzuverwenden.

  • weak_reference

    Erhalten bleibt nur eine grobe Ähnlichkeit in Kategorie oder Atmosphäre.

    Ein Track liefert eine allgemeine Stimmung.

Wähle einen Marker nur innerhalb der Rolle, die das Label in subject_definitions bereits hat. Neue Handlungen, Hintergründe oder Ereignisse im Zielvideo sind kein Verlust an Referenztreue und rechtfertigen daher keinen schwächeren Marker.

Präfix der Zusammenfassung

Sechs Aufgabentypen, verbunden mit einem Plus

Jede Zusammenfassung in Referenz zu Video beginnt mit einem Präfix in eckigen Klammern, das die Art der Aufgabe benennt. Entscheidend ist die Rolle, die jede Datei tatsächlich spielt, nicht der Dateityp: Ein Referenzvideo, das nur das Tempo vorgibt, ist reference generation, nicht video editing.

keyframe completion

Ein Bild dient als konkreter Frame-Anker: Startbild, Keyframe, Endbild oder ein anderer fester Frame.

reference generation

Eine Datei steuert die Generierung – Figur, Szene, Stil, Handlung, Kamera, Storyboard –, ohne ein konkreter Frame oder eine bearbeitete Quelle zu sein.

video editing

Ein vorhandenes Quellvideo wird direkt verändert. Das Generieren zwischen statischen Keyframes zählt nicht dazu.

video continuation

Neuer Inhalt setzt ein vorhandenes Quellvideo fort, verlängert es, nimmt es wieder auf oder schließt mit einem Übergang daran an.

audio reuse

Dasselbe Audiosignal wird ganz oder teilweise wiederverwendet.

audio reference

Referenziert werden nur Stil, Klangfarbe, Dialoginhalt, Textur, Beat oder Kontinuität – ohne dass ein Signal kopiert wird.

Kombinieren

Verbinde Typen mit einem Plus und wiederhole keinen. Setzt du einen Clip fort und nutzt dabei ein Bild als Endbild, lautet das Präfix [video continuation + keyframe completion]. Bearbeitest du einen Clip, dessen Originalton hörbar bleibt, lautet es [video editing + audio reuse] – die Audio-Hälfte vergisst man leicht, weil ihr Fehlen nichts Sichtbares kaputt macht.

Ein fester Satz

Bei einer Bearbeitung muss die Zusammenfassung – direkt nach dem Präfix – mit „The target video is an edited version of <Video 1>.“ beginnen. Der Baukasten setzt den Satz automatisch ein, sobald eine Datei als zu bearbeitende Quelle markiert ist.

Fehlersuche

Wenn Referenz zu Video deine Datei ignoriert

Referenz zu Video scheitert still und leise: Der Clip wird gerendert, die Credits sind verbraucht, und das einzige Symptom ist, dass sich das Modell nicht an deine hochgeladene Datei gehalten hat. Diese Formatursachen solltest du zuerst prüfen.

Eine Figur weicht vom hochgeladenen Bild ab

Wahrscheinliche Ursache
Das Bild hat einen eigenständigen <Picture N>-Eintrag bekommen und wird deshalb als Frame-Anker gelesen statt als Motiv, das reproduziert werden soll.
Lösung
Nenne das Bild innerhalb einer <Subject N>-Definition und lösche seine eigene Zeile.

Eine Referenz wird überhaupt nicht angewendet

Wahrscheinliche Ursache
Das Label ist definiert, wird aber in detailed_description nie genannt – nichts sagt dem Modell, wo es wirken soll.
Lösung
Führe jedes Label dort ein, wo es zum ersten Mal klar auftritt, und verwende es in späteren Einstellungen weiter.

Wiederverwendetes Audio klingt neu erzeugt statt kopiert

Wahrscheinliche Ursache
Die Audio-Zeile trägt einen visuellen Marker – oder reference, obwohl das Signal kopiert werden sollte.
Lösung
Verwende fully_copy oder partially_copy und gib das auch in dem Abschnitt an, der zur hörbaren Ebene passt.

Eine Bearbeitung verliert den Originaldialog

Wahrscheinliche Ursache
Das Präfix nennt video editing, aber nicht audio reuse – nichts legt fest, dass der Quellton erhalten bleibt.
Lösung
Schreibe [video editing + audio reuse] und ergänze eine <Audio N>-Zeile für die synchrone Tonspur.

Das Startbild wird nicht reproduziert

Wahrscheinliche Ursache
Ein einzelnes Bild wurde als Referenz beschrieben statt als Frame-Anker – das ist aber die Aufgabe von Bild-zu-Video, nicht die einer Motivdefinition.
Lösung
Markiere es als Startbild seiner Einstellung: Dann wird es zu einer <Picture N>-Zeile und ergänzt keyframe completion.

Nichts davon verlängert einen Clip über fünfzehn Sekunden hinaus – dafür planst du Segmente und gibst das Endbild jeweils weiter, und genau das übernimmt der Planer für längere Videos.

Häufige Fragen

Fragen zu Referenz-zu-Video-Prompts

Muss ich alle sechs Abschnitte verwenden?

Ja, sobald die Anfrage Referenzdateien enthält und du im Modus „Referenz zu Video“ arbeitest. Die letzten beiden Abschnitte dürfen N/A enthalten, wenn es nichts zu sagen gibt – der Abschnitt selbst steht aber trotzdem im Prompt. Hast du gar keine Referenzdateien, bist du nicht in diesem Modus und solltest stattdessen den Drei-Felder-Prompt verwenden.

Soll der Prompt auf Englisch sein?

Schreibe die sechs Abschnitte für Referenz zu Video auf Englisch. Die einzige Ausnahme im Leitfaden sind Dialoge, Liedtexte und im Bild sichtbarer Text, die in <d>-Tags ihre Originalsprache behalten – eine chinesische Dialogzeile bleibt also chinesisch, und nur die Beschreibung drumherum ist Englisch.

Wie viele Referenzbilder kann ich hochladen?

Der Modus „Referenz zu Video“ im Generator dieser Website nimmt bis zu drei Referenzbilder an. Die Nummerierung im Prompt folgt der Reihenfolge, in der du sie hinzufügst – halte die Zeilen im Baukasten also in derselben Reihenfolge wie deine Uploads.

Was ist der Unterschied zwischen <Subject 1> und <Picture 1>?

<Picture 1> steht für die Datei, <Subject 1> für den Inhalt, den du daraus wiederverwenden willst. Soll die Datei nur zeigen, wie jemand aussieht, brauchst du ein Motiv – und das Bild-Label wird in dessen Definition genannt, statt allein zu stehen.

Kann ein Motiv aus zwei Dateien stammen?

Ja. Der Leitfaden nennt als Beispiel das Aussehen aus einem Bild und die Bewegung aus einem Video, kombiniert zu einem Motiv, das angibt, was jede Datei beisteuert. Schreibe das direkt in die Definition; die Zeilen im Baukasten mit je einer Quelle decken den üblichen Fall ab.

Warum steht in retention_analysis kein (S1)?

Sprecher-IDs werden nach der Reihenfolge der stimmlichen Ereignisse im Zielvideo vergeben und gehören in die Beschreibung. Laut Leitfaden kommen sie in retention_analysis überhaupt nicht vor, selbst wenn eine Audioreferenz mit einem Sprecher verknüpft ist – diese Verknüpfung steht stattdessen in subject_definitions.

Erzeugt ein Referenzvideo automatisch ein <Audio N>?

Nein. Ein Referenzvideo mit Ton erzeugt nicht von selbst ein Audio-Label. <Audio N> fügst du nur hinzu, wenn die Tonspur tatsächlich kopiert oder referenziert wird. Video- und Audio-Nummern sind unabhängig voneinander, dieselbe Datei kann also <Video 1> und <Audio 2> sein.

Wie lang sollte detailed_description sein?

Für Generierungsaufgaben nennt der Leitfaden etwa 350 bis 500 englische Wörter und verlangt, die Details je nach Informationsdichte auf die Einstellungen zu verteilen. Bei dialoglastigen Clips richtet sich die Länge nach dem gesprochenen Zeitablauf statt nach einer Wortzahl, bei Bearbeitungen dagegen nach dem Quellclip.

Sechs Abschnitte für Referenz zu Video schreiben, dann direkt generieren

Der Baukasten übergibt den fertigen Prompt an den Generator im Modus „Referenz zu Video“. Dort hängst du die Dateien an, auf die sich die Labels beziehen.

Warum das Format so aussieht und nicht nur, wie es funktioniert, erklärt der Leitfaden zum H3-Prompt-Format – anhand eines vollständigen Beispiels von Anfang bis Ende.

Fertige Prompts für die anderen Modi findest du in der Prompt-Bibliothek.

MiniMax H3 Full-Reference Mode Rewrite Output Format Guide · September 2026