Sobald du MiniMax H3 Referenzbilder, Clips oder Audio übergibst, liest das Modell nicht mehr den Drei-Felder-Prompt der anderen Modi, sondern erwartet sechs Abschnitte. Diese Seite schreibt sie für dich, nummeriert jedes Referenz-Label und fängt die Formatfehler ab, durch die eine Referenz stillschweigend ignoriert wird.
Alle sechs offiziellen AbschnitteGetrennte Marker für Bild und AudioStartet direkt im Generator
Deine Referenzdateien
<Picture 1>
<Picture 2>
<Video 1>
<Audio 1>
werden zu sechs Prompt-Abschnitten
1subject_definitionsNur Ref2VA
2summaryNur Ref2VA
3retention_analysisNur Ref2VA
4detailed_descriptionNur Ref2VA
5overall_soundscape
6non_diegetic_music
Beispieldateien zur Veranschaulichung – generierte Platzhalter für das, was du hochladen würdest, kein MiniMax-H3-Ergebnis.
Prompt-Baukasten
Beschreibe deine Referenzdateien und erhalte die sechs Abschnitte
Lege für jede Datei, die du hochladen willst, eine Zeile an und gib an, wofür sie gedacht ist. Genau diese Wahl entscheidet, ob die Datei eine eigene Label-Zeile bekommt oder in einer Motivdefinition genannt wird – die Unterscheidung, die in Referenz-zu-Video-Prompts für MiniMax H3 am häufigsten falsch gemacht wird. Starte mit einer Vorlage und passe sie an.
Starte mit einem Setup aus der Praxis
Jedes Setup kombiniert andere Dateien mit anderen Aufgaben und ergibt daher ein anderes Präfix der Zusammenfassung. Wähle das passendste und passe es an.
Die Beispielbilder sind generierte Platzhalter für Dateien, die du hochladen würdest – keine Modellausgabe.
Präfix der Zusammenfassungreference generation
Eine Zeile pro hochgeladener Datei. Die Nummern für Picture, Video und Audio laufen unabhängig voneinander, jeweils in der Reihenfolge, in der du sie hinzufügst.
<Subject 1><Picture 1>
Erhaltung und Einstellungenfully_preserved
Wird zu einer <Subject N>-Zeile, in der das Datei-Label genannt wird. Eine eigene Zeile bekommt die Datei nicht – gegen genau diese Regel wird am häufigsten verstoßen.
Erscheint in
<Subject 2><Picture 2>
Erhaltung und Einstellungenfully_preserved
Wird zu einer <Subject N>-Zeile, in der das Datei-Label genannt wird. Eine eigene Zeile bekommt die Datei nicht – gegen genau diese Regel wird am häufigsten verstoßen.
Erscheint in
Ref2VA-Prompt
344 Wörter · Bereich 350–500
Auf Englisch, wie H3 es erwartet. Dialoge, Liedtexte und Text im Bild bleiben in <d>-Tags in ihrer Originalsprache.
subject_definitions:
<Subject 1> is the young woman in <Picture 1>, with shoulder-length auburn hair, a grey knit sweater and a thin gold chain at the collar.
<Subject 2> is the narrow bookshop interior in <Picture 2>, with floor-to-ceiling oak shelves, a brass desk lamp on the counter and a rolling ladder.
summary:
[reference generation] <Subject 1> takes a clothbound volume down from the upper shelves of <Subject 2> and carries it to the counter, where she settles and looks up toward the door.
retention_analysis:
<Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - her face, auburn hair length, grey knit sweater and gold chain are carried into both shots without change.
<Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the oak shelving, brass desk lamp and rolling ladder remain the only set, and no additional room or exit is introduced.
detailed_description:
The target video is in a warm, realistic style with soft practical lighting and a shallow depth of field.
[Shot 1] A medium-wide shot establishes <Subject 2>, the narrow bookshop, with floor-to-ceiling oak shelves running the length of the frame and a brass desk lamp burning at the counter on the right. Late-afternoon light enters from a window off-frame left and falls in a soft band across the middle shelves, leaving the upper rows in shadow. <Subject 1>, the young woman with shoulder-length auburn hair and a grey knit sweater, stands on the second rung of the rolling ladder with her left hand flat against a shelf edge for balance. She tilts her head back to read the spines above her, then draws a clothbound volume free with two fingers, and the books on either side tip inward to fill the gap it leaves. She turns the volume over to read the spine, and a thin line of dust lifts off the top edge and drifts through the band of light. The camera pushes in with small amplitude at slow speed toward the book in her hands.
[Shot 2] At 00:04.000, the shot cuts to a close-up of <Subject 1> at the counter of <Subject 2>, with the brass desk lamp just inside the right edge of frame throwing warm light across one side of her face and leaving the other in shadow. She sets the clothbound volume down on the wood, flattens the cover with her palm, and holds it there a moment longer than she needs to. Her thumb moves once across the corner of the boards. She lets out a short breath and her shoulders drop as it leaves her. The thin gold chain at her collar catches the lamp as she shifts her weight onto her other foot. She lifts her eyes from the book and looks up and past the camera toward the door, her expression settling into something closer to expectation than surprise. The camera holds a static shot throughout, letting her come to rest inside a frame that does not move with her.
overall_soundscape:
A quiet indoor room tone runs throughout, with the creak of the ladder under a shifting weight, pages riffling under a thumb, and the soft knock of board covers meeting the counter.
non_diegetic_music:
A sparse nylon-string guitar figure at a slow tempo, with a sustained low string underneath and no swell.
Öffnet den Generator mit diesem Prompt im Modus „Referenz zu Video“. Füge dort deine Dateien hinzu.
Formatprüfung
Keine Formatprobleme gefunden.
Präfix der Zusammenfassung anpassen
Ausgegraute Typen sind durch deine Dateien festgelegt. Klicke die übrigen an, um eine Beziehung zu ergänzen, die sich nicht aus den Dateien ergibt.
Das Format
Sechs Abschnitte statt drei
Text-zu-Video, Bild-zu-Video und die Keyframe-Modi teilen sich dieselben drei Kernfelder. Sobald eine Anfrage Referenzdateien enthält, erwartet MiniMax H3 bei Referenz zu Video eine andere, längere Struktur – und der Drei-Felder-Prompt, den du überall sonst verwendest, hat hier nicht mehr die richtige Form.
1
subject_definitions
Eine Zeile pro verfolgtem Element: sein Label, wofür das Label steht und an welche Merkmale sich das Modell halten soll.
2
summary
Ein kurzer Absatz, eingeleitet von einem Aufgabentyp-Präfix in eckigen Klammern, das angibt, um welche Art von Aufgabe es sich handelt.
3
retention_analysis
Eine Zeile pro Label, jeweils mit einem festen Beziehungsmarker und einer Notiz dazu, was erhalten bleibt.
4
detailed_description
Der Hauptteil: die Einstellungen in Wiedergabereihenfolge, mit Labels an den Stellen, an denen sie greifen.
5
overall_soundscape
Umgebungs- und Handlungsgeräusche im gesamten Clip. Gleiche Bedeutung wie in den Basismodi.
6
non_diegetic_music
Filmmusik, die nur das Publikum hört. Gleiche Bedeutung wie in den Basismodi.
Was sich bei Referenz zu Video ändert – und was bleibt
Einstellungen, Kameravokabular, Sprecher-IDs und Dialog-Tags teilt Referenz zu Video mit den Basismodi – alles, was du darüber schon weißt, gilt hier weiter. Vier Dinge ändern sich.
Hauptfeld
Basismodiintegrated_multimodal_descriptionReferenz zu Videodetailed_description
Stilsatz
BasismodiSteht nach [Shot 1]Referenz zu VideoSteht in einer eigenen Zeile vor [Shot 1]
Referenz-Labels
BasismodiNicht verwendetReferenz zu VideoBeim ersten Auftreten eingefügt und überall, wo die Rolle greift
Ton
BasismodiBeschreibt den eigenen Ton des VideosReferenz zu VideoGibt zusätzlich an, ob jedes genannte Signal kopiert oder referenziert wird
Die letzten beiden sind gegenüber dem Basis-Leitfaden unverändert. Die ersten vier gibt es nur bei Referenz zu Video – deshalb verliert ein Prompt, der aus einer Text-zu-Video-Vorlage kopiert wurde, seine Referenzen, ohne dass ein Fehler sichtbar wird.
Sind deine Bilder ein Start- und ein Endbild statt Figurenreferenzen, ist das ein anderer Modus mit einem anderen Zuordnungssatz – den schreibt stattdessen das Prompt-Tool für Start- und Endbild.
Kamerabewegungen werden in beiden Modi gleich formuliert – die zwanzig Bewegungsarten auf der Seite zur Kamerasteuerung gelten hier also unverändert.
Labels
Vier Label-Typen – und die Regel, die entscheidet, welchen du bekommst
In Referenz zu Video wird jede Datei über ein Label angesprochen, und dasselbe Label behält in allen sechs Abschnitten seine Bedeutung. Picture-, Video- und Audio-Nummern werden unabhängig voneinander vergeben, daher können <Video 1> und <Audio 2> aus derselben Datei stammen.
<Subject N>
Wiederverwendbarer sichtbarer Inhalt: eine Person, ein Tier, ein Objekt, eine Szene, ein Kostüm, ein Requisit, ein Stil, eine Handlung oder eine Pose. Ein Motiv kann auf mehreren Dateien beruhen, und eine Datei kann mehrere Motive liefern.
<Picture N>
Ein Bild, das als konkreter Frame dient – Startbild, Keyframe, Endbild – oder als Storyboard-Anker für die Planung der Einstellungen.
<Video N>
Eine Beziehung auf Ebene des ganzen Videos: der Clip, der bearbeitet wird, der Clip, der fortgesetzt wird, oder eine Quelle für Schnitte, Tempo und Kameraführung.
<Audio N>
Ein Audiosignal, das kopiert oder referenziert wird – als eigene Datei oder als synchrone Tonspur eines Referenzvideos.
Die Regel, gegen die die meisten Referenz-zu-Video-Prompts verstoßen
Dient ein Bild nur dazu, eine Figur, eine Szene, ein Kostüm oder einen Stil festzulegen, bekommt es keinen eigenständigen <Picture N>-Eintrag. Sein Label wird stattdessen in der <Subject N>-Definition genannt und taucht in retention_analysis nie auf. Eine eigene Zeile bekommt eine Datei nur, wenn sie eine strukturelle Rolle spielt: als Frame-Anker, als bearbeitete oder fortgesetzte Quelle oder als Träger von Audio.
Falsch
<Picture 1> is a reference image of the young woman.
<Subject 1> is the young woman.
Richtig
<Subject 1> is the young woman in <Picture 1>, with long dark hair, a blue cardigan and a thin silver necklace.
Erhaltungsmarker
Zwei Marker-Sets – und sie sind nicht austauschbar
Jede Zeile in retention_analysis trägt einen festen englischen Marker, der angibt, wie stark Referenz zu Video an dieser Datei festhält. Bild- und Tonspur verwenden unterschiedliche Sets – ein Unterschied, den fast alle Anleitungen von Dritten weglassen, weil meist nur die vier visuellen Marker zitiert werden. Nur weak_reference gehört zu beiden.
Für <Subject N>, <Picture N> und <Video N>
fully_preserved
Die definierte Rolle der Referenz bleibt vollständig erhalten.
Eine Figur behält Gesicht, Frisur und Kleidung in jeder Einstellung.
partially_preserved
Wird weiterhin verwendet, aber einige definierte Merkmale ändern sich oder bleiben nur teilweise erhalten.
Ein Raum behält seine Aufteilung, während sich die Wandgestaltung ändert.
attribute_transfer
Merkmale gehen auf ein anderes, klar erkennbares Zielmotiv über.
Eine Person trägt das Outfit einer anderen.
weak_reference
Erhalten bleibt nur eine grobe Ähnlichkeit in Stil, Kategorie, Bildaufbau oder Atmosphäre.
Ein Clip liefert nur das Tempo, sonst nichts.
Für <Audio N>
fully_copy
Das vollständige Quell-Audio wird zur vollständigen finalen Tonspur des Videos.
Bei einer Bearbeitung bleibt der Originalton des Interviews unangetastet.
partially_copy
Ein Teil der Timeline oder ausgewählte Ebenen werden kopiert, oder es werden danach Ebenen hinzugefügt oder ersetzt.
Der Dialog wird kopiert, die Umgebungsgeräusche entstehen neu.
reference
Nichts wird kopiert: Referenziert werden nur Klangfarbe, Rhythmus, Musikstil, Dialoginhalt oder Klangtextur.
Ein Sprecher orientiert sich an einer Referenzstimme, ohne sie wiederzuverwenden.
weak_reference
Erhalten bleibt nur eine grobe Ähnlichkeit in Kategorie oder Atmosphäre.
Ein Track liefert eine allgemeine Stimmung.
Wähle einen Marker nur innerhalb der Rolle, die das Label in subject_definitions bereits hat. Neue Handlungen, Hintergründe oder Ereignisse im Zielvideo sind kein Verlust an Referenztreue und rechtfertigen daher keinen schwächeren Marker.
Präfix der Zusammenfassung
Sechs Aufgabentypen, verbunden mit einem Plus
Jede Zusammenfassung in Referenz zu Video beginnt mit einem Präfix in eckigen Klammern, das die Art der Aufgabe benennt. Entscheidend ist die Rolle, die jede Datei tatsächlich spielt, nicht der Dateityp: Ein Referenzvideo, das nur das Tempo vorgibt, ist reference generation, nicht video editing.
keyframe completion
Ein Bild dient als konkreter Frame-Anker: Startbild, Keyframe, Endbild oder ein anderer fester Frame.
reference generation
Eine Datei steuert die Generierung – Figur, Szene, Stil, Handlung, Kamera, Storyboard –, ohne ein konkreter Frame oder eine bearbeitete Quelle zu sein.
video editing
Ein vorhandenes Quellvideo wird direkt verändert. Das Generieren zwischen statischen Keyframes zählt nicht dazu.
video continuation
Neuer Inhalt setzt ein vorhandenes Quellvideo fort, verlängert es, nimmt es wieder auf oder schließt mit einem Übergang daran an.
audio reuse
Dasselbe Audiosignal wird ganz oder teilweise wiederverwendet.
audio reference
Referenziert werden nur Stil, Klangfarbe, Dialoginhalt, Textur, Beat oder Kontinuität – ohne dass ein Signal kopiert wird.
Kombinieren
Verbinde Typen mit einem Plus und wiederhole keinen. Setzt du einen Clip fort und nutzt dabei ein Bild als Endbild, lautet das Präfix [video continuation + keyframe completion]. Bearbeitest du einen Clip, dessen Originalton hörbar bleibt, lautet es [video editing + audio reuse] – die Audio-Hälfte vergisst man leicht, weil ihr Fehlen nichts Sichtbares kaputt macht.
Ein fester Satz
Bei einer Bearbeitung muss die Zusammenfassung – direkt nach dem Präfix – mit „The target video is an edited version of <Video 1>.“ beginnen. Der Baukasten setzt den Satz automatisch ein, sobald eine Datei als zu bearbeitende Quelle markiert ist.
Fehlersuche
Wenn Referenz zu Video deine Datei ignoriert
Referenz zu Video scheitert still und leise: Der Clip wird gerendert, die Credits sind verbraucht, und das einzige Symptom ist, dass sich das Modell nicht an deine hochgeladene Datei gehalten hat. Diese Formatursachen solltest du zuerst prüfen.
Eine Figur weicht vom hochgeladenen Bild ab
Wahrscheinliche Ursache
Das Bild hat einen eigenständigen <Picture N>-Eintrag bekommen und wird deshalb als Frame-Anker gelesen statt als Motiv, das reproduziert werden soll.
Lösung
Nenne das Bild innerhalb einer <Subject N>-Definition und lösche seine eigene Zeile.
Eine Referenz wird überhaupt nicht angewendet
Wahrscheinliche Ursache
Das Label ist definiert, wird aber in detailed_description nie genannt – nichts sagt dem Modell, wo es wirken soll.
Lösung
Führe jedes Label dort ein, wo es zum ersten Mal klar auftritt, und verwende es in späteren Einstellungen weiter.
Wiederverwendetes Audio klingt neu erzeugt statt kopiert
Wahrscheinliche Ursache
Die Audio-Zeile trägt einen visuellen Marker – oder reference, obwohl das Signal kopiert werden sollte.
Lösung
Verwende fully_copy oder partially_copy und gib das auch in dem Abschnitt an, der zur hörbaren Ebene passt.
Eine Bearbeitung verliert den Originaldialog
Wahrscheinliche Ursache
Das Präfix nennt video editing, aber nicht audio reuse – nichts legt fest, dass der Quellton erhalten bleibt.
Lösung
Schreibe [video editing + audio reuse] und ergänze eine <Audio N>-Zeile für die synchrone Tonspur.
Das Startbild wird nicht reproduziert
Wahrscheinliche Ursache
Ein einzelnes Bild wurde als Referenz beschrieben statt als Frame-Anker – das ist aber die Aufgabe von Bild-zu-Video, nicht die einer Motivdefinition.
Lösung
Markiere es als Startbild seiner Einstellung: Dann wird es zu einer <Picture N>-Zeile und ergänzt keyframe completion.
Nichts davon verlängert einen Clip über fünfzehn Sekunden hinaus – dafür planst du Segmente und gibst das Endbild jeweils weiter, und genau das übernimmt der Planer für längere Videos.
Häufige Fragen
Fragen zu Referenz-zu-Video-Prompts
Muss ich alle sechs Abschnitte verwenden?
Ja, sobald die Anfrage Referenzdateien enthält und du im Modus „Referenz zu Video“ arbeitest. Die letzten beiden Abschnitte dürfen N/A enthalten, wenn es nichts zu sagen gibt – der Abschnitt selbst steht aber trotzdem im Prompt. Hast du gar keine Referenzdateien, bist du nicht in diesem Modus und solltest stattdessen den Drei-Felder-Prompt verwenden.
Soll der Prompt auf Englisch sein?
Schreibe die sechs Abschnitte für Referenz zu Video auf Englisch. Die einzige Ausnahme im Leitfaden sind Dialoge, Liedtexte und im Bild sichtbarer Text, die in <d>-Tags ihre Originalsprache behalten – eine chinesische Dialogzeile bleibt also chinesisch, und nur die Beschreibung drumherum ist Englisch.
Wie viele Referenzbilder kann ich hochladen?
Der Modus „Referenz zu Video“ im Generator dieser Website nimmt bis zu drei Referenzbilder an. Die Nummerierung im Prompt folgt der Reihenfolge, in der du sie hinzufügst – halte die Zeilen im Baukasten also in derselben Reihenfolge wie deine Uploads.
Was ist der Unterschied zwischen <Subject 1> und <Picture 1>?
<Picture 1> steht für die Datei, <Subject 1> für den Inhalt, den du daraus wiederverwenden willst. Soll die Datei nur zeigen, wie jemand aussieht, brauchst du ein Motiv – und das Bild-Label wird in dessen Definition genannt, statt allein zu stehen.
Kann ein Motiv aus zwei Dateien stammen?
Ja. Der Leitfaden nennt als Beispiel das Aussehen aus einem Bild und die Bewegung aus einem Video, kombiniert zu einem Motiv, das angibt, was jede Datei beisteuert. Schreibe das direkt in die Definition; die Zeilen im Baukasten mit je einer Quelle decken den üblichen Fall ab.
Warum steht in retention_analysis kein (S1)?
Sprecher-IDs werden nach der Reihenfolge der stimmlichen Ereignisse im Zielvideo vergeben und gehören in die Beschreibung. Laut Leitfaden kommen sie in retention_analysis überhaupt nicht vor, selbst wenn eine Audioreferenz mit einem Sprecher verknüpft ist – diese Verknüpfung steht stattdessen in subject_definitions.
Erzeugt ein Referenzvideo automatisch ein <Audio N>?
Nein. Ein Referenzvideo mit Ton erzeugt nicht von selbst ein Audio-Label. <Audio N> fügst du nur hinzu, wenn die Tonspur tatsächlich kopiert oder referenziert wird. Video- und Audio-Nummern sind unabhängig voneinander, dieselbe Datei kann also <Video 1> und <Audio 2> sein.
Wie lang sollte detailed_description sein?
Für Generierungsaufgaben nennt der Leitfaden etwa 350 bis 500 englische Wörter und verlangt, die Details je nach Informationsdichte auf die Einstellungen zu verteilen. Bei dialoglastigen Clips richtet sich die Länge nach dem gesprochenen Zeitablauf statt nach einer Wortzahl, bei Bearbeitungen dagegen nach dem Quellclip.
Sechs Abschnitte für Referenz zu Video schreiben, dann direkt generieren
Der Baukasten übergibt den fertigen Prompt an den Generator im Modus „Referenz zu Video“. Dort hängst du die Dateien an, auf die sich die Labels beziehen.
Warum das Format so aussieht und nicht nur, wie es funktioniert, erklärt der Leitfaden zum H3-Prompt-Format – anhand eines vollständigen Beispiels von Anfang bis Ende.
Fertige Prompts für die anderen Modi findest du in der Prompt-Bibliothek.