MiniMax H3 · FL2VA-Prompt-Generator

MiniMax H3: Start- und Endbildzum passenden Video-Prompt

H3 sieht deine beiden Bilder bereits. Was fehlt, ist der Weg dazwischen — genau den beschreibt ein FL2VA-Prompt. Gib an, was sich verändert. Der Generator bringt es in das von MiniMax vorgegebene Format: Bildzuordnung, Szenenablauf, Geräuschkulisse und Filmmusik.

Offizielle FL2VA-SyntaxAcht direkte Prompt-PrüfungenFür H3 im Browser oder ComfyUI

Prompt erstellen

Zwei Bilder, ein nachvollziehbarer Bewegungsablauf

Wähle eine Vorlage oder beschreibe deine eigene Idee. Rechts entsteht der Prompt direkt beim Eingeben — einschließlich der Bildzuordnung, die bei handgeschriebenen FL2VA-Prompts leicht übersehen wird.

Englische Prompt-Beispiele; passe die Beschreibungen nach Bedarf an. Feldnamen und Ausgabesyntax bleiben auf Englisch.

FL2VA-Prompt

Offizielles MiniMax-Format: zuerst die Bildzuordnung, dann drei Felder.

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 6.00-second mark of the target video.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a matte black gift box sits closed and centred on a pale marble counter under soft window light, its lid seam facing camera, matching the position, framing, and lighting established by Picture 1. The camera pushes in with small amplitude at slow speed as two hands enter from the lower edge, lift the lid straight up and set it aside, then withdraw as the tissue paper falls open around a glass serum bottle. Toward the end of the shot the differences narrow until the serum bottle stands upright and unobstructed in the centre of the counter with the opened box behind it and the dropper cap facing camera, landing on the exact pose, spacing, and composition established by Picture 2 at the 6.00-second mark.

overall_soundscape: A quiet room tone carries throughout, broken by the soft friction of the lid sliding free, the rustle of tissue paper, and the light tap of glass settling on stone.

non_diegetic_music: Sparse marimba notes at a slow tempo, joined by a warm synth pad that swells once as the bottle is revealed.
Mit MiniMax H3 im Browser starten

Öffnet den Generator mit diesem Prompt im Tab „Bild zu Video“. Füge dort dein Start- und Endbild hinzu.

Prompt-Prüfung

Keine Auffälligkeiten. Beide Bilder sind beschrieben, der Übergang ist ausgearbeitet und der Clip besteht aus einer durchgehenden Einstellung.

Aufbau

Die Bestandteile eines FL2VA-Prompts

Vier Teile in fester Reihenfolge. Die Bildzuordnung legt fest, welches Bild den Anfang und welches das Ende vorgibt.

Alignment line

Immer zuerst

Ein Satz ordnet Picture 1 dem Zeitpunkt 0.00 Sekunden und Picture 2 dem Clipende zu. Die Endzeit hat genau zwei Nachkommastellen. Vor den übrigen Feldern folgt eine Leerzeile.

integrated_multimodal_description

Erforderlich

Die Hauptbeschreibung: Stil, Anfangskomposition, Bewegung zwischen den Bildern, Kamera, sprechende Personen, Dialoge und sichtbare Geräuschquellen. Hier legst du den eigentlichen Ablauf fest.

overall_soundscape

Erforderlich

Ein bis vier Sätze zu Umgebungsgeräuschen, körperlichen Geräuschen und nichtsprachlichen Lauten. Dialog, Gesang und Musik, die Figuren hören, gehören in die Hauptbeschreibung.

non_diegetic_music

Erforderlich

Ein bis drei Sätze zur Musik, die die Figuren nicht hören: Instrumente, Tempo, Rhythmus und Dynamik. Wenn keine Musik gewünscht ist, ist N/A die richtige Angabe.

Ein FL2VA-Beispiel von MiniMax

Eine achtsekündige durchgehende Einstellung aus dem Prompt-Leitfaden zu den H3-Modellgewichten, hier gekürzt. Die Hauptbeschreibung beschreibt nicht einfach beide Bilder, sondern wie sich der Regenschirm dazwischen öffnet.

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a rain-soaked cyclist begins in the position and framing established by Picture 1 …

overall_soundscape: Rain falls steadily on the pavement, followed by the metallic click of the umbrella runner …

non_diegetic_music: N/A
Vollständigen Leitfaden auf Hugging Face lesen

Typische Probleme

Sechs Gründe, warum das Endbild verfehlt wird

Diese Muster helfen dir bei der Fehlersuche. Häufig lässt sich das Ergebnis schon mit einer klareren Beschreibung des Übergangs verbessern.

Das Endbild wird nicht erreicht

Ursache: Der Prompt beschreibt zwei Standbilder statt des Wegs dazwischen. So fehlt ein klarer Ablauf, der zum Zielzustand führt.

Lösung: Beschreibe die Zwischenzustände. Lass die Unterschiede schrittweise kleiner werden, bis die Komposition am Ende der letzten Einstellung Picture 2 entspricht.

Aussehen oder Kleidung verändert sich unterwegs

Ursache: Die Hauptbeschreibung legt nicht fest, welche Merkmale gleich bleiben sollen. Sobald sich die Person bewegt, kann das Modell sie neu interpretieren.

Lösung: Nenne feste Merkmale wie Kleidung, Farbe, wichtige Requisiten und räumliche Beziehungen auch im Bewegungssatz — nicht nur am Anfang.

Ein ungewollter Schnitt taucht auf

Ursache: Formulierungen für mehrere Einstellungen oder ein abrupter Perspektivwechsel werden als Schnitt interpretiert.

Lösung: Bleib nach Möglichkeit bei einer Einstellung. Beschreibe Abstands- und Winkeländerungen als Kamerabewegung. Nutze „the camera cuts to“ nur für einen bewusst geplanten Schnitt.

Die Bewegung hetzt und bleibt dann stehen

Ursache: Die Cliplänge passt nicht zum beschriebenen Ablauf. Zu viele Aktionen lassen sich nicht glaubwürdig in wenige Sekunden pressen.

Lösung: Passe die Handlung an die Dauer an oder verschiebe den Schnitt. Eine klar ausgeführte Veränderung ist besser als drei abgebrochene.

Der Dialog dauert länger als der Clip

Ursache: Der Satz ist für die verfügbare Zeit zu lang. Er wird abgeschnitten, oder der Mund bewegt sich nach dem Tonende weiter.

Lösung: Plane ungefähr zwei bis drei Wörter pro Sekunde und zusätzlich Zeit für die Handlung. Verlängere den Clip, statt den Text unnatürlich schnell sprechen zu lassen.

Musik und Umgebungsgeräusche überlagern sich

Ursache: Hörbare Musik aus der Szene wurde in non_diegetic_music eingetragen, oder die Geräuschkulisse wiederholt bereits beschriebene Ereignisse.

Lösung: Geräusche, die Figuren hören können, gehören in die Hauptbeschreibung. Reine Filmmusik gehört in non_diegetic_music. Die Geräuschkulisse fasst Umgebung, Aufprall und Atmen zusammen.

Modus wählen

FL2VA und die drei Alternativen

H3 kann Schlüsselbilder auf vier Arten nutzen. Die Bildzuordnung unterscheidet sich je nach Modus; eine falsche Zuordnung kann dazu führen, dass Referenzbilder nicht wie gewünscht berücksichtigt werden.

ModusBilderBildzuordnungKontrolleGeeignet, wenn …
T2VANur TextKeine BildzuordnungGeringsteDu keine Referenzbilder hast und das Modell sowohl Bildaufbau als auch Bewegung entwickeln soll.
I2VAStartbildPicture 1 bei 0.00 sAnfang festgelegtDas Anfangsbild feststeht, das Modell das Ende aber frei gestalten darf.
FL2VAStart- und EndbildPicture 1 bei 0.00 s, Picture 2 am EndeBeide Enden festgelegtAnfang und Ende bereits feststehen und du einen glaubwürdigen Übergang brauchst.
L2VAEndbildPicture 1 am EndeEnde festgelegtDas Zielbild feststeht — etwa ein Logo, eine Enthüllung oder eine Pose — und der Weg dorthin offen ist.

Anwendungsfälle

Was du mit zwei Bildern gestalten kannst

Die Vorlagen im Generator folgen demselben Prinzip: ein festes Anfangsbild, ein festes Zielbild und eine glaubwürdige Veränderung dazwischen.

Startbild eines MiniMax-H3-FL2VA-Prompts: eine geschlossene mattschwarze Geschenkbox mittig auf einer Marmorplatte
Bild 1
Endbild desselben FL2VA-Prompts: die ausgepackte Serumflasche steht aufrecht auf derselben Marmorplatte
Bild 2

E-Commerce

Produktenthüllung

Im ersten Bild die geschlossene Verpackung, im zweiten das freistehende Produkt. Wichtig ist, dass das Etikett während des gesamten Übergangs lesbar bleibt.

6s · eine Einstellung · Live-action, cinematic

Startbild eines Start-Endbild-Prompts: ein leerer, unrenovierter Wohnraum vom Türrahmen aus gesehen
Bild 1
Endbild desselben Prompts: derselbe Raum vollständig eingerichtet, aus identischer Perspektive
Bild 2

Renovierung / Umgestaltung

Vorher und nachher

Ein klassischer FL2V-Einsatz. Beide Bilder zeigen denselben Raum oder dasselbe Gesicht; das Modell ergänzt einen nachvollziehbaren Übergang.

8s · eine Einstellung · Live-action

Startbild eines FL2VA-Prompts: eine lockere blaue Bleistiftskizze eines Kranichs auf Papier aus der Vogelperspektive
Bild 1
Endbild desselben Prompts: die fertig kolorierte und mit Tusche ausgearbeitete Kranichillustration auf demselben Blatt
Bild 2

Kreativer Prozess

Von der Skizze zum fertigen Werk

Bild 1 zeigt den Entwurf, Bild 2 das fertige Werk. Geeignet für Illustrationen, Design, Lettering und 3D-Präsentationen.

10s · eine Einstellung · 2D-animated

Die Bildpaare veranschaulichen geeignete FL2VA-Eingaben: gleicher Bildausschnitt, gleiches Licht und eine gezielte Veränderung. Es sind Referenzbilder, keine mit MiniMax H3 erzeugten Ergebnisse.

Anleitung

Von zwei Standbildern zum fertigen Clip

  1. 1

    Wähle zuerst die beiden Bilder

    Die Qualität eines FL2VA-Clips hängt stark vom Bildpaar ab. Motiv, Objektivwirkung und Beleuchtung sollten zusammenpassen, sofern ihre Veränderung nicht gerade das Ziel ist. Zwischen beiden Zuständen muss ein plausibler Weg möglich sein.

  2. 2

    Lege vor dem Schreiben die Dauer fest

    Die Endzeit steht wörtlich in der Bildzuordnung. Änderst du sie später, muss auch der Prompt angepasst werden. Unterstützt werden vier bis fünfzehn Sekunden; sechs bis zehn Sekunden passen oft zu einer einzelnen Veränderung.

  3. 3

    Beschreibe den Übergang statt der Bilder

    Das Modell sieht beide Bilder bereits. Konzentriere dich darauf, was sich bewegt, wie Gegenstände weitergegeben werden, wie sich die Komposition entwickelt und wie sie das Endbild erreicht.

  4. 4

    Kopiere den Prompt und nutze beide Bilder

    Füge den Prompt mit Start- und Endbild in den Bild-zu-Video-Editor oder einen lokalen ComfyUI-Workflow ein. Prüfe nicht nur die Bewegung in der Mitte, sondern vor allem, ob das Endbild tatsächlich erreicht wird.

    MiniMax H3 Bild-zu-Video öffnen

FAQ

Fragen zu Start- und Endbildern

Was ist ein Start-Endbild-Prompt für MiniMax H3?

Gemeint ist das FL2VA-Format. Eine Bildzuordnung legt Picture 1 auf 0.00 Sekunden und Picture 2 auf das Clipende. Danach folgen integrated_multimodal_description, overall_soundscape und non_diegetic_music. Da H3 beide Bilder bereits sieht, beschreibt der Haupttext vor allem die Bewegung dazwischen.

Warum braucht die Bildzuordnung zwei Nachkommastellen?

MiniMax gibt die Endzeit im Format S.SS vor, also mit genau zwei Nachkommastellen. Acht Sekunden werden als 8.00 geschrieben, nicht als 8 oder 8.0. Es geht um das Format, nicht um zusätzliche zeitliche Genauigkeit. Dieser Generator setzt es automatisch um.

Soll ein FL2VA-Prompt eine oder mehrere Einstellungen enthalten?

In der Regel eine. MiniMax empfiehlt eine durchgehende Einstellung, damit das Modell kontinuierlich vom Start- zum Endbild interpolieren kann. Mehrere Einstellungen sind nur sinnvoll, wenn sie ausdrücklich benötigt werden. Bei einem Schnitt muss die letzte Einstellung das Endbild am Videoende erreichen.

Kann ich hier ein Video mit Start- und Endbild erstellen?

Ja. Der Generator auf der Startseite hat einen Tab „Bild zu Video“ mit einem Startbild und einem optionalen Endbild. Sind beide vorhanden, werden sie als first_frame_url und last_frame_url an H3 übergeben. Erstelle hier den Prompt, öffne den Generator und füge dort beide Bilder hinzu.

Was unterscheidet FL2VA von Bild zu Video?

I2VA legt nur das Startbild fest; das Ende bleibt dem Modell überlassen. FL2VA legt beide Enden fest und eignet sich etwa für eine bestimmte Produktansicht, ein fertiges Design oder eine Schlussgeste. Ein physikalisch unplausibles Bildpaar kann allerdings schlechtere Ergebnisse liefern als ein einzelnes Startbild.

Funktioniert der erzeugte Prompt auch in ComfyUI?

Ja. Das Format stammt aus dem Prompt-Leitfaden zu den offenen H3-Modellgewichten und lässt sich sowohl im gehosteten Dienst als auch in einem lokalen ComfyUI-Workflow verwenden. Auch der auf Qwen3-VL 8B basierende multimodale LightX2V-Rewriter, der first_frame und last_frame direkt liest, gibt dieselben drei Felder aus.

Wie lang darf der Dialog sein?

Rechne grob mit zwei bis drei Wörtern pro Sekunde und lass Zeit für die Handlung. Dialog steht in einem <d>[Language] ...</d>-Tag; die sprechende Person wird außerhalb genannt. Der Generator warnt, wenn der Text für die gewählte Dauer zu lang erscheint.

Was tun, wenn die beiden Bilder zu weit auseinanderliegen?

Das Modell kann den Übergang wie eine Überblendung statt wie echte Bewegung darstellen. Beschreibe sichtbare Zwischenschritte, verlängere den Clip oder teile die Idee auf zwei Generierungen auf und schneide sie zusammen.

Beide Bilder stehen fest. Beschreibe den Weg dazwischen.

Der Bild-zu-Video-Editor dieser Website übergibt Start- und Endbild an MiniMax H3. Erstelle oben den Prompt, öffne den Editor, lade beide Bilder hoch und prüfe, ob der Clip dein Zielbild erreicht.

Die FL2VA-Syntax dieser Seite — Bildzuordnung, [Shot N]-Schnitte, Kamerabegriffe und drei Ausgabefelder — stammt aus dem Video Prompt Writing Guide von MiniMaxAI zu den offenen H3-Modellgewichten. Geprüft am August 2026. Diese Website ist nicht mit MiniMax verbunden.