MiniMax H3Planer für längere Videos
H3 generiert pro Durchlauf 4 bis 15 Sekunden. Längere Videos entstehen aus aneinandergereihten Segmenten. Dieser Planer teilt die Laufzeit auf, formuliert die Prompts samt Anschlussanweisungen und zeigt dir die Kosten, bevor du Credits ausgibst.
Kurz erklärt
Kann MiniMax H3 ein 60-Sekunden-Video erstellen?
Nicht in einem einzigen Durchlauf. Der gehostete H3-Endpunkt akzeptiert 4 bis 15 Sekunden, nur in ganzen Sekunden. Ein Video mit 60 oder 120 Sekunden besteht aus mehreren Clips, die jeweils mit dem letzten Frame des vorherigen beginnen. So lässt sich ein Video fortsetzen – allerdings durch getrennte Generierungen, nicht durch einen einzigen langen Renderdurchlauf.
- Ein Durchlauf: 4–15 Sekunden mit nativ synchronisiertem Audio.
- 60 Sekunden = 4 Segmente à 15 s. 120 Sekunden = 8 Segmente à 15 s.
- Ab dem zweiten Segment nutzt jeder Bild-zu-Video-Auftrag den letzten Frame des vorherigen Clips als Eingabebild.
Diese Seite plant die Abfolge und erstellt die Prompts. Die Segmente musst du anschließend einzeln generieren und die Dateien selbst zusammenfügen. Einen Knopf für die automatische Generierung und Montage des gesamten Videos gibt es hier noch nicht.
Der Planer
Teile die Laufzeit in H3-kompatible Segmente auf
Wähle die Gesamtlänge, beschreibe Motiv und Schauplatz und lege pro Segment eine Handlung fest. Die Prompts lassen sich direkt kopieren und verwenden das englische Ausgabeformat dieses Tools.
Englische Prompt-Beispiele; passe die Beschreibungen nach Bedarf an. Feldnamen und Ausgabesyntax bleiben auf Englisch.
Eine Handlung pro Segment
Beschreibe, was sich in diesem Abschnitt verändert. Schreibe eine konkrete Handlung statt einer Zusammenfassung. Ohne klare Aktion kann das Bild abdriften oder Bewegungen wiederholen.
Deine Segmente
4 Segmente · 60 s · insgesamt etwa 804 Credits
Generiere sie der Reihe nach. Entnimm jedem fertigen Clip den letzten Frame und verwende ihn als Eingabebild des nächsten Segments.
Segment 1 · 0–15 s · 15 s
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, matching the position, framing, and lighting established by <Picture 1>. she pushes off the kerb and threads between two stalls, checking the address on her phone. overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance. non_diegetic_music: N/A
Segment 2 · 15–30 s · 15 s
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she slows at a crossing as a tram passes, rain beading on the jacket. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening. overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance. non_diegetic_music: N/A
Segment 3 · 30–45 s · 15 s
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she lifts the parcel from the crate and scans the shopfront numbers. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening. overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance. non_diegetic_music: N/A
Segment 4 · 45–60 s · 15 s
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she hands the parcel over at a lit doorway and steps back into the rain. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening. overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance. non_diegetic_music: N/A
Öffnet den Bild-zu-Video-Generator mit dem ausgefüllten Prompt. Für die Generierung brauchst du ein Konto und Credits.
Bevor du Credits ausgibst
Keine offenen Hinweise. Prüfe die Übergänge trotzdem am fertigen Material.
Die Technik
Was „Video fortsetzen“ tatsächlich bedeutet
Die H3-API besitzt keinen extend-Parameter. Die Fortsetzung ist ein Arbeitsablauf, kein eigener Endpunkt: Du übergibst der nächsten Generierung den letzten Frame des vorherigen Clips und lässt die Szene dort weitergehen.
- 1
Segment 1 generieren
Starte mit Text oder einem Referenzbild. Dieses Segment legt Identität, Farbpalette und Kameracharakter für die weitere Abfolge fest.
- 2
Den letzten Frame exportieren
Halte den fertigen Clip am Ende an und speichere den Frame oder exportiere ihn in einem Schnittprogramm. Dieses Standbild dient als Eingabe für das nächste Segment.
- 3
Das nächste Segment mit I2VA generieren
Verwende den letzten Frame als Eingabebild und den Anschluss-Prompt aus dem Planer. Es ist kein Start-/Endbild-Modus, denn ein zweites Bild liegt noch nicht vor.
- 4
Wiederholen und Dateien verbinden
Fahre bis zur gewünschten Laufzeit fort und füge die Clips in einem Schnittprogramm zusammen. Bis dahin bleibt jedes Segment eine eigene MP4-Datei.
Was den Übergang übersteht
- Komposition und Bildausschnitt am Schnittpunkt – du gibst denselben Frame weiter.
- Wortgleich wiederholte Angaben im Prompt: Motiv, Kleidung, Schauplatz und Stil-Token.
- Die grundlegende Farb- und Lichtstimmung, sofern das übergebene Bild gut belichtet ist.
Was an jedem Übergang neu entsteht
- Bewegung. Ein Standbild enthält keine Geschwindigkeit. Das Modell leitet sie neu ab; schnelle Aktionen können am Schnitt sichtbar stocken.
- Audio. Jedes Segment erzeugt seinen eigenen Ton. Ohne identische Angaben beginnen Atmosphäre und Musik neu.
- Alles außerhalb des Bildes. Was im übergebenen Frame nicht zu sehen ist, steht dem nächsten Segment nicht zur Verfügung.
Entscheidend ist die Bildanzahl: FL2VA gilt für Segmente mit vorgegebenem Start- und Endbild. Eine Fortsetzung mit nur dem letzten Frame des Vorgängers verwendet I2VA – und eine andere Anweisung. Eine FL2VA-Formulierung mit nur einem Bild kann dazu führen, dass die Referenz nicht wie beabsichtigt berücksichtigt wird.
Erwartungen
Wie lange die Abfolge zusammenhält
Jedes Segment kennt genau einen Frame der Vorgeschichte und deinen Prompt. Aus dieser Grenze lässt sich ableiten, welche Elemente mit zunehmender Länge anfällig werden.
| Länge der Kette | Bleibt meist erhalten | Beginnt abzuweichen |
|---|---|---|
| Segmente 1–2 | Identität, Kleidung, Farbpalette und Schauplatz. | Bei schnellen Aktionen das Bewegungstempo am ersten Übergang. |
| Segmente 3–4 | Identität und Schauplatz bei wiederholten festen Merkmalen. | Farbtemperatur und die Form kleinerer Requisiten. |
| Segmente 5–6 | Die grobe Szene und ausdrücklich beschriebene Merkmale. | Gesichter werden weicher oder verändern sich; Kleidungsdetails weichen ab. |
| Segmente 7–8 | Stil-Token und allgemeine Umgebung. | Im direkten Vergleich mit Segment 1 fallen kumulierte Abweichungen meist auf. |
Das sind technisch zu erwartende und aus der Community berichtete Fehlerbilder, keine von uns gemessenen Benchmark-Raten. Wenn wir Zahlen veröffentlichen, erläutern wir auch ihre Erhebung.
Kosten
Was ein längeres H3-Video hier kostet
H3 wird nach generierten Sekunden berechnet. Du zahlst für die Gesamtlaufzeit plus jedes Segment, das du erneut erstellst. Vor allem Wiederholungen bestimmen das Budget, nicht die Planung selbst.
| Laufzeit | Segmente à 15 s | Credits | Bei zwei Wiederholungen |
|---|---|---|---|
| 30s | 2 | 402 | 804 |
| 60s | 4 | 804 | 1206 |
| 90s | 6 | 1206 | 1608 |
| 120s | 8 | 1608 | 2010 |
Die Werte stammen aus der aktuellen H3-Preisberechnung dieser Website. Fehlgeschlagene Generierungen werden automatisch erstattet; ein fertiges Ergebnis, das dir nicht gefällt, dagegen nicht.
Schritt für Schritt
Ein 60-Sekunden-Video mit H3 erstellen
- 1
Die Abfolge planen
Wähle 60 Sekunden und 15-Sekunden-Segmente für vier Abschnitte. Gib jedem eine Handlung, damit keine inhaltlich unbestimmte Zeit entsteht.
- 2
Wiederkehrende Merkmale festlegen
Beschreibe das Motiv einmal konkret. Der Planer wiederholt die Beschreibung in allen vier Prompts. Das ist ein wichtiger Hebel gegen wechselndes Aussehen.
- 3
Segment 1 aus einem Referenzbild generieren
Öffne den Bild-zu-Video-Generator, lade das Startbild hoch, füge den ersten Prompt ein und generiere 15 Sekunden.
- 4
Die übrigen Segmente anschließen
Exportiere den letzten Frame jedes fertigen Clips, verwende ihn als nächste Eingabe und füge den passenden Segment-Prompt ein. Wiederhole das bis zur Ziellänge.
- 5
Clips zusammenfügen
Verbinde die vier MP4s in einem Schnittprogramm. Kürze an den Übergängen einige Frames, falls ein Bewegungsneustart sichtbar bleibt.
Begriffe unterscheiden
Drei Verfahren, die als „langes H3-Video“ bezeichnet werden
Diese Verfahren werden häufig verwechselt. Dieser Planer unterstützt das Aneinanderreihen kurzer Segmente.
| Verfahren | Was es bedeutet | Aktueller Stand |
|---|---|---|
| Einzelne Generierung | Eine Inferenz, eine Datei und nativ erzeugtes Audio. | Verfügbar, begrenzt auf 15 Sekunden. |
| Verkettete Segmente | Mehrere Generierungen, jeweils ab dem letzten Frame des Vorgängers. | Heute nutzbar. Diese Seite plant; du generierst und montierst die Teile. |
| Streaming- oder kausale Generierung | Während der Wiedergabe fortlaufend erzeugtes Video ohne feste Cliplänge. | Forschungsstadium. Nicht in der gehosteten H3-API und nicht auf dieser Seite verfügbar. |
Häufige Fragen
Fragen zu längeren H3-Videos
Wie lang kann ein MiniMax H3-Video sein?
Pro Generierung mindestens vier und höchstens fünfzehn Sekunden, nur in ganzen Sekunden. Das gilt für Text-zu-Video, Bild-zu-Video und referenzbasierte Generierung. Für längere Videos musst du mehrere Segmente verbinden.
Wie erstelle ich ein zweiminütiges MiniMax H3-Video?
Plane acht Segmente à 15 Sekunden. Starte mit einem Referenzbild und übergib danach jeweils den letzten Frame an das nächste Segment. Wiederhole dabei dieselben Merkmale des Motivs. Verbinde zum Schluss die acht Dateien und plane ein bis zwei Wiederholungen ein.
Hat H3 einen extend- oder continue-Endpunkt?
Nein. Die gehostete API enthält keinen extend-Parameter. Du setzt das Video fort, indem du den letzten Frame als Eingabebild der nächsten Generierung übergibst. Der Anschluss-Prompt verwendet daher Bild-zu-Video statt des Start-/Endbild-Formats.
Kann ich mein eigenes Video hochladen und fortsetzen?
Derzeit nicht direkt auf dieser Website. Der Generator nimmt Bilder an, keine Videos. Exportiere den letzten Frame deines Clips und beginne die Abfolge mit diesem Bild.
Warum stockt die Bewegung an Übergängen?
Ein Standbild enthält keine Geschwindigkeitsinformation. Das nächste Segment muss die Bewegung neu ableiten; schnelle Aktionen können am Schnitt kurz stillzustehen scheinen. Ruhigere Bewegungen am Übergang und das Kürzen einiger Frames beim Schnitt helfen.
Bleibt der Ton durchgehend?
Nicht automatisch. Jedes Segment erzeugt seinen eigenen Ton. Deshalb wiederholt der Planer dieselbe Klangbeschreibung in allen Prompts. Musik lässt sich meist zuverlässiger nachträglich unter das fertig montierte Video legen.
Ist das eine offizielle MiniMax-Funktion?
Nein. Die Grenze von 4–15 Sekunden stammt von MiniMax. Die Verkettung ist ein Community-Workflow, den wir in diesem Planer umgesetzt haben. Diese Website ist nicht mit MiniMax verbunden.
Weiterlesen
Mehr über H3-Prompts und Frames
Prompt-Tool für Start- und Endbild
Das passende FL2VA-Tool, wenn Anfang und Ende einer Einstellung bereits feststehen und du den Übergang beschreiben möchtest.
Das vollständige H3-Prompt-Format
Die drei gemeinsamen Ausgabefelder der vier Modi sowie Formulierungen für Kamera und Dialog.
Start- und Endbild in der Praxis
Zwei passende Frames wählen, sechs Anwendungsfälle und Lösungen, wenn das gewünschte Endbild nicht erreicht wird.
H3-Kamerasteuerung
Gib jedem Segment eine eigene Kamerabewegung mit den Begriffen, die H3 versteht.
Turbo LoRA und Sampling-Schritte
H3 lokal mit 4–8 statt etwa 20 Schritten ausführen – und erkennen, wann sich der destillierte Checkpoint nicht mehr lohnt.
Hier planen. Anschließend generieren.
Der H3-Bild-zu-Video-Generator dieser Website nimmt ein Startbild und optional ein Endbild an. Plane oben die Abfolge und generiere die Segmente anschließend nacheinander.
Die Prompt-Syntax – I2VA-Anweisung, FL2VA-Zuordnungssatz, Zeitangaben mit zwei Dezimalstellen und drei Ausgabefelder – stammt aus dem Video Prompt Writing Guide von MiniMaxAI zu den offenen H3-Gewichten, geprüft am August 2026. Die Grenze von 4–15 Sekunden gehört zur gehosteten API. Diese Website ist nicht mit MiniMax verbunden.