Planificador gratuito · sin iniciar sesión ni gastar créditos

MiniMax H3Planificador de vídeos largos

H3 genera entre 4 y 15 segundos por vez. Para crear algo más largo hay que unir varios segmentos. Este planificador divide la duración, redacta el prompt de cada parte —incluidas las indicaciones de continuidad— y calcula el coste antes de que gastes créditos.

30 s / 60 s / 90 s / 120 sPrompts de continuación I2VACréditos calculados de antemano

La respuesta breve

¿Puede MiniMax H3 crear un vídeo de 60 segundos?

No en una sola generación. El servicio H3 alojado admite entre 4 y 15 segundos, siempre enteros. Un vídeo de 60 o 120 segundos se compone de varios clips enlazados: cada uno empieza en el último fotograma del anterior. Esta técnica permite continuar el vídeo, pero encadena generaciones independientes; no produce una única toma larga de una vez.

  • Una generación: 4–15 segundos, con audio sincronizado nativo.
  • 60 segundos = 4 segmentos de 15 s. 120 segundos = 8 segmentos de 15 s.
  • A partir del segundo segmento, se genera vídeo a partir del último fotograma del clip anterior.

Esta página prepara la secuencia y los prompts. Tendrás que generar cada parte y unir los archivos por tu cuenta, paso a paso. Todavía no hay un botón que genere y monte toda la secuencia automáticamente.

El planificador

Divide la duración en segmentos compatibles con H3

Elige la duración final, describe el personaje y el lugar y asigna una acción a cada segmento. Los prompts se pueden copiar directamente en el formato en inglés que utiliza esta herramienta.

Ejemplos de prompts en inglés; puedes editar las descripciones. Los nombres de campo y la sintaxis de salida se conservan en inglés.

Una acción por segmento

Describe lo que cambia en este tramo. Escribe la acción, no un resumen: un segmento sin nada concreto que hacer puede desviarse o repetir movimientos.

1
2
3
4

Tus segmentos

4 segmentos · 60 s · unos 804 créditos en total

Genéralos en orden. Al terminar cada clip, extrae su último fotograma y úsalo como imagen de entrada del siguiente.

Segmento 1 · 0–15 s · 15 s

Modo: I2VA201 Créditos
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, matching the position, framing, and lighting established by <Picture 1>. she pushes off the kerb and threads between two stalls, checking the address on her phone.

overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance.

non_diegetic_music: N/A

Segmento 2 · 15–30 s · 15 s

Modo: I2VA201 Créditos
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she slows at a crossing as a tram passes, rain beading on the jacket. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening.

overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance.

non_diegetic_music: N/A

Segmento 3 · 30–45 s · 15 s

Modo: I2VA201 Créditos
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she lifts the parcel from the crate and scans the shopfront numbers. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening.

overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance.

non_diegetic_music: N/A

Segmento 4 · 45–60 s · 15 s

Modo: I2VA201 Créditos
For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a courier in a red rain jacket with a frayed left cuff, mid-twenties, short black hair, in a neon-lit night market street, wet asphalt, stalls still open, continuing without interruption from the position, framing, motion direction, and lighting established by <Picture 1>. she hands the parcel over at a lit doorway and steps back into the rain. The identity, clothing, colour palette, key props, and lens character stay identical to <Picture 1>; no cut, no restart, no change of shot scale at the opening.

overall_soundscape: Steady rain on canvas awnings, tyres through standing water, market chatter fading in and out, a tram bell in the distance.

non_diegetic_music: N/A
Generar el primer segmento

Abre el generador de imagen a vídeo con el prompt cargado. Para generar necesitas iniciar sesión y disponer de créditos.

Antes de gastar créditos

No hay avisos pendientes. Comprueba igualmente las uniones después de generar.

Cómo funciona

Qué significa realmente «continuar un vídeo»

La API de H3 no tiene un parámetro extend. La continuación es un flujo de trabajo: pasas el último fotograma del clip anterior a la siguiente generación y le pides que continúe desde ahí.

  1. 1

    Genera el primer segmento

    Parte de texto o de una imagen de referencia. Este tramo establece la identidad, la paleta y el tratamiento de cámara de los siguientes.

  2. 2

    Extrae el último fotograma

    Pausa el clip al final y guarda ese fotograma, o extráelo con un editor. Será la imagen de entrada del siguiente segmento.

  3. 3

    Genera el siguiente segmento con I2VA

    Usa el último fotograma como imagen de entrada y el prompt de continuación del planificador. No es el modo de primer y último fotograma: todavía no hay una segunda imagen.

  4. 4

    Repite y une los archivos

    Continúa hasta cubrir la duración prevista y une los clips en un editor. Cada segmento seguirá siendo un MP4 independiente hasta que los montes.

Qué se conserva al enlazar

  • La composición y el encuadre en el corte: se transmite exactamente el mismo fotograma.
  • Lo que repitas literalmente en el prompt: personaje, ropa, lugar y etiqueta de estilo.
  • La paleta y la iluminación generales, si el fotograma de referencia está bien expuesto.

Qué se reinicia en cada unión

  • El movimiento. Una imagen no contiene velocidad; el modelo debe deducirla y una acción rápida puede parecer detenerse en el corte.
  • El audio. Cada segmento genera el suyo; el ambiente y la música cambian si no repites las mismas indicaciones.
  • Lo que queda fuera de plano. La siguiente generación no conoce los elementos que no aparecen en la imagen recibida.

La clave está en el número de imágenes: utiliza FL2VA cuando fijes ambos extremos de un tramo, e I2VA cuando continúes desde una única imagen final del clip anterior. Las instrucciones son distintas. Usar la frase de FL2VA con una sola imagen puede hacer que no se respete la referencia como esperabas.

Expectativas

Cuánto puede mantenerse la continuidad

Cada segmento solo recibe un fotograma del pasado y tu prompt. Esa limitación ayuda a entender qué puede empezar a cambiar a medida que avanza la secuencia.

Tramos enlazadosSuele mantenerseEmpieza a cambiar
Segmentos 1–2Identidad, vestuario, paleta y lugar.El ritmo del movimiento en la primera unión, si la acción es rápida.
Segmentos 3–4Identidad y lugar, si repites los mismos rasgos.La temperatura de color y la forma de objetos secundarios.
Segmentos 5–6La escena general y los detalles fijados en el prompt.Los rostros pierden definición o cambian; varían los detalles de la ropa.
Segmentos 7–8El estilo y la ambientación general.Las desviaciones acumuladas suelen notarse al comparar con el primer segmento.

Son problemas previsibles por el funcionamiento del sistema y descritos por la comunidad, no tasas medidas en un benchmark propio. Si publicamos cifras, explicaremos cómo se obtuvieron.

Coste

Cuánto cuesta un vídeo largo de H3 aquí

H3 se cobra por segundo generado. El coste es el de la duración total más todos los segmentos que repitas. Las regeneraciones, no la planificación, son lo que más puede cambiar tu presupuesto.

DuraciónSegmentos de 15 sCréditosSi repites dos segmentos
30s2402804
60s48041206
90s612061608
120s816082010

Las cifras proceden de la tarifa vigente de H3 en este sitio. Las generaciones fallidas se reembolsan automáticamente; un resultado completado que no te guste no se reembolsa.

Paso a paso

Crea un vídeo de 60 segundos con H3

  1. 1

    Planifica la secuencia

    Elige 60 segundos y segmentos de 15 para obtener cuatro partes. Asigna una acción a cada una para que no quede tiempo sin una dirección clara.

  2. 2

    Fija la identidad

    Describe al personaje una vez, con detalles concretos, y el planificador repetirá esa descripción en los cuatro prompts. Es una de las mejores formas de limitar los cambios de aspecto.

  3. 3

    Genera el primer segmento desde una imagen

    Abre el generador de imagen a vídeo, adjunta el fotograma inicial, pega el primer prompt y selecciona 15 segundos.

  4. 4

    Enlaza los siguientes

    Extrae el último fotograma de cada clip terminado, úsalo como entrada del siguiente y pega su prompt correspondiente. Repite hasta cubrir la duración.

  5. 5

    Une los clips

    Monta los cuatro MP4 en un editor. Si se nota que el movimiento se reinicia, recorta unos fotogramas en cada unión.

Distingue los conceptos

Tres cosas distintas que se llaman «vídeo largo de H3»

Suelen confundirse. Este planificador trabaja con la unión de varios segmentos cortos.

MétodoEn qué consisteSituación actual
Una sola generaciónUna inferencia, un archivo y audio nativo.Disponible, con un máximo de 15 segundos.
Segmentos enlazadosVarias generaciones que empiezan en el fotograma final de la anterior.Disponible. Esta página lo planifica; tú generas y montas las partes.
Generación en streaming o causalVídeo que se produce de forma continua mientras se reproduce, sin una duración fija de clip.En investigación. No está disponible en la API H3 alojada ni en esta página.

Preguntas frecuentes

Dudas sobre vídeos largos con H3

¿Cuál es la duración máxima de un vídeo de MiniMax H3?

Quince segundos por generación, con un mínimo de cuatro y valores enteros. Se aplica a texto a vídeo, imagen a vídeo y vídeo con referencias. Para superar ese límite hay que unir varios segmentos.

¿Cómo hago un vídeo de dos minutos con MiniMax H3?

Planifica ocho segmentos de 15 segundos. Genera el primero desde una imagen y usa el fotograma final de cada clip como entrada del siguiente, repitiendo la misma descripción del personaje. Une los ocho archivos al final y reserva margen para rehacer uno o dos.

¿H3 tiene un endpoint extend o continue?

No. La API alojada no incluye un parámetro extend. Se continúa pasando el último fotograma del clip anterior como imagen de entrada a la siguiente generación. Por eso se utiliza un prompt de imagen a vídeo, no de primer y último fotograma.

¿Puedo subir un vídeo propio para continuarlo?

No directamente en este sitio. El generador recibe imágenes, no vídeos. Extrae el último fotograma del clip que quieres ampliar y empieza la secuencia desde esa imagen.

¿Por qué el movimiento da un salto en las uniones?

Una imagen fija no transmite velocidad. El siguiente segmento deduce el movimiento desde cero y una acción rápida puede parecer detenerse. Ayuda mantener un ritmo moderado cerca del corte y ajustar unos fotogramas durante el montaje.

¿El audio mantiene la continuidad?

No automáticamente. Cada segmento genera su audio, por lo que hay que repetir el mismo ambiente sonoro en todos los prompts; el planificador lo hace por ti. Para la música, suele ser más fiable añadirla al vídeo ya montado en un editor.

¿Es una función oficial de MiniMax?

No. El límite de 4–15 segundos es de MiniMax. La continuación por segmentos es un flujo de trabajo de la comunidad y este planificador es nuestra implementación. Este sitio no está afiliado a MiniMax.

Planifica aquí. Después, genera.

El generador H3 de este sitio admite una imagen inicial y una final opcional. Prepara la secuencia arriba y genera los segmentos uno a uno.

La sintaxis —instrucción I2VA, frase de alineación FL2VA, duraciones con dos decimales y tres campos de salida— procede de la Video Prompt Writing Guide de MiniMaxAI incluida con los pesos abiertos de H3, revisada a fecha de Agosto de 2026. El límite de 4–15 segundos corresponde a la API alojada. Este sitio no está afiliado a MiniMax.