MiniMax H3 · creador de prompts FL2VA

MiniMax H3: primer y último fotogramaCrea el movimiento entre ambos

H3 ya puede ver tus dos imágenes. Lo que necesita es saber cómo pasar de una a otra. Describe esa transformación y la herramienta la organiza en el formato de MiniMax: alineación, secuencia de planos, ambiente sonoro y música.

Sintaxis oficial FL2VAOcho comprobaciones del promptCompatible con H3 alojado y ComfyUI

Crea el prompt

Dos fotogramas, una trayectoria

Parte de un ejemplo o escribe tu propia escena. La salida se actualiza al instante, incluida la frase de alineación que suele faltar o estar mal escrita en los prompts manuales.

Ejemplos de prompts en inglés; puedes editar las descripciones. Los nombres de campo y la sintaxis de salida se conservan en inglés.

Prompt FL2VA

Formato de MiniMax: primero la alineación y después tres campos.

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 6.00-second mark of the target video.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a matte black gift box sits closed and centred on a pale marble counter under soft window light, its lid seam facing camera, matching the position, framing, and lighting established by Picture 1. The camera pushes in with small amplitude at slow speed as two hands enter from the lower edge, lift the lid straight up and set it aside, then withdraw as the tissue paper falls open around a glass serum bottle. Toward the end of the shot the differences narrow until the serum bottle stands upright and unobstructed in the centre of the counter with the opened box behind it and the dropper cap facing camera, landing on the exact pose, spacing, and composition established by Picture 2 at the 6.00-second mark.

overall_soundscape: A quiet room tone carries throughout, broken by the soft friction of the lid sliding free, the rustle of tissue paper, and the light tap of glass settling on stone.

non_diegetic_music: Sparse marimba notes at a slow tempo, joined by a warm synth pad that swells once as the bottle is revealed.
Usarlo en el generador H3

Abre el generador con el prompt cargado y el modo de imagen a vídeo seleccionado. Añade allí las imágenes inicial y final.

Comprobación del prompt

Sin avisos. Ambos fotogramas están descritos, hay una trayectoria intermedia y el clip usa un único plano continuo.

Estructura

Las partes de un prompt FL2VA

Cuatro partes en un orden fijo. La frase de alineación indica qué imagen corresponde al inicio y cuál al cierre.

Alignment line

Siempre al principio

Una frase sitúa Picture 1 en 0.00 segundos y Picture 2 al final del clip. La duración final lleva exactamente dos decimales y una línea en blanco separa la alineación de los campos.

integrated_multimodal_description

Obligatorio

El cuerpo principal: estilo, composición inicial, trayectoria entre imágenes, cámara, hablantes, diálogo y sonidos que ocurren dentro de la escena. Aquí se define la transformación.

overall_soundscape

Obligatorio

De una a cuatro frases sobre el ambiente, los sonidos físicos y las vocalizaciones no verbales del clip. El diálogo, el canto y la música que oyen los personajes pertenecen al cuerpo principal.

non_diegetic_music

Obligatorio

De una a tres frases sobre la música que no oyen los personajes: instrumentos, tempo, ritmo y dinámica. Si no la hay, N/A es una respuesta válida.

El ejemplo FL2VA de MiniMax

Un único plano de ocho segundos de la guía incluida con los pesos de H3, abreviado aquí. El cuerpo describe cómo se abre el paraguas entre las imágenes, no vuelve a enumerar lo que muestran.

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video.

integrated_multimodal_description: [Shot 1] Live-action, cinematic, a rain-soaked cyclist begins in the position and framing established by Picture 1 …

overall_soundscape: Rain falls steadily on the pavement, followed by the metallic click of the umbrella runner …

non_diegetic_music: N/A
Leer la guía completa en Hugging Face

Problemas habituales

Seis motivos por los que falla el fotograma final

Estos son patrones frecuentes. Antes de cambiar de modelo, revisa la trayectoria, la duración y cómo has repartido la información en el prompt.

El clip no llega al último fotograma

Causa: El prompt describía dos imágenes estáticas en vez del recorrido entre ellas, así que faltaba una transición clara hacia el final.

Solución: Describe los estados intermedios e indica que las diferencias se reducen hasta que la composición coincide con Picture 2 al terminar el último plano.

La identidad o la ropa cambian a mitad del clip

Causa: El cuerpo no especificaba qué rasgos debían conservarse, y el modelo los reinterpretó al empezar el movimiento.

Solución: Repite los elementos fijos —ropa, color, objetos clave y relaciones espaciales— dentro de la descripción del movimiento, no solo al principio.

Aparece un corte que no has pedido

Causa: El texto usaba expresiones de varios planos o sugería un salto de punto de vista que el modelo resolvió con un corte.

Solución: Mantén un único plano salvo que necesites un corte real. Cambia distancia y ángulo mediante la cámara y reserva los cortes para información nueva.

El movimiento se acelera y luego se detiene

Causa: La duración no encaja con la cantidad de acción descrita. Una secuencia de seis segundos no cabe de forma natural en un clip de cuatro.

Solución: Ajusta la acción a la duración o cambia el momento del corte. Una transformación clara funciona mejor que tres acciones incompletas.

El diálogo no termina dentro del clip

Causa: La frase es demasiado larga para decirla a un ritmo natural. Puede cortarse o dejar movimientos de boca sin audio.

Solución: Calcula unas dos o tres palabras por segundo y reserva tiempo para la acción. Una frase larga necesita más duración, no que el personaje hable más deprisa.

La música y el ambiente se mezclan mal

Causa: Has puesto sonido de la escena en non_diegetic_music, o has repetido en el ambiente lo que ya describe el cuerpo.

Solución: El sonido que oyen los personajes va en el cuerpo. La música solo para el público va en non_diegetic_music. El ambiente resume únicamente entorno, impactos y respiración.

Elige el modo

FL2VA frente a los otros tres modos

H3 utiliza los fotogramas clave de cuatro formas. Cambia la frase de alineación: si no corresponde al modo elegido, las referencias pueden no aplicarse como esperas.

ModoImágenesAlineaciónControlCuándo elegirlo
T2VASolo textoSin frase de alineaciónMínimoNo tienes referencias visuales y quieres que el modelo invente tanto el encuadre como el movimiento.
I2VAFotograma inicialPicture 1 en 0.00 sInicio fijadoTe importa la imagen inicial y aceptas que el modelo decida cómo termina el plano.
FL2VAFotogramas inicial y finalPicture 1 en 0.00 s y Picture 2 al finalAmbos extremos fijadosYa conoces la imagen de apertura y la de cierre y necesitas una transición creíble entre ellas.
L2VAFotograma finalPicture 1 al finalFinal fijadoLa imagen final está decidida —un logotipo, una revelación o una pose— y puedes diseñar el recorrido hasta ella.

Casos de uso

Qué puedes crear con dos fotogramas

Los ejemplos de la herramienta siguen esta estructura: un inicio fijo, un final fijo y una transformación creíble entre ambos.

Primer fotograma para MiniMax H3: caja de regalo negra mate, cerrada y centrada sobre una encimera de mármol
Fotograma 1
Último fotograma del mismo prompt FL2VA: frasco de sérum desempaquetado, en posición vertical sobre la misma encimera
Fotograma 2

Comercio electrónico

Presentación de producto

El primer fotograma muestra el embalaje cerrado y el segundo, el producto fuera de la caja. El reto es mantener la etiqueta legible durante la transformación.

6s · un solo plano · Live-action, cinematic

Primer fotograma: salón vacío y sin reformar visto desde la puerta
Fotograma 1
Último fotograma: el mismo salón amueblado, visto desde idéntico ángulo
Fotograma 2

Reformas y cambios de imagen

Antes y después

Un caso clásico de FL2V: la misma habitación o el mismo rostro en dos estados, con una transición que debe resultar creíble.

8s · un solo plano · Live-action

Primer fotograma FL2VA: boceto de una grulla a lápiz azul sobre papel, visto desde arriba
Fotograma 1
Último fotograma: ilustración de la grulla entintada y coloreada en la misma hoja
Fotograma 2

Proceso creativo

Del boceto al acabado

Un boceto al principio y una pieza terminada al final. Útil para ilustración, diseño, lettering y presentaciones giratorias en 3D.

10s · un solo plano · 2D-animated

Estas parejas ilustran cómo preparar buenas referencias FL2VA: encuadre e iluminación coherentes y un cambio principal. Son imágenes de referencia, no resultados generados con MiniMax H3.

Cómo se usa

De dos imágenes a un clip terminado

  1. 1

    Elige primero los dos fotogramas

    La pareja de imágenes determina gran parte del resultado. Mantén personaje, lente e iluminación coherentes, salvo que quieras cambiarlos, y asegúrate de que exista una transición físicamente plausible.

  2. 2

    Fija la duración antes de escribir

    La duración aparece en la frase de alineación, así que cambiarla exige actualizar el prompt. El rango es de 4 a 15 segundos; entre 6 y 10 suele bastar para una transformación.

  3. 3

    Describe el recorrido, no las imágenes

    El modelo ya ve ambos fotogramas. Explica qué se mueve, qué pasa de una mano a otra, cómo cambia la composición y cómo se aproxima a la imagen final.

  4. 4

    Copia el prompt y utiliza ambas imágenes

    Pega el prompt en el editor de imagen a vídeo junto con las imágenes inicial y final, o en tu flujo de ComfyUI. Evalúa si llega al cierre previsto, no solo si el tramo central se ve bien.

    Abrir MiniMax H3 imagen a vídeo

Preguntas frecuentes

Dudas sobre el primer y último fotograma

¿Qué es un prompt de primer y último fotograma para MiniMax H3?

Es el formato FL2VA. Empieza con una frase que sitúa Picture 1 en 0.00 segundos y Picture 2 al final. Después incluye integrated_multimodal_description, overall_soundscape y non_diegetic_music. Como H3 ya ve las dos imágenes, el cuerpo describe el movimiento entre ellas.

¿Por qué la alineación lleva dos decimales?

MiniMax especifica el tiempo final como S.SS. Ocho segundos se escriben 8.00, no 8 ni 8.0. Es una regla de formato, no de precisión; la herramienta la aplica automáticamente.

¿Conviene usar uno o varios planos?

Casi siempre uno. MiniMax recomienda un plano continuo para interpolar entre el inicio y el final, y varios solo cuando sean necesarios. Si añades un corte, el último plano debe llegar a la imagen final al terminar el vídeo.

¿Puedo generar ese vídeo en este sitio?

Sí. El modo de imagen a vídeo de la página principal permite añadir una imagen inicial y otra final opcional. Al enviar ambas se usan first_frame_url y last_frame_url. Prepara aquí el prompt, abre el generador y adjunta las dos imágenes allí.

¿En qué se diferencia de imagen a vídeo?

I2VA fija solo el inicio y deja al modelo elegir el final. FL2VA fija ambos extremos: útil para una presentación de producto, un diseño acabado o una pose concreta. Si las imágenes son físicamente incompatibles, imponer ambas puede dar peor resultado que usar una sola.

¿El prompt también sirve en ComfyUI?

Sí. El formato procede de la guía incluida con los pesos abiertos de H3 y sirve tanto para la API alojada como para ComfyUI. El reescritor multimodal LightX2V, basado en Qwen3-VL de 8B y con entradas first_frame y last_frame, utiliza los mismos tres campos.

¿Cuánto debe durar el diálogo?

Reserva unas dos o tres palabras por segundo y deja tiempo para la acción. El diálogo se escribe dentro de <d>[Language] ...</d>, con el hablante indicado fuera. La herramienta avisa si la frase parece demasiado larga.

¿Qué pasa si las dos imágenes son muy distintas?

El modelo puede resolverlo como una disolución en lugar de un movimiento. Añade estados intermedios visibles, aumenta la duración o divide la idea en dos generaciones y únelas después.

Ya tienes los extremos. Escribe el recorrido.

El editor de imagen a vídeo de este sitio envía a H3 tanto el fotograma inicial como el final. Crea el prompt, abre el editor, adjunta ambas imágenes y comprueba si el clip llega a su destino.

La sintaxis FL2VA —alineación, cortes [Shot N], vocabulario de cámara y tres campos de salida— procede de la Video Prompt Writing Guide de MiniMaxAI publicada con los pesos abiertos de H3, revisada a fecha de Agosto de 2026. Este sitio no está afiliado a MiniMax.