
<Subject N>Contenido visible reutilizable: una persona, un animal, un objeto, una escena, un vestuario, un elemento de atrezo, un estilo, una acción o una pose. Un sujeto puede basarse en varios archivos, y un archivo puede aportar varios sujetos.
Referencia a vídeo · creador de prompts
Cuando le das a MiniMax H3 imágenes, clips o audio de referencia, deja de leer el prompt de tres campos que usan los demás modos y pasa a esperar seis secciones. Esta página las escribe por ti, numera cada etiqueta de referencia y detecta los errores de formato que hacen que una referencia se ignore sin avisar.
Tus archivos de referencia

<Picture 1>
<Picture 2>
<Video 1><Audio 1>Creador de prompts
Añade una fila por cada archivo que vayas a subir e indica para qué sirve. Esa sola elección decide si el archivo tiene su propia línea de etiqueta o se cita dentro de la definición de un sujeto, que es justo la distinción en la que más fallan los prompts de referencia a vídeo de MiniMax H3. Parte de un caso de ejemplo y ajústalo.
Cada caso combina archivos distintos con funciones distintas, así que cada uno genera un prefijo de resumen diferente. Elige el más parecido al tuyo y edítalo.
Las imágenes de ejemplo son recreaciones generadas de los archivos que subirías, no resultados del modelo.
reference generationUna fila por archivo subido. Las numeraciones de Picture, Video y Audio son independientes y cada una sigue el orden en que añades los archivos.

fully_preservedSe convierte en una línea <Subject N> y la etiqueta del archivo se cita dentro de ella. No tiene línea propia: es la regla que más se incumple.

fully_preservedSe convierte en una línea <Subject N> y la etiqueta del archivo se cita dentro de ella. No tiene línea propia: es la regla que más se incumple.
En inglés, como espera H3. Los diálogos, las letras de canciones y el texto en pantalla conservan su idioma original dentro de etiquetas <d>.
subject_definitions: <Subject 1> is the young woman in <Picture 1>, with shoulder-length auburn hair, a grey knit sweater and a thin gold chain at the collar. <Subject 2> is the narrow bookshop interior in <Picture 2>, with floor-to-ceiling oak shelves, a brass desk lamp on the counter and a rolling ladder. summary: [reference generation] <Subject 1> takes a clothbound volume down from the upper shelves of <Subject 2> and carries it to the counter, where she settles and looks up toward the door. retention_analysis: <Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - her face, auburn hair length, grey knit sweater and gold chain are carried into both shots without change. <Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the oak shelving, brass desk lamp and rolling ladder remain the only set, and no additional room or exit is introduced. detailed_description: The target video is in a warm, realistic style with soft practical lighting and a shallow depth of field. [Shot 1] A medium-wide shot establishes <Subject 2>, the narrow bookshop, with floor-to-ceiling oak shelves running the length of the frame and a brass desk lamp burning at the counter on the right. Late-afternoon light enters from a window off-frame left and falls in a soft band across the middle shelves, leaving the upper rows in shadow. <Subject 1>, the young woman with shoulder-length auburn hair and a grey knit sweater, stands on the second rung of the rolling ladder with her left hand flat against a shelf edge for balance. She tilts her head back to read the spines above her, then draws a clothbound volume free with two fingers, and the books on either side tip inward to fill the gap it leaves. She turns the volume over to read the spine, and a thin line of dust lifts off the top edge and drifts through the band of light. The camera pushes in with small amplitude at slow speed toward the book in her hands. [Shot 2] At 00:04.000, the shot cuts to a close-up of <Subject 1> at the counter of <Subject 2>, with the brass desk lamp just inside the right edge of frame throwing warm light across one side of her face and leaving the other in shadow. She sets the clothbound volume down on the wood, flattens the cover with her palm, and holds it there a moment longer than she needs to. Her thumb moves once across the corner of the boards. She lets out a short breath and her shoulders drop as it leaves her. The thin gold chain at her collar catches the lamp as she shifts her weight onto her other foot. She lifts her eyes from the book and looks up and past the camera toward the door, her expression settling into something closer to expectation than surprise. The camera holds a static shot throughout, letting her come to rest inside a frame that does not move with her. overall_soundscape: A quiet indoor room tone runs throughout, with the creak of the ladder under a shifting weight, pages riffling under a thumb, and the soft knock of board covers meeting the counter. non_diegetic_music: A sparse nylon-string guitar figure at a slow tempo, with a sustained low string underneath and no swell.
Abre el generador en el modo de referencia a vídeo con este prompt cargado. Añade allí tus archivos.
No hay problemas de formato.
Los tipos en gris vienen dados por tus archivos. Haz clic en los demás para añadir una relación que los archivos no implican.
El formato
Los modos de texto a vídeo, imagen a vídeo y fotogramas clave comparten los mismos tres campos principales. En cuanto la solicitud incluye archivos de referencia, el modo de referencia a vídeo de MiniMax H3 espera una estructura distinta y más larga, y el prompt de tres campos que usabas en todo lo demás ya no encaja.
subject_definitionsUna línea por cada elemento que se sigue: su etiqueta, lo que designa y los rasgos que deben mantenerse.
summaryUn párrafo breve que empieza con un prefijo de tipo de tarea entre corchetes, que indica de qué tipo de trabajo se trata.
retention_analysisUna línea por etiqueta, cada una con un marcador de relación fijo y una nota sobre lo que se conserva.
detailed_descriptionEl cuerpo principal: los planos en orden de reproducción, con las etiquetas insertadas donde correspondan.
overall_soundscapeAmbiente y sonidos físicos de todo el clip. Significa lo mismo que en los modos base.
non_diegetic_musicMúsica que solo oye el público. Significa lo mismo que en los modos base.
Los planos, el vocabulario de cámara, los ID de hablante y las etiquetas de diálogo son los mismos que en los modos base, así que todo lo que ya sabes sobre ellos sigue valiendo en referencia a vídeo. Cambian cuatro cosas.
Las dos últimas no cambian respecto a la guía base. Las cuatro primeras solo existen en referencia a vídeo; por eso un prompt copiado de una plantilla de texto a vídeo pierde sus referencias sin ningún error visible.
Si tus imágenes son un primer y un último fotograma, y no referencias de personajes, se trata de otro modo con otra frase de alineación, y esa la escribe el creador de prompts de primer y último fotograma.
El movimiento de cámara se escribe igual en ambos, así que los veinte tipos de movimiento de la página de control de cámara se aplican aquí sin cambios.
Etiquetas
En referencia a vídeo, cada archivo se identifica con una etiqueta, y esa etiqueta significa lo mismo en las seis secciones. Las numeraciones de Picture, Video y Audio se asignan por separado, así que <Video 1> y <Audio 2> pueden salir del mismo archivo.

<Subject N>Contenido visible reutilizable: una persona, un animal, un objeto, una escena, un vestuario, un elemento de atrezo, un estilo, una acción o una pose. Un sujeto puede basarse en varios archivos, y un archivo puede aportar varios sujetos.

<Picture N>Una imagen que actúa como fotograma concreto (primer fotograma, fotograma clave o último fotograma) o como ancla de storyboard para planificar los planos.

<Video N>Una relación con el vídeo completo: el clip que se edita, el clip que se continúa o una fuente de cortes, ritmo y estructura de cámara.
<Audio N>Una señal de audio que se copia o se toma como referencia, ya sea un archivo independiente o la pista sincronizada de un vídeo de referencia.
Si una imagen solo sirve para definir un personaje, una escena, un vestuario o un estilo, no lleva una entrada <Picture N> propia. Su etiqueta se cita dentro de la definición <Subject N> y nunca aparece en retention_analysis. Un archivo solo tiene línea propia cuando cumple una función estructural: anclar un fotograma, ser el vídeo que se edita o el que se continúa, o aportar audio.
Incorrecto
<Picture 1> is a reference image of the young woman. <Subject 1> is the young woman.
Correcto
<Subject 1> is the young woman in <Picture 1>, with long dark hair, a blue cardigan and a thin silver necklace.
Marcadores de retención
Cada línea de retention_analysis lleva un marcador fijo en inglés que indica con qué fuerza el modo de referencia a vídeo retiene ese archivo. La pista visual y la de audio usan conjuntos distintos, una distinción que omiten casi todas las guías de terceros, porque los cuatro visuales son los que se suelen citar. Solo weak_reference pertenece a los dos.
fully_preservedLa función definida de la referencia se mantiene por completo.
Un personaje conserva la cara, el pelo y el vestuario en todos los planos.
partially_preservedSe sigue usando, pero algunas características definidas cambian o solo se conservan en parte.
Una habitación mantiene su distribución, pero cambia el acabado de las paredes.
attribute_transferLas características se trasladan a un sujeto de destino distinto e identificable.
La ropa de una persona se le pone a otra.
weak_referenceSolo se conserva un parecido general de estilo, categoría, composición o atmósfera.
Un clip aporta el ritmo y nada más.
fully_copyTodo el audio de origen se convierte en la pista final completa del vídeo.
Una edición conserva intacto el audio original de la entrevista.
partially_copySe copia parte de la línea de tiempo o algunas capas, o se añaden o sustituyen capas después.
Se copia el diálogo, pero el ambiente se rehace.
referenceNo se copia nada: solo se toma como referencia el timbre, el ritmo, el estilo musical, el contenido del diálogo o la textura.
Un hablante toma como modelo una voz de referencia sin reutilizarla.
weak_referenceSolo se conserva un parecido general de categoría o atmósfera.
Una pista aporta un tono general.
Elige el marcador solo dentro del papel que esa etiqueta ya tiene en subject_definitions. Las acciones, fondos o sucesos nuevos que añada el vídeo de destino no son pérdidas de fidelidad, así que no justifican rebajar el marcador.
Prefijo del resumen
Todo resumen de referencia a vídeo empieza con un prefijo entre corchetes que indica de qué tipo de trabajo se trata. Elige según el papel que desempeña de verdad cada archivo, no según el tipo de archivo: un vídeo de referencia que solo aporta el ritmo es reference generation, no video editing.
keyframe completionUna imagen ancla un fotograma concreto: primer fotograma, fotograma clave, último fotograma u otro fotograma fijo.
reference generationUn archivo guía la generación (personaje, escena, estilo, acción, cámara, storyboard) sin ser un fotograma concreto ni una fuente editada.
video editingSe modifica directamente un vídeo de origen existente. Generar entre fotogramas clave fijos no cuenta.
video continuationEl contenido nuevo continúa, amplía o retoma un vídeo de origen existente, o hace una transición desde él.
audio reuseSe reutiliza la misma señal de audio, total o parcialmente.
audio referenceSolo se toma como referencia el estilo, el timbre, el contenido del diálogo, la textura, el ritmo o la continuidad, sin copiar la señal.
Une los tipos con un signo más y no repitas ninguno. Continuar un clip usando una imagen como último fotograma es [video continuation + keyframe completion]. Editar un clip cuyo audio original se sigue oyendo es [video editing + audio reuse]; la parte del audio es fácil de olvidar, porque omitirla no rompe nada visible.
En una edición, el resumen debe empezar, justo después del prefijo, con «The target video is an edited version of <Video 1>». El creador la escribe por ti en cuanto marcas un archivo como el vídeo de origen que se edita.
Solución de problemas
El modo de referencia a vídeo falla sin hacer ruido. El clip se genera, los créditos se gastan y el único síntoma es que el modelo no ha seguido el archivo que subiste. Estas son las causas de formato que conviene revisar primero.
Nada de esto alarga un clip más allá de quince segundos: para eso hay que planificar segmentos y pasar el último fotograma al siguiente, algo que resuelve el planificador de vídeos largos.
Preguntas frecuentes
Sí, en cuanto la solicitud incluye archivos de referencia y estás en el modo de referencia a vídeo. Las dos últimas admiten N/A cuando no hay nada que decir, pero la sección tiene que aparecer igualmente. Si no tienes ningún archivo de referencia, no estás en este modo y debes usar el prompt de tres campos.
Escribe en inglés las seis secciones de referencia a vídeo. La única excepción que hace la guía son los diálogos, las letras de canciones y el texto visible en la escena, que conservan su idioma original dentro de etiquetas <d>: una frase en español se queda en español y solo la descripción que la rodea va en inglés.
El modo de referencia a vídeo del generador de este sitio admite hasta tres imágenes de referencia. La numeración del prompt sigue el orden en que las añades, así que mantén las filas del creador en el mismo orden en que subes los archivos.
<Picture 1> designa el archivo. <Subject 1> designa el contenido de ese archivo que quieres reutilizar. Si el archivo solo sirve para mostrar el aspecto de alguien, lo que necesitas es un sujeto, y la etiqueta de la imagen se cita dentro de su definición en lugar de ir sola.
Sí. La guía pone el ejemplo de un sujeto que toma el aspecto de una imagen y el movimiento de un vídeo, y que indica qué aporta cada archivo. Escríbelo directamente en la definición; las filas del creador, de una sola fuente, cubren el caso habitual.
Los ID de hablante se asignan según el orden de los eventos vocales del vídeo de destino y van en la descripción. La guía indica que no aparecen en retention_analysis en ningún caso, ni siquiera cuando una referencia de audio está vinculada a un hablante: ese vínculo se escribe en subject_definitions.
No. Un vídeo de referencia con sonido no crea por sí solo una etiqueta de audio. Solo añades <Audio N> cuando la pista se copia o se toma como referencia de verdad, y las numeraciones de Video y Audio son independientes, así que el mismo archivo puede ser <Video 1> y <Audio 2>.
La guía sitúa las tareas de generación en unas 350 a 500 palabras en inglés y pide repartir el detalle entre los planos según la carga de información. Los trabajos con mucho diálogo deben ajustarse a la duración del diálogo en lugar de alcanzar un número de palabras, y en las ediciones la extensión depende del clip de origen.
El creador pasa el prompt terminado al generador en el modo de referencia a vídeo, donde adjuntas los archivos a los que remiten las etiquetas.
Si te interesa el porqué del formato más que su mecánica, la guía del formato de prompts de H3 analiza un ejemplo completo de principio a fin.
Tienes prompts listos para los demás modos en la biblioteca de prompts.
MiniMax H3 Full-Reference Mode Rewrite Output Format Guide · September 2026