
<Subject N>재사용할 수 있는 시각 요소입니다. 사람, 동물, 사물, 장면, 의상, 소품, 스타일, 동작, 포즈가 여기에 해당합니다. 피사체 하나가 여러 파일을 참고할 수 있고, 파일 하나가 여러 피사체를 제공할 수도 있습니다.
참조 영상 생성 · 프롬프트 빌더
MiniMax H3에 참조 이미지나 클립, 오디오를 넘기면 다른 모드에서 쓰는 세 필드 프롬프트는 더 이상 읽지 않고, 대신 여섯 섹션을 요구합니다. 이 페이지는 그 여섯 섹션을 작성하고, 모든 참조 라벨에 번호를 대신 매기며, 참조가 아무 경고 없이 무시되게 만드는 형식 실수를 잡아냅니다.
내 참조 파일

<Picture 1>
<Picture 2>
<Video 1><Audio 1>빌더
업로드할 파일마다 행을 하나씩 추가하고 각 파일의 용도를 고릅니다. 이 선택 하나로 파일이 자기 라벨 줄을 따로 갖는지, 아니면 피사체 정의 안에서 인용되는지가 정해집니다. MiniMax H3 참조 영상 생성 프롬프트에서 가장 자주 틀리는 부분이 바로 이 구분입니다. 프리셋에서 시작해 필요한 부분을 고치면 됩니다.
구성마다 파일과 용도의 조합이 달라서 요약 접두사도 저마다 다르게 나옵니다. 가장 비슷한 구성을 골라 고치면 됩니다.
예시 이미지는 업로드할 파일을 대신하는 생성 이미지이며, 모델 출력이 아닙니다.
reference generation업로드하는 파일마다 한 행입니다. Picture, Video, Audio 번호는 각각 따로 매겨지며, 추가한 순서를 따릅니다.

fully_preserved<Subject N> 줄이 되고, 파일 라벨은 그 줄 안에서 인용됩니다. 파일 자체의 줄은 따로 생기지 않습니다. 가장 많이 어기는 규칙이 바로 이것입니다.

fully_preserved<Subject N> 줄이 되고, 파일 라벨은 그 줄 안에서 인용됩니다. 파일 자체의 줄은 따로 생기지 않습니다. 가장 많이 어기는 규칙이 바로 이것입니다.
H3가 요구하는 대로 영어로 작성됩니다. 대사, 가사, 화면 속 글자는 <d> 태그 안에서 원래 언어를 유지합니다.
subject_definitions: <Subject 1> is the young woman in <Picture 1>, with shoulder-length auburn hair, a grey knit sweater and a thin gold chain at the collar. <Subject 2> is the narrow bookshop interior in <Picture 2>, with floor-to-ceiling oak shelves, a brass desk lamp on the counter and a rolling ladder. summary: [reference generation] <Subject 1> takes a clothbound volume down from the upper shelves of <Subject 2> and carries it to the counter, where she settles and looks up toward the door. retention_analysis: <Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - her face, auburn hair length, grey knit sweater and gold chain are carried into both shots without change. <Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the oak shelving, brass desk lamp and rolling ladder remain the only set, and no additional room or exit is introduced. detailed_description: The target video is in a warm, realistic style with soft practical lighting and a shallow depth of field. [Shot 1] A medium-wide shot establishes <Subject 2>, the narrow bookshop, with floor-to-ceiling oak shelves running the length of the frame and a brass desk lamp burning at the counter on the right. Late-afternoon light enters from a window off-frame left and falls in a soft band across the middle shelves, leaving the upper rows in shadow. <Subject 1>, the young woman with shoulder-length auburn hair and a grey knit sweater, stands on the second rung of the rolling ladder with her left hand flat against a shelf edge for balance. She tilts her head back to read the spines above her, then draws a clothbound volume free with two fingers, and the books on either side tip inward to fill the gap it leaves. She turns the volume over to read the spine, and a thin line of dust lifts off the top edge and drifts through the band of light. The camera pushes in with small amplitude at slow speed toward the book in her hands. [Shot 2] At 00:04.000, the shot cuts to a close-up of <Subject 1> at the counter of <Subject 2>, with the brass desk lamp just inside the right edge of frame throwing warm light across one side of her face and leaving the other in shadow. She sets the clothbound volume down on the wood, flattens the cover with her palm, and holds it there a moment longer than she needs to. Her thumb moves once across the corner of the boards. She lets out a short breath and her shoulders drop as it leaves her. The thin gold chain at her collar catches the lamp as she shifts her weight onto her other foot. She lifts her eyes from the book and looks up and past the camera toward the door, her expression settling into something closer to expectation than surprise. The camera holds a static shot throughout, letting her come to rest inside a frame that does not move with her. overall_soundscape: A quiet indoor room tone runs throughout, with the creak of the ladder under a shifting weight, pages riffling under a thumb, and the soft knock of board covers meeting the counter. non_diegetic_music: A sparse nylon-string guitar figure at a slow tempo, with a sustained low string underneath and no swell.
생성기가 ‘참조 이미지로 영상’ 모드로 열리고 이 프롬프트가 채워집니다. 파일은 생성기에서 추가합니다.
형식 문제가 발견되지 않았습니다.
회색으로 표시된 유형은 에셋에 따라 정해집니다. 에셋만으로는 드러나지 않는 관계를 추가하려면 나머지 유형을 클릭합니다.
형식
텍스트 → 영상, 이미지 → 영상, 키프레임 모드는 모두 같은 세 가지 핵심 필드를 씁니다. 그런데 요청에 참조 에셋이 들어가는 순간 MiniMax H3 참조 영상 생성은 더 길고 다른 구조를 요구합니다. 다른 모드에서 늘 쓰던 세 필드 프롬프트는 여기서는 맞지 않는 형식이 됩니다.
subject_definitions추적할 항목마다 한 줄씩 씁니다. 라벨, 라벨이 가리키는 대상, 따라야 할 특징을 적습니다.
summary짧은 단락 하나로, 어떤 종류의 작업인지 밝히는 대괄호 속 작업 유형 접두사로 시작합니다.
retention_analysis라벨마다 한 줄씩 쓰며, 각 줄에는 고정된 관계 마커와 무엇이 유지되는지에 대한 메모가 들어갑니다.
detailed_description본문: 재생 순서대로 샷을 작성하고, 해당되는 위치에 라벨을 삽입합니다.
overall_soundscape클립 전체에 깔리는 환경음과 사물·동작이 내는 소리입니다. 의미는 기본 모드와 같습니다.
non_diegetic_music관객에게만 들리는 음악입니다. 의미는 기본 모드와 같습니다.
샷, 카메라 용어, 화자 ID, 대사 태그는 기본 모드와 같습니다. 그러니 이 부분에 대해 이미 알고 있는 내용은 참조 영상 생성에서도 그대로 통합니다. 달라지는 것은 네 가지입니다.
마지막 두 섹션은 기본 가이드와 같습니다. 앞의 네 섹션은 참조 영상 생성에만 있기 때문에, 텍스트 → 영상 템플릿에서 복사한 프롬프트는 눈에 보이는 오류 하나 없이 참조를 잃습니다.
이미지가 캐릭터 참조가 아니라 첫 프레임과 마지막 프레임이라면, 정렬 문장도 다른 별개의 모드입니다. 이 경우에는 첫·마지막 프레임 빌더가 그 문장을 대신 써 줍니다.
카메라 무빙은 두 모드에서 같은 방식으로 쓰므로, 카메라 제어 페이지의 20가지 카메라 무빙을 여기서도 그대로 쓸 수 있습니다.
라벨
참조 영상 생성 모드의 모든 에셋은 라벨로 지정되며, 동일한 라벨은 여섯 섹션 전체에서 같은 의미를 유지합니다. Picture, Video, Audio 번호는 서로 독립적으로 부여되므로 <Video 1>과 <Audio 2>가 같은 파일에서 나올 수 있습니다.

<Subject N>재사용할 수 있는 시각 요소입니다. 사람, 동물, 사물, 장면, 의상, 소품, 스타일, 동작, 포즈가 여기에 해당합니다. 피사체 하나가 여러 파일을 참고할 수 있고, 파일 하나가 여러 피사체를 제공할 수도 있습니다.

<Picture N>첫 프레임, 키프레임, 마지막 프레임 같은 구체적인 프레임 역할을 하거나, 샷 기획을 위한 스토리보드 기준점 역할을 하는 이미지입니다.

<Video N>영상 전체에 걸친 관계입니다. 편집할 클립, 이어 갈 클립, 또는 컷·템포·카메라 구조를 가져올 원본이 여기에 해당합니다.
<Audio N>복사되거나 참조되는 오디오 신호로, 독립 파일이거나 참조 영상의 동기화된 트랙입니다.
캐릭터, 장면, 의상, 스타일을 정의하는 용도로만 쓰는 이미지에는 독립된 <Picture N> 항목을 만들지 않습니다. 대신 그 라벨을 <Subject N> 정의 안에서 인용하고, retention_analysis 섹션에는 절대 넣지 않습니다. 파일이 자기 줄을 따로 갖는 것은 프레임 고정, 편집 대상, 이어 갈 원본, 오디오 제공처럼 구조적인 역할을 할 때뿐입니다.
잘못된 예
<Picture 1> is a reference image of the young woman. <Subject 1> is the young woman.
올바른 예
<Subject 1> is the young woman in <Picture 1>, with long dark hair, a blue cardigan and a thin silver necklace.
유지 마커
retention_analysis 섹션의 모든 줄에는 참조 영상 생성이 해당 에셋을 얼마나 강하게 유지하는지 나타내는 고정된 영어 마커가 붙습니다. 시각 트랙과 오디오 트랙은 서로 다른 세트를 쓰는데, 외부 해설 글은 거의 모두 이 구분을 빠뜨립니다. 사람들이 인용하는 것이 시각 쪽 네 가지이기 때문입니다. 두 세트에 모두 속하는 마커는 weak_reference 하나뿐입니다.
fully_preserved참조의 정의된 역할이 그대로 유지됩니다.
캐릭터가 모든 샷에서 얼굴, 헤어스타일, 의상을 그대로 유지합니다.
partially_preserved여전히 사용되지만 일부 정의된 특징이 바뀌거나 부분적으로만 유지됩니다.
방의 구조는 그대로지만 벽 마감이 바뀝니다.
attribute_transfer특징이 식별 가능한 다른 대상 피사체로 옮겨 갑니다.
한 사람의 복장이 다른 사람에게 입혀집니다.
weak_reference스타일, 종류, 구도, 분위기의 대략적인 유사성만 남습니다.
클립에서 템포만 가져오고 나머지는 가져오지 않습니다.
fully_copy전체 원본 오디오가 영상의 최종 트랙 전체가 됩니다.
편집본이 원본 인터뷰 오디오를 그대로 유지합니다.
partially_copy타임라인의 일부나 선택된 레이어가 복사되거나, 이후 레이어가 추가되거나 교체됩니다.
대사는 복사되지만 환경음은 다시 만듭니다.
reference아무것도 복사되지 않으며 음색, 리듬, 음악 스타일, 대사 내용, 질감만 참조됩니다.
화자가 참조 목소리를 재사용하지 않고 그 목소리를 닮게 말합니다.
weak_reference종류나 분위기의 대략적인 유사성만 남습니다.
트랙이 전반적인 분위기만 제공합니다.
마커는 그 라벨이 subject_definitions 섹션에서 이미 맡은 역할 안에서만 고릅니다. 생성할 영상에 새로 추가한 동작, 배경, 사건은 충실도 손실이 아니므로 마커를 낮출 이유가 되지 않습니다.
요약 접두사
참조 영상 생성 프롬프트의 요약은 모두 어떤 종류의 작업인지 밝히는 대괄호 접두사로 시작합니다. 접두사는 파일 종류가 아니라 각 에셋이 실제로 맡는 역할을 기준으로 고릅니다. 템포만 제공하는 참조 영상은 video editing이 아니라 reference generation입니다.
keyframe completion이미지가 구체적인 프레임을 고정하는 경우: 첫 프레임, 키프레임, 마지막 프레임 또는 그 밖의 고정 프레임.
reference generation에셋이 구체적인 프레임이나 편집 원본이 아니면서 캐릭터, 장면, 스타일, 동작, 카메라, 스토리보드 등 생성에 지침을 주는 경우.
video editing기존 원본 영상을 직접 수정하는 경우. 정지된 키프레임 사이를 생성하는 것은 포함되지 않습니다.
video continuation새 콘텐츠가 기존 원본 영상에서 이어지거나, 연장되거나, 재개되거나, 전환되는 경우.
audio reuse동일한 오디오 신호가 전체 또는 일부 재사용되는 경우.
audio reference스타일, 음색, 대사 내용, 질감, 비트, 연속성만 참조되고 신호는 복사되지 않는 경우.
유형은 +로 잇고, 같은 유형을 두 번 쓰지 않습니다. 클립을 이어 가면서 이미지를 마지막 프레임으로 쓰면 [video continuation + keyframe completion]입니다. 원래 오디오가 계속 들리는 클립을 편집하면 [video editing + audio reuse]입니다. 오디오 쪽은 빠뜨리기 쉬운데, 빠뜨려도 화면에서는 아무것도 깨지지 않기 때문입니다.
편집 작업이라면 요약은 접두사 바로 다음에 “The target video is an edited version of <Video 1>.”라는 문장으로 시작해야 합니다. 에셋을 편집할 원본으로 지정하는 즉시 빌더가 이 문장을 대신 써 줍니다.
문제 해결
참조 영상 생성은 조용히 실패합니다. 클립은 렌더링되고 크레딧도 차감되는데, 증상은 모델이 업로드한 파일을 따르지 않았다는 것 하나뿐입니다. 먼저 확인해 볼 만한 형식상의 원인은 다음과 같습니다.
이 중 어느 것도 클립을 15초 넘게 늘려 주지는 않습니다. 그러려면 구간을 나눠 계획하고 마지막 프레임을 다음 구간으로 넘겨야 하는데, 이 작업은 긴 영상 플래너가 맡습니다.
자주 묻는 질문
네. 요청에 참조 에셋이 들어가 참조 영상 생성 모드로 작업한다면 여섯 섹션을 모두 써야 합니다. 마지막 두 섹션은 쓸 내용이 없으면 N/A로 둘 수 있지만, 섹션 자체는 그대로 남습니다. 참조 파일이 하나도 없다면 이 모드가 아니므로 세 필드 프롬프트를 대신 써야 합니다.
참조 영상 생성의 여섯 섹션은 영어로 씁니다. 가이드가 두는 유일한 예외는 대사, 가사, 장면에 보이는 글자로, 이들은 <d> 태그 안에서 원래 언어를 유지합니다. 따라서 중국어 대사는 중국어 그대로 두고, 주변 설명만 영어로 씁니다.
이 사이트 생성기의 ‘참조 이미지로 영상’ 모드는 참조 이미지를 최대 3장까지 받습니다. 프롬프트의 번호는 추가한 순서를 따르므로, 빌더의 행 순서를 업로드 순서와 똑같이 맞춰야 합니다.
<Picture 1>은 파일 자체를 가리킵니다. <Subject 1>은 그 파일에서 재사용하려는 내용을 가리킵니다. 파일이 누군가의 생김새를 보여 주는 용도뿐이라면 필요한 것은 피사체이며, Picture 라벨은 단독으로 쓰지 않고 그 피사체의 정의 안에서 인용합니다.
네. 가이드에는 이미지에서 외형을, 영상에서 움직임을 가져와 하나의 피사체로 합치고 각 파일이 무엇을 제공하는지 밝히는 사례가 나옵니다. 이런 경우는 정의에 직접 쓰면 됩니다. 빌더의 행은 파일 하나를 출처로 하는 일반적인 경우를 다룹니다.
화자 ID는 생성할 영상에서 목소리가 나오는 순서대로 매겨지며, 본문 설명에 들어갑니다. 가이드는 오디오 참조가 화자에 연결된 경우에도 화자 ID가 retention_analysis 섹션에는 전혀 나오지 않는다고 밝힙니다. 그 연결은 대신 subject_definitions 섹션에 씁니다.
아니요. 소리가 포함된 참조 영상이 자체적으로 오디오 라벨을 생성하지는 않습니다. 트랙이 실제로 복사되거나 참조될 때만 <Audio N>을 추가하며, Video와 Audio 번호는 서로 독립적이므로 같은 파일이 <Video 1>이면서 <Audio 2>가 될 수 있습니다.
가이드에서는 생성 작업의 분량을 대략 영어 단어 350~500개로 안내하며, 정보량에 따라 디테일을 샷별로 분산하도록 요구합니다. 대사가 많은 작업은 단어 수를 채우기보다 대사 타임라인에 맞춰야 하며, 편집 작업은 원본 클립에 따라 조정됩니다.
빌더는 완성된 프롬프트를 ‘참조 이미지로 영상’ 모드의 생성기로 넘겨 줍니다. 라벨이 가리키는 파일은 생성기에서 첨부하면 됩니다.
형식의 작동 방식보다 그 원리가 궁금하다면, H3 프롬프트 형식 가이드가 전체 예제 하나를 처음부터 끝까지 안내합니다.
다른 모드용으로 준비된 프롬프트는 프롬프트 라이브러리에 있습니다.
MiniMax H3 Full-Reference Mode Rewrite Output Format Guide · September 2026