构建器
描述你的参考素材,拿到六段提示词
做参考生视频时,每个准备上传的文件加一行,说明它是干什么用的。这一个选择决定了它会不会拿到自己的标签行,还是被写进某个主体定义里——这正是 MiniMax H3 参考生视频提示词最常写错的地方。先选一个预设,再往下改。
参考素材
2/6每个上传文件一行。Picture、Video、Audio 三套编号各自独立,按你添加的顺序排。
会变成一条 <Subject N>,文件标签写在它里面,不再单独占一行——这条规则最常被违反。
会变成一条 <Subject N>,文件标签写在它里面,不再单独占一行——这条规则最常被违反。
镜头
2/3按播放顺序。第一个镜头不带时间戳,后面的镜头标在切点上。
Ref2VA 提示词
344 词 · 区间 350–500按 H3 的要求用英文。对白、歌词和画面里的文字保持原语言,写在 <d> 标签内。
subject_definitions: <Subject 1> is the young woman in <Picture 1>, with shoulder-length auburn hair, a grey knit sweater and a thin gold chain at the collar. <Subject 2> is the narrow bookshop interior in <Picture 2>, with floor-to-ceiling oak shelves, a brass desk lamp on the counter and a rolling ladder. summary: [reference generation] <Subject 1> takes a clothbound volume down from the upper shelves of <Subject 2> and carries it to the counter, where she settles and looks up toward the door. retention_analysis: <Subject 1> (appears in [Shot 1], [Shot 2]): fully_preserved - her face, auburn hair length, grey knit sweater and gold chain are carried into both shots without change. <Subject 2> (appears in [Shot 1], [Shot 2]): fully_preserved - the oak shelving, brass desk lamp and rolling ladder remain the only set, and no additional room or exit is introduced. detailed_description: The target video is in a warm, realistic style with soft practical lighting and a shallow depth of field. [Shot 1] A medium-wide shot establishes <Subject 2>, the narrow bookshop, with floor-to-ceiling oak shelves running the length of the frame and a brass desk lamp burning at the counter on the right. Late-afternoon light enters from a window off-frame left and falls in a soft band across the middle shelves, leaving the upper rows in shadow. <Subject 1>, the young woman with shoulder-length auburn hair and a grey knit sweater, stands on the second rung of the rolling ladder with her left hand flat against a shelf edge for balance. She tilts her head back to read the spines above her, then draws a clothbound volume free with two fingers, and the books on either side tip inward to fill the gap it leaves. She turns the volume over to read the spine, and a thin line of dust lifts off the top edge and drifts through the band of light. The camera pushes in with small amplitude at slow speed toward the book in her hands. [Shot 2] At 00:04.000, the shot cuts to a close-up of <Subject 1> at the counter of <Subject 2>, with the brass desk lamp just inside the right edge of frame throwing warm light across one side of her face and leaving the other in shadow. She sets the clothbound volume down on the wood, flattens the cover with her palm, and holds it there a moment longer than she needs to. Her thumb moves once across the corner of the boards. She lets out a short breath and her shoulders drop as it leaves her. The thin gold chain at her collar catches the lamp as she shifts her weight onto her other foot. She lifts her eyes from the book and looks up and past the camera toward the door, her expression settling into something closer to expectation than surprise. The camera holds a static shot throughout, letting her come to rest inside a frame that does not move with her. overall_soundscape: A quiet indoor room tone runs throughout, with the creak of the ladder under a shifting weight, pages riffling under a thumb, and the soft knock of board covers meeting the counter. non_diegetic_music: A sparse nylon-string guitar figure at a slow tempo, with a sustained low string underneath and no swell.
会打开生成器并载入这段提示词,模式为参考生视频。文件在那边上传。
格式检查
没发现格式问题。
摘要前缀
灰掉的是素材已经决定的。其余可点击,用来补充素材推不出来的关系。
格式
参考生视频要六段,不是三段
文生视频、图生视频和首尾帧几种模式共用同一套三个核心字段。但只要请求里带了参考素材,MiniMax H3 参考生视频要的就是另一套更长的结构——你在别处一直用的那套三字段,在这里不再是对的形状。
| 段落 | 装什么 |
|---|---|
subject_definitions | 每个要单独追踪的东西一行,写明标签、标签指代什么、以及要跟随的主要特征。 |
summary | 一小段话,开头是方括号里的任务类型前缀,交代这是哪一类活。 |
retention_analysis | 每个标签一行,各带一个固定的关系标记,外加一句说明什么被保住了。 |
detailed_description | 正文主体:按播放顺序写镜头,并在标签生效的位置把它们插进去。 |
overall_soundscape | 贯穿全片的环境声和实体声。含义和基础模式里完全一样。 |
non_diegetic_music | 只有观众听得到的配乐。含义和基础模式里完全一样。 |
最后两段和基础指南没有区别,前四段只存在于参考生视频——所以从一个文生视频模板抄过来的提示词会丢掉参考,而且不报任何错。
标签
四种标签,以及决定你拿到哪一种的那条规则
参考生视频里每个素材都靠标签寻址,同一个标签在六段里含义保持不变。Picture、Video、Audio 三套编号各自独立,所以 <Video 1> 和 <Audio 2> 完全可能来自同一个文件。
<Subject N>可复用的可见内容:人、动物、物体、场景、服装、道具、风格、动作或姿态。一个主体可以由多个文件定义,一个文件也可以提供多个主体。
<Picture N>作为具体帧的图片——首帧、关键帧、尾帧——或者作为镜头规划用的分镜锚点。
<Video N>整片级别的关系:被改的那条片、被续接的那条片,或者提供剪辑、节奏、运镜结构的来源。
<Audio N>被复制或被参考的音频信号,无论它是独立文件还是某条参考视频的同期声轨。
参考生视频提示词最常违反的那条规则
如果一张图只是用来定义人物、场景、服装或风格,它不该拿到独立的 <Picture N> 条目。它的标签要写进对应的 <Subject N> 定义里,而且完全不出现在 retention_analysis。只有当文件承担结构性角色——锚定某一帧、被改、被续接、或承载音频——它才配有自己的一行。
错
<Picture 1> is a reference image of the young woman. <Subject 1> is the young woman.
对
<Subject 1> is the young woman in <Picture 1>, with long dark hair, a blue cardigan and a thin silver necklace.
保留标记
两套标记,而且不能混用
retention_analysis 里每一行都带一个固定的英文标记,说明参考生视频把这份素材抓得多紧。视觉和音频用的是两套不同的标记——这个区别几乎所有第三方资料都漏掉了,因为被广泛引用的是视觉那四个。两套里只有 weak_reference 是共有的。
用于 <Subject N>、<Picture N>、<Video N>
| 标记 | 含义 | 典型用法 |
|---|---|---|
fully_preserved | 参考内容被定义的那个角色完整保留。 | 一个角色在每个镜头里都保持同样的脸、发型和衣着。 |
partially_preserved | 仍在使用,但部分既定特征被改动或只保留了一部分。 | 房间保持原有格局,但墙面处理换掉了。 |
attribute_transfer | 参考到的特征被迁移到另一个可识别的目标主体上。 | 把某个人的一身衣服穿到另一个人身上。 |
weak_reference | 只保留风格、类别、构图或氛围上的大致相似。 | 一条片子只提供节奏,别的都不带。 |
用于 <Audio N>
| 标记 | 含义 | 典型用法 |
|---|---|---|
fully_copy | 整条源音频成为目标视频完整的最终音轨。 | 改片时把原访谈声原封不动留着。 |
partially_copy | 只复制部分时间线或部分音频层,或复制后又增删替换了别的层。 | 对白照搬,环境声重做。 |
reference | 不直接复制信号,只参考音色、节奏、音乐风格、对白内容或声音质感。 | 让说话人跟着一把参考嗓子的音色来,但不复用原信号。 |
weak_reference | 只保留类别或氛围上的大致相似。 | 一条音轨只提供一个大致情绪。 |
选标记时只能在这个标签在 subject_definitions 里已经确定的角色范围内选。目标视频里新增的动作、背景或情节不算参考保真度的损失,不能拿来当降级的理由。
摘要前缀
六种任务类型,用加号组合
每条参考生视频提示词的摘要开头都要有一个方括号前缀,说明这是哪一类活。按每个素材实际扮演的角色来选,而不是按文件类型——一条只提供节奏的参考视频属于 reference generation,不是 video editing。
| 任务类型 | 什么时候用 |
|---|---|
keyframe completion | 有图片充当具体的帧锚点:首帧、关键帧、尾帧或其他固定帧。 |
reference generation | 素材为生成提供指引——人物、场景、风格、动作、运镜、分镜——但不充当具体帧,也不是被改的源片。 |
video editing | 直接修改一条已有的源视频。在静态关键帧之间生成不算。 |
video continuation | 新内容从一条已有源视频继续、延长、接续或过渡而来。 |
audio reuse | 同一条音频信号被整条或部分复用。 |
audio reference | 只参考风格、音色、对白内容、质感、节拍或连续性,不复制信号。 |
怎么组合
用加号连接,同一个类型不重复。续接一条片子同时拿一张图当尾帧,写成 [video continuation + keyframe completion]。改一条片子而原声还听得见,写成 [video editing + audio reuse]——音频这一半最容易漏,因为漏了画面上什么也不会坏。
一句固定句
改片时,摘要必须在前缀之后紧接着写"The target video is an edited version of <Video 1>."。只要你把某个素材标成被改的源片,这句话工具会自动替你写上。
和基础模式的差别
参考生视频改了什么,又保留了什么
镜头、运镜词汇、说话人编号和对白标签都和基础模式共用,所以你原本会的那些在参考生视频里照样成立。真正变的有四处。
| 基础模式 | 参考生视频 | |
|---|---|---|
| 主字段 | integrated_multimodal_description | detailed_description |
| 风格句 | 写在 [Shot 1] 之后 | 单独一行,写在 [Shot 1] 之前 |
| 参考标签 | 不使用 | 在首次出现处、以及角色生效的每个位置插入 |
| 音频 | 只描述视频自己的声音 | 还要说明每条被引用的信号是复制还是参考 |
排查
参考生视频没听你上传的文件时
参考生视频失败得很安静:片子照样出、积分照样扣,唯一的症状是模型没听你上传的那个文件。下面这些格式原因值得先查。
人物和上传的图对不上
可能原因
那张图被给了独立的 <Picture N> 条目,于是被读成帧锚点,而不是要复现的主体。
怎么改
把这张图写进某条 <Subject N> 定义里,并删掉它单独那一行。
某个参考完全没起作用
可能原因
它的标签定义了却从没在 detailed_description 里被引用,没有任何地方告诉模型它在哪生效。
怎么改
在每个标签首次清晰出现的位置引入它,后续镜头继续沿用同一个标签。
复用的音频出来像是重做的,不是复制的
可能原因
音频那行用了视觉标记,或者本该复制信号却写成了 reference。
怎么改
改用 fully_copy 或 partially_copy,并写在与可听层对应的那一段里。
改片之后原对白没了
可能原因
前缀只写了 video editing 没写 audio reuse,没有任何地方声明源音频要留下。
怎么改
写成 [video editing + audio reuse],并为同期声轨补一条 <Audio N>。
首帧没有被复现
可能原因
单张图被描述成了参考而不是帧锚点——那本是图生视频的活,不是主体定义。
怎么改
把它标成所在镜头的首帧,它就会变成 <Picture N> 行并带上 keyframe completion。
这些都不能把片子拉长到十五秒以上——那要分段规划并把尾帧往下传,交给 长视频规划器处理。
常见问题
关于参考生视频提示词
六段都必须写吗?
只要请求里带了参考素材、进了参考生视频,六段就都要写。最后两段没内容时可以写 N/A,但这一段本身还是要在。如果你一个参考文件都没有,那就不在这个模式里,该用三字段那套。
提示词要用英文吗?
参考生视频这六段正文用英文写。官方唯一的例外是对白、歌词和画面里可见的文字,它们保持原语言,写在 <d> 标签内——所以一句中文台词照样是中文,只有周围的描述是英文。
能传几张参考图?
本站生成器的参考生视频模式最多收三张参考图。提示词里的编号按你添加的顺序走,所以构建器里的行序要和上传顺序保持一致。
<Subject 1> 和 <Picture 1> 有什么区别?
<Picture 1> 指的是那个文件,<Subject 1> 指的是你想从里面复用的内容。如果这个文件只是用来说明某人长什么样,你要的是主体,图片标签写进它的定义里,不单独成行。
一个主体能来自两个文件吗?
可以。官方给的例子就是外观来自一张图、动作来自一条视频,合成一个主体并写明各自提供什么。这种情况直接在定义里写清楚即可;构建器的单来源行覆盖的是常见情况。
为什么 retention_analysis 里不写 (S1)?
说话人编号是按目标视频里实际发声事件的顺序分配的,属于描述部分。官方明确写了它完全不出现在 retention_analysis,即使某条音频参考绑定了说话人也一样——那个绑定写在 subject_definitions 里。
参考视频会自动产生一个 <Audio N> 吗?
不会。一条带声音的参考视频不会因此自动生成音频标签。只有当这条音轨确实被复制或被参考时才加 <Audio N>。而且 Video 和 Audio 编号互相独立,同一个文件完全可以既是 <Video 1> 又是 <Audio 2>。
detailed_description 应该写多长?
官方给生成类任务的参考区间大约是 350 到 500 个英文词,并要求按信息量把细节分散到各镜头。对白密集的内容以装下完整口白时间线为先,不必凑字数;改片类则随源片复杂度浮动。
写完参考生视频这六段,直接跑
构建器会把成品提示词交给生成器,模式是参考生视频,文件在那边挂上去。
打开生成器想看格式背后的道理而不只是操作, H3 提示词格式指南用一个完整例子从头讲到尾。
其他模式的现成提示词在 提示词库。
MiniMax H3 Full-Reference Mode Rewrite Output Format Guide · September 2026