尾帧始终到不了
原因:提示词描述的是两张静图而不是它们之间的路径,模型没有收敛的理由。
改法:把中间写出来。列出主体依次经过的状态,再说明差异如何收窄,直到最后一个镜头的结尾与 Picture 2 一致。
两张图 H3 本来就看得见,它看不见的是中间那条路——而 FL2VA 提示词要写的只有这个。把变化描述出来,这个工具会按 MiniMax 随模型发布的那套格式拼好:对齐句、镜头时间线、环境音、配乐。
开始拼装
可以从预设改,也可以自己写。右边是实时拼好的结果,包括大多数人手写时会写错的那句对齐句。
FL2VA 提示词
MiniMax 官方格式——先对齐句,再三个字段。
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 6.00-second mark of the target video. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a matte black gift box sits closed and centred on a pale marble counter under soft window light, its lid seam facing camera, matching the position, framing, and lighting established by Picture 1. The camera pushes in with small amplitude at slow speed as two hands enter from the lower edge, lift the lid straight up and set it aside, then withdraw as the tissue paper falls open around a glass serum bottle. Toward the end of the shot the differences narrow until the serum bottle stands upright and unobstructed in the centre of the counter with the opened box behind it and the dropper cap facing camera, landing on the exact pose, spacing, and composition established by Picture 2 at the 6.00-second mark. overall_soundscape: A quiet room tone carries throughout, broken by the soft friction of the lid sliding free, the rustle of tissue paper, and the light tap of glass settling on stone. non_diegetic_music: Sparse marimba notes at a slow tempo, joined by a warm synth pad that swells once as the bottle is revealed.拿去托管 MiniMax H3 跑
会打开生成器、载入这段提示词并切到 Image to Video 一栏,首帧和尾帧在那里上传。
提示词检查
没有问题。两帧都写了,中间有路径,而且是单个连续镜头。
结构
四个部分,顺序固定。漏掉对齐句,H3 就不知道哪张是开头、哪张是落点。
一句话把 Picture 1 钉在 0.00 秒、Picture 2 钉在片尾。结束时间必须是两位小数,后面空一行才开始写字段。
正文。风格、开场构图、两帧之间的运动路径、运镜、说话人、台词,以及画面里发生的所有声音。FL2VA 的成败都在这里。
用一到四句话概括整片的环境音、动作物理音和非语言人声。不写台词、不写歌唱、不写角色听得到的音乐——那些属于正文。
用一到三句话写角色听不到的配乐:乐器、速度、节奏、强弱。没有就写 N/A,这是正经答案,不是敷衍。
MiniMax 官方的 FL2VA 示例
来自 H3 开源权重附带的提示词写作指南,八秒单镜头,这里因篇幅做了删节。注意正文从头到尾没有描述那两张图,写的是它们之间那把伞是怎么打开的。
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a rain-soaked cyclist begins in the position and framing established by Picture 1 … overall_soundscape: Rain falls steadily on the pavement, followed by the metallic click of the umbrella runner … non_diegetic_music: N/A去 Hugging Face 看完整指南
容易翻车的地方
几乎所有失败的首尾帧片子都是这六种之一。其中五种是提示词的问题,不是模型的问题。
原因:提示词描述的是两张静图而不是它们之间的路径,模型没有收敛的理由。
改法:把中间写出来。列出主体依次经过的状态,再说明差异如何收窄,直到最后一个镜头的结尾与 Picture 2 一致。
原因:正文没告诉模型哪些属性是固定的,主体一动它就重新发明了一遍。
改法:把衣服、颜色、关键道具、空间关系这些锚点带进描述运动的那句话里,不要只留在开场那一句。
原因:多镜头的措辞混进了单镜头任务,或者描述暗示了视点跳跃,被模型当成剪辑处理了。
改法:除非真的需要,FL2VA 就保持一个镜头。景别和角度变化交给运镜,"the camera cuts to" 留给真正的新信息。
原因:片长和描述的动作量对不上。六秒的内容塞进四秒的渲染,总得有地方被牺牲。
改法:让动作量匹配时长,或者挪一下切点。一条片子做好一次清晰的变化,胜过三次全被削掉。
原因:按自然语速这句话比时长要长,结果要么被截断,要么音频停了嘴还在动。
改法:按每秒两到三个词估,并给动作留出余量。长句子该配更长的片子,而不是更快的语速。
原因:把叙事内的声音写进了 non_diegetic_music,或者环境音重复了正文已经描述过的内容。
改法:角色听得到的声音写正文,只有观众听得到的配乐写 non_diegetic_music。环境音那一栏只概括氛围、撞击和呼吸。
选模式
H3 接收关键帧有四种方式,差别就在那句对齐句上。写错的话,你的参考图会被悄悄忽略。
| 模式 | 参考图 | 对齐句 | 控制力 | 什么时候用 |
|---|---|---|---|---|
| T2VA | 只有文字 | 没有对齐句 | 最低 | 手上没有参考画面,构图和运动都想让模型自己发挥。 |
| I2VA | 首帧 | Picture 1 在 0.00 秒 | 锁开头 | 开场画面很重要,但结尾走到哪里可以交给模型决定。 |
| FL2VA | 首帧 + 尾帧 | Picture 1 在 0.00 秒,Picture 2 在片尾 | 两端都锁 | 开头和结尾的画面都已经定了,需要的是中间那段说得通的路径。 |
| L2VA | 尾帧 | Picture 1 在片尾 | 锁结尾 | 落点画面是固定的——logo、揭晓、某个收尾姿势——前面怎么铺你自己定。 |
应用场景
工具里的每个预设都对应下面一种。它们形状一样:开头画面固定、落点画面固定,中间那段变化必须说得通。


电商
第一帧是没拆的包装,第二帧是产品自己立在那儿。最难的是让标签从头到尾都看得清。
6s · 单镜头 · Live-action, cinematic


装修 / 改造
最经典的 FL2V 用法。两帧是同一个房间或同一张脸,中间那条路径要模型自己想出来。
8s · 单镜头 · Live-action


创作过程
第一帧是草稿,第二帧是成品。插画、设计、字体和三维转台都适用。
10s · 单镜头 · 2D-animated
上面这些首尾帧对是"好的 FL2VA 输入长什么样"的示意——同机位、同光线、只有一件事在变。它们是参考静图,不是 MiniMax H3 的生成结果。
怎么用
FL2VA 的上限由这一对图决定。除非变化本身就是主题,否则主体、镜头和光线保持一致,并且确认两帧之间存在物理上说得通的路径。
结束时间会原样出现在对齐句里,之后再改就要重写提示词。支持 4 到 15 秒,单次变化的片子六到十秒基本够用。
两帧模型都看得见。正文的笔墨要花在什么在动、什么易手、构图怎么演变、差异怎么朝尾帧收窄上。
常见问题
就是 FL2VA 提示词格式。开头是一句对齐句,把 Picture 1 钉在 0.00 秒、Picture 2 钉在片尾,接着是三个字段:integrated_multimodal_description、overall_soundscape、non_diegetic_music。两张图 H3 本来就看得见,所以正文写的是它们之间的运动路径,而不是图本身。
MiniMax 把结束时间规定成 S.SS,即恰好两位小数。八秒要写成 8.00,不能写 8 或 8.0。这是格式要求而不是精度要求,这个工具会替你写好。
绝大多数情况用一个。MiniMax 明确说 FL2VA 更适合单镜头,这样模型才能从首帧连续插值到尾帧,只有在明确需要时才用多镜头。真的加了切点,尾帧仍然必须由最后一个镜头在片尾抵达。
可以。首页生成器的 Image to Video 一栏有首帧槽和一个可选的尾帧槽,两张都传就是首尾帧任务,它们会分别作为 first_frame_url 和 last_frame_url 送到 H3。在这里拼好提示词,点运行,再到那边挂上这一对。
图生视频(I2VA)只锁开场那一帧,结尾走到哪里由模型决定。FL2VA 两端都锁,适合结尾画面已经定死的场合——产品主图、过审的设计稿、指定的收尾姿势。代价是:如果这两帧在物理上根本连不上,结果会比只给一张图还差。
能。格式来自 H3 开源权重附带的提示词写作指南,所以同一段文本在托管 API 和本地 ComfyUI 工作流里都成立。LightX2V 的多模态重写器现在有了基于 Qwen3-VL 的 8B 版本,可以直接读 first_frame 和 last_frame,输出的也是同样三个字段。
按每秒两到三个词估,并给动作留出余量。台词要放在 <d>[Language] ...</d> 标签里,说话人的信息写在标签外面。当这句话相对你设定的时长明显偏长时,这个工具会提示你。
模型会自己编,而且通常编出来像溶解而不是运动。要么在路径里加一个中间节拍让变化有可见的阶段,要么把片子加长,要么拆成两次生成再剪到一起。