
MiniMax H3 首尾帧实战:FL2VA 提示词该怎么写
MiniMax H3 首尾帧模式需要对齐句、单镜头,还有一段被写出来的中间过程。FL2VA 的完整格式、六个应用场景,以及尾帧对不上的原因。
第一次用 MiniMax H3 跑首尾帧,我写了两大段。一段仔细描述开头那张图,一段仔细描述结尾那张图。出来的是八秒钟的交叉溶解——两张静图互相化过去,中间没有任何看起来有重量的东西。
提示词写得不算差,只是在回答一个模型没问的问题。两张图 H3 本来就看得见。把它们再描述一遍,恰恰是 FL2VA 唯一不需要做的事。
FL2VA 是四种关键帧模式之一
MiniMax 在开源权重里附了一份提示词写作指南,把关键帧任务分成四种,区别主要在于哪张图被钉在哪个时刻:
| 模式 | 参考图 | 锁住的部分 |
|---|---|---|
| T2VA | 无 | 什么都不锁,构图和运动都由模型决定 |
| I2VA | 首帧 | 开头 |
| FL2VA | 首帧 + 尾帧 | 两端 |
| L2VA | 尾帧 | 落点 |
会用到 FL2VA,通常是因为结尾已经存在了:一张定好的产品主图、一版过审的最终设计、一个指定的收尾姿势。你问模型的不是“接下来发生什么”,而是“从 A 怎么走到 B 才像真的”。
这件事决定了提示词里该放什么。模型能看见的都是冗余,两帧之间的部分才需要你补。
大多数人漏掉的对齐句
在三个内容字段之前,FL2VA 提示词要先有一句指令,告诉 H3 哪张图属于哪个时刻:
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.这句里有三个地方特别容易写错。
N 是真正最后一个镜头的序号。 单镜头的片子,两处都是 Shot 1;加了一刀就变成 Shot 2。写错的后果是:你告诉模型尾帧属于一个并不结束视频的镜头。
S.SS 必须是两位小数。 八秒就是 8.00,不是 8,也不是 8.0。写松一点并不改变片子本身,但模型是照着严格写法训练的。
后面空一行。 这句指令自成一段,然后才开始三个字段。
I2VA 和 L2VA 各自用的是另一句开头,I2VA 的是 For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.。拿一条 I2VA 提示词直接加第二张图,是让尾帧被悄悄忽略的最快方式。
不想手工拼这些,可以直接用首尾帧提示词生成器:时长和镜头数一填,对齐句自动写好,下面那几个坑也会边写边提示。
正文是一条路径,分四拍
对齐句之后是三个字段,顺序固定:integrated_multimodal_description、overall_soundscape、non_diegetic_music。FL2VA 的成败都在第一个里。
MiniMax 给的结构是四拍:
首帧状态 → 可观察的中间变化 → 差异逐步收窄 → 尾帧状态
单镜头写出来大概是这样:
[Shot 1] <风格>, <Picture 1 里有什么>, matching the position, framing, and
lighting established by Picture 1. The camera <运镜> as <中间变化,按顺序>.
Toward the end of the shot the differences narrow until <Picture 2 里有什么>,
landing on the exact pose, spacing, and composition established by Picture 2
at the <S.SS>-second mark.真正带信息量的是中间那一段。“两只手把盖子直直提起来放到一边,然后收回去,纸巾散开露出瓶子”——这是三个可以依次经过的状态。“盒子打开露出产品”只是一条指令加一大片自由发挥空间,而自由发挥的结果就是我那段交叉溶解。
运镜有自己的三段语法:运动类型、幅度、速度,要写成自然的动作,不是在句尾堆标签。The camera pushes in with small amplitude at slow speed 是对的写法,Push In, small, slow 不是。中等幅度和常速是默认值,直接省掉。
除非真有必要,就用一个镜头
指南在这点上说得很直接:FL2VA 更适合单镜头,这样模型才能从首帧连续插值到尾帧;只有在明确需要的时候才用多镜头。
这条规则被社区提示词破坏得最多,通常是把文生视频的习惯带了过来——那边切镜头几乎没有代价,很多时候还能让画面更好看。但在 FL2VA 里,一刀切下去打断的正是你唯一要它做的那件事。
真的需要切,语法很严格。第一个镜头不带时间戳,后面每个镜头以严格递增的切点时间开头,且必须落在时长之内:
[Shot 2] At 00:03.500, the camera cuts to ...同时尾帧仍然要由最后一个镜头在片尾抵达,所以对齐句里的镜头序号也得跟着改。
只是想换角度或改景别,用运镜就够了。切镜头应该带来新信息——新的主体、新的空间、新的视点或新的时间;达不到这个程度的,交给一个推镜就行。
声音:两个字段,一条分界线
overall_soundscape 用一到四句话概括整片的环境音、动作物理音和非语言人声:雨、脚步、布料摩擦、撞击、呼吸。
non_diegetic_music 用一到三句话写角色听不到、只有观众能听到的配乐——乐器、速度、节奏、强弱变化。写 N/A 是一个正经答案,而且经常是对的答案。
分界线是“谁听得见”。房间里响着的收音机属于叙事内声音,要写进正文,和它发生时的动作放在一起。台词同样在正文里,用标签包住,说话人的信息写在标签外面:
The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>台词长度是个排期问题,不是写作问题。按每秒两到三个词估,还得给动作留位置。四秒的片子塞十二个词的句子,没地方放。
两张图能拿来做的六件事
结尾已经定死、中间才是交付物的时候,FL2VA 最划算。
1. 产品开箱。 第一帧是没拆的包装,第二帧是产品自己立在那儿。全部难点在于标签要一直看得清、手要像真的手。六秒通常够用;最容易犯的错是加一个在产品露脸那一刻正好把它挡住的运镜。
2. 前后对比。 装修、改造、修复、数据清洗前后。两帧是同一个对象同一个机位,构图一致性几乎白送,中间只要有一点跑偏也会格外明显。这是这个模式的主场。
3. 形变与材质转换。 冰化成水、草稿变成雕塑、同一条街从白天到夜里。这里的典型失败是模型选择了溶解而不是形变——同样是因为中间那段没被写出来。
4. Logo 和品牌片尾。 第二帧是不能让模型重画的既有素材。落点那句要写明这一点,片子也别太长,不给它重新解释的时间。如果 logo 还是会飘,可以改用 L2VA:它只钉尾帧,模型就不用同时兼顾开头那张图。
5. 跨镜头的人物衔接。 你手上有 A 镜头的最后一帧和 B 镜头的第一帧,缺的是中间的连接。这种情况用双镜头语法是合理的,因为你要造的本来就是一刀。
6. 分镜转动态。 相邻两张分镜之间的运动就是要生成的东西。分镜本身是画出来的,风格一致性几乎免费;真正有用的产出是时间信息——在有人开始做动画之前,你就知道这个节拍四秒装不装得下。
这六件事形状一样:开头固定、落点固定,中间那段变化必须在物理上说得通。选图这一步的分量,比写提示词还重。
尾帧就是对不上的时候
多数翻车都能归到下面几种原因。
什么都没收敛。 提示词描述的是两张静图,不是路径。补中间状态,再说明差异如何朝 Picture 2 收窄。
人物中途就变了。 衣服、颜色或某个关键道具只在开头那句里出现过。把这些锚点带进运动那句,主体动起来的时候它们才不会被重新发明。
莫名其妙多了一刀。 多镜头的措辞混进了单镜头任务。把中间段里的 “cuts to” 去掉,改用运镜。
运动先赶后停。 动作量和时长对不上。一条片子只做一次清晰的变化;宁可挪切点或者加长时长,也别把内容压扁。
这两帧根本连不上。 如果两帧之间不存在物理路径——镜头不同、房间不同、人不同——模型给出溶解,是因为溶解才是唯一诚实的答案。要么加一个中间节拍,要么加长,要么拆成两次生成再剪。
三步工作法
先选图,一个字都还没写的时候。 除非变化本身就是主题,否则主体、镜头和光线保持一致,并且确认两帧之间存在合理路径。图选坏了,提示词救不回来。
第二步定时长。 它会原样出现在对齐句和落点句里,改一次要动两个地方。单次变化的片子,六到十秒基本够。
每次重试只改一件事。 尾帧没到位,先补中间状态,别急着动运镜;运动糊了,先调时长,别先换风格。一次改两处,等于两处都没测出来。
提示词写好之后,同一段文本在托管 API 和本地 ComfyUI 里都能用,因为格式来自开源权重附带的那份指南。本地跑的话,LightX2V 的多模态提示词重写器现在有了基于 Qwen3-VL 的 8B 版本,可以直接读 first_frame 和 last_frame 并输出同样的三个字段,Q4 大约 9 GB 显存——和跑 H3 的卡基本在同一个量级。如果你是用 4 到 8 步而不是 20 步在采样,可以配合 Turbo 步数指南 一起读。
结论
FL2VA 提示词不是两张图的说明书,而是它们之间那段路程的说明书,外加一句把每张图钉到时间轴上的记账。
对齐句写对,镜头保持一个,笔墨都花在中间。我第一次拿到的那段交叉溶解,并不是模型没看懂图——而是一条没写中间过程的提示词,本来要的就是这个结果。
在 FL2VA 提示词生成器里把提示词拼好,再到 H3 生成器里带上两张图跑一遍。想看参考图生视频等其他模式的完整六段式格式,去读 MiniMax H3 提示词指南。
更多文章

海螺3 开源权重下载:Hugging Face、魔搭社区与 ComfyUI 部署指南
MiniMax H3 开源权重怎么下载?330 亿参数、Hugging Face 与魔搭社区下载、ComfyUI 部署、许可证地域限制、API 定价——这篇一次讲清。


海螺3 武打 LoRA:三个文件,两个触发词
海螺3(MiniMax H3)的武打 LoRA 有三个文件、两个触发词。步数最高的那个并不是最新版本——该用哪个,看你要的是什么。


MiniMax H3 API 指南:2K 视频、原生音频与限制
MiniMax H3 API 指南:梳理 768P 与 2K 输出、4–15 秒视频、原生立体声、多模态参考输入、文件限制与异步结果查询。
