MiniMax H3 首尾帧实战:FL2VA 提示词该怎么写
2026/08/20

MiniMax H3 首尾帧实战:FL2VA 提示词该怎么写

MiniMax H3 首尾帧模式需要对齐句、单镜头,还有一段被写出来的中间过程。FL2VA 的完整格式、六个应用场景,以及尾帧对不上的原因。

第一次用 MiniMax H3 跑首尾帧,我写了两大段。一段仔细描述开头那张图,一段仔细描述结尾那张图。出来的是八秒钟的交叉溶解——两张静图互相化过去,中间没有任何看起来有重量的东西。

提示词写得不算差,只是在回答一个模型没问的问题。两张图 H3 本来就看得见。把它们再描述一遍,恰恰是 FL2VA 唯一不需要做的事。

FL2VA 是四种关键帧模式之一

MiniMax 在开源权重里附了一份提示词写作指南,把关键帧任务分成四种,区别主要在于哪张图被钉在哪个时刻:

模式参考图锁住的部分
T2VA什么都不锁,构图和运动都由模型决定
I2VA首帧开头
FL2VA首帧 + 尾帧两端
L2VA尾帧落点

会用到 FL2VA,通常是因为结尾已经存在了:一张定好的产品主图、一版过审的最终设计、一个指定的收尾姿势。你问模型的不是“接下来发生什么”,而是“从 A 怎么走到 B 才像真的”。

这件事决定了提示词里该放什么。模型能看见的都是冗余,两帧之间的部分才需要你补。

大多数人漏掉的对齐句

在三个内容字段之前,FL2VA 提示词要先有一句指令,告诉 H3 哪张图属于哪个时刻:

How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.

这句里有三个地方特别容易写错。

N 是真正最后一个镜头的序号。 单镜头的片子,两处都是 Shot 1;加了一刀就变成 Shot 2。写错的后果是:你告诉模型尾帧属于一个并不结束视频的镜头。

S.SS 必须是两位小数。 八秒就是 8.00,不是 8,也不是 8.0。写松一点并不改变片子本身,但模型是照着严格写法训练的。

后面空一行。 这句指令自成一段,然后才开始三个字段。

I2VA 和 L2VA 各自用的是另一句开头,I2VA 的是 For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.。拿一条 I2VA 提示词直接加第二张图,是让尾帧被悄悄忽略的最快方式。

不想手工拼这些,可以直接用首尾帧提示词生成器:时长和镜头数一填,对齐句自动写好,下面那几个坑也会边写边提示。

正文是一条路径,分四拍

对齐句之后是三个字段,顺序固定:integrated_multimodal_descriptionoverall_soundscapenon_diegetic_music。FL2VA 的成败都在第一个里。

MiniMax 给的结构是四拍:

首帧状态 → 可观察的中间变化 → 差异逐步收窄 → 尾帧状态

单镜头写出来大概是这样:

[Shot 1] <风格>, <Picture 1 里有什么>, matching the position, framing, and
lighting established by Picture 1. The camera <运镜> as <中间变化,按顺序>.
Toward the end of the shot the differences narrow until <Picture 2 里有什么>,
landing on the exact pose, spacing, and composition established by Picture 2
at the <S.SS>-second mark.

真正带信息量的是中间那一段。“两只手把盖子直直提起来放到一边,然后收回去,纸巾散开露出瓶子”——这是三个可以依次经过的状态。“盒子打开露出产品”只是一条指令加一大片自由发挥空间,而自由发挥的结果就是我那段交叉溶解。

运镜有自己的三段语法:运动类型、幅度、速度,要写成自然的动作,不是在句尾堆标签。The camera pushes in with small amplitude at slow speed 是对的写法,Push In, small, slow 不是。中等幅度和常速是默认值,直接省掉。

除非真有必要,就用一个镜头

指南在这点上说得很直接:FL2VA 更适合单镜头,这样模型才能从首帧连续插值到尾帧;只有在明确需要的时候才用多镜头。

这条规则被社区提示词破坏得最多,通常是把文生视频的习惯带了过来——那边切镜头几乎没有代价,很多时候还能让画面更好看。但在 FL2VA 里,一刀切下去打断的正是你唯一要它做的那件事。

真的需要切,语法很严格。第一个镜头不带时间戳,后面每个镜头以严格递增的切点时间开头,且必须落在时长之内:

[Shot 2] At 00:03.500, the camera cuts to ...

同时尾帧仍然要由最后一个镜头在片尾抵达,所以对齐句里的镜头序号也得跟着改。

只是想换角度或改景别,用运镜就够了。切镜头应该带来新信息——新的主体、新的空间、新的视点或新的时间;达不到这个程度的,交给一个推镜就行。

声音:两个字段,一条分界线

overall_soundscape 用一到四句话概括整片的环境音、动作物理音和非语言人声:雨、脚步、布料摩擦、撞击、呼吸。

non_diegetic_music 用一到三句话写角色听不到、只有观众能听到的配乐——乐器、速度、节奏、强弱变化。写 N/A 是一个正经答案,而且经常是对的答案。

分界线是“谁听得见”。房间里响着的收音机属于叙事内声音,要写进正文,和它发生时的动作放在一起。台词同样在正文里,用标签包住,说话人的信息写在标签外面:

The young woman with a quiet, breathy voice (S1) says: <d>[English] I get off at the next station.</d>

台词长度是个排期问题,不是写作问题。按每秒两到三个词估,还得给动作留位置。四秒的片子塞十二个词的句子,没地方放。

两张图能拿来做的六件事

结尾已经定死、中间才是交付物的时候,FL2VA 最划算。

1. 产品开箱。 第一帧是没拆的包装,第二帧是产品自己立在那儿。全部难点在于标签要一直看得清、手要像真的手。六秒通常够用;最容易犯的错是加一个在产品露脸那一刻正好把它挡住的运镜。

2. 前后对比。 装修、改造、修复、数据清洗前后。两帧是同一个对象同一个机位,构图一致性几乎白送,中间只要有一点跑偏也会格外明显。这是这个模式的主场。

3. 形变与材质转换。 冰化成水、草稿变成雕塑、同一条街从白天到夜里。这里的典型失败是模型选择了溶解而不是形变——同样是因为中间那段没被写出来。

4. Logo 和品牌片尾。 第二帧是不能让模型重画的既有素材。落点那句要写明这一点,片子也别太长,不给它重新解释的时间。如果 logo 还是会飘,可以改用 L2VA:它只钉尾帧,模型就不用同时兼顾开头那张图。

5. 跨镜头的人物衔接。 你手上有 A 镜头的最后一帧和 B 镜头的第一帧,缺的是中间的连接。这种情况用双镜头语法是合理的,因为你要造的本来就是一刀。

6. 分镜转动态。 相邻两张分镜之间的运动就是要生成的东西。分镜本身是画出来的,风格一致性几乎免费;真正有用的产出是时间信息——在有人开始做动画之前,你就知道这个节拍四秒装不装得下。

这六件事形状一样:开头固定、落点固定,中间那段变化必须在物理上说得通。选图这一步的分量,比写提示词还重。

尾帧就是对不上的时候

多数翻车都能归到下面几种原因。

什么都没收敛。 提示词描述的是两张静图,不是路径。补中间状态,再说明差异如何朝 Picture 2 收窄。

人物中途就变了。 衣服、颜色或某个关键道具只在开头那句里出现过。把这些锚点带进运动那句,主体动起来的时候它们才不会被重新发明。

莫名其妙多了一刀。 多镜头的措辞混进了单镜头任务。把中间段里的 “cuts to” 去掉,改用运镜。

运动先赶后停。 动作量和时长对不上。一条片子只做一次清晰的变化;宁可挪切点或者加长时长,也别把内容压扁。

这两帧根本连不上。 如果两帧之间不存在物理路径——镜头不同、房间不同、人不同——模型给出溶解,是因为溶解才是唯一诚实的答案。要么加一个中间节拍,要么加长,要么拆成两次生成再剪。

三步工作法

先选图,一个字都还没写的时候。 除非变化本身就是主题,否则主体、镜头和光线保持一致,并且确认两帧之间存在合理路径。图选坏了,提示词救不回来。

第二步定时长。 它会原样出现在对齐句和落点句里,改一次要动两个地方。单次变化的片子,六到十秒基本够。

每次重试只改一件事。 尾帧没到位,先补中间状态,别急着动运镜;运动糊了,先调时长,别先换风格。一次改两处,等于两处都没测出来。

提示词写好之后,同一段文本在托管 API 和本地 ComfyUI 里都能用,因为格式来自开源权重附带的那份指南。本地跑的话,LightX2V 的多模态提示词重写器现在有了基于 Qwen3-VL 的 8B 版本,可以直接读 first_framelast_frame 并输出同样的三个字段,Q4 大约 9 GB 显存——和跑 H3 的卡基本在同一个量级。如果你是用 4 到 8 步而不是 20 步在采样,可以配合 Turbo 步数指南 一起读。

结论

FL2VA 提示词不是两张图的说明书,而是它们之间那段路程的说明书,外加一句把每张图钉到时间轴上的记账。

对齐句写对,镜头保持一个,笔墨都花在中间。我第一次拿到的那段交叉溶解,并不是模型没看懂图——而是一条没写中间过程的提示词,本来要的就是这个结果。

FL2VA 提示词生成器里把提示词拼好,再到 H3 生成器里带上两张图跑一遍。想看参考图生视频等其他模式的完整六段式格式,去读 MiniMax H3 提示词指南

免费试用

立即用 MiniMax H3 生成你的第一段视频

支持文生视频与图生视频,并提供可直接使用的提示词案例,帮助你快速开始创作。无需下载,打开浏览器即可使用。