AI 视频运镜提示词:大多数人漏掉的那半句
2026/09/10

AI 视频运镜提示词:大多数人漏掉的那半句

AI 视频运镜提示词失效通常只有一个原因:镜头没有落点。这里是 MiniMax H3 认识的 20 种运镜写法,以及让它真正动起来的那半句话。

上周我花了一下午,就为了让一个运镜生效。

镜头本身不复杂:一个女人坐在厨房餐桌旁,我想让画面向左移,最后停在她背后的窗户上。我写「camera moves left」,出来一个静止镜头。改成「slow pan to the left, cinematic」,还是静止的,只是光线有点不一样。再改成「the camera slowly pans left across the room」,这次动了——大概晃了四度,然后停住。

后来我翻开 H3 开源权重里附带的那份提示词指南,找到运镜那一节,把这句重写成 The camera pans left with large amplitude at slow speed, revealing the window behind her。一次就对了。

我想要的东西一个字没变。变的是我不再自己造词,开始用它公布过的那套说法——并且补上了我整个下午一直漏掉的那半句。

一条运镜指令有三段,不是一段

大多数运镜提示词只写了一段:方向。这就是它们大多效果很弱的原因。

模型被训练时读的格式有三段:

[运动类型] + [幅度与速度,有意义时才写] + [镜头最终落在什么上]

下面三句是 MiniMax 在自己的指南里给出的例句,原文照录:

The camera pushes in with small amplitude at slow speed toward the folded letter in her hands.
The camera pans right with large amplitude at fast speed, revealing the open doorway.
The camera holds a static shot as the runner exits the frame.

再看一遍,注意每一句是怎么收尾的。「toward the folded letter」「revealing the open doorway」「as the runner exits the frame」。没有一句停在方向上。

收尾这半句,就是我那一下午一直漏掉的东西。方向只告诉模型往哪边走,没说走多远、什么时候停、这个镜头是为了什么。让它自己猜,它就选最保险的做法——几乎不动。而这在你屏幕上看起来,跟指令被完全忽略一模一样。

模型真正认识的 20 种运镜

词表是固定的。二十种运动类型,写在这之外的都是在赌。

机身不动,镜头转或变焦

运动类型提示词写法实际效果
Zoom In / Zoom OutThe camera zooms in只改焦距,相机本身没有位移
Pan Left / Pan RightThe camera pans left机位不动,镜头水平转
Tilt Up / Tilt DownThe camera tilts up机位不动,镜头垂直俯仰

整台机器在移动

运动类型提示词写法实际效果
Push In / Pull OutThe camera pushes in机身朝主体推进或后退
Truck Left / Truck RightThe camera trucks left机身横向平移
Pedestal Up / Pedestal DownThe camera pedestals up机身垂直升降
Static ShotThe camera holds a static shot机位和镜头都不动

由主体决定

运动类型提示词写法实际效果
Arc ShotThe camera arcs around the subject绕着主体走弧线
Tracking ShotThe camera tracks the subject跟随移动中的主体
POVThe camera holds the subject's point of view画面变成主体自己的视角

翻滚与抖动

运动类型提示词写法实际效果
Roll Clockwise / CounterclockwiseThe camera rolls clockwise绕镜头轴旋转
Shake Slightly / Shake StronglyThe camera shakes slightly轻微或剧烈的镜头抖动

这张表我一直开着一个标签页放在手边。也有一个可点的版本,能直接帮你把整句拼出来,不想记的话用它。

Pan 不是 Truck,Zoom 不是 Push

这两组混淆造成的废片,比词表里其他所有情况加起来还多。原因是日常说话时我们两个都叫「移镜头」。

Pan 是机器钉在原地、镜头转过去,像你站着不动扭头。Truck 是把整台机器搬起来横着走,像你走过去。成片上这两个完全不像:横移的时候近处的东西比远处掠过得快,空间是有纵深的;摇的时候画面整体一起扫,空间是平的。

所以「camera moves left」不只是没在词表里,它本身就有歧义——两种都可能。模型必须替你选一个,而它不一定选你想的那个。

Zoom 是机身不动改焦距,脸会被压平、背景被压缩。Push In 是机器真的往前走,透视是自然的,感觉像在靠近一个人。导演是刻意在这两者之间做选择的。你想要推近却写了变焦,会得到一个技术上没错、但感觉不对的镜头,而且说不出哪里不对。

幅度和速度,以及什么时候该闭嘴

两个修饰词,各有两个公布过的取值:

  • with small amplitude / with large amplitude——构图变化的幅度
  • at slow speed / at fast speed——变化发生的快慢

它们互相独立,这一点很有用。大幅度慢速是层层递进的揭示,小幅度快速是一个激灵。同一个运动类型,完全是两个镜头。

指南里明确写着:中等幅度和常速通常省略不写。这句话很容易一眼扫过去,但它比看上去重要——运镜从句里每多一个词,都在跟真正承载指令的那些词抢注意力。写「at normal speed」不会强化默认值,只会稀释这句话。什么都不写,拿到的就是默认。

二十种里有四种根本不接修饰词。Static ShotPOV 描述的是状态不是运动,Shake SlightlyShake Strongly 本身已经带了程度——「shakes strongly with large amplitude」是指南从没定义过的说法,写了就又回到赌运气。

给运镜一个落点

这条花了我一下午,所以单独拎出来讲。

对比一下:

The camera pans left with large amplitude at slow speed.
The camera pans left with large amplitude at slow speed, revealing the window behind her.

第一句怎么读都是一条完整的指令。但它就是不好用,因为「pan left」描述的是一个没有终止条件的过程。第二句给了这个摇镜一个目的地,而正是这个目的地告诉模型:要摇多远,摇到哪算完。

三个连接词基本够用了:

  • toward …——镜头朝某样东西靠近。pushes in toward the open watch case between his hands
  • revealing …——镜头带出画面里原本没有的东西。trucks right, revealing the queue that has formed behind him
  • as …——镜头和某个动作对时间。holds a static shot as the runner exits the frame

如果这三个你一个都接不上去,值得停下来想想。这通常说明这个镜头压根没有动的理由——那还不如就静止,比让模型自己去编一个漂移的目的强。

可以直接抄的模板

[Shot 1] Live-action, cinematic, <开场景别与场景>。
The camera <运动类型> <with … amplitude> <at … speed> <toward / revealing / as …>。
<主体在做什么,可以没有。>

填好之后:

[Shot 1] Live-action, cinematic, a medium-wide shot frames a watchmaker at a
cluttered bench under a single warm desk lamp. The camera pushes in with small
amplitude at slow speed toward the open watch case between his hands. He sets
down the tweezers and turns the movement a quarter turn to catch the light.

注意顺序:先把场景立住,运镜再作用在它上面。把运镜堆在提示词末尾——, cinematic, pan right, 4k, dynamic camera——读起来就是一串风格标签,模型也会按标签的分量来对待它。

六个悄悄让你多废几条的错误

1. 自己造动词。「drone shot」「slow zoom out effect」「camera glides」——都是通顺的英文,都不在公布的词表里。模型是按公布的写法训练的,换个近义词就是在掷硬币。

2. 写完方向就停。 上面讲过了。这是最常见的一个,也是最贵的,因为出来的结果看着像指令被无视了,而不是像指令没写完。

3. 让一个镜头改方向。 先向左摇两秒再向右摇——一个镜头只承载一个运镜。在同一个镜头里互相打架的指令往往会彼此抵消,最后拿到一个几乎不动的相机。真要两个运动就切一刀:[Shot 2] At 00:04.000, the camera cuts to …,给第二个镜头它自己的运动类型。

4. 把运镜埋进场景描述里。 运镜要写成镜头内的一个动作,不是句尾的标签。

5. 给不接修饰词的类型加修饰词。 Static、POV 和两个 Shake。给它们加幅度,产出的是指南没有定义过的短语。

6. 整条片子一直抖。 Shake Strongly 从头抖到尾,会把画面里其他东西一起晃散——脸会糊,画面里的文字会认不出来。想要冲击力就切一刀进去,别从头抖到尾。

三步走的写法

先按静止镜头写。The camera holds a static shot 把景别、主体和动作先弄对。如果这个场景站着不动都不成立,加运镜也救不回来。

加一个运镜,带上落点。 一个运动类型,一个目的地。把句子念出来——如果它停在一个方向上而不是一样东西上,就是还没写完。

最后才碰修饰词。 幅度和速度是留给「默认值明显不对」的时候用的,不是每个镜头都要加。说不出默认哪里不对,就别写。

如果这个镜头必须停在某一张指定的画面上,而不是停在某个运动上,那是另一套提示词格式,有它自己的对齐句——首尾帧提示词工具负责写那一种。运镜从句所在的整体结构,可以看六段式提示词指南

说到底

AI 视频的运镜不是一个设置问题。没有摇杆,也没有关键帧轨道——模型读的就是你给它的那些字,而且它只认固定的那一套。

所以写运镜提示词说到底就两个习惯。用公布过的动词,别用近义词。以及把句子写完:说清楚镜头最后落在什么上,而不只是往哪边动。

第二个习惯,就是把我那一下午救回来的东西。

本文的运镜词表来自 MiniMax H3 开源权重附带的 Video Prompt Writing Guide,2026 年 9 月核对。本站与 MiniMax 无隶属关系。

免费试用

立即用 MiniMax H3 生成你的第一段视频

支持文生视频与图生视频,并提供可直接使用的提示词案例,帮助你快速开始创作。无需下载,打开浏览器即可使用。