MiniMax H3 Max 是什么、怎么用:免费额度、参数与提示词
2026/08/30

MiniMax H3 Max 是什么、怎么用:免费额度、参数与提示词

从用户角度讲清 MiniMax H3 Max:发布时的免费额度、文生视频和图生视频怎么选、首次参数、提示词模板、常见问题,以及和 MiniMax H3 的区别。

MiniMax H3 Max 的人,真正想先弄清的通常是四件事:它和 MiniMax H3 有什么区别?能不能免费试?第一次该选什么参数?所谓 3 秒生成,对实际创作有没有用?

先给结论。据 8 月 30 日发布资料,H3 Max 是基于开源 MiniMax H3 继续训练的高速版本,支持文生视频和图生视频,目标输出为带原生音频的 768p 视频。发布方公布的测试中,5 秒视频后端推理约 3 秒;这不是完整点击等待时间保证。发布页面当时也标注了少量每日免费额度。

下面直接按实际操作顺序讲。

H3 Max 快速答案

问题实用答案
能生成什么?768p、带原生音频的 AI 视频
支持什么输入?文生视频、图生视频
一条多长?发布页面核对到的是 5 秒;更长时长要以你实际使用入口为准
到底有多快?已公布测试中,5 秒视频推理约 3 秒
可以免费用吗?8 月 30 日发布页面曾标注免登录每天 5 条 5 秒视频
和 MiniMax H3 一样吗?不一样;底层同源,但 H3 Max 主打高速 768p 迭代
包含 H3 Max Live 吗?不包含;Live 是另一份实验性连续直播模型

免费额度和服务限制都可能调整。上表是 2026 年 8 月 30 日发布方给出的条件,不是本文独立跑出的 benchmark,也不是永久额度。正式安排批量任务前,要重新看生成按钮旁边的实时说明。

MiniMax H3 Max 到底是什么

发布资料把 H3 Max 描述为基于开源 MiniMax H3,重点改善提示词遵循、画面审美与服务速度。把它理解成“适合快速试镜头的 H3 变体”更准确,不要把它当成能覆盖所有 H3 工作流的下一代。

三者的实际区别是:

  • **H3 Max:**高速 768p 文生视频和图生视频,带原生音频,适合快速迭代;
  • **基础 MiniMax H3:**官方 768P/2K 输出、更完整的多模态参考流程,也有开源权重;
  • **H3 Max Live:**跨场景保留上下文的实验性连续直播版本。

如果你想为一条社媒视频连续试十个方向,应该看 H3 Max。如果目标是 2K 成片、多份视频/音频参考或本地部署,先看基础 H3。

哪些人适合用 H3 Max,哪些需求不适合

H3 Max 最有价值的地方,是快速比较受控变量:不同开头、运镜、动作节奏或产品图动画。代理商可以给客户看会动的分镜,不必只靠静帧猜节奏;产品团队也能先比较运镜,再决定是否进入正式拍摄或高分辨率生成。

比较适合的任务包括:

  • **短视频创作者:**同一个选题需要多套开头、转场或视觉钩子;
  • **分镜与预演:**先判断动作节奏和运镜,不要求第一版就是最终像素;
  • **产品运动测试:**从已经确认的产品图出发,比较光线和镜头方案;
  • **短对白走位:**检查一句台词能不能在镜头时长内自然说完;
  • **小团队快速评审:**上一条结果还记得很清楚时,马上验证下一个变量。

如果第一要求是精确文字、精确包装、2K 交付、大量参考素材,或者一条镜头里包含多个剪辑点,H3 Max 就不是最稳的终点。生成更快,不代表这些约束消失了。更合理的做法,是用它一次回答一个创意问题,再把通过的方向交给能满足最终规格的流程。

你真正想确认的问题更有用的 H3 Max 测试
这个开头 3 秒内能不能看懂?同一主体连续生成三条 5 秒开头
哪种运镜最能突出产品?产品图和动作不变,只改运镜
这句台词能不能自然说完?一个说话人、一句短句、固定时长
客户会不会认可这个构图?先让已确认的分镜或产品首帧动起来
能不能直接当 2K 最终成片?不能;它适合筛选方向,最终 2K 仍要交给符合交付规格的流程

不写代码怎么用 H3 Max

第一步:选文生视频还是图生视频

没有既定构图,希望模型从零找方向,用文生视频。它适合灵感探索、环境镜头和还没有定稿视觉的创意测试。

已经有产品图、角色设定、分镜图或客户确认过的首帧,用图生视频。输入图不能锁死后面每一帧,但比用文字重新描述一次更稳。

第二步:先跑 5 秒

第一次只跑 5 秒,先回答这些问题:

  • 主体对不对?
  • 镜头是不是朝指定方向运动?
  • 核心动作有没有完成?
  • 对白是不是太长?
  • 生成的声音是否真的属于这幕?

如果实际入口提供更长时长,也不要第一条就拉满。时长越长,出错点越多,一旦失败也更难定位;实际额度和计费是否按时长变化,以当前界面为准。

第三步:先确定最终画幅

发布位置建议先测的比例构图提醒
YouTube 或网站 Hero16:9主体不要贴最左右边缘
TikTok、Reels、Shorts9:16用中景或全身竖构图
Instagram 信息流1:1少用大幅横向运镜

等镜头通过后再改比例,基本等于重新做一套构图。第一次测试就用真实交付比例。

第四步:写一个镜头,不要写整支广告

一条容易诊断的单镜头提示词,可以拆成五部分:

[主体与固定细节] + [一个可见动作] + [地点与光线] + [运镜] + [对白、环境声和约束]

例如:

A ceramic artist in a clay-stained navy apron lifts a newly glazed cup from the workbench and turns it once toward the window light. Quiet workshop at blue hour, shelves of unfinished pottery behind her. Slow 50mm push-in, shallow focus, natural hand movement. Sound: soft room tone, distant rain and one ceramic tap. No captions, no logos, no cut.

这条只有一个人物、一个动作和一套镜头计划。需要三幕就生成三条短片,不要把三个剪辑点藏进一句话里,再指望模型猜中你的节奏。

三套可以直接改写的 H3 Max 提示词

真正好用的起点不是一串“电影感、史诗感、高级感”,而是你这条视频具体要完成什么工作。

模板一:5 秒产品运动测试

使用图生视频,把上传图作为构图和包装参照,但不要假设文字与几何能够完全锁定,结果仍需逐帧检查。

The same matte silver travel bottle remains centred on the stone plinth. A narrow band of morning light moves slowly from left to right across the bottle while two condensation drops travel down the front. Camera makes a gentle 10 cm push-in at product height, 50mm lens, no tilt. Keep the cap shape, bottle proportions, printed label and silver colour unchanged. Sound: quiet room tone and one soft glass tap. No hands, no new props, no text change, no rotation.

这条写法的优点,是点名了必须保留的包装部分,只安排两个可见变化,并把镜头路径写成可衡量的动作。它仍不能保证包装完全准确,所以标签、瓶盖与比例必须单独检查。最常见的错误,是只写“高级产品广告”,却没有写任何产品约束。

模板二:一个角色说一句短台词

A tired night-shift baker in a flour-dusted green apron leans against the stainless-steel counter and looks toward the first light outside. She exhales, then says quietly, “We made it.” Warm oven light behind her, cool dawn at the window. Locked medium close-up with a very slow push-in. Preserve her short dark curls, green apron and the scar above her left eyebrow. Sound: low refrigerator hum, distant delivery van, no music. No cut, no subtitles, no second speaker.

一句短台词通常更适合 5 秒镜头,但仍要实测语速与发音。说话人写得很明确,短卷发、绿围裙、左眉疤痕也是三个看得见的身份锚点,比一大段人物身世更有用。

模板三:有明确运动线的环境镜头

A small coastal train crosses a weathered steel bridge during a summer storm, warm carriage windows reflected in the dark water below. One sheet of rain moves across the valley as lightning briefly reveals the distant cliffs. Wide 24mm aerial tracking shot, camera follows parallel to the train at constant speed. Sound: rain, rail rhythm and one distant thunder roll. Natural scale, no speed ramp, no cut, no text.

列车提供稳定运动线,天气只负责一次清楚变化,镜头和主体的相对关系也没有突然改变。不要再加第二个地点,也别要求 5 秒内从车外穿进车厢。

第一次测试建议用什么参数

参数建议起点原因
模式找灵感用文生视频;构图已定用图生视频先匹配任务,不强行只用一种入口
分辨率768p当前 H3 Max 的目标规格
时长5 秒最快发现提示词问题
画幅最终交付比例避免后续裁切毁掉构图
提示词扩写基准测试先保持默认;若界面提供,再作为独立变量测试避免第一轮同时改变太多因素
音频只描述画面里确实该听到的声音避免泛化配乐压住场景

如果实际入口提供更长时长,先让 5 秒版本跑通,再用时间线扩展,不要只堆更多形容词:

0–5s: she lifts the cup and checks the glaze.
5–10s: she turns toward the window and the surface catches the blue light.
10–15s: she sets it beside the finished set and smiles, camera settles.

每一段都需要一个可见变化。没有动作的空白时间,常常会被填成慢动作、重复动作或没必要的镜头漂移。

五步测试顺序,怎样减少无效尝试

五条随机提示词,只会得到五个互不相关的结果。按变量排列测试,可以减少干扰,更容易判断哪处修改可能起了作用。

  1. **基准测试:**用一个动作和一个运镜,先生成最简单的 5 秒版本;
  2. **运镜测试:**其他文字全部不动,只换镜头焦段和移动路径;
  3. **动作测试:**恢复原运镜,只改变人物动作或动作发生时间;
  4. **参考图测试:**如果身份或构图漂移,换成图生视频并上传最佳首帧;
  5. **交付测试:**发布平台一开始就确定时,从基准测试起保持最终比例;只有平台未定时,才在这一步切换真实比例。入口支持更长时长时,再做延长测试。

最好顺手做一个很短的测试记录:

次数只改了什么保留 / 淘汰判断理由
1基准版本主体、动作、运镜、声音是否成立
2只改运镜产品或角色是不是更突出
3只改动作5 秒内有没有完成核心事件
4加入参考图身份和构图是否更稳定
5比例或时长通过的创意能否适应真实交付设置

一次只改一个变量只能减少干扰,不能证明因果,因为生成本身带随机性。入口若支持固定 seed,就保持不变;不支持时,关键版本最好重复 2–3 次,再判断哪个方向更稳定。

图生视频的运动约束怎么写

前面的模式选择解决“要不要上传首帧”。确定使用图生视频后,下一步是分清哪些部分允许运动,哪些部分必须保持可辨认。不能只写“动起来”,要说明输入帧之后什么会变化:

The camera slides ten centimetres to the right while the bottle remains centred. Condensation beads roll slowly down the glass; the backlight brightens and the reflection travels across the label. Keep package geometry, label text and cap colour unchanged. No rotation, no new objects.

“其他都不变”太模糊。包装几何、标签文字、瓶盖颜色这些真正不能动的部分,要点名写出来。

H3 Max 和 MiniMax H3 怎么选

需求更合适的起点
快速尝试大量创意方向H3 Max
768p 社媒短片、对白镜头H3 Max
2K 最终输出MiniMax H3
多张图、多条视频或音频参考MiniMax H3
开源权重或本地工作流MiniMax H3
连续互动直播H3 Max Live,等生产使用入口开放后

一个合理流程可以两者都用:先用 H3 Max 快速选方向,保留通过的提示词和首帧,再判断这条镜头是否值得用高分辨率 H3 重跑。

常见问题怎么修

提示词后半段被忽略

删到只剩一个动作,把可见事件放在风格词前面。两个动作都不能删,就给它们明确时间段。

人物一运动就变脸

改用图生视频,再重复两三个身份锚点:发型、一件服装、一个明显配件。很长的人物背景,不如三个看得见的细节有用。

对白听起来很赶

缩短台词,并先按自然语速读一遍。5 秒通常只适合一句短句。写清谁说、什么语气,别同时塞三个人物的对白。

模型生成很快,画面节奏还是很慢

模型速度和镜头节奏不是一回事。把“优雅地移动”换成具体动作和运镜路径。角色没有事情可完成,模型就只能靠慢动作填时间。

结果很快,但不能直接交付

H3 Max 适合迭代,选中的镜头仍要在最终尺寸下检查。768p 对社媒和概念测试可能够用,但不自动等于适合大屏或重裁切成片。

第一次生成前,大家最常搜的几个问题

“3 秒生成 5 秒视频”是不是完整等待时间

更准确的理解是后端推理速度,不是每次点击后都保证 3 秒拿到文件。上传、排队、安全检查、音频处理和结果传输都可能增加等待时间。真正做项目时,要记录自己使用入口的“点击到看见结果”总耗时。

有原生音频,是不是不用再做声音

不是。原生音频适合判断对白节奏、环境氛围和概念方向。正式交付前仍要检查人声清晰度、意外配乐、结尾是否突然断掉,以及多条独立生成视频之间的声音是否一致。

多条视频能不能保持同一个角色

图生视频加上重复的可见锚点,会比纯文字稳定,但几次独立任务不会自动共享一段持续记忆。保存通过的首帧,固定发型、服装和明显配件,并预留后期修连续性的时间。

提示词一定要写英文吗

用你最能准确描述镜头的语言。某些运镜或灯光术语如果翻译后不稳定,可以保留英文专业词,其余部分自然写中文。清楚的中英混合提示词,比一条模糊的全英文翻译更好。

生成结果能不能商用

画面质量和使用权是两件事。要重新查看当前服务条款,确认上传素材确实有权使用,并检查输出里是否混入未要求的商标、人脸、音乐或其他受保护内容。生成得快,不会自动帮你解决权利问题。

H3 Max 值不值得用

如果快速反馈能让你多试几套方向,它就值得用。社媒短片、视觉开发、对白走位、产品运动测试和预演,都是它的强项。

如果第一要求是 2K、多模态参考包、本地部署或持续直播 session,就别硬套 H3 Max;分别去看基础 MiniMax H3 或 H3 Max Live。

想找可改写的提示词结构,可以看MiniMax H3 提示词库。两者底层同源,主体—动作—镜头—声音这套写法能够迁移,但最终仍要在 H3 Max 上跑一遍确认。

如果你真正关心的是连续版本,而不是普通短片,请继续看面向直播创作者的 H3 Max Live 应用指南,或先用 H3 Max Live 场景导演器编排下一幕。

产品限制和免费额度核对时间为 2026 年 8 月 30 日。它们是当前服务条件,不是永久不变的模型保证。

免费试用

立即用 MiniMax H3 生成你的第一段视频

支持文生视频与图生视频,并提供可直接使用的提示词案例,帮助你快速开始创作。无需下载,打开浏览器即可使用。