MiniMax H3 API 指南:2K 视频、原生音频与限制
2026/07/31

MiniMax H3 API 指南:2K 视频、原生音频与限制

MiniMax H3 API 指南:梳理 2K 输出、4–15 秒视频、原生立体声、多模态参考输入、文件限制与异步结果查询。

2026 年 7 月 31 日,MiniMax 正式发布 MiniMax H3。官方将它定位为通用全模态生成模型;目前公开 API 的开发者工作流集中在视频生成,支持 2K 输出、原生立体声和 4–15 秒时长。下文分别说明已经开放的 API 能力与官方仍在推进的计划。

MiniMax H3 是什么?

MiniMax 将 H3 定义为通用全模态生成模型。落到实际工作流里,就是你可以同时提交多种参考素材,再用自然语言说明它们之间的关系。例如:镜头运动参考视频 1,人物外观参考图片 2,演唱节奏和音色参考音频 3。

这种方式与“先生成画面,再单独做口型、音效和放大”的拼接流程不同。H3 会先理解完整上下文,再生成画面与原生立体声。声音不是最后附加的一条音轨,而是生成目标的一部分。

官方发布文章还介绍了图像生成、图像编辑、音频生成和音视频编辑等训练任务。不过,首发时公开的 H3 API 是视频生成接口。这里需要分清:模型的训练与研究范围很广,当前开发者文档明确开放的是视频工作流。

MiniMax H3 API 当前支持什么?

官方模型名是 MiniMax-H3,现阶段主要有三种用法:

  1. 文生视频:提交文字提示词,并选择支持的画面比例。
  2. 图生视频:可以上传首帧、尾帧,或同时上传首尾帧。输出比例由输入图片决定。
  3. 参考生视频:组合图片、视频和音频参考,再用提示词说明每份素材分别控制什么。

当前参数并不模糊:

  • 分辨率:2K
  • 时长:4–15 秒之间的任意整数
  • 画面比例:支持 adaptive、21:9、16:9、4:3、1:1、3:4、9:16。文生视频必须指定一种具体比例;图生视频固定按输入图片自适应;参考生视频可省略该参数并默认使用 adaptive
  • 参考图片:最多 9 张
  • 参考视频:最多 3 个,总时长不超过 15 秒
  • 参考音频:最多 3 个,总时长不超过 15 秒
  • 请求体总大小:不超过 64 MB

每次请求都必须包含非空文字提示词。音频不能单独作为唯一参考;参考生视频至少还要有一张图片或一段视频。图生视频和参考生视频也是两种独立模式,首尾帧不能与 reference 类型素材混在同一个请求中。

这些限制很实用。很多生成失败并非提示词不好,而是素材角色、数量或文件大小不符合接口要求。

创建任务时,请使用 Bearer 鉴权向 api.minimax.io/v2/video_generation 发送 POST 请求,并在 content 数组中放入至少一条非空文字。接口会返回 task_id。随后使用该任务 ID 轮询 GET /v2/query/video_generation/;任务成功后,从 task.content.url 读取视频地址。

原生音频和多模态参考真正解决了什么?

H3 的重点不只是“视频带声音”,而是多份输入之间的关系。

做产品短片时,一张图片可以固定产品与包装,一段视频可以提供运镜,一段音频可以规定节奏。做角色镜头时,图片负责人物外观,视频负责动作,音频负责表演节拍。文字提示词则负责把这些素材的分工说清楚。

因此,一条好用的 H3 提示词不应只堆氛围词。给每份参考素材安排一个任务,再按时间顺序描述成片。

例如:

参考图片 1:
保持人物的脸部、服装和色彩。
参考视频 1:
沿用缓慢推进镜头。
参考音频 1:
沿用音色和说话节奏。
人物转身看向窗外,
说完一句简短对白后停顿。
城市灯光映在玻璃上。
全程保持人物身份和房间布局一致。
使用原生立体声环境音,不加背景音乐。

这种写法方便后续修改。若结果不理想,你能判断问题出在人物、运镜、声音还是动作,而不是把整段提示词推倒重来。

三步完成一个可控镜头

1. 先选对生成模式

没有视觉锚点时用文生视频;构图和起止状态重要时用首尾帧图生视频;人物身份、动作或声音必须来自现有素材时,再用参考生视频。

不要因为接口支持很多素材,就把所有文件都塞进去。每份参考都应该解决一个具体问题。

2. 把提示词写成镜头计划

依次说明主体、动作、镜头、灯光、声音和结尾。使用参考素材时,明确指出每份素材负责什么。对于 4–15 秒短片,一个清晰的动作节点通常比多个无关事件更容易控制。

你可以先在本站的文生视频工作区整理镜头,或在图生视频工作区为静态画面设计运动。站内工作区不等同于 MiniMax 官方 H3 API,生成前请以模型选择器显示的实际模型和参数为准。

3. 异步生成,再逐项验收

H3 API 采用异步任务。创建任务后会返回 task_id,再通过查询接口读取 queued、running、succeeded、failed 或 expired 等状态。任务成功后,响应中会给出视频地址。

验收时不要只看“画面是否好看”。人物身份、物体位置、运镜、对白、声音时机,以及结尾能否顺利剪辑,都应该逐项检查。下一轮只改一个变量,结果更容易判断。

H3 的四项核心技术,用普通话讲清楚

官方发布文章提到四个系统:

  • Contextual Omni Representation:描述文字、图片、视频和音频之间的关系,让模型理解跨模态指令。
  • H3-VAE:提高媒体压缩效率。MiniMax 表示,它将有效序列长度提高到原来的 4 倍,是原生 2K 输出的重要基础。
  • H3-Omni Transformer:在训练时拆分理解与生成负载。官方称端到端训练吞吐提升接近 30%。
  • In-Context Regeneration:模型生成 2K 结果时会再次查看原始参考,而不是只对低分辨率结果做传统超分,因此更有机会恢复小字和细节。

对 2K 输出而言,MiniMax 表示再生成阶段会重新读取原始多模态上下文,以恢复传统超分步骤只能推测的细节。

投入生产前要知道的限制

H3 已经发布,但首发文档仍有清晰边界。

API 当前只列出 2K 输出,可选时长为 4–15 秒的整数,参考素材的角色、格式和体积也有严格要求。MiniMax 同时承认,部分场景的视觉细节仍有提升空间。官方表示计划在未来几天开放模型权重,但这项计划受适用法律法规约束;“计划开放”不等于本文发布时已经可以下载。

如果要用于客户项目或付费投放,先用最终需要的画面比例、素材组合和音频要求做一轮小样。将成功的提示词、素材角色和输出参数一起保存,后续镜头才更容易复现。

最后怎么判断 MiniMax H3?

MiniMax-H3 API 已开放 2K 视频生成,可使用文字、图片、视频和音频上下文。首发时,MiniMax 表示模型权重仍计划在随后几天开放。

实际使用时,可以先让每份参考只负责一件事,一次测试一个短镜头,再根据当前 API 限制扩展镜头或生产规模。

MiniMax H3(minimax3.com)是独立的第三方平台,与 MiniMax 或 Hailuo 无隶属、授权或运营关系。最新模型与接口信息请以 MiniMax H3 官方发布页官方 API 文档为准。

免费试用

立即用 MiniMax H3 生成你的第一张图像

可靠的非拉丁文本渲染、精准的定向编辑,以及 50+ 开箱即用的提示词。无需下载——在浏览器中打开即可使用。