海螺3 是什么?能做什么、效果怎么样、多少钱
2026/08/05

海螺3 是什么?能做什么、效果怎么样、多少钱

海螺3(MiniMax H3)是能同时生成画面和声音的 AI 视频模型。这篇讲清它能出什么样的片子、擅长和不擅长什么、怎么开始用、价格多少。

海螺3 是 MiniMax 7 月 31 日发布的 AI 视频模型,官方名字叫 MiniMax H3。

一句话说清它跟别的 AI 视频工具的区别:别的模型给你一段无声画面,海螺3 直接给你一条带声音的成片。

你写"雨点打在雨棚上,远处有车流声",出来的片子里就有这个声音。角色说话,口型是对的。人走路,脚步声落在脚碰到地面那一帧上。这些不是后期配的,是模型一次生成出来的——因为画面和声音在同一个网络里训练,不是两个工具拼的。

一条片子 4 到 15 秒,画质 768P 或 2K。

它能出什么样的片子

会说话的人。 这是它最拿得出手的部分。角色开口说台词,口型跟着对;语气、环境音、背景音乐一起出来。以前做这个要三步:生成画面、AI 配音、手动对轴,现在一次成片。做数字人口播、角色对白、访谈感的内容,省掉的就是这几步。

有镜头语言的画面。 推、拉、摇、跟这些运镜可以在提示词里指定,不是随机晃。配合光线描述(主光从哪来、什么色温),出来的东西有电影质感而不是监控录像感。

从产品图变成广告片。 上传一张产品照片,画面主体不变,但镜头开始运动、光影开始变化。做电商预览、社交平台的产品短片,不用重新拍。

同一个角色出现在多个镜头里。 这是靠"参考素材"实现的——你可以一次给它最多 9 张图、3 段视频、3 段音频(合计不超过 12 个文件)。图片锁住人脸和美术风格,视频告诉它动作怎么做,音频定嗓音或氛围。做系列分镜、多镜头叙事时,角色不会每个镜头换张脸。

这里有个反直觉的坑:参考文件不是越多越好。 如果你传了两张不同人的脸,模型会在两个人中间摇摆,出来的角色两边都不像。传一张清楚的,比传五张互相打架的强。

什么活儿它干不了

说实话的部分。

做不了长片。 上限就是 15 秒,你在网上看到的 AI 长视频都是分段生成再剪的。想要一分钟的成片,得自己拼四五段,而且段与段之间的连贯性要靠参考素材去兜。

做不了逐帧精确控制。 你没法指定"第 3 秒第 12 帧手抬到这个位置"。它理解的是描述,不是关键帧。有精确动画需求的活儿,这类模型都还不行。

做不了稳定复现。 同一条提示词跑两次,出来的东西不完全一样。要交付给客户的确定性内容,还是得人工把关每一条。

长镜头里人会变。 15 秒是上限,但时间越长,角色一致性越容易漂——脸会慢慢变得不像开头那个人。做长一点的镜头一定要检查这个。

现在怎么开始用

最快的是直接开网页。浏览器打开就能生成,不用装环境、不用显卡、不用等模型下载。本站(minimax3.com)就是这类入口,注册领免费积分就能试。

说明白:本站不是海螺AI 官网,是独立的第三方工具。 要找官方入口的话去 MiniMax 自己的域名;本站的积分和官方账号也不互通。

要接进自己产品的,走官方 API,模型名填 MiniMax-H3,异步返回,提交任务后轮询结果。

第三条路是本地部署,但这条路不是所有人都能走。

想本地部署,先看你在哪个国家

8 月 3 日,MiniMax 把海螺3 的权重传到了 Hugging Face,330 亿参数,ComfyUI 当天就支持了。所以你现在还能搜到的"海螺3 什么时候开源""开源倒计时",都过时了。

但这个开放带条件。许可证叫 MiniMax H3 Community License,非商用免费,年营收 2000 万美元以下的公司也能商用——听着宽松,可它划了一个"适用地域",美国、欧盟、英国、韩国不在里面

不在里面的意思是:这四个地方的用户没被授权在本地跑这些权重,本地跑出来的东西也不能分发。许可证里没写为什么排除这几个地区。

所以你要是在这些地方,网上那些 ComfyUI 部署教程对你不适用,走网页版或官方 API 才是能走的路(这两条走的是服务条款,跟权重许可证是两回事)。真要部署自己把许可证原文读一遍,这篇不算法律意见。

不在被排除地区的话,本地跑没问题。ComfyUI 升到 0.30.0 以上,官方给了三套工作流模板。文件加起来最小 42.5 GB(全精度要 123.6 GB),ComfyUI 那边说 12G 显存加 offload 能跑。

多少钱

官方 API 按秒收费:

画质单价
768P$0.08 / 秒
2K$0.13 / 秒

一条 10 秒的 2K 大概 $1.3,一条 5 秒的 768P 大概 $0.4。试错成本不高,这点其实挺关键——你可以先用 768P 把提示词调对,确认没问题了再上 2K 出成片。

本地跑没有 API 费用,但要有那 42.5 GB 和一张能跑的卡。

第三方网页版工具给的免费积分(包括本站)走自己的账,跟 MiniMax 官方账号不通用。

提示词怎么写才出效果

这一步决定成片质量,而且大部分人一开始都写错。

典型的坏例子:

一个女人在雨中的城市街道,电影感,4K,超写实

看着信息挺多,但模型没法执行。"电影感"是什么镜头?"4K"是分辨率参数,不该写进提示词。这么写出来的东西全靠模型猜。

同一个场景,这样写:

一位穿米色风衣的女性站在便利店招牌下避雨,右手收伞。夜晚的东京后巷,地面积水反射霓虹。中景,镜头缓慢推近至半身。主光来自身后招牌,冷白色,雨丝在逆光中可见。环境音:雨打雨棚、远处车流。结尾停在她抬头看向镜头外的瞬间。

差别在于每句话都对应画面里一个具体的东西。按这个顺序想:

  1. 谁/什么——具体到能认出来
  2. 在做什么——动作有始有终
  3. 在哪——时间、天气
  4. 镜头——远近景、怎么运动
  5. 光——从哪来、什么颜色
  6. 声音——说什么、什么环境音
  7. 怎么收尾——最后一帧停在哪,方便接下一个镜头

提示词最长 7000 字符,但写满没用,太长模型反而抓不住重点。先把一个镜头写清楚。

出片之后检查四件事:人从头到尾是不是同一个、动作有没有做完、口型对不对得上、最后一帧能不能接下一个镜头。哪项不对就只改那一句,别整段重写——重写会把本来对的地方也改掉。

参考素材只传你有权用的。真人照片、别人的作品、带商标的产品,用之前确认清楚。

几个容易搞混的事

海螺3 不是 MiniMax M3。 M3 是同一家公司的语言模型,聊天写代码用的,跟视频没关系。名字太像,搜索经常撞一起。

也不是腾讯 Hy3。 那是另一家公司的另一个模型,有些 API 目录会把两个列在一块。

网上说的 1440p 是错的。 官方只有 768P 和 2K 两档,1440p 大概率是早期传播把 2K 换算错了。

值不值得试

要做十几秒的短片、需要画面和声音对得上,海螺3 现在是省事的选择——省掉了单独配音和对轴。

要做几分钟的成片、每帧精确控制、或者交付客户的稳定输出,那现阶段没有哪个 AI 视频模型能满足,海螺3 也一样。

想试的话最快的验证方法:写一条上面那种有层次的提示词,先出 5 秒 768P,花四毛钱美金,按上面四条检查一遍,然后只改一个地方再跑一次。两轮加起来不到一美元,够你判断它适不适合你的活儿。

本站可以直接在浏览器里用海螺3,注册就送积分。接 API 的话,接口细节和参数限制看 MiniMax H3 API 指南。规格数字可以在 MiniMax 官方 API 文档Hugging Face 模型卡上自己核。


本站(minimax3.com)是独立的第三方工具,与 MiniMax 或海螺AI 无隶属、认可或运营关系。产品名称仅用于描述功能,版权归各自所有者所有。

免费试用

立即用 MiniMax H3 生成你的第一张图像

可靠的非拉丁文本渲染、精准的定向编辑,以及 50+ 开箱即用的提示词。无需下载——在浏览器中打开即可使用。