
海螺3 开源权重下载:Hugging Face、魔搭社区与 ComfyUI 部署指南
MiniMax H3 开源权重怎么下载?330 亿参数、Hugging Face 与魔搭社区下载、ComfyUI 部署、许可证地域限制、API 定价——这篇一次讲清。
7 月 31 日,MiniMax 上线了海螺3(MiniMax H3)的 API。两天后发布了社区许可证。8 月 3 日,权重正式登陆 Hugging Face——330 亿参数,两个检查点,ComfyUI 当天就支持了。
如果你一直在搜"MiniMax H3 开源""海螺3 下载""MiniMax H3 Hugging Face",这篇把实际发生了什么、你能拿它干什么,一次讲清楚。
三天时间线
发布分了三步走,每一步能做的事都不一样:
- 7 月 31 日——API 上线。 MiniMax 在 platform.minimax.io 开放了 H3 API。此时唯一的用法是通过 API 或套了 API 的网页工具。没有权重,本地跑不了。
- 8 月 2 日——社区许可证发布。 MiniMax 放出了即将伴随权重发布的许可证全文。地域限制在这一天公开——权重还没上线,条款先出来了。
- 8 月 3 日——权重登陆 Hugging Face。 330 亿参数的模型出现在 Hugging Face 的 MiniMaxAI/MiniMax-H3,同时在魔搭社区(ModelScope)上了镜像。Comfy-Org 同一天推出了量化检查点和三套工作流模板。
许可证比权重早一天发布这件事其实挺重要。它给了大家一天时间先读条款再决定要不要下载。几位社区里有影响力的人在这个窗口里把地域限制的事挑出来说了,省得别人下了几百 GB 才发现自己不能合法使用。
这是开源权重,不是开源
你会看到很多文章管海螺3 叫"开源"。严格来说不是,而且这个区别在你想部署的时候很重要。
开源(Open Source) 指的是代码和权重以 OSI 认可的许可证发布——任何人都能使用、修改、再分发,限制极少。Apache 2.0、MIT 这些是典型的开源许可证。
开源权重(Open Weights) 指的是权重可以下载、本地跑,但许可证带条件。MiniMax H3 属于这一类。
MiniMax H3 社区许可证允许免费非商用,年营收 2000 万美元以下的公司也可以商用。允许修改和微调。
但它排除了四个地区:美国、欧盟、英国、韩国。如果你在这些地方,许可证不授权你在本地跑权重,也不授权你分发本地生成的内容。
许可证没写为什么排除。它定义了一个"适用地域",这四个地方不在里面。
反过来说,中国在适用地域内。 只要你满足营收条件,在国内本地跑、微调、商用都没问题。
| 许可证允许的事项 | 适用地域内(含中国) | 美国 / 欧盟 / 英国 / 韩国 |
|---|---|---|
| 非商用本地推理 | 是 | 否 |
| 商用(年营收 < 2000 万美元) | 是 | 否 |
| 商用(年营收 ≥ 2000 万美元) | 需另签协议 | 需另签协议 |
| 微调与修改 | 是 | 否 |
| 官方 API 访问 | 是 | 是 |
| 网页版工具(如本站) | 是 | 是 |
这是大部分报道最容易漏掉或搞错的地方。教你本地部署 H3 的教程很少提你所在的地方到底有没有授权。部署之前自己把许可证原文读一遍——这篇文章不算法律意见。
模型参数:330 亿 MiniMax H3 参数详解
MiniMax H3 是一个 330 亿参数的稠密 Transformer,一次前向传播同时生成画面和声音。下面每一项数据都来自官方 API 文档或 Hugging Face 模型卡:
| 规格 | 数值 | 来源 |
|---|---|---|
| 参数量 | 330 亿(稠密) | HF 模型卡 |
| 输出分辨率 | 768P 和 2K | API 文档 |
| 时长 | 4–15 秒(仅整数) | API 文档 |
| 帧率 | 24 FPS | 模型卡 |
| 音频 | 32 kHz 原生立体声 | 模型卡 |
| 提示词长度 | 最多 7000 字符 | API 文档 |
| 参考素材 | 最多 12 个文件:9 张图 + 3 段视频 + 3 段音频 | API 文档 |
| 画面比例 | 21:9、16:9、4:3、1:1、3:4、9:16 | API 文档 |
| 宽高比范围 | 2:5 到 5:2 | API 文档 |
"稠密"这个词要单独说一下。有些大模型用的是 MoE(混合专家)架构,推理时只激活一部分参数——号称"1000 亿参数"的 MoE 模型实际跑的可能只有 300 亿。H3 是稠密的,330 亿参数每一帧全部参与计算。这就是它即便做了量化,对显卡要求依然不低的原因。
音视频联合架构是 H3 跟大多数视频模型最大的区别。它不是先出无声画面再跑一个音频模型去配,而是在同一次前向传播里把画面和声音一起生成。视频 VAE 负责画面帧,音频 VAE 负责同步立体声——两者从同一个潜空间解码。结果就是口型、音效、环境音跟画面是对齐的,不是后期贴上去的。
几个容易踩的坑:
1440p 的说法是错的。 官方分辨率只有 768P 和 2K 两档。1440p 是早期二手报道里传出来的,之后一直在复制粘贴。
时长从 4 秒起,不是 5 秒。 好几篇竞品文章写的是 5–15 秒,API 文档写的是 4–15 秒。
"可延长到 30 秒"不是官方说法。 有些报道说能延长到 30 秒。模型单次生成 4–15 秒片段;更长的是多次生成后剪在一起。MiniMax 没有为 H3 公布过延长功能。
海螺3 下载:Hugging Face、魔搭社区和 Comfy-Org
三个地方可以拿到权重。选哪个,看你在哪、怎么用。
魔搭社区 / ModelScope(国内首选)
国内用户首选这个。 MiniMax 在魔搭社区(ModelScope)有官方组织页。权重一样,许可证一样,文件结构一样,但 CDN 针对国内网络做过优化,下载速度比直接从 Hugging Face 拉快得多。
不需要任何科学上网就能访问和下载。如果你在国内,直接用魔搭社区,省时间省心。
Hugging Face(官方首发源)
官方仓库是 Hugging Face 上的 MiniMaxAI/MiniMax-H3。全精度仓库大约 498 GB——但你不需要全下。
有两个任务专用检查点:
- FL2VA(首尾帧到音视频):处理文生视频和图生视频,可选首帧和尾帧输入
- Ref2VA(参考到音视频):处理多参考生成,最多同时用 9 张图、3 段视频、3 段音频
大部分人只需要一个。做文生视频或图生视频,FL2VA 够了。需要在多个镜头里保持角色一致性,用参考素材去控制,就用 Ref2VA。
怎么选:如果你有一份文案,想从文字描述或一张关键帧图片出片,从 FL2VA 开始。如果你有一个角色的照片,需要这个角色在多个镜头里长得一样——或者你想喂一段声音让模型匹配音色——用 Ref2VA。两个都能下,但每个都很大,先下跟你当前工作流匹配的那个。
下载两个检查点:
huggingface-cli download MiniMaxAI/MiniMax-H3 \
--include "model_index.json" "FL2VA/*" "Ref2VA/*" \
--local-dir MiniMax-H3只下载 FL2VA(文生视频 / 图生视频):
huggingface-cli download MiniMaxAI/MiniMax-H3 \
--include "model_index.json" "FL2VA/*" \
--local-dir MiniMax-H3如果你用 Diffusers 而不是 ComfyUI,也可以直接加载:
from diffusers import ModularPipeline
pipe = ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3")大模型文件下载注意事项
全精度 H3 仓库 498 GB,单个检查点也有几十 GB。几点实用建议:
- 用
huggingface-cli而不是浏览器下载。 浏览器下几十 GB 的文件极其不稳定。CLI 工具支持断点续传——连接断了重跑同一条命令就行,不用从头来。 --include是你的好朋友。 上面的下载命令用了--include只拉你需要的检查点文件夹。不加的话会下整个 498 GB 仓库。- 先确认磁盘空间。 全精度单个检查点可能超过 100 GB。Comfy-Org 的量化版本小很多但也是多 GB 级别。先看看盘还剩多少空间。
- 国内直接访问 Hugging Face 下载大文件经常断或者巨慢。 建议直接用魔搭社区的镜像,省事。如果一定要从 Hugging Face 下,挂上稳定的代理再用 CLI 工具,并且做好断点续传的准备。用
huggingface-cli的--resume-download参数可以断点续传。
Comfy-Org(ComfyUI 用的量化版本)
如果你用 ComfyUI,一般不需要去官方仓库直接下。Comfy-Org 在 Hugging Face 上托管了预量化版本,已经为 ComfyUI 流程优化过——下载更小、显存更省、直接放进节点图就能用:
| 组件 | 模型名 | 功能 |
|---|---|---|
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq | 处理文本和图像提示 |
| FL2VA 扩散模型 | minimax_h3_fl2va_pruned_int8_convrot | 文生视频和图生视频生成 |
| Ref2VA 扩散模型 | minimax_h3_ref2va_pruned_int8_convrot | 多参考生成 |
| 视频 VAE | minimax_h3_video_vae_fp16 | 编码和解码视频帧 |
| 音频 VAE | minimax_h3_audio_vae_fp32 | 编码和解码同步音频 |
Comfy-Org 版本对扩散模型用了 INT8 量化,文本编码器用了 NVF4+AWQ——下载大小和显存占用比官方全精度权重小非常多。
MiniMax H3 ComfyUI 部署教程
开始之前你需要什么
- ComfyUI 0.30.0 或更高版本——旧版本没有 H3 节点。从这个版本开始 H3 支持已经内置,不需要装任何自定义节点包。
- 一张有足够显存的显卡——官方文档没写最低要求。社区反馈 Comfy-Org 的量化检查点在 CPU offloading 模式下大约 12 GB 显存可以跑。显存越大,生成越快,换入换出越少。
- 磁盘空间——量化检查点比 498 GB 的全精度仓库小得多,但仍然是多 GB 级别的下载。
第一步:更新 ComfyUI
确认版本在 0.30.0 以上。如果是旧版本,从 ComfyUI 仓库拉最新代码。H3 节点会自动出现——不需要额外安装。
第二步:获取模型
ComfyUI 内置的模型管理器可以直接拉 Comfy-Org 的量化版本。也可以手动从 Comfy-Org/MiniMax-H3 下载,放到对应的模型目录里。
第三步:加载工作流模板
H3 配了三套官方工作流模板:
- 文生视频(T2V)——写一段提示词,出一条带同步音频的片子
- 图生视频(I2V)——提供首帧、尾帧或两者都给
- 参考生视频(R2V)——喂入参考图、视频片段和音频,保持角色和风格一致
模板文件在 GitHub:
加载一个,挂上模型,写好提示词,开始生成。
选哪个模板取决于你做什么:
- T2V 最简单——只需要文字提示词。适合测试配置是否正常,以及从零开始生成素材。新手从这里开始。
- I2V 控制力更强。给一张首帧(或首尾帧都给),模型在中间生成运动。适合产品镜头这种需要特定起始构图的场景,或者需要明确起止姿态的动画。
- R2V 能力最强但也最吃资源。你可以喂参考图控制角色外貌,喂视频片段控制运动风格,喂音频控制嗓音或氛围。多镜头保持角色一致就靠这个——但它需要 Ref2VA 检查点,而且处理的输入数据更多,速度更慢。
第四步(可选):安装 Sage Attention
Sage Attention 能让生成速度大约翻倍,画质损失很小。它需要单独安装——ComfyUI 默认不带。如果生成速度对你很重要,值得装。
消费级硬件上的实际表现
先说实话:一条 5 秒 768P 的片子在大部分消费级显卡上要跑好几分钟。这是一个 330 亿参数的模型——量化了也还是很大的计算量。
主要瓶颈是显存。模型装不进显存的时候,ComfyUI 会把一部分卸到内存里——模型照样跑,但因为数据要在 PCIe 总线上来回搬运,生成速度会明显慢下来。24 GB 显存的卡(RTX 4090、RTX 3090)能让更多模型常驻显存,比 12 GB 显存的卡快很多。
如果速度比本地控制更重要,API 可能更适合你——一条 5 秒 768P 的片子走 API 几秒钟就出来,花大约 $0.40(约 2.9 元人民币)。
本地部署不了怎么办
如果你在美国、欧盟、英国或韩国——或者你没有跑得动的显卡——本地部署对你来说既不合规也不实际。但这不代表你用不了 H3。
官方 API 按输出秒数计费,不限地区:
| 分辨率 | 每秒价格 | 人民币参考 |
|---|---|---|
| 768P | $0.08 | ≈ ¥0.58 |
| 2K | $0.13 | ≈ ¥0.94 |
一条 10 秒 2K 大概 $1.30(约 ¥9.4),一条 5 秒 768P 大概 $0.40(约 ¥2.9)。先用 768P 试错,确认没问题了再上 2K——这个价差让实验成本很低。
网页版工具(比如本站)替你调 API,背后跑的就是 H3。不用装环境、不用显卡,注册送免费积分。说清楚:这是独立的第三方工具,不是 MiniMax 官方平台。本站的积分跟 MiniMax 账号不通用。
API 和网页版工具都走 MiniMax 的服务条款,跟权重许可证是两回事。哪个地区都能用。
社区生态
权重发布几天,Hugging Face 上已经很热闹了:
- 29 个 Spaces 跑着 H3 的演示,浏览器里就能试
- 19 个微调版本 针对不同场景发布
- 20 个量化版本 覆盖 GGUF、INT4、INT8 等多种格式
- 49 个讨论帖 在模型的社区标签下
微调版本值得关注。已经有人在针对特定工作流做适配了——动漫风格、产品短片、带特定嗓音特征的数字人。
如果你想用社区做的量化版本来省显存,先看看别人测过没有。有些量化方法对音频质量的损伤比对画面质量大,而音视频同步恰恰是 H3 跟其他视频模型拉开差距的地方。一个量化版本画面看着没问题但口型对不上了,那就丢了 H3 最核心的优势。
这 20 个量化版本覆盖了多种格式:GGUF 适配 llama.cpp 生态,INT4 极限压缩,INT8 在质量和体积之间取平衡。Comfy-Org 的 INT8 版本是最稳的起点——它们专门为 ComfyUI 设计过结构,Comfy-Org 团队测试过。社区量化版本可能也好用,但音频保真度上有更大的不确定性。
其他报道容易搞错的地方
这篇文章的数据全部来自一手信息源,这里列一下大部分海螺3 文章容易犯的错:
- 管它叫"开源"——实际是开源权重,带限制性社区许可证
- 列 1440p 为分辨率档位——官方只有 768P 和 2K
- 说时长是 5–15 秒——实际是 4–15 秒
- 说"可延长到 30 秒"——不是官方功能
- 不提地域限制——许可证排除了美国、欧盟、英国和韩国的本地部署
- 引 OpenArt 或 X 帖子当数据源——那些是聚合站,不是 MiniMax。规格应该以官方 API 文档和 Hugging Face 模型卡为准
这篇文章里的每一个规格数字都来自 platform.minimax.io 或官方 Hugging Face 模型卡。官方没给数字的地方,我们直接说没有,不猜。
常见问题
MiniMax H3 下载免费吗?
下载免费。用起来免不免费取决于你在哪、拿它干什么——回去看上面许可证那部分。
本地跑 H3 最低要多少显存?
MiniMax 没给过官方最低值。社区反馈是 Comfy-Org 的 INT8 量化检查点在 CPU offloading 模式下大约需要 12 GB 显存。显存越大生成越快。
MiniMax H3 在魔搭社区上有吗?
有。MiniMax 在魔搭社区有官方组织页:modelscope.cn/organization/minimax。权重和许可证跟 Hugging Face 一样。国内用户直接用这个,下载速度快很多。
能微调 MiniMax H3 吗?
许可证在适用地域内允许修改。截至发稿时 Hugging Face 上已经有 19 个微调版本了。
为什么美国、欧盟、英国和韩国不能本地跑?
社区许可证定义了一个"适用地域",排除了这些地区。没写原因。这只影响在自己硬件上跑权重——API 和网页版工具在所有地方都能用,走的是另一套服务条款。
ComfyUI 是本地跑的唯一方式吗?
不是。模型也支持 Diffusers(ModularPipeline.from_pretrained())用于 Python 流水线,以及 SGLang 用于多 GPU 部署。ComfyUI 是最好上手的——如果你想用可视化工作流编辑器而不是写代码的话。
海螺3 跟其他能本地跑的视频模型比怎么样?
330 亿参数,比大部分能在本地跑的视频模型都大。代价是它能在一次前向传播中同时生成音频和视频——大多数替代方案做不到这一点,需要单独生成音频再手动同步。如果音频不在你的工作流里,更小的模型在本地跑可能更实际。
社区微调版本也受相同的许可证限制吗?
是的。MiniMax H3 社区许可证适用于衍生作品,微调版本也包括在内。第三方在 Hugging Face 上发的微调版本不能覆盖原始许可证的地域限制或营收上限。
官方 Hugging Face 仓库和 Comfy-Org 仓库有什么区别?
官方 MiniMaxAI/MiniMax-H3 仓库是全精度权重,适合 Diffusers、SGLang 或自定义流水线。Comfy-Org/MiniMax-H3 仓库是量化和剪枝过的版本,专门按 ComfyUI 的模型目录结构来的。用 ComfyUI 就选 Comfy-Org 仓库。自己写推理代码或用 Diffusers 就选官方仓库。
能拿 H3 生成商用内容吗?
在适用地域内、公司年营收低于 2000 万美元的话,可以。超过这个营收门槛或在适用地域之外,需要跟 MiniMax 另签商业协议。通过官方 API 或网页版工具使用 H3 走的是 MiniMax 的服务条款,商用条款另算。
更多文章

海螺3 是什么?能做什么、效果怎么样、多少钱
海螺3(MiniMax H3)是能同时生成画面和声音的 AI 视频模型。这篇讲清它能出什么样的片子、擅长和不擅长什么、怎么开始用、价格多少。


MiniMax H3 vs Seedance 2.0:四组实测对比
MiniMax H3 和 Seedance 2.0 到底谁更强?我们用游戏 UI 动效、2D+3D 融合、爆款复刻、一镜到底四组测试实测对比,附评分和花费。


MiniMax H3 提示词指南:六类创作场景写法详解
MiniMax H3 视频生成提示词怎么写?三种输入模式选型、可复用的提示词公式、六类创作场景完整写法——看完就能上手。
