海螺3 开源权重下载:Hugging Face、魔搭社区与 ComfyUI 部署指南
2026/08/05

海螺3 开源权重下载:Hugging Face、魔搭社区与 ComfyUI 部署指南

MiniMax H3 开源权重怎么下载?330 亿参数、Hugging Face 与魔搭社区下载、ComfyUI 部署、许可证地域限制、API 定价——这篇一次讲清。

7 月 31 日,MiniMax 上线了海螺3(MiniMax H3)的 API。两天后发布了社区许可证。8 月 3 日,权重正式登陆 Hugging Face——330 亿参数,两个检查点,ComfyUI 当天就支持了。

如果你一直在搜"MiniMax H3 开源""海螺3 下载""MiniMax H3 Hugging Face",这篇把实际发生了什么、你能拿它干什么,一次讲清楚。

三天时间线

发布分了三步走,每一步能做的事都不一样:

  • 7 月 31 日——API 上线。 MiniMax 在 platform.minimax.io 开放了 H3 API。此时唯一的用法是通过 API 或套了 API 的网页工具。没有权重,本地跑不了。
  • 8 月 2 日——社区许可证发布。 MiniMax 放出了即将伴随权重发布的许可证全文。地域限制在这一天公开——权重还没上线,条款先出来了。
  • 8 月 3 日——权重登陆 Hugging Face。 330 亿参数的模型出现在 Hugging Face 的 MiniMaxAI/MiniMax-H3,同时在魔搭社区(ModelScope)上了镜像。Comfy-Org 同一天推出了量化检查点和三套工作流模板。

许可证比权重早一天发布这件事其实挺重要。它给了大家一天时间先读条款再决定要不要下载。几位社区里有影响力的人在这个窗口里把地域限制的事挑出来说了,省得别人下了几百 GB 才发现自己不能合法使用。

这是开源权重,不是开源

你会看到很多文章管海螺3 叫"开源"。严格来说不是,而且这个区别在你想部署的时候很重要。

开源(Open Source) 指的是代码和权重以 OSI 认可的许可证发布——任何人都能使用、修改、再分发,限制极少。Apache 2.0、MIT 这些是典型的开源许可证。

开源权重(Open Weights) 指的是权重可以下载、本地跑,但许可证带条件。MiniMax H3 属于这一类。

MiniMax H3 社区许可证允许免费非商用,年营收 2000 万美元以下的公司也可以商用。允许修改和微调。

但它排除了四个地区:美国、欧盟、英国、韩国。如果你在这些地方,许可证不授权你在本地跑权重,也不授权你分发本地生成的内容。

许可证没写为什么排除。它定义了一个"适用地域",这四个地方不在里面。

反过来说,中国在适用地域内。 只要你满足营收条件,在国内本地跑、微调、商用都没问题。

许可证允许的事项适用地域内(含中国)美国 / 欧盟 / 英国 / 韩国
非商用本地推理
商用(年营收 < 2000 万美元)
商用(年营收 ≥ 2000 万美元)需另签协议需另签协议
微调与修改
官方 API 访问
网页版工具(如本站)

这是大部分报道最容易漏掉或搞错的地方。教你本地部署 H3 的教程很少提你所在的地方到底有没有授权。部署之前自己把许可证原文读一遍——这篇文章不算法律意见。

模型参数:330 亿 MiniMax H3 参数详解

MiniMax H3 是一个 330 亿参数的稠密 Transformer,一次前向传播同时生成画面和声音。下面每一项数据都来自官方 API 文档或 Hugging Face 模型卡:

规格数值来源
参数量330 亿(稠密)HF 模型卡
输出分辨率768P 和 2KAPI 文档
时长4–15 秒(仅整数)API 文档
帧率24 FPS模型卡
音频32 kHz 原生立体声模型卡
提示词长度最多 7000 字符API 文档
参考素材最多 12 个文件:9 张图 + 3 段视频 + 3 段音频API 文档
画面比例21:9、16:9、4:3、1:1、3:4、9:16API 文档
宽高比范围2:5 到 5:2API 文档

"稠密"这个词要单独说一下。有些大模型用的是 MoE(混合专家)架构,推理时只激活一部分参数——号称"1000 亿参数"的 MoE 模型实际跑的可能只有 300 亿。H3 是稠密的,330 亿参数每一帧全部参与计算。这就是它即便做了量化,对显卡要求依然不低的原因。

音视频联合架构是 H3 跟大多数视频模型最大的区别。它不是先出无声画面再跑一个音频模型去配,而是在同一次前向传播里把画面和声音一起生成。视频 VAE 负责画面帧,音频 VAE 负责同步立体声——两者从同一个潜空间解码。结果就是口型、音效、环境音跟画面是对齐的,不是后期贴上去的。

几个容易踩的坑:

1440p 的说法是错的。 官方分辨率只有 768P 和 2K 两档。1440p 是早期二手报道里传出来的,之后一直在复制粘贴。

时长从 4 秒起,不是 5 秒。 好几篇竞品文章写的是 5–15 秒,API 文档写的是 4–15 秒。

"可延长到 30 秒"不是官方说法。 有些报道说能延长到 30 秒。模型单次生成 4–15 秒片段;更长的是多次生成后剪在一起。MiniMax 没有为 H3 公布过延长功能。

海螺3 下载:Hugging Face、魔搭社区和 Comfy-Org

三个地方可以拿到权重。选哪个,看你在哪、怎么用。

魔搭社区 / ModelScope(国内首选)

国内用户首选这个。 MiniMax 在魔搭社区(ModelScope)有官方组织页。权重一样,许可证一样,文件结构一样,但 CDN 针对国内网络做过优化,下载速度比直接从 Hugging Face 拉快得多。

不需要任何科学上网就能访问和下载。如果你在国内,直接用魔搭社区,省时间省心。

Hugging Face(官方首发源)

官方仓库是 Hugging Face 上的 MiniMaxAI/MiniMax-H3。全精度仓库大约 498 GB——但你不需要全下。

有两个任务专用检查点:

  • FL2VA(首尾帧到音视频):处理文生视频和图生视频,可选首帧和尾帧输入
  • Ref2VA(参考到音视频):处理多参考生成,最多同时用 9 张图、3 段视频、3 段音频

大部分人只需要一个。做文生视频或图生视频,FL2VA 够了。需要在多个镜头里保持角色一致性,用参考素材去控制,就用 Ref2VA。

怎么选:如果你有一份文案,想从文字描述或一张关键帧图片出片,从 FL2VA 开始。如果你有一个角色的照片,需要这个角色在多个镜头里长得一样——或者你想喂一段声音让模型匹配音色——用 Ref2VA。两个都能下,但每个都很大,先下跟你当前工作流匹配的那个。

下载两个检查点:

huggingface-cli download MiniMaxAI/MiniMax-H3 \
  --include "model_index.json" "FL2VA/*" "Ref2VA/*" \
  --local-dir MiniMax-H3

只下载 FL2VA(文生视频 / 图生视频):

huggingface-cli download MiniMaxAI/MiniMax-H3 \
  --include "model_index.json" "FL2VA/*" \
  --local-dir MiniMax-H3

如果你用 Diffusers 而不是 ComfyUI,也可以直接加载:

from diffusers import ModularPipeline
pipe = ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3")

大模型文件下载注意事项

全精度 H3 仓库 498 GB,单个检查点也有几十 GB。几点实用建议:

  • huggingface-cli 而不是浏览器下载。 浏览器下几十 GB 的文件极其不稳定。CLI 工具支持断点续传——连接断了重跑同一条命令就行,不用从头来。
  • --include 是你的好朋友。 上面的下载命令用了 --include 只拉你需要的检查点文件夹。不加的话会下整个 498 GB 仓库。
  • 先确认磁盘空间。 全精度单个检查点可能超过 100 GB。Comfy-Org 的量化版本小很多但也是多 GB 级别。先看看盘还剩多少空间。
  • 国内直接访问 Hugging Face 下载大文件经常断或者巨慢。 建议直接用魔搭社区的镜像,省事。如果一定要从 Hugging Face 下,挂上稳定的代理再用 CLI 工具,并且做好断点续传的准备。用 huggingface-cli--resume-download 参数可以断点续传。

Comfy-Org(ComfyUI 用的量化版本)

如果你用 ComfyUI,一般不需要去官方仓库直接下。Comfy-Org 在 Hugging Face 上托管了预量化版本,已经为 ComfyUI 流程优化过——下载更小、显存更省、直接放进节点图就能用:

组件模型名功能
文本编码器qwen3vl_32b_minimax_h3_nvfp4_awq处理文本和图像提示
FL2VA 扩散模型minimax_h3_fl2va_pruned_int8_convrot文生视频和图生视频生成
Ref2VA 扩散模型minimax_h3_ref2va_pruned_int8_convrot多参考生成
视频 VAEminimax_h3_video_vae_fp16编码和解码视频帧
音频 VAEminimax_h3_audio_vae_fp32编码和解码同步音频

Comfy-Org 版本对扩散模型用了 INT8 量化,文本编码器用了 NVF4+AWQ——下载大小和显存占用比官方全精度权重小非常多。

MiniMax H3 ComfyUI 部署教程

开始之前你需要什么

  • ComfyUI 0.30.0 或更高版本——旧版本没有 H3 节点。从这个版本开始 H3 支持已经内置,不需要装任何自定义节点包。
  • 一张有足够显存的显卡——官方文档没写最低要求。社区反馈 Comfy-Org 的量化检查点在 CPU offloading 模式下大约 12 GB 显存可以跑。显存越大,生成越快,换入换出越少。
  • 磁盘空间——量化检查点比 498 GB 的全精度仓库小得多,但仍然是多 GB 级别的下载。

第一步:更新 ComfyUI

确认版本在 0.30.0 以上。如果是旧版本,从 ComfyUI 仓库拉最新代码。H3 节点会自动出现——不需要额外安装。

第二步:获取模型

ComfyUI 内置的模型管理器可以直接拉 Comfy-Org 的量化版本。也可以手动从 Comfy-Org/MiniMax-H3 下载,放到对应的模型目录里。

第三步:加载工作流模板

H3 配了三套官方工作流模板:

  1. 文生视频(T2V)——写一段提示词,出一条带同步音频的片子
  2. 图生视频(I2V)——提供首帧、尾帧或两者都给
  3. 参考生视频(R2V)——喂入参考图、视频片段和音频,保持角色和风格一致

模板文件在 GitHub:

加载一个,挂上模型,写好提示词,开始生成。

选哪个模板取决于你做什么:

  • T2V 最简单——只需要文字提示词。适合测试配置是否正常,以及从零开始生成素材。新手从这里开始。
  • I2V 控制力更强。给一张首帧(或首尾帧都给),模型在中间生成运动。适合产品镜头这种需要特定起始构图的场景,或者需要明确起止姿态的动画。
  • R2V 能力最强但也最吃资源。你可以喂参考图控制角色外貌,喂视频片段控制运动风格,喂音频控制嗓音或氛围。多镜头保持角色一致就靠这个——但它需要 Ref2VA 检查点,而且处理的输入数据更多,速度更慢。

第四步(可选):安装 Sage Attention

Sage Attention 能让生成速度大约翻倍,画质损失很小。它需要单独安装——ComfyUI 默认不带。如果生成速度对你很重要,值得装。

消费级硬件上的实际表现

先说实话:一条 5 秒 768P 的片子在大部分消费级显卡上要跑好几分钟。这是一个 330 亿参数的模型——量化了也还是很大的计算量。

主要瓶颈是显存。模型装不进显存的时候,ComfyUI 会把一部分卸到内存里——模型照样跑,但因为数据要在 PCIe 总线上来回搬运,生成速度会明显慢下来。24 GB 显存的卡(RTX 4090、RTX 3090)能让更多模型常驻显存,比 12 GB 显存的卡快很多。

如果速度比本地控制更重要,API 可能更适合你——一条 5 秒 768P 的片子走 API 几秒钟就出来,花大约 $0.40(约 2.9 元人民币)。

本地部署不了怎么办

如果你在美国、欧盟、英国或韩国——或者你没有跑得动的显卡——本地部署对你来说既不合规也不实际。但这不代表你用不了 H3。

官方 API 按输出秒数计费,不限地区:

分辨率每秒价格人民币参考
768P$0.08≈ ¥0.58
2K$0.13≈ ¥0.94

一条 10 秒 2K 大概 $1.30(约 ¥9.4),一条 5 秒 768P 大概 $0.40(约 ¥2.9)。先用 768P 试错,确认没问题了再上 2K——这个价差让实验成本很低。

网页版工具(比如本站)替你调 API,背后跑的就是 H3。不用装环境、不用显卡,注册送免费积分。说清楚:这是独立的第三方工具,不是 MiniMax 官方平台。本站的积分跟 MiniMax 账号不通用。

API 和网页版工具都走 MiniMax 的服务条款,跟权重许可证是两回事。哪个地区都能用。

社区生态

权重发布几天,Hugging Face 上已经很热闹了:

  • 29 个 Spaces 跑着 H3 的演示,浏览器里就能试
  • 19 个微调版本 针对不同场景发布
  • 20 个量化版本 覆盖 GGUF、INT4、INT8 等多种格式
  • 49 个讨论帖 在模型的社区标签下

微调版本值得关注。已经有人在针对特定工作流做适配了——动漫风格、产品短片、带特定嗓音特征的数字人。

如果你想用社区做的量化版本来省显存,先看看别人测过没有。有些量化方法对音频质量的损伤比对画面质量大,而音视频同步恰恰是 H3 跟其他视频模型拉开差距的地方。一个量化版本画面看着没问题但口型对不上了,那就丢了 H3 最核心的优势。

这 20 个量化版本覆盖了多种格式:GGUF 适配 llama.cpp 生态,INT4 极限压缩,INT8 在质量和体积之间取平衡。Comfy-Org 的 INT8 版本是最稳的起点——它们专门为 ComfyUI 设计过结构,Comfy-Org 团队测试过。社区量化版本可能也好用,但音频保真度上有更大的不确定性。

其他报道容易搞错的地方

这篇文章的数据全部来自一手信息源,这里列一下大部分海螺3 文章容易犯的错:

  1. 管它叫"开源"——实际是开源权重,带限制性社区许可证
  2. 列 1440p 为分辨率档位——官方只有 768P 和 2K
  3. 说时长是 5–15 秒——实际是 4–15 秒
  4. 说"可延长到 30 秒"——不是官方功能
  5. 不提地域限制——许可证排除了美国、欧盟、英国和韩国的本地部署
  6. 引 OpenArt 或 X 帖子当数据源——那些是聚合站,不是 MiniMax。规格应该以官方 API 文档和 Hugging Face 模型卡为准

这篇文章里的每一个规格数字都来自 platform.minimax.io官方 Hugging Face 模型卡。官方没给数字的地方,我们直接说没有,不猜。

常见问题

MiniMax H3 下载免费吗?

下载免费。用起来免不免费取决于你在哪、拿它干什么——回去看上面许可证那部分。

本地跑 H3 最低要多少显存?

MiniMax 没给过官方最低值。社区反馈是 Comfy-Org 的 INT8 量化检查点在 CPU offloading 模式下大约需要 12 GB 显存。显存越大生成越快。

MiniMax H3 在魔搭社区上有吗?

有。MiniMax 在魔搭社区有官方组织页:modelscope.cn/organization/minimax。权重和许可证跟 Hugging Face 一样。国内用户直接用这个,下载速度快很多。

能微调 MiniMax H3 吗?

许可证在适用地域内允许修改。截至发稿时 Hugging Face 上已经有 19 个微调版本了。

为什么美国、欧盟、英国和韩国不能本地跑?

社区许可证定义了一个"适用地域",排除了这些地区。没写原因。这只影响在自己硬件上跑权重——API 和网页版工具在所有地方都能用,走的是另一套服务条款。

ComfyUI 是本地跑的唯一方式吗?

不是。模型也支持 Diffusers(ModularPipeline.from_pretrained())用于 Python 流水线,以及 SGLang 用于多 GPU 部署。ComfyUI 是最好上手的——如果你想用可视化工作流编辑器而不是写代码的话。

海螺3 跟其他能本地跑的视频模型比怎么样?

330 亿参数,比大部分能在本地跑的视频模型都大。代价是它能在一次前向传播中同时生成音频和视频——大多数替代方案做不到这一点,需要单独生成音频再手动同步。如果音频不在你的工作流里,更小的模型在本地跑可能更实际。

社区微调版本也受相同的许可证限制吗?

是的。MiniMax H3 社区许可证适用于衍生作品,微调版本也包括在内。第三方在 Hugging Face 上发的微调版本不能覆盖原始许可证的地域限制或营收上限。

官方 Hugging Face 仓库和 Comfy-Org 仓库有什么区别?

官方 MiniMaxAI/MiniMax-H3 仓库是全精度权重,适合 Diffusers、SGLang 或自定义流水线。Comfy-Org/MiniMax-H3 仓库是量化和剪枝过的版本,专门按 ComfyUI 的模型目录结构来的。用 ComfyUI 就选 Comfy-Org 仓库。自己写推理代码或用 Diffusers 就选官方仓库。

能拿 H3 生成商用内容吗?

在适用地域内、公司年营收低于 2000 万美元的话,可以。超过这个营收门槛或在适用地域之外,需要跟 MiniMax 另签商业协议。通过官方 API 或网页版工具使用 H3 走的是 MiniMax 的服务条款,商用条款另算。

免费试用

立即用 MiniMax H3 生成你的第一张图像

可靠的非拉丁文本渲染、精准的定向编辑,以及 50+ 开箱即用的提示词。无需下载——在浏览器中打开即可使用。