LightX2V Turbo 4-step v1.0 (768p)
这组权重中分辨率较高的蒸馏版本,以 1344×768 训练,无需额外引导。适合直接四步生成 768p,而不是从 544p 放大。
minimax_h3_fl2v_turbo_4step_v1.0_768p_bf16.safetensors
多个 Turbo 权重系列将 MiniMax H3 的采样从约 20 步压缩到 4–8 步。本页帮助你按任务选择权重、确定实用步数,并了解追求速度时会损失什么。
Turbo 配置选择器
选择生成任务、优先目标和显存容量。推荐依据权重作者的模型说明,不是本站自行跑分得出的结论。
推荐配置
作者 larryvrh · Apache-2.0
v4 使用新的训练方案,不只是增加训练步数。作者推荐此版本;它改善了早期约 850 版本的过锐、塑料感,以及静态和小幅运动中脸、手指与纹理的细节。
查看模型说明预期效果
处于 v4 作者推荐区间,比四步更有利于恢复脸部和手指等细节。
需要接受的取舍
若镜头以快速运动为主,旧 v1 ckpt-850 在低步数下可能更合适。
采样步数
两位 Turbo 作者都把质量较均衡的区间放在 6–8 步,而非名称中的 4 步。选好权重后,步数同样会明显影响结果。
4 步
宣传中的最低步数
Turbo 的“四步”由此得名。适合静态画面、缓慢摇镜和人物讲话;大幅度或快速运动最容易出现问题。
6 步
实用的起点
v4 作者认为 6–8 步明显优于 4 步:脸部和手部细节有所恢复,中等运动中的拖影也会减少。
8 步
实用步数的上限
这是作者推荐区间的另一端。继续增加步数未见明显收益,反而可能出现过度锐化。
约 20 步
基础模型
未经蒸馏的 MiniMax H3。对于快速运动和不容反复返工的交付内容,它仍是值得对照的基准。
横向对比
两个独立蒸馏系列,加上参考图生视频预览版。均为社区发布的 Apache-2.0 权重,不是 MiniMax 官方模型。
| 权重 | 任务 | 分辨率 | 采样步数 | 适用情况 |
|---|---|---|---|---|
| larryvrh Turbo LoRA v4 (step 600, EMA)larryvrh | T2V · I2V · FL2V · Ref2V | 混合 | 4–8 | 多数任务的 6–8 步起点 |
| LightX2V Turbo 4-step v1.0 (768p)lightx2v / ModelTC | T2VA · FL2VA | 768p (1344×768) | 4 | 追求速度,同时直接输出 768p |
| LightX2V Turbo 8-step v1.0 (544p)lightx2v / ModelTC | T2VA · FL2VA | 544p,多种比例 | 8(也可尝试 4) | ModelTC 示例工作流的默认选择 |
| larryvrh Turbo LoRA v1 line (ckpt 850, EMA)larryvrh | T2V · I2V · FL2V | 混合 | 4 | 限定四步的剧烈快速运动 |
| LightX2V Ref2VA Turbo 4-step v0.1lightx2v / ModelTC | 仅 Ref2VA | 544p,多种比例 | 4 | 参考图生视频专用 |
这组权重中分辨率较高的蒸馏版本,以 1344×768 训练,无需额外引导。适合直接四步生成 768p,而不是从 544p 放大。
minimax_h3_fl2v_turbo_4step_v1.0_768p_bf16.safetensors
ModelTC 的 T2VA 和 I2VA 示例默认使用该权重。按 8 NFE 蒸馏;需要更快预览时也可尝试降至 4 步。
minimax_h3_fl2v_turbo_8step_v1.0_bf16.safetensors
v4 使用新的训练方案,不只是增加训练步数。作者推荐此版本;它改善了早期约 850 版本的过锐、塑料感,以及静态和小幅运动中脸、手指与纹理的细节。
minimax_h3_turbo_v4_step600_ema.safetensors
参数设置
多数设置在不同权重系列间通用。需要特别留意 LoRA 强度:模型说明与社区实践给出的范围有所不同。
LoRA 强度
1.0(作者)/ 0.6–0.8(社区)
v4 模型说明以强度 1.0 为基准;社区常在 6–10 步时尝试 0.6–0.8,Kijai 转换版也建议在噪点明显时降低强度。先从 1.0 开始,再按结果调整。
调度器
simple
这是作者默认设置。Kijai 的转换说明还提供了 er_sde、sa_solver 在 4 步、强度 0.75 下的示例。
CFG / 引导
1.0
这些蒸馏权重无需额外引导。调高 CFG 不等于增加清晰度,反而可能干扰蒸馏效果。
采样步数
4–8
4 步是实用下限,6–8 步是作者推荐的质量区间;v4 超过 8 步可能出现过度锐化。
EMA 与非 EMA
优先 EMA
larryvrh 仓库同时提供两者。建议使用 EMA 文件,非 EMA 主要用于对比。
安装路径
ComfyUI/models/loras/
MiniMax H3 已获 ComfyUI 原生支持,无需自定义节点。在模型加载器与采样器之间接入 LoRA 即可。
实际速度
约 5 倍指采样步数从约 20 降至 4。模型加载、文本编码、VAE 解码和音频解码不会同比缩短,因此不能直接换算成总耗时。
更有意义的是每条可用片段的耗时。四步生成后因拖影而作废,可能比一次成功的六步生成更费时间。
一位社区用户的实测记录
RTX 5080,15 秒片段,约 50 万像素.
这是一位用户在特定机器和配置下的记录,不是受控基准测试。它只能说明加速趋势,不代表你能复现相同秒数。
低显存方案
以下大致按画质代价从低到高排列。建议逐级尝试,不必直接使用压缩最激进的量化版本。
drbaph · Abiray
将同一套 Turbo 权重整理为更适合 ComfyUI 的较小下载文件,可先于激进量化尝试。
查看仓库Kijai
许多 ComfyUI 工作流使用这些转换版。仓库提示:输出噪点较多时可尝试降低强度。
查看仓库rzgar · t8star
LightX2V 四步 FL2V 系列的量化版本,仍属实验方案。批量使用前,先与 bf16 做相同条件的对比。
查看仓库infosave
压缩最激进的一档,仅在其他方案仍装不下时考虑。特别检查音频与同步,不能只看画面是否正常。
查看仓库故障排查
先对照这六类常见原因。许多问题可以通过调整步数或强度解决,不一定需要更换权重。
原因:这是四步处理大幅快速运动时已知的问题;此场景下 v4 可能比旧 v1 更明显。
处理:先提高到 6–8 步。如果动作镜头必须固定四步,可尝试 larryvrh ckpt-850。
原因:可能来自旧 v1(约 850)系列的固有倾向,或 v4 使用了超过 8 步。
处理:改用 v4 step-600 EMA,步数保持 6–8;超过 8 步可能让问题加重。
原因:LoRA 强度可能不适合当前转换权重,尤其是部分 ComfyUI 转换版。
处理:将强度从 1.0 逐步降至 0.6–0.8。这项参数的社区实践与模型说明存在差异。
原因:larryvrh 系列仍在改进音频;激进量化也可能先影响音频和同步。
处理:先用 bf16 对照。如果使用 Q4/Q2,尝试压缩程度更低的版本再比较。
原因:四步蒸馏对参考一致性的保留有限,Ref2VA Turbo 也仍处于 v0.1 预览阶段。
处理:先增加步数,再考虑换权重。最终交付前,与基础模型的同条件结果比较。
原因:模型装不进显存,ComfyUI 需要通过 PCIe 卸载部分数据。
处理:先保持 544p,开启卸载和 block swap;再考虑裁剪版或 INT8,而不是直接牺牲更多画质。
版本演进
这套生态仍处于快速迭代阶段。在把某个权重视为稳定方案前,先了解它的发布时间和定位。
2026 年 8 月 5 日
larryvrh 发布首个四步预览 LoRA,开启这一实验系列。
2026 年 8 月 7 日
LightX2V/ModelTC 发布首个 H3 Turbo 蒸馏版本:四步 FL2V v0.1。
2026 年 8 月 8 日
larryvrh v4 采用新训练方案。社区测试成功跑出两步结果,音频较干净,但视频明显更柔和。
2026 年 8 月 11 日
LightX2V Turbo v1.0 发布八步权重及以 768p 训练的四步版本,均提供可用于 ComfyUI 的 bf16 权重。
截至核对日期
裁剪版、INT8 和 CMF 量化转换版持续出现,讨论重点逐渐从能否运行转向如何选择。
本页列出的参考图生视频专用蒸馏权重只有一个;FL2V 系列覆盖其他任务。显存容量决定是否需要卸载,以及是否应限制在 544p。
H3 已获 ComfyUI 原生支持,无需额外自定义节点。把权重放到 ComfyUI/models/loras/,在模型加载器与采样器之间接入 LoRA。
LoRA 强度从 1.0 开始,调度器选 simple,CFG 保持 1.0。如果画面有噪点,先把强度降至 0.6–0.8,再考虑其他调整。
常见问题
它不是 MiniMax 官方模型,而是一组社区 LoRA,通过蒸馏把 H3 的采样从约 20 步降至 4–8 步,同时生成视频与同步立体声音频。主要系列来自 LightX2V/ModelTC 和 larryvrh,另有 Kijai 等提供 ComfyUI 转换版。
本页对比中,LightX2V Ref2VA 是专门蒸馏用于参考图生视频的权重。其他多数任务可从作者推荐的 larryvrh v4 step-600 EMA、6–8 步开始;追求直接 1344×768 快速输出时,可考虑 LightX2V 768p 四步版。
约五倍只对应采样从约 20 步降至 4 步。加载模型、文本编码、VAE 和音频解码不会同比缩短。请把失败重试也算入每条可用片段的总耗时。
速度比快速运动细节更重要时选 4 步;多数任务从 6–8 步开始。两位作者都推荐这个质量区间,v4 超过 8 步则可能过锐,未必更好。
这是低步数处理大幅快速运动的已知弱点。先提高到 6 或 8 步;若仍需低步数处理高速动作,可比较旧 larryvrh ckpt-850 与 v4。
不能。本站生成器运行的是标准 MiniMax H3,不是 Turbo LoRA。本页是本地 ComfyUI 或 Diffusers 使用 Turbo 权重的配置参考。
LightX2V/ModelTC 和 larryvrh 的这些权重以 Apache-2.0 发布。商业使用前仍需核对具体模型说明,因为基础模型与 LoRA 各有条款。
不需要。H3 已获原生支持,可使用标准 LoRA 加载器。将文件放到 ComfyUI/models/loras/,在模型加载器与采样器之间接入即可。
v4 模型说明以 1.0 为基准;社区常在 6–10 步时采用 0.6–0.8,Kijai 转换版也提示在噪点明显时降低强度。建议从 1.0 开始,再根据画面逐步调整。
v4 发布后,社区测试得到过音频较干净的两步结果,但视频明显更柔和。这不适合作为默认配置,实际规划仍以四步为下限。
先考虑裁剪版或 INT8,而非完整 bf16;保持 544p,开启卸载与 block swap。更低的 Q4/Q2 版本也存在,但务必单独检查音频同步,不能只检查画面。
可以。SageAttention 加速注意力计算,Turbo LoRA 减少采样步数,作用于不同环节。一位 RTX 5080 用户的记录显示两者叠加更快,但不是通用性能保证。
快速运动和最终交付值得与未经蒸馏的模型比较。本地基础模型约需 20 步;本站在云端运行基础 MiniMax H3。你可以先用 Turbo 确定镜头,再在这里生成要保留的版本,不占用本地显卡。
本页权重名称、步数建议和参数来自 LightX2V/ModelTC 与 larryvrh 的模型说明及仓库,核对日期:2026 年 8 月 15 日。MiniMax H3 Turbo LoRA 是社区版本,不是 MiniMax 官方产品;本站与 MiniMax 无关联。