MiniMax-H3-GGUF命令行完全指南:sd-cli参数逐项解析与实用技巧
【免费下载链接】MiniMax-H3-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/unsloth/MiniMax-H3-GGUF
MiniMax-H3-GGUF 是 unsloth 团队发布的 GGUF 量化版视频生成模型,配合 stable-diffusion.cpp 自带的 sd-cli 命令行工具,就能在本地显卡上直接生成"自带声音"的短视频——画面和 32kHz 立体声音轨由模型同步产出,无需任何云端 API。对新手来说,最大的门槛往往是那一长串 sd-cli 参数:哪些必填、哪些影响画质、哪些决定显存占用。本文将以一条可复现的命令为主线,逐项解析 sd-cli 参数,并给出量化等级选择与实用调参技巧。
MiniMax-H3 是什么:一个会"出声"的视频生成模型
MiniMax H3 是 MiniMax 发布的 omni-modal(全模态)生成系统,核心亮点是视频与音频联合生成:不是后期配音,而是扩散模型在生成画面帧的同时直接产出 32kHz 立体声,最长支持 15 秒、24 FPS 的片段。
本仓库提供了两套去噪模型,加载哪一套决定了你能输入什么:
- fl2va_pruned(首尾帧版):输入文字,可选 0、1 或 2 张首帧/尾帧图片。
- ref2va_pruned(参考版):输入文字,外加参考图、参考视频和参考音频。
两者是独立的 checkpoint 而非设置项,按任务二选一即可。此外还需要共享的 Qwen3-VL 文本编码器和视频/音频 VAE。
准备工作:一次下载全部所需文件
先用 git clone 拉取整个仓库(内含全部 GGUF 模型与 VAE):
git clone https://gitcode.com/hf_mirrors/unsloth/MiniMax-H3-GGUF仓库结构如下,vae/目录下已有现成的视频与音频 VAE,无需额外下载:
MiniMax-H3-GGUF/ ├── vae/ │ ├── minimax_h3_video_vae_fp16.safetensors # 视频解码器 │ └── minimax_h3_audio_vae_fp32.safetensors # 音频解码器 ├── minimax_h3_fl2va_pruned-*.gguf # 首尾帧版去噪器(8 个量化档) ├── minimax_h3_ref2va_pruned-*.gguf # 参考版去噪器(6 个量化档) └── qwen3vl_32b_minimax_h3-*.gguf # Qwen3-VL 文本编码器(2 个档)跑通第一条命令:sd-cli 最小示例
sd-cli --mode vid_gen \ --diffusion-model minimax_h3_fl2va_pruned-UD-Q2_K_XL.gguf \ --llm qwen3vl_32b_minimax_h3-Q2_K_M.gguf \ --vae minimax_h3_video_vae_fp16.safetensors \ --audio-vae minimax_h3_audio_vae_fp32.safetensors \ --prompt "a red fox trotting through falling snow, cinematic" \ --width 640 --height 384 --video-frames 25 --steps 4 --cfg-scale 1.0 \ --backend te=cpu --diffusion-fa \ --output out.webmsd-cli 参数逐项解析:从必填项到可选优化
--mode vid_gen:第一个必填参数
--mode指定运行模式,视频生成必须显式写成--mode vid_gen。不写的话 sd-cli 会把它当作图片生成模式,直接拿图片路径去解析 prompt 然后报错退出。
--diffusion-model:选择去噪模型
指向minimax_h3_fl2va_pruned-*.gguf或minimax_h3_ref2va_pruned-*.gguf。想用首尾帧控图就选 fl2va,想用参考视频/音频就选 ref2va。
--llm:文本编码器搭配
--llm指定qwen3vl_32b_minimax_h3-Q2_K_M.gguf或Q4_K_M。官方建议:最小的两个去噪器搭配 Q2_K_M,其余档位搭配 Q4_K_M。
--vae 与 --audio-vae:视频和音频的"解码器"
--vae用vae/minimax_h3_video_vae_fp16.safetensors,--audio-vae用vae/minimax_h3_audio_vae_fp32.safetensors。两个 VAE 是 fl2va/ref2va 共用的,切换去噪器不用重下。
--prompt:提示词写法
英文提示词效果最佳,建议包含主体、动作、环境与风格词,例如"a red panda stepping along a mossy log in a misty forest, cinematic"。
--width 与 --height:分辨率与显存直接挂钩
官方示例图是 960x544 分辨率,入门建议从 640x384 起步。分辨率越高显存占用越大,显存不够就先降分辨率。
--video-frames:视频帧数
帧数决定时长,配合 24 FPS:25 帧约 1 秒,124 帧约 5 秒。帧数越多,显存与推理时间线性增长。
--steps 与 --cfg-scale:速度与质量的平衡
H3 是蒸馏模型,官方示例仅需4~8 步即可出片。--cfg-scale必须显式写成 1.0,这是第二个必填参数——H3 是无 classifier-free guidance 的蒸馏模型,默认值 7.0 会导致直接中止报错。
--backend te=cpu:第三个必填参数
--backend te=cpu把约 12GB 的文本编码器放到 CPU 上运行,避免挤占显卡显存,这是本仓库 README 明确要求的默认配置。
--diffusion-fa:Flash Attention 加速
开启 Flash Attention 可显著降低注意力计算的显存与耗时,建议一直加上。
--output:输出文件
输出支持.webm等格式,直接指向out.webm即可,生成结果自带音轨。
--offload-to-cpu:小显存救星
如果上述配置仍然显存不足,追加--offload-to-cpu把部分层卸载到 CPU 换显存,代价是速度下降。
量化等级怎么选:从 Q2_K 到 Q8_0
| 量化档位 | fl2va 体积 | ref2va 体积 | 适用场景 |
|---|---|---|---|
| Q2_K | 6.26 GiB | 6.22 GiB | 极低显存尝鲜 |
| UD-Q2_K_XL | 7.51 GiB | — | 最小推荐档(动态混合精度) |
| Q3_K | 8.16 GiB | 8.12 GiB | 入门 |
| UD-Q3_K_XL | 8.90 GiB | — | 动态混合精度进阶 |
| Q4_K | 10.64 GiB | 10.60 GiB | 画质/体积均衡之选 |
| Q5_0 | 12.97 GiB | 12.94 GiB | 高质量 |
| Q6_K | 15.45 GiB | 15.42 GiB | 接近无损 |
| Q8_0 | 19.97 GiB | 19.94 GiB | 最高保真 |
UD-前缀表示动态混合精度版本,非均匀量化能效比更高;普通档则全程使用同一精度。新手建议从UD-Q2_K_XL+Q2_K_M文本编码器组合开始,显存足够再升档。
实用技巧:三个必填项之外的调参心得
- 固定 seed 复现效果:示例中 seed 11 是官方验证过的参数组合(960x544、124 帧、8 步、guidance 1.0),先照抄再微调。
- 控制变量法调参:先固定分辨率与步数,只调 prompt,确认画面风格后再动分辨率。
- 显存不够时的降级顺序:降分辨率 → 减少 video-frames → 换更低的量化档 → 最后才加
--offload-to-cpu。 - 音频是模型输出的一部分:生成的
.webm自带立体声,无需任何后期配音工具。 - 两个去噪器切换零成本:文本编码器与 VAE 共享,只需多下载一个去噪器文件。
常见问题(FAQ)
问:报错说 cfg-scale 不能大于 1.0?答:H3 是蒸馏模型,务必显式写--cfg-scale 1.0,不要依赖默认值。
问:--mode不写会怎样?答:sd-cli 会按图片模式解析 prompt 并立即报错,所以--mode vid_gen必须显式声明。
问:生成的是无声视频?答:确认同时传入了--audio-vae minimax_h3_audio_vae_fp32.safetensors,否则不会生成音轨。
问:显存只有 8GB 能跑吗?答:可以,用UD-Q2_K_XL+Q2_K_M,分辨率降到 640x384、帧数降到 25,必要时再加--offload-to-cpu。
许可证提醒
使用前请务必阅读仓库内的LICENSE与NOTICE文件:本模型采用 MiniMax H3 Community License Agreement,对适用区域有明确限定;GGUF 文件属于量化后的 Model Derivatives,NOTICE中已逐项列明修改内容与归属说明。这不是 MiniMax 官方产品,也未经 MiniMax 背书。
现在就去 clone 仓库,用第一条 sd-cli 命令生成你的第一个"带声音"的视频吧!🎬
【免费下载链接】MiniMax-H3-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/unsloth/MiniMax-H3-GGUF
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考