承接:同一条船,重一个量级的货
系列前两篇交代过我们的测试平台(文生图篇、LLM 实测篇):Ryzen AI Max+ 395 / Radeon 8060S / 128GB 统一内存,BIOS 划分 96GB 专用显存 + 32GB 系统。没看过的可以先翻前两篇,这一篇会反复用到这组数字。
文生图最大的模型 35GB,视频生成直接上一个量级:双专家 14B fp8、45.5GB 的量化权重,工作显存 27-45GB。到这个量级,统一内存切分从"建议"变成"生死线",先讲一个必崩点:
不少开源方案默认把文本编码器(TE)放到 CPU 上跑(
te=cpu)省显存。在 96+32 这个划分下,TE 一上 CPU,32GB 系统内存立刻不够——必崩。显存够大的平台上,全显存方案反而更稳。这不是理论,是我们实打实崩出来的结论。
Wan2.2-T2V:23.7 分钟的 5 秒视频,和一次教科书级翻车
配置先摆出来:Wan2.2-T2V 双专家 14B(fp8)+ lightx2v 4 步加速 LoRA,ComfyUI 工作流,跑 832×480、81 帧(约 5 秒 @16fps)。实测耗时23.7 分钟、显存约27GB——跑得动,而且画面接近照片级。
但第一次跑出来的是废片。症状很有迷惑性:色调对、零结构——画面颜色大致贴合提示词(暖金夕阳、黄绿色调都在),却没有任何可辨识的物体。排查一圈,是两个参数:
| 参数 | 错误值 | 正确值 | 后果 |
|---|---|---|---|
| ModelSamplingSD3 的 shift | 8.0(Wan2.2 原生模板值) | 5.0(lightx2v LoRA 的要求) | 噪声调度错位,去噪轨迹走歪 |
| 高噪采样器 return_with_leftover_noise | disable | enable | 高噪专家的剩余噪声没传给低噪专家 |
▲ 同一提示词:shift=8.0 出"色调对零结构"的废片,shift=5.0 直接出片(金毛犬花田,接近照片级)
给你一条判据,值得收藏:画面"颜色大致对但没有成形物体",先查 shift 和 leftover_noise,再查双专家的 LoRA 是不是接反了——这三个原因的症状几乎一样。修复后同一提示词直接出片:金毛犬朝镜头奔跑、向日葵花田成排延伸,抽帧目视与提示词一致。
MiniMax-H3:双后端对比与 8 分钟出片配方
45.5GB 的 MiniMax-H3 我们用 Vulkan(sd-cli)和 ROCm 两条后端跑了同规格对比:
| 维度 | Vulkan | ROCm |
|---|---|---|
| 采样步速 | 35.2 s/it | 26.5 s/it(快 25%) |
| 模型加载(mmap) | 92s×2(TE+DiT) | 40s+23s |
| 运行显存 | ~45GB | ~45GB |
ROCm 这条有个工程小技巧:不用再装一套环境,复用现成的 ROCm venv,把 venv 里 ROCm SDK 的 bin 目录加进 PATH,再把amdhip64_7.dll复制一份改名为amdhip64.dll,就能跑。
最快配方:8 分钟一条
帧数×步数是采样耗时的乘积,性价比最高的降档是33 帧 × 12 步(864×480,约 1.4 秒@24fps):实测一条 8 分钟整,抽帧盲评与 20 步满配无差异——结构、毛发、光线全保持。含音频。任务投递走 HTTP 接口(JSON 里 UTF-8 原生支持中文提示词,顺便绕开 bat 的代码页坑,后文细说)。
能力边界:比速度更重要的清单
这个模型更大的价值,是逼我们写出了本地视频生成的边界清单——能干什么、不能干什么,比快慢重要得多:
| 场景 | 结论(实测) |
|---|---|
| 慢镜头/单主体/氛围短片(约 2 秒) | ✅ 最优场景,8 分钟/条,提示词遵循度 9/10 |
| 叙事短片(5-10 秒) | △ 可用但画质递减 |
| 15 秒长片 | ❌ 12 步必糊,20 步约 2.5 小时且不保证 |
| 多人物、快动作 | ❌ 主体渗透/拖影,边界之外 |
▲ 同模型同提示词:速度档(33帧×12步)与 15 秒档的画质差异——边界清单的一图流证据
一句话定位:本地量化视频模型的正确用法是**“慢镜头单主体氛围片生成器”**;要长片、要多人调度,走官方 API。画质天花板在"剪枝量化 + 480p + ggml 近似"三件套上,工程优化只解决速度,不解决画质——步数加上去也翻不过去(10 秒 @20 步仅小改善,实测)。
显存纪律:视频篇的三条血泪
- 崩溃进程会泄漏 Vulkan 显存(实测一个失控进程占着 38.6GB 不放)。跑大任务前先确认显存干净,否则尾段的 VAE 加载必崩;
- 杀进程要杀干净:结束服务务必
taskkill /T /F——只杀父进程会留下占显存的孤儿进程。统一内存机器上后果比独显平台更重:它咬掉的是你整个专用显存预算; - 脚本里别放中文提示词:bat 的代码页坑(
chcp 65001写进 bat 反而让 cmd 解析错位),解法就是改 HTTP 投递,JSON 原生 UTF-8。
收尾:本地视频生成的正确期待
上篇文生图的结论是"两条路线都留着";视频这边的结论不一样——它不是"能不能跑"的问题,而是"跑什么"的问题:氛围短片交给本地(8 分钟一条、数据不出门),长片和复杂调度交给 API。分清这条线,才不会在本地死磕 2.5 小时的糊片。
这些边界同样是替客户趟出来的:客户问"这台机器能不能做视频",参数表只能答"显存够",这份清单能答"能做什么、做到什么程度、什么别勉强"——做产品交出去的从来不是硬件,是这些验证过的边界。