☰
generative-models 模型下载与首次推理:SDXL 到 SV4D 的三条路径一次配齐
2026/10/2 13:36:03 网站建设 项目流程

generative-models 模型下载与首次推理:SDXL 到 SV4D 的三条路径一次配齐

【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models

这篇指南带你走通 Stability AI 的 generative-models 仓库从模型下载到首次推理的完整流程:先做环境自检,再按生成任务挑选对应权重——SDXL 负责静态图像,SVD 与 SV3D 负责图生视频,SV4D 负责 4D 资产。所有权重统一放入仓库根目录的checkpoints/,配套配置随仓库提供,不用手写。

任务到权重映射:先确定你要生成什么

下载之前最值得做的事是定位任务,下面这张表把三条路径一次列清,后面每个小节都对应其中一行。

生成目标对应模型需下载的文件(均放入 checkpoints/)体积量级
文本生图 / 图生图SDXL base(可选 refiner)sd_xl_base_1.0.safetensors,可选sd_xl_refiner_1.0.safetensors约 7GB / 约 5GB
静态图动起来(14 帧 / 25 帧)SVD / SVD-XTsvd.safetensors、svd_xt.safetensors各约 1.5~2.3GB
单图合成环绕多视角视频SV3Dsv3d_u.safetensors、sv3d_p.safetensors各数 GB
短视频合成新视角 4D 资产SV4D 2.0sv4d2.safetensors(8 视角变体sv4d2_8views.safetensors)约 30GB

表里每个文件名都与 scripts/sampling/configs/ 中各 yaml 的ckpt_path一一对应,下载落位后配置无需改动。

下载前自检:Python、PyTorch、CLI 与磁盘

任务定了,再确认机器本身没问题,避免下到一半才发现环境不达标。

组件底线版本怎么查
Python3.10(仓库按 3.10 验证)python --version
PyTorch2.0.1python -c "import torch; print(torch.__version__)"
CUDA11.8(安装 torch 时选 cu118)nvidia-smi右上角版本
Hugging Face CLI任意支持download子命令的版本huggingface-cli --version

⚠️ 磁盘方面,单个文件从 SDXL 的约 7GB 到 SV4D 2.0 的 30GB 不等,如果打算把三条路径的权重都留本地,建议目标盘预留 100GB 以上。

另外跑推理前记得把仓库依赖装进环境:

pip3 install -r requirements/pt2.txt pip3 install . # 安装 sgm 包,采样脚本依赖它

按任务拉取权重并确认落地

环境核对完,就可以按你的生成目标挑权重了。三条路径的命令都输出到checkpoints/,按任务执行对应一段即可。

静态图像生成:SDXL 基础权重下载命令

这条线适合做文本生图或图生图,只下sd_xl_base_1.0.safetensors一个主文件就能开工,也是最适合首次下载的对象。

# 拉取 SDXL base 权重(约 6.9GB),--include 只取 safetensors,--local-dir 指定落点 huggingface-cli download stabilityai/stable-diffusion-xl-base-1.0 \ --include "*.safetensors" --local-dir checkpoints # 完成后得到 checkpoints/sd_xl_base_1.0.safetensors # 可选:需要 refiner 精修(img2img 第二步)时再补一个文件 huggingface-cli download stabilityai/stable-diffusion-xl-refiner-1.0 \ --include "*.safetensors" --local-dir checkpoints

refiner 不是 txt2img 模型,只在图生图流程里对 base 的结果做二次精修,对应 configs/inference/sd_xl_refiner.yaml。只玩文本生图的话可以先不下。

确认落好了:

ls -lh checkpoints/sd_xl_base_1.0.safetensors # 预期:约 6.9GB 的单个文件,且目录内无 .incomplete 残留

图生视频生成:SVD 与 SV3D 权重下载命令

这条线适合让单张静态图动起来(SVD 出 14 帧或 25 帧),或由单图合成环绕视角视频(SV3D),一次下 4 个文件。

# SVD 14 帧版 huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd.safetensors --local-dir checkpoints # SVD-XT 25 帧版 huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt \ svd_xt.safetensors --local-dir checkpoints # SV3D 两个变体:sv3d_u 无相机条件环绕,sv3d_p 支持指定相机路径 huggingface-cli download stabilityai/sv3d \ sv3d_u.safetensors sv3d_p.safetensors --local-dir checkpoints # 可选:低显存机器用图像解码器变体 huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd_image_decoder.safetensors --local-dir checkpoints

确认落好了:

ls -lh checkpoints/svd.safetensors checkpoints/svd_xt.safetensors \ checkpoints/sv3d_u.safetensors checkpoints/sv3d_p.safetensors # 预期:4 个文件均存在且大小非零,即可进入推理

4D 资产生成:SV4D 2.0 权重下载命令

这条线文件最少、单文件最大(约 30GB)。输入建议用白底运动物体的短视频,SV4D 2.0 每次生成 48 帧(12 帧 x 4 视角)。

# SV4D 2.0 主权重,对应 scripts/sampling/configs/sv4d2.yaml huggingface-cli download stabilityai/sv4d2.0 \ sv4d2.safetensors --local-dir checkpoints # 8 视角变体(同一仓库,替换主权重使用) huggingface-cli download stabilityai/sv4d2.0 \ sv4d2_8views.safetensors --local-dir checkpoints

确认落好了:

ls -lh checkpoints/sv4d2.safetensors # 预期:数十 GB 的文件,且无 .incomplete 残留

如需跑初代 SV4D,再从stabilityai/sv4d仓库取sv4d.safetensors,其推理脚本同时依赖上面已下的sv3d_u.safetensors。

网络不畅时的加速:镜像端点与断点续传

下载中断、速度上不去是常事,两招能解决大部分情况。访问 HuggingFace 不畅时,先给当前会话导出镜像端点:

# 之后本会话的 huggingface-cli 请求都走镜像 export HF_ENDPOINT=https://hf-mirror.com

注意镜像的文件列表有同步延迟,新权重若提示找不到文件,就取消这个变量回退官方端点。断点续传不需要额外命令:中断后直接重放原下载命令即可从断点继续,不用删已有文件。唯一要注意的是别手动移动或清理本地缓存与目标目录,否则断点会重置。

# 想再快一点:从文件页拿到直链后用 aria2c 16 连接并发拉单文件 aria2c -x 16 -s 16 -o svd.safetensors "<权重文件直链>" # aria2c 不认识仓库结构也不参与 hf 续传,只适合单文件提速

跑通最小推理:一条命令验证全链路

权重就位后,跑一次最小推理确认全链路通了,以 SVD 为例:

# 用仓库自带测试图生成 14 帧视频(默认 25 采样步) python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png --version svd # 成功后 outputs/simple_video_sample/svd/ 新增 000000.jpg 与 000000.mp4 # 终端无 traceback、mp4 能正常播放,即首次推理通过

✅ 输出统一落在仓库根目录的outputs/下,--version可换成svd_xt、sv3d_u、sv3d_p等验证其他模型。SV4D 2.0 用独立脚本:

python scripts/sampling/simple_video_sample_4d2.py \ --input_path assets/sv4d_videos/camel.gif --output_folder outputs

其余模型的结构配置(yaml)在 configs/inference/,各采样脚本的参数与版本对应关系见 scripts/sampling/ 下对应文件。

高频报错对照:现象、根因与处置

推理阶段遇到问题时,先按下表对号入座,多数情况不用重装环境。

现象根因处置影响面
加载时报Missing key(s) in state_dict权重不完整,或版本与配置不匹配删除该文件重放获取命令,重下前核对仓库页文件清单该模型无法加载
CUDA out of memory显存不足采样脚本加--decoding_t=1(或--encoding_t=1、--img_size降到 512)仅当前运行失败,降帧后可继续
生成结果模糊、畸变配置与权重版本不一致核对 scripts/sampling/configs/ 中 yaml 的ckpt_path与checkpoints/实际文件名是否同一发布版本该模型输出全部异常
中断后残留 0 字节或.incomplete文件网络中断留下的传输残留重放同一条 huggingface-cli 命令续传,仍慢则切镜像端点仅该文件需重下

对照表解决不了时,按这个顺序兜底排查:

  1. 对权重文件执行sha256sum,与 README.md Inference 一节列出的文件哈希比对(SDXL base 与 refiner 均有)。
  2. 逐项核对 scripts/sampling/configs/ 中各ckpt_path与checkpoints/内的实际文件名。
  3. 删除整个checkpoints/目录,重放该模型的完整获取命令。

首次推理跑通后,再按实际需要补齐其余模型权重即可,上面三条路径的获取命令都可以随时重放。

【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询