generative-models 模型下载与首次推理:SDXL 到 SV4D 的三条路径一次配齐
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
这篇指南带你走通 Stability AI 的 generative-models 仓库从模型下载到首次推理的完整流程:先做环境自检,再按生成任务挑选对应权重——SDXL 负责静态图像,SVD 与 SV3D 负责图生视频,SV4D 负责 4D 资产。所有权重统一放入仓库根目录的checkpoints/,配套配置随仓库提供,不用手写。
任务到权重映射:先确定你要生成什么
下载之前最值得做的事是定位任务,下面这张表把三条路径一次列清,后面每个小节都对应其中一行。
| 生成目标 | 对应模型 | 需下载的文件(均放入 checkpoints/) | 体积量级 |
|---|---|---|---|
| 文本生图 / 图生图 | SDXL base(可选 refiner) | sd_xl_base_1.0.safetensors,可选sd_xl_refiner_1.0.safetensors | 约 7GB / 约 5GB |
| 静态图动起来(14 帧 / 25 帧) | SVD / SVD-XT | svd.safetensors、svd_xt.safetensors | 各约 1.5~2.3GB |
| 单图合成环绕多视角视频 | SV3D | sv3d_u.safetensors、sv3d_p.safetensors | 各数 GB |
| 短视频合成新视角 4D 资产 | SV4D 2.0 | sv4d2.safetensors(8 视角变体sv4d2_8views.safetensors) | 约 30GB |
表里每个文件名都与 scripts/sampling/configs/ 中各 yaml 的ckpt_path一一对应,下载落位后配置无需改动。
下载前自检:Python、PyTorch、CLI 与磁盘
任务定了,再确认机器本身没问题,避免下到一半才发现环境不达标。
| 组件 | 底线版本 | 怎么查 |
|---|---|---|
| Python | 3.10(仓库按 3.10 验证) | python --version |
| PyTorch | 2.0.1 | python -c "import torch; print(torch.__version__)" |
| CUDA | 11.8(安装 torch 时选 cu118) | nvidia-smi右上角版本 |
| Hugging Face CLI | 任意支持download子命令的版本 | huggingface-cli --version |
⚠️ 磁盘方面,单个文件从 SDXL 的约 7GB 到 SV4D 2.0 的 30GB 不等,如果打算把三条路径的权重都留本地,建议目标盘预留 100GB 以上。
另外跑推理前记得把仓库依赖装进环境:
pip3 install -r requirements/pt2.txt pip3 install . # 安装 sgm 包,采样脚本依赖它按任务拉取权重并确认落地
环境核对完,就可以按你的生成目标挑权重了。三条路径的命令都输出到checkpoints/,按任务执行对应一段即可。
静态图像生成:SDXL 基础权重下载命令
这条线适合做文本生图或图生图,只下sd_xl_base_1.0.safetensors一个主文件就能开工,也是最适合首次下载的对象。
# 拉取 SDXL base 权重(约 6.9GB),--include 只取 safetensors,--local-dir 指定落点 huggingface-cli download stabilityai/stable-diffusion-xl-base-1.0 \ --include "*.safetensors" --local-dir checkpoints # 完成后得到 checkpoints/sd_xl_base_1.0.safetensors # 可选:需要 refiner 精修(img2img 第二步)时再补一个文件 huggingface-cli download stabilityai/stable-diffusion-xl-refiner-1.0 \ --include "*.safetensors" --local-dir checkpointsrefiner 不是 txt2img 模型,只在图生图流程里对 base 的结果做二次精修,对应 configs/inference/sd_xl_refiner.yaml。只玩文本生图的话可以先不下。
确认落好了:
ls -lh checkpoints/sd_xl_base_1.0.safetensors # 预期:约 6.9GB 的单个文件,且目录内无 .incomplete 残留图生视频生成:SVD 与 SV3D 权重下载命令
这条线适合让单张静态图动起来(SVD 出 14 帧或 25 帧),或由单图合成环绕视角视频(SV3D),一次下 4 个文件。
# SVD 14 帧版 huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd.safetensors --local-dir checkpoints # SVD-XT 25 帧版 huggingface-cli download stabilityai/stable-video-diffusion-img2vid-xt \ svd_xt.safetensors --local-dir checkpoints # SV3D 两个变体:sv3d_u 无相机条件环绕,sv3d_p 支持指定相机路径 huggingface-cli download stabilityai/sv3d \ sv3d_u.safetensors sv3d_p.safetensors --local-dir checkpoints # 可选:低显存机器用图像解码器变体 huggingface-cli download stabilityai/stable-video-diffusion-img2vid \ svd_image_decoder.safetensors --local-dir checkpoints确认落好了:
ls -lh checkpoints/svd.safetensors checkpoints/svd_xt.safetensors \ checkpoints/sv3d_u.safetensors checkpoints/sv3d_p.safetensors # 预期:4 个文件均存在且大小非零,即可进入推理4D 资产生成:SV4D 2.0 权重下载命令
这条线文件最少、单文件最大(约 30GB)。输入建议用白底运动物体的短视频,SV4D 2.0 每次生成 48 帧(12 帧 x 4 视角)。
# SV4D 2.0 主权重,对应 scripts/sampling/configs/sv4d2.yaml huggingface-cli download stabilityai/sv4d2.0 \ sv4d2.safetensors --local-dir checkpoints # 8 视角变体(同一仓库,替换主权重使用) huggingface-cli download stabilityai/sv4d2.0 \ sv4d2_8views.safetensors --local-dir checkpoints确认落好了:
ls -lh checkpoints/sv4d2.safetensors # 预期:数十 GB 的文件,且无 .incomplete 残留如需跑初代 SV4D,再从stabilityai/sv4d仓库取sv4d.safetensors,其推理脚本同时依赖上面已下的sv3d_u.safetensors。
网络不畅时的加速:镜像端点与断点续传
下载中断、速度上不去是常事,两招能解决大部分情况。访问 HuggingFace 不畅时,先给当前会话导出镜像端点:
# 之后本会话的 huggingface-cli 请求都走镜像 export HF_ENDPOINT=https://hf-mirror.com注意镜像的文件列表有同步延迟,新权重若提示找不到文件,就取消这个变量回退官方端点。断点续传不需要额外命令:中断后直接重放原下载命令即可从断点继续,不用删已有文件。唯一要注意的是别手动移动或清理本地缓存与目标目录,否则断点会重置。
# 想再快一点:从文件页拿到直链后用 aria2c 16 连接并发拉单文件 aria2c -x 16 -s 16 -o svd.safetensors "<权重文件直链>" # aria2c 不认识仓库结构也不参与 hf 续传,只适合单文件提速跑通最小推理:一条命令验证全链路
权重就位后,跑一次最小推理确认全链路通了,以 SVD 为例:
# 用仓库自带测试图生成 14 帧视频(默认 25 采样步) python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png --version svd # 成功后 outputs/simple_video_sample/svd/ 新增 000000.jpg 与 000000.mp4 # 终端无 traceback、mp4 能正常播放,即首次推理通过✅ 输出统一落在仓库根目录的outputs/下,--version可换成svd_xt、sv3d_u、sv3d_p等验证其他模型。SV4D 2.0 用独立脚本:
python scripts/sampling/simple_video_sample_4d2.py \ --input_path assets/sv4d_videos/camel.gif --output_folder outputs其余模型的结构配置(yaml)在 configs/inference/,各采样脚本的参数与版本对应关系见 scripts/sampling/ 下对应文件。
高频报错对照:现象、根因与处置
推理阶段遇到问题时,先按下表对号入座,多数情况不用重装环境。
| 现象 | 根因 | 处置 | 影响面 |
|---|---|---|---|
加载时报Missing key(s) in state_dict | 权重不完整,或版本与配置不匹配 | 删除该文件重放获取命令,重下前核对仓库页文件清单 | 该模型无法加载 |
CUDA out of memory | 显存不足 | 采样脚本加--decoding_t=1(或--encoding_t=1、--img_size降到 512) | 仅当前运行失败,降帧后可继续 |
| 生成结果模糊、畸变 | 配置与权重版本不一致 | 核对 scripts/sampling/configs/ 中 yaml 的ckpt_path与checkpoints/实际文件名是否同一发布版本 | 该模型输出全部异常 |
中断后残留 0 字节或.incomplete文件 | 网络中断留下的传输残留 | 重放同一条 huggingface-cli 命令续传,仍慢则切镜像端点 | 仅该文件需重下 |
对照表解决不了时,按这个顺序兜底排查:
- 对权重文件执行
sha256sum,与 README.md Inference 一节列出的文件哈希比对(SDXL base 与 refiner 均有)。 - 逐项核对 scripts/sampling/configs/ 中各
ckpt_path与checkpoints/内的实际文件名。 - 删除整个
checkpoints/目录,重放该模型的完整获取命令。
首次推理跑通后,再按实际需要补齐其余模型权重即可,上面三条路径的获取命令都可以随时重放。
【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考