SadTalker checkpoints 配置三步走:8 个模型文件一次下齐
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
跟着本文操作完,你的机器上会有一个装好 4 个模型文件的checkpoints/目录,外加gfpgan/weights/下的 4 个人脸增强权重——这就是 SadTalker 启动推理所需的全部模型配置。这个项目用一张静态人像加一段音频就能生成说话头像视频(CVPR 2023),环境搭建、模型下载、验证推理三步都能在同一个终端里串完。
输入端只需要一张这种静态人像和一段音频,剩下的准备工作全部围绕模型展开。
步骤 1:搭建能跑 inference.py 的运行环境
先锁定 Python 版本:依赖矩阵是按 3.8 调的,用更高版本的 conda 环境容易出现模块报错。下面命令完成克隆、建环境、装依赖三件事:
git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker conda create -n sadtalker python=3.8 conda activate sadtalker pip install -r requirements.txt环境里还需要 ffmpeg 负责视频编解码,缺了就执行conda install ffmpeg。macOS 的 M 系列芯片要单独补一句pip install dlib,否则关键点提取那步会抛出 Illegal Hardware Error。
步骤 2:用脚本下齐 checkpoints 与 GFPGAN 权重
默认路径只跑一条命令,脚本会自己创建目录并拉取全部文件:
bash scripts/download_models.shwget 带的-nc参数含义是不覆盖已有文件,所以下载中断后直接重跑同一条命令即可续传,已完成的文件会自动跳过。
备选路径留给默认源连不通的场景:从 GitHub Releases、Google Drive 或百度网盘(提取码sadt)里任选其一,手动取回完整模型包,再对照下表摆放:
| 文件 | 放置位置 | 用途 |
|---|---|---|
| mapping_00109-model.pth.tar | checkpoints/ | 256 档映射网络权重 |
| mapping_00229-model.pth.tar | checkpoints/ | 512 档映射网络权重 |
| SadTalker_V0.0.2_256.safetensors | checkpoints/ | 256 分辨率面部渲染权重 |
| SadTalker_V0.0.2_512.safetensors | checkpoints/ | 512 分辨率面部渲染权重 |
| alignment_WFLW_4HG.pth | gfpgan/weights/ | 人脸对齐 |
| detection_Resnet50_Final.pth | gfpgan/weights/ | 人脸检测 |
| GFPGANv1.4.pth | gfpgan/weights/ | 人脸增强主权重 |
| parsing_parsenet.pth | gfpgan/weights/ | 语义解析 |
两个下载前值得留意的点:
- ✅ 全套体积约 5GB,开始前先确认磁盘剩余空间够不够
- 📂 模型文件版本要和代码版本配套,升级代码时整套重下,不要只补个别文件
步骤 3:跑一条最短验证命令
验证模型是否放对位置,最短路径是用仓库自带样例音频加样例人像生成一条视频:
python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/art_0.png \ --enhancer gfpgan命令没有报模型加载错误、默认result/目录里产出视频,就说明 checkpoints 和 GFPGAN 权重都到位了;报加载错误则回到步骤 2 的表格核对对应文件。
排错速查表:下载与加载报错对照
上面流程最常见的翻车情形汇总成一张表,按现象对号入座:
| 现象 | 原因 | 处理 |
|---|---|---|
| 下载中断,文件不完整 | 网络波动或链接断开 | 重跑bash scripts/download_models.sh,-nc自动跳过已完成文件 |
unexpected EOF ... corrupted | 模型文件损坏或没下完 | 重新下载对应文件;GFPGAN 相关则整个gfpgan/weights/重取 |
FileNotFoundError: ... checkpoints | 目录缺失或文件名不对 | 按步骤 2 表格核对文件名与位置,注意大小写 |
| 加载模型报版本相关错误 | 新旧模型混用 | 整套重下模型文件,保证与当前代码版本一致 |
| 磁盘写入失败 | 空间不足(全套约 5GB) | 清理空间后重新下载 |
需要更多配置选项时,可以翻一下 docs/best_practice.md;遇到表外报错,docs/FAQ.md 里收录了各平台的排查条目。建议把模型目录随代码一起备份,换机重建环境时不必再为这 8 个文件重新排队下载。
【免费下载链接】SadTalker[CVPR 2023] SadTalker:Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考