Duix.Avatar本地部署指南:10秒视频克隆你的数字人,在自己电脑上批量生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar是一套可在本地、全离线运行的开源数字人工具:上传一段10秒左右的说话视频,即可克隆你的形象和声音,再输入文案或音频,自动生成口播视频。本文带你走完环境准备、Docker服务启动到出片验证的完整流程,一个晚上就能跑通。
为什么值得在自己电脑上跑
- 全离线:模型训练与视频合成全部发生在本地GPU上,视频和声音样本不出机器,适合素材敏感、要求数据私密的场景。
- 成本:官方对比商用方案,制作成本降低99%以上,周期从数周缩到小时级;一次搭好之后生成不限次数,不再按条付费。
- 可扩展:仓库 deploy/ 目录里的编排文件拿来即用,服务启动后会在本机暴露语音(端口18180)和合成(端口8383)接口,方便接入自己的业务系统。
过来人提醒:只是想出几条片子,8GB显存能跑的lite版就够了;声音克隆和形象合成都想保留,就上完整三服务。
它能干什么:三个能力各看三行
形象与面部克隆
- 原理:face2face模型分析短视频中的五官、轮廓与表情变化,重建一张可用的虚拟脸。
- 价值:10秒视频即可得到一个数字人形象,支持多模型导入与随时切换。
- 门槛:只需录视频时正面、光线均匀、人声清晰,不需要算法背景。
声音克隆与语音合成
- 原理:合成模型以声音样本加参考文本为条件重建音色,保留原声的语调和习惯。
- 价值:输入文案就能得到原声口吻的语音;脚本支持中、英、日、韩、法、德、阿、西共8种语言。
- 门槛:零门槛,一段10秒带人声的素材即可;想调语音参数可参考 src/main/service/voice.js。
文案转视频合成
- 原理:口型与音频节奏对齐,音视频自动同步后输出成片。
- 价值:形象训练完即可“文案→语音→视频”一条龙,进度还能通过8383接口轮询。
- 门槛:客户端界面操作即可;用API集成的话,参考 src/main/service/video.js。
过来人提醒:第一次先挑最短的10秒素材,目标先出一条完整片子,再谈质感。
🖥️ 硬件怎么选:三档配置表
| 档位 | CPU | 内存 | 显卡 | 存储 | 可完成的任务 |
|---|---|---|---|---|---|
| 体验档 | i5-12400或同级 | 16GB | 8GB显存的N卡(lite版) | SSD空闲100GB以上 | lite单服务、720p出片、单模型约40分钟 |
| 流畅档 | i5-13400F或i7-13700 | 32GB | RTX 4070(12GB) | SSD空闲100GB以上 | 完整三服务、1080p出片、单模型约20分钟 |
| 批量档 | i7-14700或更高 | 32–64GB | RTX 4090(24GB) | SSD 100GB + 1TB数据盘 | 长视频批量合成、多模型并行训练 |
注意:
- NVIDIA显卡加驱动是硬门槛,缺了它三个服务一个都起不来。
- 验证方式:执行下面的命令,能看到显卡型号、显存和驱动版本才算通过。
nvidia-smi过来人提醒:内存32GB才是分水岭,16GB机器上ASR服务经常起不来。
📦 怎么跑起来:准备、执行、验证
第一步 准备:系统、磁盘、Docker、仓库
- 确认系统版本。Windows需10 19042.1526及以上,用
winver查看;Ubuntu用22.04 Desktop,用lsb_release -a查看。 - 确认磁盘空间。Windows下镜像盘(通常C盘)需100GB以上空闲、数据盘30GB以上空闲;Ubuntu需100GB以上空闲。C盘不够时,在Docker Desktop的 Settings → Resources → Advanced 里点 Browse,把镜像存放位置挪到大盘。
- 安装Docker。Windows先装WSL(
wsl --install后wsl --update),再装Docker Desktop并首次启动(接受协议、跳过登录);Ubuntu执行:sudo apt update sudo apt install docker.io docker-compose验证方式:
docker --version能输出版本号。 - 克隆代码。
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar验证方式:
ls能看到deploy和src两个目录。 - 确认NVIDIA驱动已装好,执行
nvidia-smi复核(见上一节)。
第二步 执行:一条命令拉起服务
- 进入部署目录启动:
cd deploy docker-compose up -dlite版(8GB显存)把文件换成
docker-compose-lite.yml;Ubuntu用docker-compose-linux.yml;RTX 50系显卡用同目录下的5090配置文件。 - 首次会自动拉镜像,约70GB流量,耗时30分钟到2小时。 注意:如果拉取超时并出现 "request canceled" 报错,打开Docker Desktop → Docker Engine,在JSON里加入 registry-mirrors 加速源,点 Apply & restart,再重跑上一步命令。
- 启动后先别急着开客户端。ASR服务就绪较慢,等服务完全起来后至少留5分钟再操作。
第三步 验证:成功的三条标准
docker ps里三个容器均为 Up/Running:Duix.Avatar-asr、Duix.Avatar-tts、Duix.Avatar-gen-video(lite版只有一个 duix-avatar-gen-video)。- 本机端口18180与8383处于监听状态。
- 客户端连得上:装官方客户端(Windows装.exe,Ubuntu直接用.AppImage),主界面出现“My Works”和“My Avatars”且没有离线提示。
过来人提醒:三个服务全部Running再去点克隆,否则大概率报Connection refused。
落地到谁手里:两个真实用法
教育:批量做课前3分钟预告片
- 素材:8秒正面口播片段,1080p,人声单一、无背景音乐。
- 流程:训练一次形象模型,课程文案按每段不超300字切分,逐段生成,再用自己的剪辑工具拼接。
- 建议参数:语速约200字/分钟,一位老师一个模型,模型可长期复用并随形象更新替换。
自媒体:虚拟主播口播切片
- 素材:12秒vlog开场片段(带一次微笑),不低于720p。
- 流程:客户端里输入当日选题得到语音,一键合成视频,成片直接导出发平台。
- 建议参数:单条控制在60秒以内,方便控制合成时长;8GB显存下批量出片约5–8分钟/分钟视频。
过来人提醒:一个定位一个模型,同一张脸跨栏目乱用,观众很快会腻。
文档、配置和帮助去哪找
- 常见问题的现成解法:仓库里的 doc/常见问题.md 收录了拉镜像失败、建形象报错等案例,提问前照自查清单过一遍。
- 启动配置:deploy/ 目录四个编排文件分别对应Windows完整、lite、Ubuntu与5090场景。
- API示例:语音与合成接口启动后在本机即可调用,示例代码见 src/main/service/video.js,可直接抄走做集成。
- 社区:仓库的Issues区每天更新,先查再问,很多坑已经有人替你踩过。
过来人提醒:项目更新比较频繁,先确认客户端和服务端都是最新版,再谈排障。
🔍 四个高频卡点:症状→原因→解法
1. 拉镜像失败,提示 request canceled / context canceled
- 症状:
docker-compose up -d执行后出现 ✘,连接 registry-1.docker.io 超时。 - 可能原因:Docker Hub官方源不稳定。
- 解决方案:在Docker Engine的JSON里加 registry-mirrors 加速源,重启Docker后重新拉取。
2. 新建形象报错:视频必须带声音
- 症状:上传视频创建形象后立刻失败。
- 可能原因:素材无声音,或声音不是人在说话;程序要靠这段人声做声音克隆。
- 解决方案:重录一段10秒连续说话的片段再上传。
3. 克隆时出现 Connection refused
- 症状:日志里ASR websocket连接失败,报
'NoneType' object has no attribute 'send'。 - 可能原因:ASR服务就绪慢,或内存太小(16GB可能直接起不来)。
- 解决方案:服务就绪后等5–10分钟再操作;仍失败就把内存升到32GB。
4. 镜像存放位置突然爆满
- 症状:拉取中途卡死,Docker Desktop提示磁盘空间不足。
- 可能原因:约100GB镜像全部落在默认盘位置。
- 解决方案:Settings → Resources 里把镜像位置改到大盘,再重启Docker。
全离线、不限次、一次投入长期复用,这是自己跑数字人的全部价值。打开deploy目录,今晚把服务拉起来,产出第一条口播视频。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考