10分钟跑通:开源数字人Duix.Avatar本地部署实战
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar是一款开源数字人工具,在你本地电脑上就能把一段十秒视频变成会说话、能对口型的数字人。个人创作者、教育机构、企业宣传部门都用得上。照着走一遍,你就能完成数字人私有化部署,产出第一条AI口播视频。
⚡ 你的机器够格吗?(硬件门槛)
先别急着敲命令,把硬件对一下。这套开源数字人工具的所有算力都在自己电脑里跑,三个服务全部吃显卡,显卡就是最大的瓶颈——显存直接决定你能跑哪一档的模型。下面是三档参考配置:
| 部件 | 入门 | 推荐 | 生产 |
|---|---|---|---|
| CPU | 第10代英特尔酷睿 i5 或同等AMD | 第13代酷睿 i7-13700F | 第14代酷睿 i9-14900K |
| 内存 | 16GB | 32GB | 64GB |
| 显卡 | RTX 3060(6GB显存) | RTX 4070(12GB显存) | RTX 4090(24GB显存) |
| 存储 | 256GB SSD + 1TB HDD | 512GB SSD + 2TB SSD | 1TB SSD + 4TB SSD |
速度预期上,入门档约30分钟/模型,720p合成约5分钟/分钟视频;推荐档约15分钟/模型,1080p合成约2分钟/分钟视频;生产档约8分钟/模型,4K合成约1分钟/分钟视频。另外英伟达驱动必须装好(用nvidia-smi验证一下),内存只有16G时ASR服务可能直接起不来,32G才是真正的安全线。如果你是50系新卡(比如5090),服务端要用deploy/目录下专用的docker-compose-5090.yml启动。拿不准就从入门档起步,够用再说。
🔧 从克隆到出片,四步跑通部署
先把环境收拾干净
Windows用户先确认系统是 Win10 19042.1526 或更高版本,然后装上WSL并更新到最新版,再安装 Docker Desktop;Ubuntu 22.04 用户跳过WSL,直接用 apt 装 Docker:
wsl --install wsl --update接着把项目仓库克隆到本地磁盘,后面所有操作都在这个目录里完成:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar注意:Windows 上 C 盘存 Docker 镜像,空闲要留足 100G;D 盘存数字人数据(默认挂载路径是d:/duix_avatar_data),空闲留 30G 以上。
再拉起服务端
服务端配置都放在deploy/目录里,跑一条命令,Docker 会自动拉三个镜像(ASR、TTS、视频合成)并把容器拉起来:
cd deploy docker-compose up -d注意:首次拉镜像约消耗 70G 流量,视网速要半小时到两小时,这段时间别去动它。服务会在127.0.0.1上开放 18180 和 8383 两个端口,机器上别跑其他占同端口的服务。配置较低的显卡可以改用 lite 配置docker-compose-lite.yml,只起视频合成一个服务。
客户端安装没啥难度
服务端起来后,从项目 Releases 页面下载安装包:Windows 双击Duix.Avatar-x.x.x-setup.exe一路默认装完;Ubuntu 22.04 双击 AppImage 直接就能跑,无需安装。注意:安装路径保持默认即可;Ubuntu 桌面环境如果用 root 用户,需要在命令行里启动:
./Duix.Avatar-x.x.x.AppImage --no-sandbox验证有没有起来
最后一步,确认服务端真的就绪了:
docker ps看到duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务都是 Running 状态,说明服务端全通了。然后打开客户端,用一段十秒的正面人像视频建一个测试形象,再喂一句话生成测试视频,能正常播放,这次数字人本地部署教程的流程就算全部走完了。
图1:Docker 容器状态与日志页,某个服务异常时点进去看日志
🎬 三大引擎,各干各的事
可以把三个服务的分工理解成一条流水线:你丢进去一段视频,它给你吐出一个能说话的人,就这么简单。
视觉克隆:输入一段10秒正面视频,输出一个可驱动的数字人形象。素材质量直接决定效果上限——人脸尽量正对镜头、光线均匀充足,大侧脸基本没法用。
声音克隆:从素材视频里提取人声(必须有人在说话,静音视频不行),得到一个可反复调用的音色。环境噪音是隐形杀手,安静环境录制的干声,克隆效果会明显更好。
文本驱动合成:输入一段文字,输出一条带口型、带表情的口播视频。参数调整入口主要在这一步:停顿靠逗号和句号自动生成,语速上教育类内容调到120~150字/分钟比较稳。AI口播视频生成全程由这三个服务在本地完成,你的机器全程不用联网。
图2:Duix.Avatar 主界面,"My Avatars"区域展示克隆出来的数字人形象
🎯 三个场景,照着做就行
这三个是社区里用得最多的落地场景,操作路径都一样,差别只在素材录制和参数选择。
教育——给课程配个虚拟讲师
- 录一段10~15秒的教师正面视频,背景简洁、光线均匀,表情自然
- 分辨率不低于720p,MP4格式,视频里必须包含老师讲话的声音
- 面部细节精度选"高",声音采样率保持44.1kHz
- 课程正文用文本驱动模式生成,语速调到120~150字/分钟
企业——做一个数字代言人
- 选代言人职业形象素材,正面和45度角各备一份视频
- 安静环境录制人声,正式、亲切等不同语气的片段都留一些
- 统一品牌色调和Logo位置,保存为可复用的项目模板
- 企业介绍、产品宣传、活动通知批量套用同一形象生成
自媒体——批量产出口播视频
- 一个形象+一个音色足够用,不必每条视频重新克隆
- 文案按段落写,用标点控制停顿节奏
- 输出1080p,横竖屏平台都够用
- 同一天排着队生成多条脚本,只改文字就行
踩坑急救包(Q&A)
先看现象,再猜最可能的原因,最后才动手敲命令——顺序反了会白忙。
服务起不来怎么办
现象:docker-compose up -d跑完,容器不是 Up 状态,或者拉镜像直接报错。
最可能的原因:十有八九是 Docker Hub 官方源连接不稳定,镜像拉不下来;其次是英伟达显卡驱动没装或版本太旧。
操作:先看日志定位:
docker logs -f duix-avatar-gen-video超时类报错就进 Docker Desktop → Settings → Docker Engine,在registry-mirrors字段里加几个国内镜像源(图中红框位置),Apply 后重试;GPU 相关报错先nvidia-smi确认驱动是否正常。
图3:Docker Engine 设置里配置 registry-mirrors 镜像源
训练卡在某个百分比不动了
现象:克隆形象的进度条停在某个百分比,长时间不走。
最可能的原因:ASR 服务启动比较慢,三个服务刚拉起就立刻操作,会报 Connection refused;其次是素材视频本身没声音。
操作:等服务全部 Running 后等几分钟再动手;确认素材是人在说话、光线充足、分辨率不低于720p,不达标就重录。
合成视频特别慢或卡
现象:视频生成进度走得极慢,客户端画面发卡。
最可能的原因:内存不够(16G 机器会明显吃力),或者同时排了多个任务把显存和CPU都挤满了。
操作:关掉其他吃资源的程序,保证数据盘有 30G 以上空闲,多条合成排着队一条条出。合成服务是单卡跑的,排队就是正确姿势。
另外养成两个习惯:向社区反馈问题时,点开 Docker 容器列表里的服务,找到关键错误行直接复制日志;日常维护上,每周清一次d:/duix_avatar_data下的缓存数据,每月回deploy/目录重新跑一遍docker-compose up -d把镜像更新掉,能挡掉大部分坑。
图4:容器日志页,红框处是关键报错位置,反馈问题时直接复制
去哪找资源
- 服务端部署配置:deploy/
- 常见问题与自查步骤:doc/常见问题.md
- 服务端API实现参考(想调接口看这里):src/main/service/
- 客户端源码:src/renderer/
- 许可协议:LICENSE
到这里,硬件核对、四步部署、三引擎分工、场景参数、常见坑位就都过了一遍。打开终端,敲下第一条wsl --update,今晚就能看到你的数字人开口说话。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考