如何 30 分钟本地部署 Duix-Avatar:离线 AI 数字人完整教程
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
录一段 10 秒的说话视频,放到自己的电脑上,Duix-Avatar 就能把这个人的形象和声音克隆下来,之后输入文字,直接产出这个人开口说话的数字人视频。它是一套开源的 AI 数字人工具包,模型训练、语音合成、视频渲染全部跑在你自己的显卡上,全程不需要联网,素材也不出机器。
部署 Duix-Avatar 能做什么(快速认识)
Duix-Avatar 是一个完全离线的视频合成工具,官方在 Windows 10 19042.1526 以上和 Ubuntu 22.04 上做了完整适配。定位很直接:克隆真人形象与声音,再用文字或音频驱动这个分身生成视频。它适合三类人——做内容的个人创作者、有内训需求的企业、想接本地接口的开发者。
它解决的是商用方案的硬伤:视频必须先传到云服务器,隐私风险一直悬在头顶。这个项目把全部算力放进了本地 Docker 容器,断网也能跑。按官方口径,传统 3D 数字人制作成本是几十万美元级别,用 AI 克隆的路线能降到 1000 美元左右,门槛差了两个数量级。
客户端界面就两个主按钮:"Create Avatar" 用视频训练数字人模型,"Create Video" 用文字生成视频。下方 My Avatars 和 My Works 两个列表,分别管理已训练的模型和产出的作品。
本地部署前的硬件检查清单
门槛不高,但有几项硬指标必须满足:
| 部件 | 推荐配置 | 硬性说明 |
|---|---|---|
| CPU | 13 代 Intel i5-13400F | 无明确下限,x86_64 即可 |
| 内存 | 32GB | 16GB 可能带不动 ASR 服务 |
| 显卡 | NVIDIA RTX 4070 | 必须是 NVIDIA 卡且装好驱动 |
| 硬盘 | D 盘 ≥30GB,C 盘 ≥100GB | C 盘存镜像,D 盘存数字人数据 |
前置条件一张短清单:
- 系统为 Windows 10 19042.1526 及以上,或 Ubuntu 22.04
- NVIDIA 驱动已安装,
nvidia-smi能显示显卡信息 - Docker 已装好(Windows 走 WSL 2 后端)
- 磁盘剩余空间达到上表要求
30 分钟跑通第一个数字人服务
环境自检:验证 WSL 与显卡驱动
终端依次执行下面两条命令。WSL 没装或版本旧,先执行wsl --update更新;nvidia-smi能打印显卡型号,驱动侧就齐了。
wsl --list --verbose nvidia-smiC 盘空间不够 100GB 时,在 Docker Desktop 的 Settings → Resources → Advanced 里,把 Disk image location 挪到空间更充裕的磁盘。
拉取镜像并启动三个 Docker 服务
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d💡 首次启动要拉取约 70GB 镜像,官方口径约半小时,网络必须稳定。compose 文件把D:\duix_avatar_data挂进容器当数据目录,建议提前在 D 盘建好;只想要视频生成能力的话,改用docker-compose -f docker-compose-lite.yml up -d启动轻量版,只有一个服务。
验证服务状态并查看日志
docker-compose ps docker logs -f duix-avatar-ttsduix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video三个服务全部 Running,部署就完成了;轻量版只需要duix-avatar-gen-video一个服务 Running。之后从官方发布页安装客户端,打开检测到本地服务在线,就可以开始建模型。
拆解两个核心点位:10 秒素材如何变成数字人
短音频克隆出自己的音色
客户端里看到的现象:上传视频后,系统自动拆出静音视频和音频,音频直接用于声音克隆,日志里大约 10.5 秒的录音也能正常走通。
背后流程一句话:音频先降噪、WAV 格式化、清理,再由 fun-asr 语音识别服务(10095 端口)转写出文本,fish-speech 合成服务拿"音频+文本"做参考去合成新语音。量化一下:TTS 服务监听本地 18180 端口,接口里 topP 与 temperature 固定 0.7,max_new_tokens 给到 1024,一次请求能合成一整段话。
形象驱动的口型同步视频合成
现象:模型训好后输入文字,生成的视频里嘴型自动对上音频,不需要逐帧调。
原理一句话:视频合成服务接收音频+视频两个输入,从 8383 端口的/easy/submit接口吐出对口型视频,客户端的调用逻辑可以直接看 src/main/service/video.js。compose 配置里给容器分了 8g 共享内存(shm_size),并用max_split_size_mb:512压制显存碎片。脚本支持中、英、日、韩、法、德、阿、西共 8 种语言。
两个马上能落地的应用场景
个人 IP 短视频批量产出。先在 My Avatars 里建 2~3 个不同场景的模特(列表支持按名字搜索),再自己封一个批处理脚本,循环调用http://127.0.0.1:8383/easy/submit,把合成好的音频和模特视频分别传进audio_url和video_url。关键参数:watermark_switch设 0 关掉水印;做多语言版本时,脚本文本直接在 8 种支持语言里切换。
断网企业的内部培训数字人。整条链路跑在本地回环地址上:tts 占 18180、asr 占 10095、gen-video 占 8383,全是内网可达的本地端口,机房可以完全断外网。素材和模型文件统一落在挂载的D:\duix_avatar_data下,不出内网,适合合规培训、内部宣讲这类场景。
高频问题避坑自检清单
⚠️ 排查前先看两件事:三个服务是否都 Running,nvidia-smi是否能看到卡。这两条不满足,后面都不用看。
- 拉镜像失败,request canceled:官方源不稳。在 Docker Engine 的
registry-mirrors里配镜像加速器,或开全局模式。
- 新增模特报 "file not exists":视频里必须有人声且在说话,程序要靠这段声音做声音克隆,纯静音素材必挂。
- 定制模特 Connection refused:ASR 服务启动慢,服务端拉起来后等几分钟再操作;内存只有 16GB 时可能直接起不来。
- 三个服务全部起不来:NVIDIA 显卡或驱动没装。本项目算力全在本地,没有替代方案。
- 端口被占用:改 deploy 目录 里
docker-compose.yml的端口映射,比如 8383 改成 8384。
Duix-Avatar 把过去要花几十万美元的数字人制作流程,压缩成了一台机器加一条 Docker 命令,隐私和成本问题一起落地。现在就录一段 10 秒说话视频,把第一个模型跑出来吧。项目后续会往实时交互和更多平台方向迭代,跟进版本更新即可。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考