如何 30 分钟本地部署 Duix-Avatar:离线 AI 数字人完整教程
2026/9/11 9:58:27 网站建设 项目流程

如何 30 分钟本地部署 Duix-Avatar:离线 AI 数字人完整教程

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

录一段 10 秒的说话视频,放到自己的电脑上,Duix-Avatar 就能把这个人的形象和声音克隆下来,之后输入文字,直接产出这个人开口说话的数字人视频。它是一套开源的 AI 数字人工具包,模型训练、语音合成、视频渲染全部跑在你自己的显卡上,全程不需要联网,素材也不出机器。

部署 Duix-Avatar 能做什么(快速认识)

Duix-Avatar 是一个完全离线的视频合成工具,官方在 Windows 10 19042.1526 以上和 Ubuntu 22.04 上做了完整适配。定位很直接:克隆真人形象与声音,再用文字或音频驱动这个分身生成视频。它适合三类人——做内容的个人创作者、有内训需求的企业、想接本地接口的开发者。

它解决的是商用方案的硬伤:视频必须先传到云服务器,隐私风险一直悬在头顶。这个项目把全部算力放进了本地 Docker 容器,断网也能跑。按官方口径,传统 3D 数字人制作成本是几十万美元级别,用 AI 克隆的路线能降到 1000 美元左右,门槛差了两个数量级。

客户端界面就两个主按钮:"Create Avatar" 用视频训练数字人模型,"Create Video" 用文字生成视频。下方 My Avatars 和 My Works 两个列表,分别管理已训练的模型和产出的作品。

本地部署前的硬件检查清单

门槛不高,但有几项硬指标必须满足:

部件推荐配置硬性说明
CPU13 代 Intel i5-13400F无明确下限,x86_64 即可
内存32GB16GB 可能带不动 ASR 服务
显卡NVIDIA RTX 4070必须是 NVIDIA 卡且装好驱动
硬盘D 盘 ≥30GB,C 盘 ≥100GBC 盘存镜像,D 盘存数字人数据

前置条件一张短清单:

  • 系统为 Windows 10 19042.1526 及以上,或 Ubuntu 22.04
  • NVIDIA 驱动已安装,nvidia-smi能显示显卡信息
  • Docker 已装好(Windows 走 WSL 2 后端)
  • 磁盘剩余空间达到上表要求

30 分钟跑通第一个数字人服务

环境自检:验证 WSL 与显卡驱动

终端依次执行下面两条命令。WSL 没装或版本旧,先执行wsl --update更新;nvidia-smi能打印显卡型号,驱动侧就齐了。

wsl --list --verbose nvidia-smi

C 盘空间不够 100GB 时,在 Docker Desktop 的 Settings → Resources → Advanced 里,把 Disk image location 挪到空间更充裕的磁盘。

拉取镜像并启动三个 Docker 服务

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d

💡 首次启动要拉取约 70GB 镜像,官方口径约半小时,网络必须稳定。compose 文件把D:\duix_avatar_data挂进容器当数据目录,建议提前在 D 盘建好;只想要视频生成能力的话,改用docker-compose -f docker-compose-lite.yml up -d启动轻量版,只有一个服务。

验证服务状态并查看日志

docker-compose ps docker logs -f duix-avatar-tts

duix-avatar-ttsduix-avatar-asrduix-avatar-gen-video三个服务全部 Running,部署就完成了;轻量版只需要duix-avatar-gen-video一个服务 Running。之后从官方发布页安装客户端,打开检测到本地服务在线,就可以开始建模型。

拆解两个核心点位:10 秒素材如何变成数字人

短音频克隆出自己的音色

客户端里看到的现象:上传视频后,系统自动拆出静音视频和音频,音频直接用于声音克隆,日志里大约 10.5 秒的录音也能正常走通。

背后流程一句话:音频先降噪、WAV 格式化、清理,再由 fun-asr 语音识别服务(10095 端口)转写出文本,fish-speech 合成服务拿"音频+文本"做参考去合成新语音。量化一下:TTS 服务监听本地 18180 端口,接口里 topP 与 temperature 固定 0.7,max_new_tokens 给到 1024,一次请求能合成一整段话。

形象驱动的口型同步视频合成

现象:模型训好后输入文字,生成的视频里嘴型自动对上音频,不需要逐帧调。

原理一句话:视频合成服务接收音频+视频两个输入,从 8383 端口的/easy/submit接口吐出对口型视频,客户端的调用逻辑可以直接看 src/main/service/video.js。compose 配置里给容器分了 8g 共享内存(shm_size),并用max_split_size_mb:512压制显存碎片。脚本支持中、英、日、韩、法、德、阿、西共 8 种语言。

两个马上能落地的应用场景

个人 IP 短视频批量产出。先在 My Avatars 里建 2~3 个不同场景的模特(列表支持按名字搜索),再自己封一个批处理脚本,循环调用http://127.0.0.1:8383/easy/submit,把合成好的音频和模特视频分别传进audio_urlvideo_url。关键参数:watermark_switch设 0 关掉水印;做多语言版本时,脚本文本直接在 8 种支持语言里切换。

断网企业的内部培训数字人。整条链路跑在本地回环地址上:tts 占 18180、asr 占 10095、gen-video 占 8383,全是内网可达的本地端口,机房可以完全断外网。素材和模型文件统一落在挂载的D:\duix_avatar_data下,不出内网,适合合规培训、内部宣讲这类场景。

高频问题避坑自检清单

⚠️ 排查前先看两件事:三个服务是否都 Running,nvidia-smi是否能看到卡。这两条不满足,后面都不用看。

  • 拉镜像失败,request canceled:官方源不稳。在 Docker Engine 的registry-mirrors里配镜像加速器,或开全局模式。

  • 新增模特报 "file not exists":视频里必须有人声且在说话,程序要靠这段声音做声音克隆,纯静音素材必挂。
  • 定制模特 Connection refused:ASR 服务启动慢,服务端拉起来后等几分钟再操作;内存只有 16GB 时可能直接起不来。
  • 三个服务全部起不来:NVIDIA 显卡或驱动没装。本项目算力全在本地,没有替代方案。
  • 端口被占用:改 deploy 目录 里docker-compose.yml的端口映射,比如 8383 改成 8384。

Duix-Avatar 把过去要花几十万美元的数字人制作流程,压缩成了一台机器加一条 Docker 命令,隐私和成本问题一起落地。现在就录一段 10 秒说话视频,把第一个模型跑出来吧。项目后续会往实时交互和更多平台方向迭代,跟进版本更新即可。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询