Duix-Avatar:用10秒视频克隆你的数字人,开源AI数字人本地部署全流程
2026/9/20 22:31:54 网站建设 项目流程

Duix-Avatar:用10秒视频克隆你的数字人,开源AI数字人本地部署全流程

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

想给自己做一条口播视频,常规路线大概是这样的:把素材传到某个云平台,按次或按月付费,等它渲染。视频必须离开你的机器,用得多花得多,还总担心素材泄露。

Duix-Avatar 走的是另一条路:把数字人克隆、声音克隆、口播视频生成这套 AI 能力,全部装进你自己的电脑里。你只需要录一段 10 秒左右的讲话视频,它就能克隆你的形象和声音;之后输入一段文字,就能产出一条"用你的声音、你的嘴型"说话的视频,全程不联网。👇

这篇文章带你从零把它部署起来,并跑通第一个视频。

项目速写:Duix-Avatar 到底是什么

一句话:Duix-Avatar 是一款可本地部署、全离线运行的开源 AI 数字人工具包

  • 10 秒视频完成克隆:上传一段你本人出镜、对着镜头说话的视频,同时完成形象克隆和声音克隆,生成你的专属数字人模型
  • 全本地、不联网:所有推理都在你机器上跑(依赖 NVIDIA 显卡),素材不出内网,隐私可控
  • 开箱即用 + 开放 API:提供图形客户端,也暴露本地端口接口,方便接入自己的业务系统

适合谁:想批量产出口播内容但不想依赖云服务的自媒体人、做培训/宣讲内容的企业、以及想基于数字人做二次开发的开发者。

主界面很直白:上方两个入口——Create Video(用文字驱动数字人说话)和 Create Avatar(上传视频克隆数字人);下方 My Works 是生成的视频列表,My Avatars 是你克隆出来的模型库。

部署前清单:先花 3 分钟确认环境

部署前把下面这份清单过一遍,能省掉后面 90% 的坑 ✅

  • 系统:Windows 10 19042.1526 及以上,或 Ubuntu 22.04 Desktop
  • 显卡:NVIDIA 独显,且驱动已正确安装(本项目所有算力都在本地,没有 N 卡跑不起来)
  • 内存:32GB 及以上(官方推荐配置,16G 内存可能起不来服务)
  • 磁盘:D 盘(或任意数据盘)空闲 30GB+,用于存数字人和作品
  • 镜像空间:至少 100GB 空闲给 Docker 镜像
  • 工具:Docker(Windows 需 WSL 支持),客户端源码二次开发还需 Node.js 18
  • 网络:预留约 70GB 的镜像下载流量,建议连 Wi-Fi

如果 C 盘空间不够 100GB,Windows 上可以在 Docker Desktop 的 Settings → Resources → Advanced 里,把 Disk image location 指到别的磁盘,再 Apply & restart。

Windows 部署:一键拉起完整服务

第 1 步:装好 WSL 和 Docker

这步是打地基:Docker Desktop 在 Windows 上依赖 WSL 运行。

先看看 WSL 装没装:

wsl --list --verbose

没装就执行wsl --install(安装中会设置用户名密码,记一下),装完再执行wsl --update更新一次。然后到 Docker 官网下载 Windows 版 Docker Desktop 安装包,按 CPU 架构选对应版本,装完首次启动接受协议、跳过登录即可。

第 2 步:克隆仓库并启动服务端

这步是核心:三条命令,把三个 AI 服务全部拉起来。

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d

三个服务各司其职:ASR(语音识别)、TTS(声音克隆合成)、gen-video(数字人视频合成)。首次拉镜像约 70GB,耐心等待半小时左右。

拉完后,Docker 容器列表里看到Duix.Avatar-asr、Duix.Avatar-tts、Duix.Avatar-gen-video 三个服务都是 Running,服务端就算成功了。

💡 如果你的机器只想做视频合成、不需要克隆功能,可以换成轻量版,只起一个服务:

docker-compose -f docker-compose-lite.yml up -d

第 3 步:安装客户端

到项目的 Release 页面下载官方构建的 Windows 安装包(Duix.Avatar-x.x.x-setup.exe),双击安装,启动后自动连接本地服务。

Ubuntu 22.04 部署:Linux 版流程

Ubuntu 路线多两个前置:装 Docker 和让 Docker 能调用 N 卡。

第 1 步:装 Docker

先用docker --version检查,没有的话:

sudo apt update sudo apt install docker.io sudo apt install docker-compose

第 2 步:让 Docker 用上 NVIDIA 显卡

先按官方流程装好显卡驱动,执行nvidia-smi能看到显卡信息即成功。接着安装 NVIDIA Container Toolkit(先添加 NVIDIA 包仓库,再执行安装),最后两步:

sudo nvidia-ctk runtime configure --runtime=docker sudo systemctl restart docker

第 3 步:启动服务端并运行客户端

cd /deploy docker-compose -f docker-compose-linux.yml up -d

客户端下载 Release 页的 Linux 版 AppImage,双击即可运行;root 用户桌面下直接双击起不来的话,终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox

🔧 如果你是 NVIDIA 50 系显卡(如 5090),30/40 系用 CUDA 12.8 的也可以,服务端请改用专用编排文件:

docker-compose -f docker-compose-5090.yml up -d

跑通后的第一眼:怎么判断成功了

部署成功的样子非常具体,你对着核对一遍就行:

  1. Docker 里三个容器状态都是 Running(lite 版则只有一个 gen-video 服务)
  2. 打开客户端,走一遍完整流程:点Create Avatar,上传你那段 10 秒视频,等模型训练完,My Avatars 里多出一个你的数字人
  3. Create Video,选中刚建好的模型,输入一段文案,生成完成后 My Works 里出现一条视频——点开播放,画面里的"你"在用它克隆的声音口播你写的文字

看到这条视频能正常播放,恭喜,全套链路(声音克隆 → 语音合成 → 口型驱动 → 视频合成)已经全部跑通了 🎉

玩法进阶:API、多语言与二次开发

跑通基础流程后,还有几个值得知道的入口,点到为止:

  • 开放 API:服务启动后会在本地暴露端口——模型训练http://127.0.0.1:18180/v1/preprocess_and_tran、音频合成http://127.0.0.1:18180/v1/invoke、视频合成http://127.0.0.1:8383/easy/submit加进度查询/easy/query。三步串起来就是一个可编程的数字人流水线,现成的调用示例可以参考客户端的 src/main/service/
  • 多语言脚本:口播文案支持英、日、韩、中、法、德、阿拉伯、西八种语言
  • 多模型管理:支持克隆多个数字人(不同学科的老师、不同风格的主播),在 My Avatars 里统一管理,按场景切换
  • 客户端源码可改:客户端是基于 Electron + Vue 的桌面应用,源码就在 src/ 下,想换皮、加功能都可以从npm run dev起步

避坑手册:三个高频报错的解法

坑一:docker-compose up -d 拉镜像失败,提示 request canceled / context canceled

现象:三个服务全部 Error,日志里是Get "https://registry-1.docker.io/v2/": net/http: request canceled...,本质是 Docker Hub 官方源连不上。

解法:给 Docker 配一个可用的镜像加速源。Windows 上在 Docker Desktop 的 Settings → Docker Engine 的 JSON 里加registry-mirrors字段:

Ubuntu 上则改/etc/docker/daemon.json,同样加registry-mirrors,保存后sudo systemctl restart docker。镜像源会失效更替,配之前搜一下当前可用的地址。

坑二:新增模特失败,服务端日志报 "file not exists"

现象:上传视频创建数字人时失败,TTS 容器日志里反复出现File not exists

解法:先点开对应容器的 Logs 标签页确认报错位置:

最常见的原因其实不在文件,而在你的素材:用于克隆的视频必须带声音,且是人在正常说话——程序要从中提取人声做声音克隆,静音视频或纯 BGM 视频都会失败。换一段你对着镜头讲话的 10 秒视频重试即可。

坑三:定制模特报 Connection refused

现象:刚部署完就急着克隆形象,TTS 日志里出现建立funasr连接异常:Connection refused

解法:这是 ASR 服务启动比其它服务慢导致的,服务端全部 Running 后等几分钟再操作克隆。另外若内存只有 16G,ASR 服务可能根本起不来,建议按 32G 配置准备机器。

🔍 排查任何问题时,两份日志是标配:客户端日志通过右上角设置菜单的 Open Log 打开:

对应的main.log文件就在系统用户目录的 logs 文件夹里;服务端日志则直接看三个容器的 Logs 标签页。更多问题可以参考项目内的 常见问题文档。

落地思路:三个真实场景

  • 个人 IP / 自媒体口播:录一次 10 秒视频,之后每期内容只改文案。批量出稿时数字人永远在线,你只需要写字;全本地处理也意味着选题素材、未发布内容都不必上传给任何第三方
  • 企业内训与课程制作:给培训讲师克隆一个数字人,课程讲稿换成文本就能重制视频,课件更新后重新生成一版即可,省去反复进录影棚的成本
  • 业务系统集成:如果数字人要嵌进你自己的产品(比如智能客服的话术播报、内部系统播报),用开放 API 串起"文本 → 克隆语音 → 口播视频"三步,把结果回传给业务系统

结语

Duix-Avatar 把过去要买服务、要上云的数字人能力,变成了一套跑在自己电脑上的开源工具——隐私、成本、可控性,一次说清楚。

下一步很简单:对照"部署前清单"准备好一台带 N 卡的机器,然后从docker-compose up -d开始,今天就能拥有第一条你自己克隆的口播视频。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询