Duix.Avatar 本地部署教程:用 10 秒视频克隆数字人,30 分钟生成口播视频
2026/9/11 4:15:33 网站建设 项目流程

Duix.Avatar 本地部署教程:用 10 秒视频克隆数字人,30 分钟生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款可本地部署、完全开源的 AI 数字人工具,由硅基智能(Duix.com)发布。它把"克隆外貌 + 克隆声音 + 生成口播视频"整合进一条离线流水线:上传一段约 10 秒的说话视频,即可训练出可驱动的数字人形象;之后再输入文字或直接传音频,就能在本地 NVIDIA 显卡上合成口型匹配的口播视频,全程无需联网。它适合三类人:想批量产出口播内容却不想出镜的自媒体创作者、需要标准化讲师形象的教育机构,以及希望把数字人接入自有系统的开发者。因为数据不出本机、也没有订阅费,它对注重隐私与成本的用户比较友好。

部署前准备:先核对硬件与磁盘

在装任何东西之前,先把硬件门槛和磁盘空间核一遍,能省下后面反复排错的功夫。

核对系统、显卡与内存

  • 系统:Windows 10(19042.1526 及以上)或 Ubuntu 22.04(内核 6.8.0-52-generic 已验证)。
  • 显卡:NVIDIA 显卡且驱动必须装对;RTX 30/40 系列验证通过,50 系列需用专用镜像。
  • 内存:32GB 及以上是硬要求,16GB 的机器往往连 ASR 服务都起不来。
  • 参考配置:13 代 i5-13400F,显卡 rtx-4070。

验证 NVIDIA 驱动是否就绪

本项目所有算力都跑在本地,没有 NVIDIA 显卡或驱动,三个服务根本起不来。在终端执行nvidia-smi,能看到显卡型号与驱动版本才算通过。

规划磁盘空间

Windows 下 C 盘存服务镜像,留 100GB 以上空余;D 盘存数字人、音频与作品数据,留 30GB 以上。C 盘不够时,装好 Docker 后打开 Docker Desktop 的 Resources → Advanced,把 Disk image location 改到空间更大的磁盘,再点 Apply & restart。

服务端离线拉起:一条命令启动三个服务

服务端由 Docker 拉起,三个镜像分别负责语音合成、语音识别和视频生成。

Windows 下先装好 Docker 与 WSL

  1. 打开 PowerShell,执行wsl --list --verbose查看是否已装 WSL,未装则执行wsl --install,过程中设置的登录用户名和密码要记牢。
  2. 执行wsl --update把 WSL 更新到最新版。
  3. 从 Docker 官网下载 Windows 版 Docker Desktop 并安装,首次启动接受协议、跳过登录即可。

一条命令启动服务

克隆仓库进入 deploy/ 目录执行docker-compose up -d,Docker 会拉取并启动三个镜像,耗时约半小时、下载量约 70GB,建议连 Wi-Fi。只想跑视频生成单服务时,用 lite 版:docker-compose -f docker-compose-lite.yml up -d

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d

Ubuntu 22.04 的额外准备

先用docker --version检查是否已装 Docker,没装则执行sudo apt update && sudo apt install docker.io docker-compose。装好 NVIDIA 驱动(nvidia-smi验证)后,再安装 NVIDIA Container Toolkit:添加 NVIDIA 包仓库,sudo apt-get install -y nvidia-container-toolkitsudo nvidia-ctk runtime configure --runtime=dockersudo systemctl restart docker。最后在 deploy 目录执行docker-compose -f docker-compose-linux.yml up -d;50 系列显卡(或 30/40 系 CUDA12.8 用户)改用docker-compose -f docker-compose-5090.yml up -d

安装桌面客户端

Windows 客户端

从项目发布页下载对应安装包,双击Duix.Avatar-x.x.x-setup.exe完成安装即可使用。

Linux 客户端

下载 Linux 版Duix.Avatar-x.x.x.AppImage,双击直接启动、无需安装;root 用户进桌面时双击可能失效,改在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox启动。

克隆素材拍摄要点

克隆质量取决于原始视频,拍之前先把素材标准定好,比事后返工省事。

时长与说话内容

  • 时长 10~20 秒:太短提取不到足够特征,太长徒增处理时间。
  • 必须是真人对着镜头说话,且视频里要有清晰人声——系统靠这段声音做声音克隆。
  • 无声或时长不足的素材,会直接导致创建失败。

光线、角度与声音

面部光线均匀、避免阴影与逆光;尽量正面拍摄,避免侧脸或遮挡;背景简洁、口齿清晰,便于识别面部特征与还原音色。

创建数字人并生成口播视频

服务端与客户端都就绪后,整条链路在客户端界面里完成。

上传视频,克隆形象与声音

  1. 打开客户端,点击首页的 Create Avatar。
  2. 选择准备好的视频上传,系统自动提取面部特征与声音特征,训练出数字人模型,几分钟完成,耗时随硬件浮动。
  3. 完成后在 My Avatars 列表里能看到新模型。

输入文案,生成口播视频

  1. 在 My Avatars 里选中刚创建的模型。
  2. 进入 Create Video,输入要说的文案,或直接上传一段音频文件。
  3. 点击生成,本地 GPU 合成口型匹配的视频,几分钟后可在 My Works 列表查看与下载。

多模型与多语言

客户端支持导入并管理多个模型,可按需切换;脚本支持 8 种语言——中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语。

常见问题排查

大多数问题出在拉镜像和音频环节,先自查再动手。

镜像拉取失败:配置加速源

docker-compose up -d卡在拉镜像、报registry-1.docker.io连接超时,多因 Docker Hub 官方源不稳定。打开 Docker Desktop 的 Docker Engine,在 JSON 里加入registry-mirrors后 Apply & restart;Ubuntu 则编辑/etc/docker/daemon.json写入同样字段再重启 Docker。

克隆报 Connection refused

新增模特报Connection refused(fun asr 连接被拒),通常是 ASR 服务启动较慢,服务端起来后等几分钟再做克隆;内存只有 16GB 的机器可能根本起不来该服务。创建失败若提示需要声音,先检查素材里是否有人在说话。

用日志定位错误

视频生成卡住或报错时,客户端点右上角 Open Log 查看本地日志;服务端则打开对应 Docker 容器的 Logs 页,按报错关键词(如 file not exists、Connection refused)定位到音频路径或服务异常。

本地 API 与工程结构

对需要把数字人接进自有系统的开发者,Docker 启动后在本地暴露了三个端口,通过http://127.0.0.1即可调用。

三个开放端口

  • 语音合成 TTS:18180(映射容器 8080)。
  • 语音识别 ASR:10095
  • 视频合成:8383

从训练到合成的调用链

模特训练调用POST /v1/preprocess_and_tran(18180),先把视频拆成静音视频加音频,音频放入约定目录,返回asr_format_audio_urlreference_audio_text;音频合成调用POST /v1/invoke(18180),传入文本与上一步返回的参考音频字段生成 wav;视频合成调用POST /easy/submit(8383)提交,再用GET /easy/query?code=…查进度。完整参数见 src/main/service/model.js 以及同目录的 voice.js、video.js;更多问题见 常见问题。

作为持续迭代的开源项目,社区更新较频繁,遇到问题先升级到最新版服务端与客户端,多数问题新版已修复,商用授权与边界以LICENSE为准。先按上文核对硬件、装好 Docker 并配置好加速源,再拿一段 10 秒视频跑一次克隆,即可验证整条本地链路是否打通。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询