Duix.Avatar:全离线开源数字人克隆与视频生成工具
2026/9/11 7:18:28 网站建设 项目流程

Duix.Avatar:全离线开源数字人克隆与视频生成工具

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一款支持本地部署与 API 调用的开源数字人视频生成工具:提交一段 10 秒左右的视频即可完成外貌与声音克隆,再输入文本或音频驱动口型,自动生成口播视频。所有推理在本地英伟达显卡上完成,全程无需联网。

它是什么

Duix.Avatar 是一个由「桌面客户端 + Docker 本地推理服务」组成的离线数字人工具集:客户端负责素材上传、任务下发与成片预览,服务端在 GPU 上运行语音识别、语音合成、视频合成三类能力。它适合希望不采购 SaaS 服务就能产出口播视频的创作者、讲师与小型团队,也适合想把数字人能力嵌入自有系统的开发者。需要明确的边界是:它做的是非实时视频合成,即离线批量产出成片,而非实时对话交互;也不涉及 3D 建模与 3D 数字人资产制作。

工作原理

克隆模型时,提交的视频先被拆分为无声视频轨与音频轨。音频经 ASR 服务转写成文本,作为 TTS 服务的音色参照,与视频画面共同构成「形象 + 声音」的数字人模型。生成视频时,输入的文本或上传的音频先由 TTS 服务转成语音。视频合成服务再基于模型形象逐帧生成口型画面,与音频合成后输出成片。三个服务以独立容器运行,分别监听 18180、10095、8383 本地端口,客户端通过 127.0.0.1 与之通信,数据全程不出本机。

首次运行流程

硬件基线:Windows 10 19042.1526 及以上或 Ubuntu 22.04 Desktop,已安装驱动的英伟达显卡,32G 及以上内存,D 盘 30G 以上空闲(存数据),C 盘 100G 以上空闲(存镜像,安装 Docker 后也可改到别的磁盘)。

  1. 安装 Docker 环境。Windows 下先安装并更新 WSL,再安装 Docker Desktop 并在首次运行时接受协议;Ubuntu 下安装 Docker 与 docker-compose,同时装好 NVIDIA Container Toolkit 以启用 nvidia 运行时。预期现象:Docker Desktop 正常启动并显示 Engine running。
  2. 启动服务端。从 https://gitcode.com/GitHub_Trending/he/Duix-Avatar 获取项目代码,在 deploy 目录执行docker-compose up -d。预期现象:首次拉取镜像约需半小时,消耗 70G 左右流量。
  3. 验证服务状态。打开 Docker 容器列表查看。预期现象:duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个服务均为 Running(lite 版本只有一个)。
  4. 安装客户端。从官方 Releases 下载对应构建版本,Windows 双击 .exe 安装,Linux 双击 AppImage 启动(root 用户需追加 --no-sandbox 参数)。预期现象:主界面出现「Create Video」与「Create Avatar」两个入口,克隆功能可正常发起。

完成任务

克隆数字人模型

  • 目标:得到一个带特定人物形象与声音的可复用数字人。
  • 操作:点击 Create Avatar,上传一段人物清晰说话的 10 秒左右视频;视频必须带人声,它是声音克隆的素材。
  • 结果:训练完成后模型出现在「My Avatars」列表,同时保存形象与声音克隆数据。

文本生成口播视频

  • 目标:把一篇文稿变成数字人念稿视频。
  • 操作:选中目标模型,输入文稿;脚本支持中、英、日、韩、法、德、阿拉伯、西八种语言。
  • 结果:本地 TTS 先合成语音,视频服务再生成口型同步的成片,作品存入「My Works」,全程离线完成。

API 接入自有系统

  • 目标:开发者把数字人能力集成进自己的产品,不依赖桌面客户端。
  • 操作:直接调用本地接口,127.0.0.1:18180 负责音频预处理与语音合成,127.0.0.1:8383 提交视频合成任务并查询进度,请求参数可参考服务源码。
  • 结果:同一套 GPU 服务可被任意上层应用驱动,适合批量生产或业务嵌入场景。

进阶设置

部署方案选择

  • 完整版(默认 docker-compose.yml):三个服务,ASR、TTS、视频合成能力齐全。
  • lite 版(docker-compose-lite.yml):仅部署 Duix.Avatar-gen-video 一个服务,适合已有语音能力、只做视频合成的场景。
  • 英伟达 50 系列显卡:改用 docker-compose-5090.yml 启动,基于 PyTorch 官方预览版;30、40 系列使用 CUDA 12.8 的用户也可采用该方案。

数据目录与挂载

音频默认放在 D:\duix_avatar_data\voice\data,视频合成数据在 D:\duix_avatar_data\face2face,二者均是与容器约定的挂载路径;磁盘布局不同时,可在 deploy/ 下的 docker-compose 文件中修改卷挂载。

语言

客户端界面支持中英文切换,口播脚本支持上述八种语言。

性能与资源要点

  • 32G 内存是硬性要求,16G 机器可能无法把所有服务拉起;
  • 镜像总体积较大,首次拉取约 70G 流量,建议稳定网络环境;
  • 全部服务依赖 GPU 算力,可在 compose 文件中用 NVIDIA_VISIBLE_DEVICES 环境变量指定使用哪块卡。

排错手册

排查前建议先保留两类日志:客户端菜单「Open Log」入口(日志文件 main.log 位于用户 Roaming 目录下 logs 子目录),以及各 Docker 容器的日志页。

  1. compose 启动超时报错。症状:request canceled 或 context canceled。最可能原因:Docker Hub 官方源连接不稳定。处理:在 Docker Desktop 的 Docker Engine 设置里为 registry-mirrors 添加国内镜像地址,Apply and restart 后重新执行启动命令。

  1. 新增模特报错。症状:模型训练直接失败。最可能原因:提交视频没有声音轨道或并非人声,声音克隆无法进行。处理:重新录制人物清晰说话的视频再上传。

  2. 定制模特出现 Connection refused。症状:日志显示 ASR 连接被拒。最可能原因:Duix.Avatar-asr 启动较慢,连接尚未就绪,或内存不足。处理:服务端全部启动后等几分钟再做克隆操作;16G 内存机器先确认三个服务是否全部常驻。

  3. 服务反复重启或无法启动。症状:容器始终到不了 Running。最可能原因:机器没有英伟达显卡或驱动未装好,本项目算力全部在本地 GPU。处理:重装显卡驱动并确认能正常查询到显卡信息,参考 doc/常见问题.md 中的自查步骤。

使用边界

数据虽然全程在本地处理,但提交的视频、音频与克隆出的模型仍涉及当事人个人信息,素材应为自己所有或已取得本人同意,不要用于冒充他人。商用方面,项目支持全球免费商用,但用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议,详见仓库中的 LICENSE。

Duix.Avatar 把「一段视频变数字人」的完整链路放进了本地机器,对个人创作者而言成本与数据风险都更低。社区更新频繁、问题单每日处理,部署教程与实战案例也属于开源共创计划的鼓励方向,欢迎把数字人本地部署中踩过的坑拿出来分享 🚀

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询