10秒视频克隆你的开源数字人:Duix-Avatar 本地部署从零到出片
2026/9/20 2:11:18 网站建设 项目流程

10秒视频克隆你的开源数字人:Duix-Avatar 本地部署从零到出片

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

你有没有过这种经历:把人脸视频传到某个在线服务,排队等二十分钟,还不知道素材最后去了哪?Duix-Avatar 换了个思路:全程本地部署,一段 10 秒的视频就能克隆你的形象和声音,整个流程不依赖联网。

它到底能干什么:三个场景

先说结论:这是一个"写完文案就出片"的工具,价值集中在三类用法上。

  • 口播视频:输入文案(或直接上传音频),数字人开口念,口型自动对齐,适合课程录制、商品讲解、短视频口播。
  • 多语种复用:脚本支持中、英、日、韩等 8 种语言,同一个模型可以产出不同语言的口播内容。
  • 个人 IP 沉淀:形象和声音克隆一次之后,后续新视频都用同一个"你"来出镜,不用反复拍摄。

所谓离线数字人生成,本质就是把全部算力放在你自己的电脑上:素材不出机器、不用排队、生成量不限。

快速上手:在 Windows 上 30 分钟拉起来

读完这节能拿到一套完整的 Windows 部署路径:从硬件核对到三个服务跑起来;Ubuntu 方案最后两三句话带过。

硬件与磁盘空间

先说结论:官方推荐配置是 i5-13400F、32GB 内存、RTX 4070,且必须有已装驱动的英伟达显卡。磁盘有两个硬性要求:

  • C 盘空闲大于 100GB:存服务镜像文件
  • D 盘空闲大于 30GB:存数字人模型和作品数据

C 盘不够的话,装好 Docker 后可以在 Docker Desktop 的"Resources"设置里,把镜像存储位置改到空闲足够的盘。

一条命令部署服务

先确认 WSL 可用(wsl --list --verbose查看,没有就用wsl --update更新),装好 Docker Desktop 并启动,然后只需要这一组核心命令:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d

首次运行要下载约 70GB 镜像,大概半小时,建议连 WiFi。Docker 里看到三个服务在运行就成功了。两个常见变体:lite 版执行docker-compose -f docker-compose-lite.yml up -d,只起一个视频生成服务;RTX 50 系列显卡则改用docker-compose-5090.yml

服务端就绪后,下载官方构建的Duix.Avatar-x.x.x-setup.exe双击安装,启动客户端会自动检测本地服务状态,能直接开始创作。

Ubuntu 三句话:已适配 Ubuntu 22.04 Desktop,装好 docker.io 与 docker-compose、NVIDIA 驱动和 NVIDIA Container Toolkit 后,在 deploy 目录执行docker-compose -f docker-compose-linux.yml up -d;客户端用 AppImage 版,双击即用。

界面初体验:三块区域

界面就分三块,三分钟能熟悉。

  • Create Video(左上):视频生成主入口。选一个模型,输入文案或上传音频,生成带口型的口播视频。
  • Create Avatar(右上):创建模型的入口。10秒视频克隆的核心就在这一步:上传一段约 10 秒、声音清晰的正面视频,程序提取形象和声音后生成新模型。
  • My Works / My Avatars(中部列表):前者是已生成的视频,后者是模型库,支持按名字搜索和删除。右上角设置菜单可以查看用户协议、打开客户端日志、切换界面语言。

进阶:用开放 API 接进自己的应用

如果你不想局限于客户端界面,Docker 启动后会本地暴露几个端口,通过http://127.0.0.1就能调用。流程分三步:

  1. 模型训练:把视频分离出的音频提交给 18180 端口的预处理接口(/v1/preprocess_and_tran),返回的音频参考地址和参考文本留好,供下一步用。
  2. 音频合成:调同端口的/v1/invoke,传入要合成的文本和上一步的参考信息,返回那个人声音的 WAV。
  3. 视频合成:向 8383 端口的/easy/submit提交任务,再用GET /easy/query?code=xxx轮询进度。

最短示例——提交一次视频合成任务(请求体包含音频路径、静音视频路径、唯一任务编号和几个固定值字段):

curl -X POST http://127.0.0.1:8383/easy/submit -H "Content-Type: application/json" -d '{"audio_url":"a.wav","video_url":"v.mp4","code":"t-01","chaofen":0,"watermark_switch":0,"pn":1}'

客户端本身就是靠这些接口完成请求的,调用逻辑见 src/main/service/,可以直接抄作业。

避坑指南:最常见的三个问题

读完这节,卡住时能按号入座,三十秒定位。

GPU 没被识别

现象:三个服务起不来,或客户端提示服务不可用。原因:项目所有算力都在本地,没有英伟达显卡或驱动没装好,服务就是起不来。解法:nvidia-smi能打印显卡信息才算驱动装好;Linux 上再装 NVIDIA Container Toolkit 并让 Docker 使用 NVIDIA 运行时。

镜像拉取慢或超时

现象:docker-compose up -drequest canceled或超时。原因:Docker Hub 官方源从国内网络访问不稳定。解法:在 Docker Engine 设置(或/etc/docker/daemon.json)里加一组registry-mirrors国内镜像源,再重新拉取。

音频素材不对

现象:创建模型时报错,服务日志里常见file not exists。原因:素材视频里没有声音,或音频文件没放在服务约定的目录。解法:提交的 10 秒视频里必须有人在说话;分离出的音频要放到与服务约定的目录(默认D:\duix_avatar_data\voice\data,可在 docker-compose 里改),路径避免特殊字符。

更多细节和自查步骤在 doc/常见问题.md。

三步开始

  1. 先核硬件:英伟达显卡加驱动、C 盘 100GB、D 盘 30GB,缺一项就先补齐。
  2. 跑通服务出第一片:按快速上手把三个服务拉起来,录一段 10 秒视频完成建模,产出你的第一条口播视频。
  3. 接入自己的工作流:熟悉界面后,用开放 API 接进自己的应用,或对照源码做修改。

遇到问题想参与共建,最直接的途径是给项目提交 Issue,也可以加入官方的技术交流群一起讨论。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询