Duix.Avatar:开源AI数字人,10秒视频本地生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是由 Duix 出品的免费开源数字人工具,支持本地部署与 API 调用。它只需一段 10 秒左右的视频即可克隆人物形象与声音,输入文案或上传音频,就能在本地离线生成口型同步的口播视频,素材与算力均不出本机。
Duix.Avatar 的能力清单
- 形象与声音克隆:提交一段 10 秒左右的视频,系统同时提取五官轮廓等外貌特征与人声样本,生成数字人模型;克隆所用的声音样本必须来自视频内真实的人声。
- 口播视频生成:输入文本或上传音频驱动数字人口型,输出音画同步的视频,文本经语音合成服务转为语音后再与画面合成。
- 全离线运行:服务端基于 3 个 Docker 容器,全部算力在本地 GPU 完成,素材与数据不经过外网;数据目录约定为
D:\duix_avatar_data。 - 多模型管理:可导入多个数字人模型,在客户端统一管理并按场景选择,模型与作品记录保存在本地数据库。
- 多语言界面:客户端支持英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语 8 种语言切换。
商用授权方面,README 声明支持全球免费商用;用户量超过 10 万或年营收达 1000 万美元以上的企业需签署商业许可协议(见 LICENSE)。
Docker 部署走读:环境、命令与验证
前置条件:系统与硬件清单
| 项目 | 要求 |
|---|---|
| 操作系统 | Windows 10 19042.1526 或更高版本;Ubuntu 22.04 Desktop(内核 6.8.0-52-generic,其他 Linux 未做兼容性测试) |
| 显卡 | 英伟达 GPU 并正确安装驱动(必要项,无驱动三个服务无法启动) |
| 内存 | 32GB 及以上(必要) |
| 磁盘 | Windows:D 盘空闲 30GB 以上存放模型与作品,C 盘空闲 100GB 以上存储服务镜像;Ubuntu:空闲空间 100GB 以上 |
| 推荐配置 | i5-13400F、32GB 内存、RTX 4070 |
| 依赖 | Nodejs 18、Docker;三个镜像guiji2025/fun-asr、guiji2025/fish-speech-ziming、guiji2025/duix.avatar |
执行:按系统选择路径
Windows 侧先检查 WSL 是否已安装(wsl --list --verbose,未装则wsl --install,网络不佳时多试几次),再执行wsl --update更新,随后从 Docker 官网下载 Docker Windows 版并按 CPU 架构安装。服务端配置在 deploy/docker-compose.yml 中,进入deploy目录执行:
docker-compose up -d如需轻量版(仅启动视频生成一个服务)改用docker-compose -f docker-compose-lite.yml up -d;NVIDIA 50 系列显卡(5090 已测试通过,30/40 系列 CUDA 12.8 用户也可用)使用:
docker-compose -f docker-compose-5090.yml up -dUbuntu 侧先安装 Docker:
sudo apt update && sudo apt install docker.io docker-compose再安装英伟达驱动(装完执行nvidia-smi能显示显卡信息即为成功)与 NVIDIA Container Toolkit,然后cd /deploy && docker-compose -f docker-compose-linux.yml up -d。
验证:成功信号判断
拉取镜像耗时约半小时(取决于网速,消耗约 70GB 流量,建议连 WiFi)。判断标准:Docker 中出现duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务且均为 Running 状态(lite 版本只有一个duix-avatar-gen-video)。客户端从 GitHub Releases 下载对应系统的安装包:Windows 双击Duix.Avatar-x.x.x-setup.exe安装;Ubuntu 直接运行Duix.Avatar-x.x.x.AppImage,root 用户需加--no-sandbox参数启动。
创建第一个数字人:从素材到成片
素材要求:一段 10 秒左右的视频,人物面部清晰、视频中有人正在说话——声音克隆直接取材于这段视频的音轨,静音素材会直接报错。关键操作:在主界面创建数字人,上传视频后等待系统完成形象与声音特征提取(几分钟,视硬件而定);随后在 My Avatars 中选中该模型,输入要说的文案或上传音频,点击生成,数分钟后得到口型同步的口播视频。
幕后原理:三个服务与一条数据流
- 客户端是 Electron 33 + Vue3 桌面程序,模型与作品记录存于本地 SQLite(better-sqlite3),文件落盘在
D:\duix_avatar_data。 guiji2025/fun-asr:语音识别服务,基于 FunASR,负责把参考音频转成文本(容器端口 10095)。guiji2025/fish-speech-ziming:语音合成服务,基于 fish-speech,负责文本转语音与声音克隆(对外端口 18180)。guiji2025/duix.avatar:数字人视频合成引擎,负责口型与画面的对齐生成(对外端口 8383)。- 数据流:视频先转 H264 并用 ffmpeg 分离音频,音频送 TTS 服务做克隆训练与后续合成,合成后的音频再与模型视频送入 8383 端口的合成引擎,产出最终口播视频。
踩坑手册:现象、原因与处理
- 拉镜像报
Client.Timeout exceeded:Docker Hub 连接不稳定。处理:配置国内镜像源(修改 Docker 配置文件的registry-mirrors),详见 doc/常见问题.md。 - 新增模特报错:素材视频没有说话声。声音克隆依赖视频内人声,换一段人物口播视频重新创建即可。
- 克隆形象报
Connection refused:ASR 服务启动慢,服务端刚拉起来就操作了。处理:服务端启动后等几分钟再克隆;内存小于 32GB(如 16GB)可能直接起不来。 - 服务起不来或状态异常:按自查顺序排查——三个服务是否 Running;是否有英伟达显卡且驱动正常(
nvidia-smi验证);服务端是否重新执行docker-compose up -d更新到最新版;Issue 列表里是否已有相同问题。 - 磁盘不足:C 盘放不下镜像时,安装 Docker 后可在其设置中把镜像存储改到其他空闲大于 100GB 的磁盘。
进阶用法:API 调用、批量任务与多语言
API 调用:Docker 启动后在本地暴露 HTTP 端口,可用http://127.0.0.1直接调用,完整流程分三步——模特训练调用http://127.0.0.1:18180/v1/preprocess_and_tran(先把参考音频放入与 TTS 服务约定的目录D:\duix_avatar_data\voice\data,记下返回的asr_format_audio_url与reference_audio_text);音频合成调用http://127.0.0.1:18180/v1/invoke(带上一步的返回值作参考音频);视频合成调用http://127.0.0.1:8383/easy/submit,用http://127.0.0.1:8383/easy/query?code=${taskCode}轮询进度。请求参数结构可对照 src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。
批量任务:客户端内部对合成任务做排队处理,My Works 列表按等待顺序显示进度;通过 API 同理可循环提交任务、按code轮询,实现批量视频生产。
多语言:客户端界面支持 8 种语言,在设置中切换即可。
其他:NVIDIA 50 系列显卡使用deploy/docker-compose-5090.yml方案(基于 torch 官方预览版);官方另提供云端克隆 API 服务,适合不想自购 GPU 服务器的业务场景,两者取舍对比见 README_zh.md 的开发者说明。
适合谁用
- 自媒体创作者:用它批量产出数字人口播视频,无需真人出镜也能维持更新频率。
- 企业与培训团队:用它制作产品介绍、客服讲解、标准化教学等数字人视频。
- 开发者:用它本地部署或调用 API,把数字人形象克隆与视频合成集成进自有系统。
更多细节见 doc/常见问题.md,部署与使用中的问题可查阅官方 FAQ 与项目 Issue 单(入口见 README_zh.md 末尾)。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考