Duix.Avatar本地部署指南:10秒视频克隆你的数字人,在自己电脑上批量生成口播视频
2026/9/11 3:57:48 网站建设 项目流程

Duix.Avatar本地部署指南:10秒视频克隆你的数字人,在自己电脑上批量生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar是一套可在本地、全离线运行的开源数字人工具:上传一段10秒左右的说话视频,即可克隆你的形象和声音,再输入文案或音频,自动生成口播视频。本文带你走完环境准备、Docker服务启动到出片验证的完整流程,一个晚上就能跑通。

为什么值得在自己电脑上跑

  • 全离线:模型训练与视频合成全部发生在本地GPU上,视频和声音样本不出机器,适合素材敏感、要求数据私密的场景。
  • 成本:官方对比商用方案,制作成本降低99%以上,周期从数周缩到小时级;一次搭好之后生成不限次数,不再按条付费。
  • 可扩展:仓库 deploy/ 目录里的编排文件拿来即用,服务启动后会在本机暴露语音(端口18180)和合成(端口8383)接口,方便接入自己的业务系统。

过来人提醒:只是想出几条片子,8GB显存能跑的lite版就够了;声音克隆和形象合成都想保留,就上完整三服务。

它能干什么:三个能力各看三行

形象与面部克隆

  • 原理:face2face模型分析短视频中的五官、轮廓与表情变化,重建一张可用的虚拟脸。
  • 价值:10秒视频即可得到一个数字人形象,支持多模型导入与随时切换。
  • 门槛:只需录视频时正面、光线均匀、人声清晰,不需要算法背景。

声音克隆与语音合成

  • 原理:合成模型以声音样本加参考文本为条件重建音色,保留原声的语调和习惯。
  • 价值:输入文案就能得到原声口吻的语音;脚本支持中、英、日、韩、法、德、阿、西共8种语言。
  • 门槛:零门槛,一段10秒带人声的素材即可;想调语音参数可参考 src/main/service/voice.js。

文案转视频合成

  • 原理:口型与音频节奏对齐,音视频自动同步后输出成片。
  • 价值:形象训练完即可“文案→语音→视频”一条龙,进度还能通过8383接口轮询。
  • 门槛:客户端界面操作即可;用API集成的话,参考 src/main/service/video.js。

过来人提醒:第一次先挑最短的10秒素材,目标先出一条完整片子,再谈质感。

🖥️ 硬件怎么选:三档配置表

档位CPU内存显卡存储可完成的任务
体验档i5-12400或同级16GB8GB显存的N卡(lite版)SSD空闲100GB以上lite单服务、720p出片、单模型约40分钟
流畅档i5-13400F或i7-1370032GBRTX 4070(12GB)SSD空闲100GB以上完整三服务、1080p出片、单模型约20分钟
批量档i7-14700或更高32–64GBRTX 4090(24GB)SSD 100GB + 1TB数据盘长视频批量合成、多模型并行训练

注意:

  • NVIDIA显卡加驱动是硬门槛,缺了它三个服务一个都起不来。
  • 验证方式:执行下面的命令,能看到显卡型号、显存和驱动版本才算通过。
nvidia-smi

过来人提醒:内存32GB才是分水岭,16GB机器上ASR服务经常起不来。

📦 怎么跑起来:准备、执行、验证

第一步 准备:系统、磁盘、Docker、仓库

  1. 确认系统版本。Windows需10 19042.1526及以上,用winver查看;Ubuntu用22.04 Desktop,用lsb_release -a查看。
  2. 确认磁盘空间。Windows下镜像盘(通常C盘)需100GB以上空闲、数据盘30GB以上空闲;Ubuntu需100GB以上空闲。C盘不够时,在Docker Desktop的 Settings → Resources → Advanced 里点 Browse,把镜像存放位置挪到大盘。
  3. 安装Docker。Windows先装WSL(wsl --installwsl --update),再装Docker Desktop并首次启动(接受协议、跳过登录);Ubuntu执行:
    sudo apt update sudo apt install docker.io docker-compose

    验证方式:docker --version能输出版本号。

  4. 克隆代码。
    git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

    验证方式:ls能看到deploysrc两个目录。

  5. 确认NVIDIA驱动已装好,执行nvidia-smi复核(见上一节)。

第二步 执行:一条命令拉起服务

  1. 进入部署目录启动:
    cd deploy docker-compose up -d

    lite版(8GB显存)把文件换成docker-compose-lite.yml;Ubuntu用docker-compose-linux.yml;RTX 50系显卡用同目录下的5090配置文件。

  2. 首次会自动拉镜像,约70GB流量,耗时30分钟到2小时。 注意:如果拉取超时并出现 "request canceled" 报错,打开Docker Desktop → Docker Engine,在JSON里加入 registry-mirrors 加速源,点 Apply & restart,再重跑上一步命令。
  3. 启动后先别急着开客户端。ASR服务就绪较慢,等服务完全起来后至少留5分钟再操作。

第三步 验证:成功的三条标准

  1. docker ps里三个容器均为 Up/Running:Duix.Avatar-asr、Duix.Avatar-tts、Duix.Avatar-gen-video(lite版只有一个 duix-avatar-gen-video)。
  2. 本机端口18180与8383处于监听状态。
  3. 客户端连得上:装官方客户端(Windows装.exe,Ubuntu直接用.AppImage),主界面出现“My Works”和“My Avatars”且没有离线提示。

过来人提醒:三个服务全部Running再去点克隆,否则大概率报Connection refused。

落地到谁手里:两个真实用法

教育:批量做课前3分钟预告片

  • 素材:8秒正面口播片段,1080p,人声单一、无背景音乐。
  • 流程:训练一次形象模型,课程文案按每段不超300字切分,逐段生成,再用自己的剪辑工具拼接。
  • 建议参数:语速约200字/分钟,一位老师一个模型,模型可长期复用并随形象更新替换。

自媒体:虚拟主播口播切片

  • 素材:12秒vlog开场片段(带一次微笑),不低于720p。
  • 流程:客户端里输入当日选题得到语音,一键合成视频,成片直接导出发平台。
  • 建议参数:单条控制在60秒以内,方便控制合成时长;8GB显存下批量出片约5–8分钟/分钟视频。

过来人提醒:一个定位一个模型,同一张脸跨栏目乱用,观众很快会腻。

文档、配置和帮助去哪找

  • 常见问题的现成解法:仓库里的 doc/常见问题.md 收录了拉镜像失败、建形象报错等案例,提问前照自查清单过一遍。
  • 启动配置:deploy/ 目录四个编排文件分别对应Windows完整、lite、Ubuntu与5090场景。
  • API示例:语音与合成接口启动后在本机即可调用,示例代码见 src/main/service/video.js,可直接抄走做集成。
  • 社区:仓库的Issues区每天更新,先查再问,很多坑已经有人替你踩过。

过来人提醒:项目更新比较频繁,先确认客户端和服务端都是最新版,再谈排障。

🔍 四个高频卡点:症状→原因→解法

1. 拉镜像失败,提示 request canceled / context canceled

  • 症状:docker-compose up -d执行后出现 ✘,连接 registry-1.docker.io 超时。
  • 可能原因:Docker Hub官方源不稳定。
  • 解决方案:在Docker Engine的JSON里加 registry-mirrors 加速源,重启Docker后重新拉取。

2. 新建形象报错:视频必须带声音

  • 症状:上传视频创建形象后立刻失败。
  • 可能原因:素材无声音,或声音不是人在说话;程序要靠这段人声做声音克隆。
  • 解决方案:重录一段10秒连续说话的片段再上传。

3. 克隆时出现 Connection refused

  • 症状:日志里ASR websocket连接失败,报'NoneType' object has no attribute 'send'
  • 可能原因:ASR服务就绪慢,或内存太小(16GB可能直接起不来)。
  • 解决方案:服务就绪后等5–10分钟再操作;仍失败就把内存升到32GB。

4. 镜像存放位置突然爆满

  • 症状:拉取中途卡死,Docker Desktop提示磁盘空间不足。
  • 可能原因:约100GB镜像全部落在默认盘位置。
  • 解决方案:Settings → Resources 里把镜像位置改到大盘,再重启Docker。

全离线、不限次、一次投入长期复用,这是自己跑数字人的全部价值。打开deploy目录,今晚把服务拉起来,产出第一条口播视频。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询