☰
10分钟快速部署CyberVerse:纯语音数字人Agent新手入门完整教程
2026/10/10 17:46:53 网站建设 项目流程

【免费下载链接】CyberVerse

Self hosted, real-time digital human agent platform. Build voice-first AI agents with WebRTC, persona memory, tools, RAG, and optional digital-human video.

项目地址:https://gitcode.com/gh_mirrors/cyb/CyberVerse
点击查看免费下载

CyberVerse是一个开源的实时数字人 Agent 平台:基于 WebRTC 构建语音优先(voice-first)的 AI 智能体,内置人设记忆、SubAgent 任务、RAG 知识库,并可选接入数字人视频。本文将带你以纯语音数字人 Agent模式,在约 10 分钟内完成一次零 GPU 的完整部署。

先认识一下它的工作方式——CyberVerse 把"多源感知输入 → 智能决策引擎 → 数字人呈现与交互"封装成了可替换的插件化模块,新手只需关心配置与启动:

部署完成后,你可以在浏览器里直接和语音数字人"视频通话",随时插话、打断:

一、部署前检查:环境要求清单

纯语音模式不需要本地 GPU,运行成本只取决于你使用的 LLM / TTS / ASR 服务商。

依赖版本要求用途
Node.js18+前端服务
Go1.25(含protoc-gen-go、protoc-gen-go-grpc)API 服务
Conda + Python3.10+推理服务
FFmpeg任意较新版本音视频处理
系统库libopus-dev、libopusfile-dev、libsoxr-dev、pkg-config音频链路

一条命令验证是否就绪:

node --version && go version && ffmpeg -version && conda --version

二、第 1 步:克隆 CyberVerse 仓库

git clone https://gitcode.com/gh_mirrors/cyb/CyberVerse.git cd CyberVerse

仓库整体结构一览(后面会用到):

  • frontend/ — Vue 前端,角色管理与对话界面
  • inference/ — Python 推理服务(LLM / TTS / ASR / RAG 插件)
  • server/ — Go API 服务与 WebRTC 编排
  • infra/config/cyberverse.yaml — 核心配置模板

三、第 2 步:创建 Python 环境并配置 API Key

conda create -n cyberverse python=3.10 conda activate cyberverse

复制配置模板并填入你的 API Key(阿里云 Qwen 或火山引擎 Doubao 任选其一):

cp -r infra/config config

编辑config/env:

# 方式一:阿里云 Qwen 系列 DASHSCOPE_API_KEY=your_dashscope_api_key # 方式二:火山引擎 Doubao 系列 DOUBAO_ACCESS_TOKEN=your_doubao_access_token DOUBAO_APP_ID=your_doubao_app_id

💡 omni、LLM、Embedding、TTS、ASR 的模型定义会自动从 infra/config 下的*_models/目录发现;服务启动后,也可以在 Web 界面的/settings页面随时修改 API Key 与端点。

四、第 3 步:启用 voice-only 纯语音模式(关键一步)

编辑config/cyberverse.yaml,把数字人视频推理关闭:

inference: avatar: enabled: false

这一行决定了你的部署形态:enabled: false时,CyberVerse 作为纯语音 Agent 助手运行,无需下载任何 Avatar 模型权重。完整模板见 infra/config/cyberverse.yaml。

五、第 4 步:一键安装全部依赖

make setup

Makefile 中的setup目标会一次完成三件事:安装 Python 可编辑包([dev,inference])、生成 gRPC stubs、安装前端npm依赖。如后续想扩展更多语音组件,可追加:

pip install -e ".[all]"

六、第 5 步:三终端启动服务

终端命令服务
终端 1make inferencePython 推理服务(omni / LLM / TTS / ASR)
终端 2make serverGo API 服务(HTTP 8080 + gRPC)
终端 3make frontend前端开发服务器

三个服务全部起来后,部署即完成 ✅

七、第 6 步:验证部署结果

curl -s http://localhost:8080/api/v1/health

浏览器打开http://localhost:5173,进入角色列表即可开始体验——点击任意角色的「启动」,即可发起一次全双工语音会话:

角色支持自定义人设风格、欢迎语,还可以为角色导入素材库文档建立 RAG 索引,让回答贴合角色背景与设定:

八、进阶:升级到完整数字人视频模式

当你的 GPU 满足条件(CUDA 12.8+、RTX 5090 或 RTX PRO 6000 档位),只需三步:

  1. 下载模型权重:models/flash_head/(FlashHead 1.3B)或 models/SoulX-LiveAct/(LiveAct 18B)
  2. 在config/cyberverse.yaml中把inference.avatar.enabled改回true,并指定default: "flash_head"
  3. 编辑config/avatar_models/flash_head.yaml,把 checkpoint 路径指向本地权重

详细参数见 README.zh-CN.md 的「完整数字人视频模式」章节。

九、常见问题快速自检

视频卡顿、落后于语音?看推理终端日志中的 RTP 指标(RTP = 生成耗时 / 播放时长):

  • RTP < 1:有余量,可稳定实时推流
  • RTP > 1:生成跟不上播放 → 降低分辨率、换model_type: "lite",或增加 GPU(runtime.world_size)

远程访问连不上音视频?使用streaming_mode: direct时,浏览器必须能访问服务器8443/TCP(内嵌 TURN)。不可达时可用 SSH 隧道转发,详见 README.zh-CN.md 的「远程访问说明」。


🎉 至此,你已完成一次CyberVerse 纯语音数字人 Agent的完整部署:从克隆仓库到浏览器里与语音 Agent 对话,全程约 10 分钟。接下来可以试试为角色写入人设提示词、导入知识库素材,或者按进阶章节接入本地数字人视频模型。

【免费下载链接】CyberVerse

Self hosted, real-time digital human agent platform. Build voice-first AI agents with WebRTC, persona memory, tools, RAG, and optional digital-human video.

项目地址:https://gitcode.com/gh_mirrors/cyb/CyberVerse
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询