OpenVoice 语音克隆保姆级教程:3 步本地部署,用 15 秒音频克隆你的声音
2026/9/1 8:44:32 网站建设 项目流程

OpenVoice 语音克隆保姆级教程:3 步本地部署,用 15 秒音频克隆你的声音

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

OpenVoice 是一个开源的即时语音克隆工具,只要 15 秒参考音频,就能用你的音色说出多语言文字,MIT 协议可免费商用。

它能帮你做什么(先看适不适合你)

  • 给视频、播客配音:录一段自己 15 秒的声音,之后让任意文字自动变成你的声音读出来,不用再逐条重录。
  • 给作品做多语言版本:用你中文的音色,直接读出英语、日语、韩语台词,配音不必另请配音员。
  • 想上手语音技术但没基础:自带一个本地网页,填字、传音频、点按钮就能出结果,不必先啃代码。

下面这张图展示"克隆出的声音"在一个产品里被使用起来的整体流程。

3 步在本地跑起来

先建干净的 Python 环境再装,能少踩一半的坑。整个安装就下面这几条命令,V1 和 V2 完全一样:

conda create -n openvoice python=3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .
  • 前两条:建一个叫 openvoice 的 Python 3.9 环境并激活,避免弄脏你系统的 Python。
  • 第三条:把仓库克隆到本地。
  • 后两条:进入目录并安装依赖。

💡 装好之后,终端最后一行会打印 Successfully installed MyShell-OpenVoice-0.0.0,说明依赖都到位了,可以进入下一步。

原理白话版:它是怎么"换声带"的

可以把 OpenVoice 理解成一条流水线,分两件事做。第一段由基础说话人模型 BaseSpeakerTTS 负责"念稿",也就是把你要说的内容合成语音,口音、情绪、节奏这些"风格"都由它控制;第二段由音色转换器 ToneColorConverter 负责"换声带",它从你的参考音频里只抽出"音色"这一个属性,贴到刚才那段语音上,而语气、停顿、节奏都原样保留。所以你能一边用你的音色,一边让它用耳语、生气或欢快的语气说话。

核心功能逐个试

1|打开网页界面,填字就能出声音

不想写代码时,OpenVoice 自带一个本地 Gradio 网页:填文本、传一段你的音频、选个风格,点 Send 就能听到用你音色读出来的结果。装好依赖后在项目根目录运行:

python -m openvoice_app --share

浏览器会自动打开页面,左侧输入框写一句话、上传参考音频并勾选同意,右侧就播放克隆好的语音。本地网页 Demo 支持的语言与风格如下(源码见 openvoice/openvoice_app.py):

语言本地网页 Demo 支持的风格
英语default、whispering、excited、cheerful、sad、angry、terrified、friendly 等
中文目前仅 default

2|让同一个音色换语气、换情绪

音色只克隆"音色",语气和情绪由基础说话人模型控制,所以你能让同一个人一会儿耳语、一会儿生气、一会儿开心。在网页界面 Style 下拉框里选不同风格(whispering 耳语、excited 兴奋、sad 悲伤等),再点 Send。你会看到出来一段音色没变、但语气明显不同的语音。

3|跨语言克隆(你的声音说外语)

参考语音和生成语音的语言,都不需要在训练集里出现过——这就是零样本跨语言。V2 原生支持英、西、法、中、日、韩六种语言;其他语言可换成对应的基础说话人模型再走同一个音色转换器。具体写法参考示例 demo_part2.ipynb,你会看到自己中文录音的音色,却流利地读出英文或日语台词。

⚠️ 踩坑指南:现象 → 原因 → 怎么办

  • 音色"像"但口音、情绪对不上。原因是 OpenVoice 只克隆音色,不克隆口音和情绪,那些由基础说话人模型决定。想换口音或情绪,就换带那种风格的基础说话人模型,而不是指望转换器去模仿。
  • 生成语音有杂音、发闷。常见原因是参考音频有背景噪声、太短、多人说话或有大段空白。换一段 5–15 秒、干净、单人、无长空白的录音,采样率 16kHz 以上。
  • 跑 VAD 环节卡在 Silero 下载。原因是机器连不上 GitHub,自动下载失败。按 docs/QA.md 手动下载 Silero VAD 的 zip 并解压到缓存目录即可。
  • 网页 Demo 里输入其他语言报错。原因是本地 Gradio Demo 只支持英语和中文,且中文只有 default。其他语言改用 Python API 换对应基础模型,或上 V2 用原生六语言。

总结

OpenVoice 把"音色"和"语气"拆开处理,让你用 15 秒音频克隆声音并自由换语气、换语言,MIT 协议可免费商用。它最适合给视频/播客批量配音、给作品做多语言版本。下一步建议通读 docs/USAGE.md 了解 V1/V2 细节,遇到报错再翻 docs/QA.md。

【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询