终极电子书转有声书工具:一键生成支持1158种语言的AI语音,还能克隆你的声音
2026/9/8 18:56:07 网站建设 项目流程

终极电子书转有声书工具:一键生成支持1158种语言的AI语音,还能克隆你的声音

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

还在手动把电子书文本逐段复制粘贴进朗读软件吗?或者面对一堆外语书,找不到支持该语种的配音工具?

ebook2audiobook(E2A)是一个开源的电子书转有声书工具:把EPUB、MOBI、PDF 等 20+ 种格式一键转成带章节结构的m4b/mp3 有声书,内置XTTSv2、Bark、VITS 等 8 个 TTS 引擎,覆盖1158 种语言,还支持语音克隆——用你自己的声音读给你听。

读完本文,你可以:

  • 搭建一个本地有声书生成器,支持 Windows、macOS、Linux 三大平台
  • 克隆一个属于自己的 AI 声音,让任何书都用它朗读
  • 调优合成参数,在生成速度和音质之间找到平衡点
  • 批量转换整个书架目录,并自动保留章节与元数据

能力全景:为什么值得选它

传统方式 vs 本项目,核心差异一眼看清:

维度传统方式ebook2audiobook
格式支持多为 txt,需手动导出EPUB/MOBI/PDF 等20+ 格式,自动识别章节
语言覆盖主流 5–10 种1158 种语言与方言
声音定制换不了声音语音克隆,上传1–5 分钟录音即可
输出结构一段连续音频章节、元数据的 m4b,可直接导入播放器

它的 Web GUI 分为"输入选项"和"音频生成偏好"两个页签,上传文件、选语言、点 Convert 就能开工:

图:Web GUI 输入配置界面——电子书、克隆语音、处理器、语言与 TTS 引擎一屏搞定

最低配置也很友好:2 GB 内存 + 1 GB 显存就能跑,推荐 8 GB 内存 / 4 GB 显存。

快速上手:三条路线生成你的第一本有声书

路线一:懒人路线(GUI 图形界面,适合所有人)

  1. 克隆仓库到本地:
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook
  1. 双击启动脚本:Linux/macOS 运行./ebook2audiobook.command,Windows 双击ebook2audiobook.cmd(首次会自动装好依赖)。
  2. 浏览器打开终端提示的地址http://localhost:7860/,上传电子书、选择语言,点击Convert

一句话优势:全程点鼠标,零命令行经验也能出成品。

路线二:极客路线(headless 命令行,适合批量与自动化)

  1. 同样先克隆仓库并进入目录。
  2. 用一条命令直接转换,跳过图形界面:
./ebook2audiobook.command --headless --ebook book.epub --language eng
  1. Windows 下把脚本名换成ebook2audiobook.cmd,其余参数相同。

一句话优势--ebooks_dir指向整个目录即可批量转换,--session参数还能在中断后恢复转换,适合挂机跑整本书库。

路线三:云端路线(Docker 容器,适合不想污染本机环境的人)

  1. 在仓库目录执行构建命令,如./ebook2audiobook.command --script_mode build_docker
  2. docker run挂载ebooks/audiobooks目录并映射7860 端口,GPU 机器加--gpus all
  3. 浏览器访问http://localhost:7860/即可,容器内一切自包含。

一句话优势:依赖混乱?容器里全部打包好了,CPU/CUDA/ROCm/XPU/Jetson 都有对应镜像标签。

分平台要点:差异与易错步骤

Windows

  • 双击ebook2audiobook.cmd启动,缺少的程序会用scoop自动安装,无需管理员权限
  • 想用 Docker,需先在 BIOS 里开启虚拟化(Virtualization),否则容器跑不起来
  • ARM 架构的 Windows 同样支持,不只是 x86
  • NVIDIA 显卡需要CUDA ≥ 11.8的驱动才能被识别为 GPU 设备
  • 生成局域网/公网分享链接:脚本后加--share参数

macOS

  • 运行./ebook2audiobook.command,缺失依赖会自动通过 Homebrew 安装
  • Apple Silicon(M 系列)芯片会自动启用MPS 加速,无需额外配置
  • 注意:MPS 不对外暴露在 Docker 中,容器模式下请用 CPU
  • Intel x86 与 Apple Silicon 双架构都官方适配

Linux

  • 与 macOS 相同的./ebook2audiobook.command启动方式
  • GPU 后端选择最多:CUDA、ROCm(AMD)、XPU(Intel)、Jetson 均可自动检测
  • 服务器 SMP 多核 CPU 下,纯 CPU 模式的效率明显高于普通笔记本
  • 提供 Docker Compose 与 Podman Compose 两套编排文件,--profile gpu一键拉起 GPU 环境
  • 想固定旧版本:git checkout tags/vXX即可回退

进阶玩法:从"能读"到"读得好"

语音克隆:让"你"给你读书

一句话定义:上传一段自己的录音,TTS 引擎就能用你的音色朗读整本书。

  • 准备1–5 分钟的录音,任意支持的音频格式即可
  • 不需要棚录——背景有噪音、有音乐都没关系,E2A 会自动把参考音频降噪
  • 在 GUI 的 Cloning Voice 上传区拖入文件,或命令行加--voice 路径

效果:输出音色的相似度足以以假乱真,README 里的演示包括 ASMR 声、纪录片解说声等多种风格,克隆后的声音可长期保存在voices/目录复用。

调参旋钮:温度、速度与重复惩罚

一句话定义:Audio Generation Preferences 页签提供一组滑块,实时控制"多自然 vs 多快"。

图:音频生成参数页——Temperature、Top-k/p、Speed 等滑块

  • 想要更稳、更快:调低 Top-k 与 Top-p(输出更受限,生成速度提升)
  • 想要更有情感起伏:适当调高 Temperature(默认 0.65)
  • Speed 滑块控制语速,0.5 到 3 倍均可调节

成品试听与下载

转换完成后,同一页面内置播放器可先试听再下载,输出格式默认 m4b,也支持 mp3、flac、ogg、wav 等10 种格式,单声道/立体声可选:

图:转换完成后的试听与下载界面,直接导出 m4b 有声书

OCR 扫描:图片版"电子书"也能读

一句话定义:对扫描版 PDF 或图片(JPG/BMP/PNG/TIFF)自动 OCR 提取文字再合成,连手写体都在测试支持范围内。

图:OCR 功能支持的手写体扫描页样本

  • 直接上传扫描版 PDF,无需先手动转文字
  • 配合语言参数选择对应语种,识别后进入正常合成流程
  • 识别质量取决于原图清晰度,高 DPI 扫描效果最佳

性能实测与调优

以一本10 万字左右的长书为参考量级,典型耗时对比:

  • 基础 CPU 配置:60+ 分钟→ 中端 GPU 加速:15–20 分钟→ 高端 GPU:5–10 分钟(GPU 下可接近实时)

三条可立即执行的调优建议:

  1. 优先用 GPU:启动时确认设备被识别为 CUDA/MPS 而非 CPU;NVIDIA 卡驱动装到 CUDA ≥ 11.8
  2. 调低 Top-k / Top-p 滑块:输出更收敛,音频生成速度明显提升,适合赶时间场景
  3. 纯 CPU 就换轻量引擎:XTTSv2 等大模型在 CPU 上很慢,改用 YourTTS、Tacotron2 这类轻量引擎,音质接近 Siri 但快得多;转换中断后用--session恢复,避免从头再跑

踩坑速查:高频问题一屏解决

GPU 没被检测到→ 确认驱动版本(NVIDIA 需 CUDA ≥ 11.8),可运行仓库自带的python detect_gpus.py诊断

依赖安装报错、版本冲突→ 放弃本地环境,直接用 Docker 镜像,完全自包含

重启脚本后网页连不上→ 脚本重开后 Gradio 会生成新连接,刷新一下浏览器页面即可重新连接

音频被截断、句子读了一半→ 检查长句切分逻辑是否适配该语种,把样本和日志提交给社区协助调优

EPUB 里混入了不想要的内容→ EPUB 格式没有统一的章节标准,转换前先手动删掉前言、广告等文字

写在最后

项目路线图上还排着 iOS/Android 应用、更多 TTS 引擎接入(GPT-SoVITS、F5-TTS 等)和云端服务集成,功能在持续快速迭代中。

今晚就挑一本吃灰的外语书,让它用"你的声音"读给你听吧 🎧

小提示:收藏本文方便随查,有转换样本或语种调优建议,欢迎反馈给社区。

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询