终极电子书转有声书工具:一键生成支持1158种语言的AI语音,还能克隆你的声音
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
还在手动把电子书文本逐段复制粘贴进朗读软件吗?或者面对一堆外语书,找不到支持该语种的配音工具?
ebook2audiobook(E2A)是一个开源的电子书转有声书工具:把EPUB、MOBI、PDF 等 20+ 种格式一键转成带章节结构的m4b/mp3 有声书,内置XTTSv2、Bark、VITS 等 8 个 TTS 引擎,覆盖1158 种语言,还支持语音克隆——用你自己的声音读给你听。
读完本文,你可以:
- 搭建一个本地有声书生成器,支持 Windows、macOS、Linux 三大平台
- 克隆一个属于自己的 AI 声音,让任何书都用它朗读
- 调优合成参数,在生成速度和音质之间找到平衡点
- 批量转换整个书架目录,并自动保留章节与元数据
能力全景:为什么值得选它
传统方式 vs 本项目,核心差异一眼看清:
| 维度 | 传统方式 | ebook2audiobook |
|---|---|---|
| 格式支持 | 多为 txt,需手动导出 | EPUB/MOBI/PDF 等20+ 格式,自动识别章节 |
| 语言覆盖 | 主流 5–10 种 | 1158 种语言与方言 |
| 声音定制 | 换不了声音 | 语音克隆,上传1–5 分钟录音即可 |
| 输出结构 | 一段连续音频 | 带章节、元数据的 m4b,可直接导入播放器 |
它的 Web GUI 分为"输入选项"和"音频生成偏好"两个页签,上传文件、选语言、点 Convert 就能开工:
图:Web GUI 输入配置界面——电子书、克隆语音、处理器、语言与 TTS 引擎一屏搞定
最低配置也很友好:2 GB 内存 + 1 GB 显存就能跑,推荐 8 GB 内存 / 4 GB 显存。
快速上手:三条路线生成你的第一本有声书
路线一:懒人路线(GUI 图形界面,适合所有人)
- 克隆仓库到本地:
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook- 双击启动脚本:Linux/macOS 运行
./ebook2audiobook.command,Windows 双击ebook2audiobook.cmd(首次会自动装好依赖)。 - 浏览器打开终端提示的地址
http://localhost:7860/,上传电子书、选择语言,点击Convert。
一句话优势:全程点鼠标,零命令行经验也能出成品。
路线二:极客路线(headless 命令行,适合批量与自动化)
- 同样先克隆仓库并进入目录。
- 用一条命令直接转换,跳过图形界面:
./ebook2audiobook.command --headless --ebook book.epub --language eng- Windows 下把脚本名换成
ebook2audiobook.cmd,其余参数相同。
一句话优势:--ebooks_dir指向整个目录即可批量转换,--session参数还能在中断后恢复转换,适合挂机跑整本书库。
路线三:云端路线(Docker 容器,适合不想污染本机环境的人)
- 在仓库目录执行构建命令,如
./ebook2audiobook.command --script_mode build_docker。 - 用
docker run挂载ebooks/audiobooks目录并映射7860 端口,GPU 机器加--gpus all。 - 浏览器访问
http://localhost:7860/即可,容器内一切自包含。
一句话优势:依赖混乱?容器里全部打包好了,CPU/CUDA/ROCm/XPU/Jetson 都有对应镜像标签。
分平台要点:差异与易错步骤
Windows
- 双击
ebook2audiobook.cmd启动,缺少的程序会用scoop自动安装,无需管理员权限 - 想用 Docker,需先在 BIOS 里开启虚拟化(Virtualization),否则容器跑不起来
- ARM 架构的 Windows 同样支持,不只是 x86
- NVIDIA 显卡需要CUDA ≥ 11.8的驱动才能被识别为 GPU 设备
- 生成局域网/公网分享链接:脚本后加
--share参数
macOS
- 运行
./ebook2audiobook.command,缺失依赖会自动通过 Homebrew 安装 - Apple Silicon(M 系列)芯片会自动启用MPS 加速,无需额外配置
- 注意:MPS 不对外暴露在 Docker 中,容器模式下请用 CPU
- Intel x86 与 Apple Silicon 双架构都官方适配
Linux
- 与 macOS 相同的
./ebook2audiobook.command启动方式 - GPU 后端选择最多:CUDA、ROCm(AMD)、XPU(Intel)、Jetson 均可自动检测
- 服务器 SMP 多核 CPU 下,纯 CPU 模式的效率明显高于普通笔记本
- 提供 Docker Compose 与 Podman Compose 两套编排文件,
--profile gpu一键拉起 GPU 环境 - 想固定旧版本:
git checkout tags/vXX即可回退
进阶玩法:从"能读"到"读得好"
语音克隆:让"你"给你读书
一句话定义:上传一段自己的录音,TTS 引擎就能用你的音色朗读整本书。
- 准备1–5 分钟的录音,任意支持的音频格式即可
- 不需要棚录——背景有噪音、有音乐都没关系,E2A 会自动把参考音频降噪
- 在 GUI 的 Cloning Voice 上传区拖入文件,或命令行加
--voice 路径
效果:输出音色的相似度足以以假乱真,README 里的演示包括 ASMR 声、纪录片解说声等多种风格,克隆后的声音可长期保存在voices/目录复用。
调参旋钮:温度、速度与重复惩罚
一句话定义:Audio Generation Preferences 页签提供一组滑块,实时控制"多自然 vs 多快"。
图:音频生成参数页——Temperature、Top-k/p、Speed 等滑块
- 想要更稳、更快:调低 Top-k 与 Top-p(输出更受限,生成速度提升)
- 想要更有情感起伏:适当调高 Temperature(默认 0.65)
- Speed 滑块控制语速,0.5 到 3 倍均可调节
成品试听与下载
转换完成后,同一页面内置播放器可先试听再下载,输出格式默认 m4b,也支持 mp3、flac、ogg、wav 等10 种格式,单声道/立体声可选:
图:转换完成后的试听与下载界面,直接导出 m4b 有声书
OCR 扫描:图片版"电子书"也能读
一句话定义:对扫描版 PDF 或图片(JPG/BMP/PNG/TIFF)自动 OCR 提取文字再合成,连手写体都在测试支持范围内。
图:OCR 功能支持的手写体扫描页样本
- 直接上传扫描版 PDF,无需先手动转文字
- 配合语言参数选择对应语种,识别后进入正常合成流程
- 识别质量取决于原图清晰度,高 DPI 扫描效果最佳
性能实测与调优
以一本10 万字左右的长书为参考量级,典型耗时对比:
- 基础 CPU 配置:60+ 分钟→ 中端 GPU 加速:15–20 分钟→ 高端 GPU:5–10 分钟(GPU 下可接近实时)
三条可立即执行的调优建议:
- 优先用 GPU:启动时确认设备被识别为 CUDA/MPS 而非 CPU;NVIDIA 卡驱动装到 CUDA ≥ 11.8
- 调低 Top-k / Top-p 滑块:输出更收敛,音频生成速度明显提升,适合赶时间场景
- 纯 CPU 就换轻量引擎:XTTSv2 等大模型在 CPU 上很慢,改用 YourTTS、Tacotron2 这类轻量引擎,音质接近 Siri 但快得多;转换中断后用
--session恢复,避免从头再跑
踩坑速查:高频问题一屏解决
GPU 没被检测到→ 确认驱动版本(NVIDIA 需 CUDA ≥ 11.8),可运行仓库自带的python detect_gpus.py诊断
依赖安装报错、版本冲突→ 放弃本地环境,直接用 Docker 镜像,完全自包含
重启脚本后网页连不上→ 脚本重开后 Gradio 会生成新连接,刷新一下浏览器页面即可重新连接
音频被截断、句子读了一半→ 检查长句切分逻辑是否适配该语种,把样本和日志提交给社区协助调优
EPUB 里混入了不想要的内容→ EPUB 格式没有统一的章节标准,转换前先手动删掉前言、广告等文字
写在最后
项目路线图上还排着 iOS/Android 应用、更多 TTS 引擎接入(GPT-SoVITS、F5-TTS 等)和云端服务集成,功能在持续快速迭代中。
今晚就挑一本吃灰的外语书,让它用"你的声音"读给你听吧 🎧
小提示:收藏本文方便随查,有转换样本或语种调优建议,欢迎反馈给社区。
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考