3 步把 EPUB 变成带同步字幕的有声书:Abogen 上手指南
【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen
你手里攒着一批 EPUB 和 PDF,想"听"完它们,靠人工读转不现实。Abogen 把 EPUB、PDF 和纯文本转成带同步字幕的有声书:拖入文件、选声音、点开始,音频和字幕一起出来。
🚀 装好它并跑起来
语音合成由 Kokoro-82M 模型完成,各系统都要先装 espeak-ng 组件(负责把文字转成音素,相当于给 TTS 备一本注音字典):
- Windows:装一个 espeak-ng 的 .msi 安装包
- macOS:
brew install espeak-ng - Linux:
sudo apt install espeak-ng(Debian/Ubuntu)
然后装主程序,需要已装 uv,Python 3.10 到 3.12 均可:
uv tool install --python 3.12 abogen有 NVIDIA 显卡的话,包名末尾加[cuda]装上 GPU 加速版。Windows 上也可以直接克隆仓库,双击WINDOWS_INSTALL.bat,Python 都会替你装好:
git clone https://gitcode.com/GitHub_Trending/ab/abogen装完敲abogen打开桌面窗口;敲abogen-web启动 Web 版,浏览器打开 http://localhost:8808 。
🎧 拿它干三件事
想把单个文件变成能听的书
- 拖入 EPUB、PDF、.MD、.TXT 或字幕文件(.srt / .ass / .vtt)
- 语音用两位字母选:第一位是语言(a 美英、b 英英、e 西语、f 法语、z 中文等,共 8 种),第二位是性别,转换前可以先试听预览
- EPUB 和 PDF 自动识别章节,可每章存一个音频文件,再加一份合并版
- M4B 输出会写入章节和封面元数据,有声书播放器能直接翻章
- 音频可选 WAV、FLAC、MP3、OPUS,OPUS 体积最小
想批量转换一堆文件
- 逐个把文件加入队列,每项保留加入时的配置
- 勾选"覆盖项目设置",可以强制整个队列用当前配置
- 按顺序自动跑完,不用守着
想给视频配音或做定时脚本
- 拖入 .srt / .ass / .vtt,直接得到时间轴对得上的音频
- 字幕输出支持 SRT 和多种 ASS 版式,方便叠到视频上
- 也可以写带 HH:MM:SS 时间戳的文本,Abogen 按指定时间点朗读
⚙️ 调一调:GPU、声音、字幕
按操作顺序来:
- 先开 GPU 开关。NVIDIA 用户用
uv tool install --python 3.12 abogen[cuda]安装;启动时若看到 "CUDA GPU is not available. Using CPU",说明回落到 CPU,能跑但慢。把 CUDA 理解成第二台发动机,没有也能开,只是肉。 - 选声音,再试听。主界面语音下拉里用两位字母选,点预览听效果。想要独一份的音色,打开 Voice Mixer 按权重混合两三个声音模型,存成 profile 下次直接复用。
- 拉语速和字幕粒度。语速 0.1x 到 2.0x 可调;字幕从行级、句级到单词级,单词级时间戳目前只有英文支持,其他语言自动落到句级。
- 准备离线用。设置菜单里有"预下载模型与语音",下完一次就能断网转换。
🖥️ 换个方式跑
| 方式 | 命令 | 适合谁 |
|---|---|---|
| 桌面版 | abogen | 单机使用、拖放文件、离线跑 |
| Web 版 | abogen-web | 用更新的功能:LLM 文本规范化、Audiobookshelf 推送、Supertonic TTS |
| 容器 | docker build+docker run | 跑在服务器上,机器上没有 Python 环境 |
容器从仓库根目录执行:
mkdir -p ~/abogen-data docker build -t abogen . docker run --rm -p 8808:8808 -v ~/abogen-data:/data --name abogen abogen上传文件落在 /data/uploads,结果在 /data/outputs;带 GPU 的编排配置见 docker-compose.yaml。
🛠️ 卡住了怎么办
Q:安装时报 "No matching distribution found"?A:只支持 Python 3.10 到 3.12,换个版本再试,推荐用 uv 装。
Q:警告 "CUDA GPU is not available. Using CPU"?A:PyTorch 回落到了 CPU,照样能用只是慢。Windows 只支持 NVIDIA,AMD 要在 Linux 上走 ROCm,也可以换 CUDA 版本重装。
Q:Linux 下abogen提示 command not found,还警告脚本不在 PATH?A:执行echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc && source ~/.bashrc把 uv tool 的目录加进 PATH。
Q:日语声音生成不出来?A:Kokoro 的日语文本规范化要额外依赖,装好日语语言包再试。
Abogen 能从 EPUB、PDF、TXT 一路做到"音频 + 同步字幕",GPU 或 CPU 都能跑。挑一本 EPUB 拖进去试试,或者先翻翻 官方文档。
【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考