Buzz 离线语音转写完整指南:从安装到 GPU 加速只需 10 分钟
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款运行在你自己电脑上的免费离线音频转写工具,内置 OpenAI Whisper 模型,支持 Whisper.cpp、Faster-Whisper 和 Hugging Face 多种后端,无需联网即可将录音、播客或视频音轨转成带时间戳的文字稿。本指南面向第一次接触 Buzz 的用户,带你完成安装、首次转写、模型选择和性能调优。
为什么本地转写值得投入
🔒 隐私是本地转写最直接的收益:你的音频文件永远不出电脑,不存在上传到第三方服务器的风险。其次是零成本——模型一次下载后永久免费使用,没有按分钟计费的焦虑。Buzz 同时支持 NVIDIA GPU(CUDA)、Apple Silicon 和集显(Vulkan),即使没有独立显卡也能跑出可用的速度。
与在线转写服务对比:
| 维度 | 在线服务 | Buzz 本地转写 |
|---|---|---|
| 隐私 | 音频上传到服务器 | 文件不出本机 |
| 费用 | 按时长/次数计费 | 免费,模型一次下载 |
| 网络依赖 | 必须联网 | 完全离线可用 |
| 语言支持 | 取决于服务商 | 90+ 种语言 |
三种安装方式,选一个适合你的
Buzz 提供三种安装途径,根据你熟悉的系统选择即可。
方式一:图形安装包(推荐新手)
前往 SourceForge 下载对应系统的安装包:macOS 是.dmg,Windows 是安装程序。Windows 安装包未签名,安装时系统会弹出安全提示,点击「更多信息」→「仍要运行」即可。
方式二:Linux 包管理器
flatpak install flathub io.github.chidiwilliams.Buzz这条命令通过 Flatpak 从 Flathub 仓库安装 Buzz,不需要手动编译。如果你更习惯 Snap,也可以运行sudo snap install buzz。
方式三:pip 从源码安装
先确保系统已安装 ffmpeg 并使用 Python 3.12 环境,然后执行:
pip install buzz-captions python -m buzzpip install从 PyPI 拉取 Buzz 包及其依赖,python -m buzz启动图形界面。适合想要跟踪最新开发版本的用户。
第一次转写:导入音频、选模型、点开始
打开 Buzz 后,你会看到上面这样的任务列表界面。第一次转写只需三步:
- 导入音频。点击工具栏上的「+」按钮,在文件选择器中挑选 MP3、WAV、FLAC、M4A 等格式的音频或视频文件。Buzz 也支持直接粘贴 YouTube 链接导入。
- 选择模型和语言。在导入对话框里,从下拉列表选择 Whisper 模型(首次使用建议选
base或small),指定音频语言或留空让 Buzz 自动检测。任务类型选「Transcribe」做同语言转写,选「Translate to English」则把外语翻译成英文。 - 点击 OK 开始转写。任务加入队列后,进度条会实时更新。完成后双击任务行即可打开转写查看器。
转写查看器支持按段落播放、调速和文字搜索,适合边听边校对。
模型怎么选:大小、后端与 GPU 加速
Buzz 内置四种本地模型后端,各有侧重:
- Whisper.cpp:纯 C++ 实现,CPU 上表现稳定,支持量化(如
q5、q8)降低内存占用。 - Faster-Whisper:基于 CTranslate2 的优化版,GPU 加速下速度明显快于原版 Whisper。
- Whisper(原版):PyTorch 实现,生态兼容性最好。
- Hugging Face Whisper 类型:支持 Whisper 之外的其他 Transformer 语音模型。
打开首选项(Ctrl/Cmd + ,)→「Models」标签页,可以下载、删除和切换模型。
模型大小怎么选:
| 模型 | 适用场景 | 大致内存需求 |
|---|---|---|
| tiny | 快速草稿、低配设备 | ~1 GB |
| base / small | 日常会议、播客 | ~2 GB |
| medium | 高质量转写 | ~5 GB |
| large-v3 | 专业级、多语言混合 | ~10 GB |
GPU 加速要点:NVIDIA 显卡用户安装 Buzz 时注意选择带 CUDA 支持的 PyTorch 版本;Apple Silicon 用户自动使用 Metal 后端;其他 GPU(包括集显)可以通过 Whisper.cpp 的 Vulkan 支持获得加速。如果在首选项「General」中勾选「Reduce GPU RAM」,Buzz 会对模型做 8 位量化,以少量精度损失换取更低的显存占用。
实时录音与演示模式
Buzz 不只能转写文件,还支持麦克风实时转写。点击工具栏的录音按钮,Buzz 会持续监听麦克风并将语音实时转成文字。
这个功能在两个场景特别有用:
- 会议记录:开着 Buzz 开会,结束后直接拿到完整文字稿。
- 现场演讲:启用「Presentation Window」(演示窗口),实时字幕会放大显示在独立窗口中,可以投屏给观众看。实时转写还有三种模式:在末尾追加、在顶部追加、以及「追加并修正」(会回溯修正上一句的错误,但更耗资源)。
导出与后处理:从文字稿到字幕文件
转写完成后,右键任务行可以选择导出格式:
- TXT:纯文本,适合快速浏览。
- SRT / VTT:带时间戳的字幕文件,可直接拖进视频编辑器或视频播放器。
Buzz 还提供几个实用的后处理功能:
- 说话人识别:自动区分录音中不同人的发言,在文字稿前加上说话人标签。
- 语音分离:在转写前先用 Demucs 把混叠的人声分开,适合多人重叠说话的嘈杂录音。
- 段落重新分段(Resize):手动拖拽调整段落边界,让时间戳更贴合实际语句节奏。
提速的隐藏设置项
Buzz 的部分高级参数不暴露在图形界面上,而是通过环境变量控制。在启动 Buzz 之前设置这些变量即可生效:
| 变量 | 作用 | 示例 |
|---|---|---|
BUZZ_WHISPERCPP_N_THREADS | 控制 Whisper.cpp 使用的 CPU 线程数,默认是核心数的一半。笔记本上设成略低于核心数通常有 15% 左右提速。 | BUZZ_WHISPERCPP_N_THREADS=8 |
BUZZ_FORCE_CPU | 强制使用 CPU 而非 GPU,适合旧显卡反而比 GPU 更快的情况。 | BUZZ_FORCE_CPU=true |
BUZZ_REDUCE_GPU_MEMORY | 对模型做 8 位量化,降低显存占用。 | BUZZ_REDUCE_GPU_MEMORY=true |
BUZZ_MODEL_ROOT | 自定义模型文件的存储目录,方便统一管理。 | BUZZ_MODEL_ROOT=/data/models |
以 macOS / Linux 为例,可以写一个启动脚本run_buzz.sh,在里面export这些变量再调用buzz;Windows 下则用run_buzz.bat配合set命令。
常见坑与解决思路
转写速度慢:先确认是否启用了 GPU 加速(查看系统监控里 GPU 使用率);如果显存紧张,勾选「Reduce GPU RAM」或换小一号的模型;CPU 用户可以适当调低BUZZ_WHISPERCPP_N_THREADS。
模型下载失败:Buzz 默认从 Hugging Face 拉取模型文件。如果网络不稳定,可以手动下载.bin或.ct2模型文件,然后在 Whisper.cpp 的模型选择里选「Custom」,粘贴文件的本地路径或直链 URL。
转写结果不准确:换更大的模型通常是最有效的办法;其次检查音频信噪比,嘈杂环境下可以先用语音分离功能;对于专业术语较多的录音,在转写选项里填写initial_prompt(一段提示文字),帮助模型锁定领域词汇。
下一步
想深入了解 Buzz 的更多能力,可以从项目文档入手:docs/docs/ 目录下的cli.md讲命令行自动化,faq.md汇总了高频问题。插件系统源码在 buzz/plugins/,目前包含 AI 摘要生成、Docx 导出、自动跳过已转写文件等扩展,适合有定制需求的用户参考。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考