Buzz 离线语音转写完整指南:从安装到 GPU 加速只需 10 分钟
2026/9/10 11:58:37 网站建设 项目流程

Buzz 离线语音转写完整指南:从安装到 GPU 加速只需 10 分钟

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款运行在你自己电脑上的免费离线音频转写工具,内置 OpenAI Whisper 模型,支持 Whisper.cpp、Faster-Whisper 和 Hugging Face 多种后端,无需联网即可将录音、播客或视频音轨转成带时间戳的文字稿。本指南面向第一次接触 Buzz 的用户,带你完成安装、首次转写、模型选择和性能调优。

为什么本地转写值得投入

🔒 隐私是本地转写最直接的收益:你的音频文件永远不出电脑,不存在上传到第三方服务器的风险。其次是零成本——模型一次下载后永久免费使用,没有按分钟计费的焦虑。Buzz 同时支持 NVIDIA GPU(CUDA)、Apple Silicon 和集显(Vulkan),即使没有独立显卡也能跑出可用的速度。

与在线转写服务对比:

维度在线服务Buzz 本地转写
隐私音频上传到服务器文件不出本机
费用按时长/次数计费免费,模型一次下载
网络依赖必须联网完全离线可用
语言支持取决于服务商90+ 种语言

三种安装方式,选一个适合你的

Buzz 提供三种安装途径,根据你熟悉的系统选择即可。

方式一:图形安装包(推荐新手)

前往 SourceForge 下载对应系统的安装包:macOS 是.dmg,Windows 是安装程序。Windows 安装包未签名,安装时系统会弹出安全提示,点击「更多信息」→「仍要运行」即可。

方式二:Linux 包管理器

flatpak install flathub io.github.chidiwilliams.Buzz

这条命令通过 Flatpak 从 Flathub 仓库安装 Buzz,不需要手动编译。如果你更习惯 Snap,也可以运行sudo snap install buzz

方式三:pip 从源码安装

先确保系统已安装 ffmpeg 并使用 Python 3.12 环境,然后执行:

pip install buzz-captions python -m buzz

pip install从 PyPI 拉取 Buzz 包及其依赖,python -m buzz启动图形界面。适合想要跟踪最新开发版本的用户。

第一次转写:导入音频、选模型、点开始

打开 Buzz 后,你会看到上面这样的任务列表界面。第一次转写只需三步:

  1. 导入音频。点击工具栏上的「+」按钮,在文件选择器中挑选 MP3、WAV、FLAC、M4A 等格式的音频或视频文件。Buzz 也支持直接粘贴 YouTube 链接导入。
  2. 选择模型和语言。在导入对话框里,从下拉列表选择 Whisper 模型(首次使用建议选basesmall),指定音频语言或留空让 Buzz 自动检测。任务类型选「Transcribe」做同语言转写,选「Translate to English」则把外语翻译成英文。
  3. 点击 OK 开始转写。任务加入队列后,进度条会实时更新。完成后双击任务行即可打开转写查看器。

转写查看器支持按段落播放、调速和文字搜索,适合边听边校对。

模型怎么选:大小、后端与 GPU 加速

Buzz 内置四种本地模型后端,各有侧重:

  • Whisper.cpp:纯 C++ 实现,CPU 上表现稳定,支持量化(如q5q8)降低内存占用。
  • Faster-Whisper:基于 CTranslate2 的优化版,GPU 加速下速度明显快于原版 Whisper。
  • Whisper(原版):PyTorch 实现,生态兼容性最好。
  • Hugging Face Whisper 类型:支持 Whisper 之外的其他 Transformer 语音模型。

打开首选项(Ctrl/Cmd + ,)→「Models」标签页,可以下载、删除和切换模型。

模型大小怎么选:

模型适用场景大致内存需求
tiny快速草稿、低配设备~1 GB
base / small日常会议、播客~2 GB
medium高质量转写~5 GB
large-v3专业级、多语言混合~10 GB

GPU 加速要点:NVIDIA 显卡用户安装 Buzz 时注意选择带 CUDA 支持的 PyTorch 版本;Apple Silicon 用户自动使用 Metal 后端;其他 GPU(包括集显)可以通过 Whisper.cpp 的 Vulkan 支持获得加速。如果在首选项「General」中勾选「Reduce GPU RAM」,Buzz 会对模型做 8 位量化,以少量精度损失换取更低的显存占用。

实时录音与演示模式

Buzz 不只能转写文件,还支持麦克风实时转写。点击工具栏的录音按钮,Buzz 会持续监听麦克风并将语音实时转成文字。

这个功能在两个场景特别有用:

  • 会议记录:开着 Buzz 开会,结束后直接拿到完整文字稿。
  • 现场演讲:启用「Presentation Window」(演示窗口),实时字幕会放大显示在独立窗口中,可以投屏给观众看。实时转写还有三种模式:在末尾追加、在顶部追加、以及「追加并修正」(会回溯修正上一句的错误,但更耗资源)。

导出与后处理:从文字稿到字幕文件

转写完成后,右键任务行可以选择导出格式:

  • TXT:纯文本,适合快速浏览。
  • SRT / VTT:带时间戳的字幕文件,可直接拖进视频编辑器或视频播放器。

Buzz 还提供几个实用的后处理功能:

  • 说话人识别:自动区分录音中不同人的发言,在文字稿前加上说话人标签。
  • 语音分离:在转写前先用 Demucs 把混叠的人声分开,适合多人重叠说话的嘈杂录音。
  • 段落重新分段(Resize):手动拖拽调整段落边界,让时间戳更贴合实际语句节奏。

提速的隐藏设置项

Buzz 的部分高级参数不暴露在图形界面上,而是通过环境变量控制。在启动 Buzz 之前设置这些变量即可生效:

变量作用示例
BUZZ_WHISPERCPP_N_THREADS控制 Whisper.cpp 使用的 CPU 线程数,默认是核心数的一半。笔记本上设成略低于核心数通常有 15% 左右提速。BUZZ_WHISPERCPP_N_THREADS=8
BUZZ_FORCE_CPU强制使用 CPU 而非 GPU,适合旧显卡反而比 GPU 更快的情况。BUZZ_FORCE_CPU=true
BUZZ_REDUCE_GPU_MEMORY对模型做 8 位量化,降低显存占用。BUZZ_REDUCE_GPU_MEMORY=true
BUZZ_MODEL_ROOT自定义模型文件的存储目录,方便统一管理。BUZZ_MODEL_ROOT=/data/models

以 macOS / Linux 为例,可以写一个启动脚本run_buzz.sh,在里面export这些变量再调用buzz;Windows 下则用run_buzz.bat配合set命令。

常见坑与解决思路

转写速度慢:先确认是否启用了 GPU 加速(查看系统监控里 GPU 使用率);如果显存紧张,勾选「Reduce GPU RAM」或换小一号的模型;CPU 用户可以适当调低BUZZ_WHISPERCPP_N_THREADS

模型下载失败:Buzz 默认从 Hugging Face 拉取模型文件。如果网络不稳定,可以手动下载.bin.ct2模型文件,然后在 Whisper.cpp 的模型选择里选「Custom」,粘贴文件的本地路径或直链 URL。

转写结果不准确:换更大的模型通常是最有效的办法;其次检查音频信噪比,嘈杂环境下可以先用语音分离功能;对于专业术语较多的录音,在转写选项里填写initial_prompt(一段提示文字),帮助模型锁定领域词汇。

下一步

想深入了解 Buzz 的更多能力,可以从项目文档入手:docs/docs/ 目录下的cli.md讲命令行自动化,faq.md汇总了高频问题。插件系统源码在 buzz/plugins/,目前包含 AI 摘要生成、Docx 导出、自动跳过已转写文件等扩展,适合有定制需求的用户参考。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询