Buzz 离线语音转录完全指南:为什么选它,以及如何在 5 分钟内转写出第一份音频
2026/9/7 6:05:52 网站建设 项目流程

Buzz 离线语音转录完全指南:为什么选它,以及如何在 5 分钟内转写出第一份音频

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款在你个人电脑上完成离线语音转录的桌面工具,基于 OpenAI Whisper 引擎,把音频或视频转换成文字与字幕。全程不依赖网络,音频数据从不离开设备,同时支持 99 种以上语言的识别与翻译。本文从安装讲起,覆盖最短转录路径、核心功能、性能调优与常见故障排查。

一、它替谁解决了什么问题

Buzz 面向的不是某一种用户,而是所有"有音频、要文字、且不方便上传云"的人:

  • 记者:采访结束后把录音拖进 Buzz,开启实时转录即可边录边看文字雏形,导出 TXT 直接进入编辑环节。采访对象的发言不需要经过任何第三方服务器。
  • 研究人员:处理多语言讲座、访谈资料时,支持超过 99 种语言的识别,可批量排队多个文件,字幕导出为 SRT 后直接挂到课程视频上。
  • 内容创作者:导入 MP4 后 Buzz 自动提取音轨转录,再用字幕调整功能控制每行时长,导出 SRT/VTT 导入剪辑软件。

二、Windows、macOS、Linux 上如何安装 Buzz

Windows:从发布页下载安装包。程序未签名,安装时如出现 SmartScreen 警告,选择"更多信息"→"仍要运行"即可。

macOS:下载.dmg后拖入应用程序文件夹。原生支持 Apple Silicon,配合 Whisper.cpp 后端性能较好。

Linux

# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # Snap sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz

开发者(PyPI):需 Python 3.12 环境,并预先安装 ffmpeg:

pip install buzz-captions python -m buzz

三、从导入到出结果的最短路径:3 步

  1. 拖入文件:把 MP3、WAV、FLAC、MP4 等文件直接拖到主界面,或点击左上角"+"按钮选择文件,也支持导入 YouTube 链接。
  2. 选模型、定参数:在任务行中选择 Whisper 模型(Tiny 最快,Large 最准)、语言与任务类型(转录或翻译)。
  3. 运行并导出:点击运行,进度条走完后双击该行打开转录查看器,在导出菜单中选择 TXT、SRT 或 VTT。

四、Buzz 核心功能拆解:实时转录、文件夹监视与说话人识别

实时麦克风转录

选中录音设备后点击录制,Buzz 提供三种模式:追加下方追加上方追加并校正。第三种会在后续音频中回填修正前面的识别结果,适合长会议。演示窗口模式可以把字幕投到大屏,方便演讲现场使用。

文件夹监视自动转录

在偏好设置中指定输入文件夹,Buzz 会监视该目录,新放入的音频自动排队转录,输出保存到配置的路径。配合导出模板可自动命名文件,适合"录音笔一放就转"的工作流。

说话人识别

多人对话时,Buzz 可先做语音分离再转录,并自动给每个说话人打标签,导出后能清楚区分"谁说了什么"。实现入口见查看器中的说话人识别面板,源码位于 buzz/widgets/transcription_viewer/speaker_identification_widget.py。

多格式导出与字幕调整

查看器支持全文搜索、按片段播放和倍速。"调整大小"功能可以按标点拆分或合并片段,控制单条字幕长度:

模型管理与快捷键

在"模型"标签页可下载、删除和管理不同规格的 Whisper 模型,已下载模型缓存在本地,之后离线可用。

快捷键(录制、导入、播放控制等)全部可在偏好设置中自定义,减少鼠标操作。插件系统还提供 AI 摘要、跳过已转录片段等扩展,目录见 plugins/。

五、让转录更快更准的做法

提速:低配机器选 Tiny/Base 模型;有 Nvidia GPU(6GB 显存以上)用 Faster Whisper 后端;其他 GPU 或 Mac 用 Whisper.cpp(支持 Vulkan 加速);关闭其他高负载程序。

提准:尽量在安静环境录音;手动指定语言而非自动检测;重要内容用 Large 系列模型;在"初始提示"里填入专有名词和术语,能显著减少同音字错误。

六、遇到问题先查这里

1. 转录速度太慢原因:模型过大或走了纯 CPU。做法:换更小的模型,或在"whisper 类型"中选择 Faster Whisper(Nvidia GPU)/ Whisper.cpp(其他设备)。

2. 启动崩溃或模型损坏原因:模型下载不完整。做法:在 帮助→偏好设置→模型 中删除对应模型文件后重新下载。注意 Buzz 要求 CPU 支持 AVX2。

3. 录音报错 Unanticipated host error [PaErrorCode-9999]原因:系统禁止了应用访问麦克风。做法:Windows 检查 设置→隐私→麦克风 权限;其他系统检查音频输入权限与杀毒软件拦截。

4. 完全离线的电脑能不能用可以。做法:先在有网电脑上下载好模型,把模型目录整体拷贝到离线机器的同一缓存位置(Linux 为~/.cache/Buzz),或用 scripts/download-models.py 预先准备模型缓存。

七、去哪里看更多

  • 官方文档(含 CLI 用法、偏好设置详解):docs/docs/
  • 说话人识别实现:buzz/widgets/transcription_viewer/speaker_identification_widget.py
  • 插件系统与内置插件:plugins/

Buzz 的价值很直接:识别引擎在本地跑,数据不出机器,流程又是"拖入—运行—导出"三步。想先跑通一遍,可以按下面清单操作:

  1. 按第二节安装 Buzz,下载一个 Base 或 Small 模型;
  2. 拖入一段 1 分钟左右的音频,指定语言后点击运行;
  3. 打开查看器核对文字,分别导出一次 TXT 和 SRT,确认结果格式符合你的用途。

之后再去尝试实时录音、文件夹监视和说话人识别,按需深入。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询