Buzz 离线语音转录完全指南:为什么选它,以及如何在 5 分钟内转写出第一份音频
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款在你个人电脑上完成离线语音转录的桌面工具,基于 OpenAI Whisper 引擎,把音频或视频转换成文字与字幕。全程不依赖网络,音频数据从不离开设备,同时支持 99 种以上语言的识别与翻译。本文从安装讲起,覆盖最短转录路径、核心功能、性能调优与常见故障排查。
一、它替谁解决了什么问题
Buzz 面向的不是某一种用户,而是所有"有音频、要文字、且不方便上传云"的人:
- 记者:采访结束后把录音拖进 Buzz,开启实时转录即可边录边看文字雏形,导出 TXT 直接进入编辑环节。采访对象的发言不需要经过任何第三方服务器。
- 研究人员:处理多语言讲座、访谈资料时,支持超过 99 种语言的识别,可批量排队多个文件,字幕导出为 SRT 后直接挂到课程视频上。
- 内容创作者:导入 MP4 后 Buzz 自动提取音轨转录,再用字幕调整功能控制每行时长,导出 SRT/VTT 导入剪辑软件。
二、Windows、macOS、Linux 上如何安装 Buzz
Windows:从发布页下载安装包。程序未签名,安装时如出现 SmartScreen 警告,选择"更多信息"→"仍要运行"即可。
macOS:下载.dmg后拖入应用程序文件夹。原生支持 Apple Silicon,配合 Whisper.cpp 后端性能较好。
Linux:
# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # Snap sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz开发者(PyPI):需 Python 3.12 环境,并预先安装 ffmpeg:
pip install buzz-captions python -m buzz三、从导入到出结果的最短路径:3 步
- 拖入文件:把 MP3、WAV、FLAC、MP4 等文件直接拖到主界面,或点击左上角"+"按钮选择文件,也支持导入 YouTube 链接。
- 选模型、定参数:在任务行中选择 Whisper 模型(Tiny 最快,Large 最准)、语言与任务类型(转录或翻译)。
- 运行并导出:点击运行,进度条走完后双击该行打开转录查看器,在导出菜单中选择 TXT、SRT 或 VTT。
四、Buzz 核心功能拆解:实时转录、文件夹监视与说话人识别
实时麦克风转录
选中录音设备后点击录制,Buzz 提供三种模式:追加下方、追加上方和追加并校正。第三种会在后续音频中回填修正前面的识别结果,适合长会议。演示窗口模式可以把字幕投到大屏,方便演讲现场使用。
文件夹监视自动转录
在偏好设置中指定输入文件夹,Buzz 会监视该目录,新放入的音频自动排队转录,输出保存到配置的路径。配合导出模板可自动命名文件,适合"录音笔一放就转"的工作流。
说话人识别
多人对话时,Buzz 可先做语音分离再转录,并自动给每个说话人打标签,导出后能清楚区分"谁说了什么"。实现入口见查看器中的说话人识别面板,源码位于 buzz/widgets/transcription_viewer/speaker_identification_widget.py。
多格式导出与字幕调整
查看器支持全文搜索、按片段播放和倍速。"调整大小"功能可以按标点拆分或合并片段,控制单条字幕长度:
模型管理与快捷键
在"模型"标签页可下载、删除和管理不同规格的 Whisper 模型,已下载模型缓存在本地,之后离线可用。
快捷键(录制、导入、播放控制等)全部可在偏好设置中自定义,减少鼠标操作。插件系统还提供 AI 摘要、跳过已转录片段等扩展,目录见 plugins/。
五、让转录更快更准的做法
提速:低配机器选 Tiny/Base 模型;有 Nvidia GPU(6GB 显存以上)用 Faster Whisper 后端;其他 GPU 或 Mac 用 Whisper.cpp(支持 Vulkan 加速);关闭其他高负载程序。
提准:尽量在安静环境录音;手动指定语言而非自动检测;重要内容用 Large 系列模型;在"初始提示"里填入专有名词和术语,能显著减少同音字错误。
六、遇到问题先查这里
1. 转录速度太慢原因:模型过大或走了纯 CPU。做法:换更小的模型,或在"whisper 类型"中选择 Faster Whisper(Nvidia GPU)/ Whisper.cpp(其他设备)。
2. 启动崩溃或模型损坏原因:模型下载不完整。做法:在 帮助→偏好设置→模型 中删除对应模型文件后重新下载。注意 Buzz 要求 CPU 支持 AVX2。
3. 录音报错 Unanticipated host error [PaErrorCode-9999]原因:系统禁止了应用访问麦克风。做法:Windows 检查 设置→隐私→麦克风 权限;其他系统检查音频输入权限与杀毒软件拦截。
4. 完全离线的电脑能不能用可以。做法:先在有网电脑上下载好模型,把模型目录整体拷贝到离线机器的同一缓存位置(Linux 为~/.cache/Buzz),或用 scripts/download-models.py 预先准备模型缓存。
七、去哪里看更多
- 官方文档(含 CLI 用法、偏好设置详解):docs/docs/
- 说话人识别实现:buzz/widgets/transcription_viewer/speaker_identification_widget.py
- 插件系统与内置插件:plugins/
Buzz 的价值很直接:识别引擎在本地跑,数据不出机器,流程又是"拖入—运行—导出"三步。想先跑通一遍,可以按下面清单操作:
- 按第二节安装 Buzz,下载一个 Base 或 Small 模型;
- 拖入一段 1 分钟左右的音频,指定语言后点击运行;
- 打开查看器核对文字,分别导出一次 TXT 和 SRT,确认结果格式符合你的用途。
之后再去尝试实时录音、文件夹监视和说话人识别,按需深入。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考