Buzz 语音转文字完整实战指南:从零安装到字幕导出
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款免费的开源语音转文字工具,能在你的电脑上离线完成音频转录与翻译,核心由 OpenAI 的 Whisper 模型驱动,支持导入音频文件、麦克风实时录音,并导出 TXT、SRT、VTT 字幕,全程不需要把文件传到云端。本文按"装好 → 转出第一段文字 → 提速 → 导出 → 排错"的顺序带你走完全流程。
一、三种安装方式:先让 Buzz 跑起来
这一节解决"怎么把它装到我电脑上"的问题,Windows、macOS、Linux 都能覆盖。
Windows 和 macOS
先去官方发布页下载对应系统的安装包:macOS 是.dmg,Windows 是安装程序。Windows 的应用没有做签名,安装时会弹出警告,点More info再选Run anyway即可。
Linux
Snap 方式需要先补上音频依赖库,再安装主程序并授权密码存储:
sudo apt-get install libportaudio2 libcanberra-gtk-module sudo snap install buzz sudo snap connect buzz:password-manager-service如果你用 Flatpak,一条命令就够了:
flatpak install flathub io.github.chidiwilliams.Buzz通过 PyPI 安装
已经有 Python 3.12 和 ffmpeg 的话,可以直接从 PyPI 装,装完用模块方式启动:
pip install buzz-captions python -m buzzLinux 上可能还要补装 libportaudio2 等系统库,完整清单见 官方安装文档。
二、第一次转录:把音频变成文字
四步之内,你会看到自己的第一段转录结果。
先点工具栏的 "+" 按钮(快捷键Ctrl+O)添加音频或视频文件,也支持粘贴 YouTube 链接;再在任务列表里选择任务类型——Transcribe是保留原文转文字,Translate to English是翻译成英文,建议手动指定语言而不是自动检测,准确率更稳;最后点Run,状态变成 Completed 后双击这一行就打开结果。
Whisper 模型是"听过多少种声音的耳朵",档位从 tiny 到 large,越大越准也越慢,第一次用 tiny 就够。
转录完成后双击打开转录查看器,可以边播音频边校对,用Ctrl+F搜索文字,逐行核对时间戳:
三、实时录音:麦克风转实时文字
会议和讲座不想等录音结束?这一节让你边说边出文字 🔊
在实时录音面板先选任务、语言和麦克风,再点Record,文字会随说话逐句出现。文字有三种追加模式:新句子加在下方、加在上方、或者"追加并纠错"(会回头修正上一句的错误,更吃算力),在偏好设置里切换。
两个注意点:默认 Whisper 模型比较重,实时场景建议换 Whisper.cpp 配小模型更跟得上;录音进行中可以打开Presentation window,把大字号字幕投到屏幕上,适合现场活动。
如果录音源是电脑本身播放的声音而不是麦克风,需要先把它路由到虚拟音频设备(BlackHole、VB CABLE 或 PulseAudio 虚拟声卡),再在 Buzz 里选这个设备作为输入,步骤见实时录音文档。
四、选模型与 GPU 加速:提速的关键
转录太慢或太不准?多半出在模型档位和硬件这两处 ⚙️
按硬件挑模型档位
- 老款笔记本:tiny / base,快,精度一般
- 日常使用:small,速度和质量的平衡点
- 要更高准确率:medium
- 工作站级别:large
已下载的模型可以在偏好设置(Ctrl+,)→ 模型设置里查看和删除:
打开 GPU 加速
Buzz 支持多种后端:Nvidia 显卡走 CUDA,Mac 的 Apple Silicon 有原生加速,Whisper.cpp 则支持 Vulkan,覆盖大部分独立显卡和核显。做实时转录时,Whisper.cpp 加小模型通常是最快组合。
用环境变量精调
一些高级项要靠启动前设环境变量,比如写一个 run_buzz.sh:
#!/bin/bash export BUZZ_MODEL_ROOT=/data/models/buzz export BUZZ_WHISPERCPP_N_THREADS=8 export BUZZ_FAVORITE_LANGUAGES=zh,en buzz第一条改模型存放目录,第二条限制 CPU 线程数(官方文档的测试里设为核数一半反而更快),第三条把常用语言顶到语言列表最前。完整变量说明在偏好设置文档。
五、导出结果:字幕和纯文本
转录完只是走完一半,这一节帮你把成果变成能用的格式。
在转录查看器里点导出按钮,可选TXT、SRT、VTT等格式。做字幕的话,用Resize工具把逐词计时的行合并成完整字幕行,可以设每行最大长度、是否按标点断句,还能给每条字幕追加在屏时长;如果原始音频文件还在本机,它还会分析静音点让字幕打点更准,详见编辑与调整文档。
不想开图形界面可以用命令行批量处理,例如把本地视频转成字幕:
buzz add --task transcribe \ --model-type whispercpp --model-size small \ --srt --vtt meeting.mp4完整参数见 CLI 文档,支持指定模型类型、语言、初始提示词等。
六、常见卡点与维护
中途卡住了?先对照下面这份清单自查。
- Windows 安装弹安全警告:应用未签名,属正常现象,选 More info → Run anyway 即可
- Linux 没有录音设备:确认装过 libportaudio2,snap 版要执行密码服务授权那条命令
- 模型下载慢:按偏好文档设置 HF_ENDPOINT 指向镜像源
- 人名专名总被转错:在导入任务的 Advanced 选项里填 Initial prompt,把常用名字写进去
- 实时转录卡:换更小的模型,观察队列长度,必要时调大"Transcription step"
用一段时间后可以回偏好设置删掉不用的模型腾空间;换机器时把模型目录整体搬走,再把 BUZZ_MODEL_ROOT 指过去就行。
到这里,安装、首转、提速、导出、排错五个环节就都跑通了。下一步建议先拿一段真实的会议录音完整走一遍"导入 → 转录 → 导出 SRT",模型拿不准时回到第四节的档位对照表按自己的硬件选。🏁
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考