如何用 Buzz 做离线语音转文字:音频到字幕三步搞定,本地转录完整指南
2026/9/20 20:12:35 网站建设 项目流程

如何用 Buzz 做离线语音转文字:音频到字幕三步搞定,本地转录完整指南

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款免费开源的离线语音转文字桌面工具。它用 OpenAI Whisper 模型在你自己的电脑上把音频、视频转成文字并翻译,全程不上传任何音频,适合需要会议记录、视频字幕制作和敏感内容整理的用户。它支持近百种语言、多种 Whisper 后端,MIT 许可证。

🚀 最短路径:三步拿到转录结果

先拿安装包。macOS 下载 .dmg,Windows 下载安装程序(安装包未签名,安装时弹出安全提示属正常现象,选"更多信息"→"仍要运行"即可)。Linux 用户一条命令:

flatpak install flathub io.github.chidiwilliams.Buzz

习惯命令行的话用 pip 装。前提是机器上已装好 ffmpeg,Python 版本按 README 要求准备:

pip install buzz-captions python -m buzz

打开主界面后三步走:导入音频或视频(也可以直接粘贴一个 URL),在任务列表里选好模型、语言和任务,点"运行"。

只想出文件、不看界面的话,一行命令搞定:

buzz add --srt --vtt --language zh meeting.mp3

这条命令用默认的 Whisper 后端、默认的 tiny 模型(最小、最快),把 meeting.mp3 按中文转写,在文件旁边同时生成 SRT 和 VTT 字幕。末尾可以跟多个文件(1.4.6 起支持一次传多个),也可以加--hide-gui把主窗口完全藏起来。

📝 如何把会议录音转成文字

场景:手里有一段访谈录音或一小时会议音频,想要一份可编辑的文本记录。

导入文件,在任务表格中为它选好模型、语言,运行。每个文件的状态都在表里:排队中、进行到百分之几、用时多少,一目了然。

几个值得知道的细节:

  • 模型大小决定速度与准确率的平衡。机器慢就用 tiny 或 base 先出结果,在意准确率再上 medium 以上。
  • 语言确定就指定(如zh),不确定就留空让它自动检测。
  • 转录完成后双击任务进入转录查看器,支持搜索、播放和调速回放。
  • 要批量处理,设置"监视文件夹":新文件落进某个目录,Buzz 自动建任务并转录。入口在偏好设置的 Folder Watch 选项卡。

🎬 如何给视频生成字幕并调整时长

场景:做教程视频,要一份能直接导入剪辑软件的字幕文件。

导入视频文件即可,Buzz 自动抽取音轨,不用自己转格式。任务选"转录",按机器性能选 small 或 medium 模型,运行。完成后打开转录查看器核对:表格每一行带起止时间戳,点一行就播放对应音频片段。

字幕行太长、不适合上屏时,打开 Resize 功能:把间隔小于 0.2 秒的短句合并成一行、按标点断开、限制每行最大长度,默认值通常够用,点 Merge 就完事。导出 SRT 或 VTT 直接进剪辑软件。需要更精细的对齐时,在高级设置里打开"字级时间戳",每个词都有独立时间点。

🎙️ 如何实时转录讲座并区分发言人

场景:现场活动或授课,要文字实时出现,还要分清是谁说的。

切换到"实时录音"模式,选好麦克风,按下录音。Buzz 边听边转,每隔几秒吐出一段文字。现场演示可以弹出演示窗口,把实时文字投到大屏上,字号可调。

多人对话可以再做说话人识别:在查看器里点"Identify speakers",MSDD 模型会自动把句子聚成不同说话人,已知人数时也可以手动指定数量。识别结果可试听每人的 10 秒片段确认音色,再把标签改成真名保存。注意说话人识别在 Intel macOS 上不可用。

环境嘈杂的录音,转录前勾选"提取语音"(命令行参数是--extract-speech),先把人声从背景噪声里分离出来,准确率会好一截。

常见坑速查

问:转录太慢,怎么提速?先换小模型(tiny/base);再换 Whisper.cpp 后端——它是 C++ 实现,Vulkan 加速覆盖包括核显在内的大多数显卡。Nvidia 独显且有 6GB 以上显存的机器,用 Faster Whisper,比原版实现快一个数量级。

问:large 系模型那么多版本,怎么选?Large-V2 准确率稳定;Large-V3 最新、多数场景最好,但偶尔会"脑补"音频里没有的词;Turbo 偏速度准确率平衡。名字带 .En 的模型只认英文。没有标准答案,用自己语言的音频各试一遍最可靠。

问:专业名词、人名总认错?两招:在高级设置里填"初始提示"(一段带领域上下文的文字,把常用术语写进去);语言已知就手动指定,别依赖自动检测。

问:机器完全没网,能用吗?能。在有网的机器上下载好模型,把模型文件夹整个拷到离线机的同一位置(Linux 是~/.cache/Buzz)即可,模型位置在偏好设置的 Models 页点"Show file location"就能看到。

问:Windows 安装提示安全警告 / 录音没声音?未签名的警告是正常现象(更多信息 → 仍要运行)。录音没声音多半是系统隐私设置挡住了 Buzz 的麦克风权限;另外 CPU 需要支持 AVX2,太老的机器跑不了。

🔍 技术底座大白话:架构与扩展入口

一句话概括:PyQt6 桌面应用 + 本地 SQLite 数据库 + 可插拔的转录后端。

  • 数据层:转录历史和设置全存在本地 SQLite,实体定义与数据访问在 buzz/db/。
  • 后端层:Whisper、Whisper.cpp、Faster Whisper、Hugging Face、OpenAI API 五种后端在 buzz/transcriber/ 目录里各占一个文件,接新后端从这里入手最清楚。
  • 插件层:一个插件就是一个文件夹,plugin.py 里定义一个BuzzPlugin子类,挂进"转录前/转录后"钩子。内置了 AI 摘要、DOCX 导出、字幕自动调整等,见 buzz/plugins/。
  • 命令行全参数:docs/docs/cli.md 列了完整选项和示例。

📚 去哪找更多资料

官方文档 docs/docs/ 目录按场景组织(文件导入、实时录音、翻译、编辑调整、说话人识别、查看器、插件),卡住时按场景翻对应一篇。模型选择、GPU 加速、离线使用这些高频问题在 FAQ 里都写得很细。遇到 bug 或有改进想法,直接去项目 Issues 页提交,维护者更新频率很高。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询