Buzz 离线语音转文字完整指南:3个场景搞定音频转文字
2026/9/7 10:05:41 网站建设 项目流程

Buzz 离线语音转文字完整指南:3个场景搞定音频转文字

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款开源的离线语音转文字工具,基于 OpenAI Whisper 模型,把转录与翻译全部放在你本机完成,支持文件导入、麦克风实时录音和 TXT、SRT、VTT 等格式导出。本文按三个典型场景走通完整流程。

📦 安装 Buzz:Windows、Mac、Linux 各走一条路

按你的系统选一条路:

  • macOS:下载.dmg安装包直接装。
  • Windows:下载安装包;应用未签名,首次运行会有警告,选"更多信息" → "仍要运行"即可。
  • Linux:走 Flatpak 或 Snap。
  • PyPI:需要 Python 3.12 并预装 ffmpeg,执行pip install buzz-captions后用python -m buzz启动。

首次运行要下载 Whisper 模型。若目标机器完全离线,可把联网机器上的models目录(Linux 默认在~/.cache/Buzz)复制到离线机器相同位置,仓库里的 scripts/download-models.py 就是为准备离线模型缓存写的。

flatpak install flathub io.github.chidiwilliams.Buzz # 或 Snap: sudo snap install buzz

🎧 场景一:把采访录音批量转成文字

Buzz 主界面是任务列表:每个音频占一行,显示状态、所用模型和导出路径。

第一次转录的三步操作

  1. 菜单"文件 → 导入媒体文件",或按Ctrl/Cmd + O,选择 MP3、WAV、MP4 等文件。
  2. 选任务(转录或翻译成英文)、语言和模型,点"运行"。
  3. 状态变为 Completed 后双击该行,打开转录查看器。

右侧选项里还能设置导出格式(TXT/SRT/VTT)、开启Word-Level Timings生成逐字时间戳,或勾选Extract speech先抽取人声再转录,提升嘈杂录音的准确率。

模型尺寸与后端怎么选

尺寸从 tiny 到 large:越小越快、误差越多,日常用small起步通常够用。后端按硬件选:

  • Whisper:官方实现,准确但慢、吃内存。
  • Whisper.cpp:C++ 实现,独立显卡、核显甚至纯 CPU 都能跑。
  • Faster Whisper:需要 6GB 以上显存的 Nvidia 显卡。
  • HuggingFace:支持自定义模型和 MMS 多语言模型家族。

另外两个细节:高级设置里的Initial prompt可填入容易拼错的人名、术语,减少专名词误识别;已知语种时手动指定语言,比自动检测更稳。

🎤 场景二:讲座或会议的实时转录

切到录音界面,选好任务、语言、模型和麦克风,点Record即开始,文字随讲话滚动输出。转录模式有三种:追加在下方、追加在上方、追加并纠正(持续修正上一句尾部,负载更高)。

做现场活动时可打开演示窗口,把实时文字用大字号投到第二块屏幕。实时转录还能把文本文件持续导出,方便接进 OBS 等直播工具。

两条经验提示:

  • 实时转录负载大,优先Whisper.cpp加小模型(base 及以下)。
  • 环境嘈杂时调高静音阈值,低于阈值的声音直接不转。

🎬 场景三:把转录稿变成能用的字幕

转录查看器支持搜索、播放和倍速调整,可以边听音频边逐段核对、修改边界。

字幕分段调整

原始分段对字幕来说往往太长。Resize 功能把词级分片重新组合成字幕长度的段落:按标点拆句、按静音间隔合并、限定单条字幕最大长度。前提是转录时开启了词级时间戳。

🧩 用插件扩展转录流水线

1.4.5 起内置插件系统:菜单Help → Plugins里可启用/停用、拖拽调整执行顺序。自带的几个覆盖了常见需求:

  • AI Summary:转录后用 OpenAI 兼容 API 生成摘要。
  • DeepFilterNet:转录前先去除背景噪音。
  • Enhanced Language Detection:对未知语种文件自动检测语言。
  • Skip Already Transcribed:同目录已有.srt/.txt的文件直接跳过。
  • Export to DOCX:一键导出 Word 文档。

插件源码在 buzz/plugins/ 目录,读它的结构就能照着写自己的插件。

⌨️ 命令行与文件夹监控的批量自动化

文件多时用buzz add命令行:

buzz add --task transcribe --model-type whispercpp --model-size small \ --prompt "录音中常出现 AlphaGo 这个词" --srt --vtt interview.mp3

--hide-gui可隐藏主窗口后台运行;完整参数说明见 docs/docs/cli.md。整目录批处理可以写个循环:

for f in *.mp3; do buzz add --hide-gui "$f"; done

偏好在 Folder Watch 选项卡里还能设监控目录:放入的音频自动排队转录,配合跳过插件就不会重复跑。

⚡ 速度不够时先做这 3 件事

  1. 换小一号的模型或改用 Whisper.cpp 后端;显存紧张时选q_5这类量化版本。
  2. 设置环境变量BUZZ_WHISPERCPP_N_THREADS调线程数:16 线程笔记本设为8约有 15% 提速,设得再高反而变慢。
  3. 老显卡比 CPU 还慢或有兼容问题,设BUZZ_FORCE_CPU=true强制 CPU;显存不够用BUZZ_REDUCE_GPU_MEMORY=true做 8bit 量化。

另外注意:Buzz 要求 CPU 支持 AVX2,非常老的机器跑不起来。

下一步行动

  1. 按你的系统装好 Buzz,挑一段短音频完成第一次转录。
  2. 下载与硬件匹配的模型,试一次实时录音并打开演示窗口。
  3. 文件量大时,把 CLI 循环命令和文件夹监控配好,让机器自己跑。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询