Buzz本地转录:Whisper离线跑的3个场景
2026/9/7 4:16:11 网站建设 项目流程

Buzz本地转录:Whisper离线跑的3个场景

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz已经把会议录音转写完毕,带时间戳的文件正静静躺在桌面。它直接在你的个人电脑上运行OpenAI Whisper模型,音频不离开机器,断网状态下Buzz的本地转录与翻译照常工作。

Buzz是什么:离线音频转录与翻译工具

Buzz要解决的问题只有一个:云端转录服务带来的隐私风险与网络依赖。它把Whisper语音识别模型完整搬到本地,转录、翻译全程离线完成。与同类工具相比,它的差异在于既有图形界面也有命令行,覆盖从单文件到批量监听的完整链路。

它最核心的能力:

  • 音频视频文件离线转录
  • 麦克风实时录音转录
  • 99种语言识别与翻译
  • TXT/SRT/VTT多格式导出
  • 文件夹监控自动处理

装好之后,第一件事是跑通一条最小流程:导入文件、选模型、出结果。

安装Buzz并完成第一次转录

macOS下用安装包装Buzz

到项目发布页下载.dmg文件,拖入应用程序文件夹即可。

Windows下用安装程序装Buzz

下载.exe安装文件并运行。程序未签名,首次安装会弹出警告,选择“更多信息”→“仍要运行”。

Linux下用Flatpak或Snap装Buzz

flatpak install flathub io.github.chidiwilliams.Buzz

Python源码方式安装Buzz

先安装ffmpeg,然后:

pip install buzz-captions python -m buzz

安装完成后,启动Buzz,按Ctrl/Cmd + O导入一段音频,语言选“自动检测”、模型选 tiny,点 Run。状态变成 Completed 后双击该行,就能看到你的第一份逐字稿。整个闭环不超过5分钟。

跑通基本流程后,再看三个真实使用场景。

批量转写已有的会议录音

手头有一整周的访谈录音要出稿时,批量导入是最快路径。

  1. Ctrl/Cmd + O选入多个音频或视频文件
  2. 逐个设置任务(转录/翻译为英文)、语言、模型
  3. 点 Run,任务自动排队执行
  4. 完成后双击任务行打开转录结果

技巧:专有名词容易被转错。点“高级”按钮,在初始提示里列出人名、术语(如“心肌梗死、心电图”),识别准确率会明显提升。完整的语言与模型选项定义在 buzz/transcriber/transcriber.py。

用麦克风实时转写一场会议

讲座、访谈进行中就需要文字时,开启录音转录。

  1. 切换到“录音转录”页面
  2. 选择任务、语言与麦克风设备
  3. 点红色 Record 开始,随时可暂停或停止
  4. 结束后双击任务行查看完整逐字稿

注意:默认Whisper模型计算量大,实时场景建议换用 Whisper.cpp 后端加小模型,延迟会更低。做现场演讲时还能打开演示窗口,把实时字幕投到大屏上。

修正文字并一键导出字幕

机器转写总有错字,Buzz的查看器把修改成本压到最低。

  1. 双击转录记录打开查看器
  2. 直接编辑文字、拖动调整时间戳
  3. 点 Resize 把词级时间戳合并成字幕行
  4. 导出为 TXT、SRT 或 VTT

技巧:转录时勾选“词级时间戳”,后续合并字幕时可按静音间隔重新断句,效果远好于按固定字数切分。

如果你要处理上百个文件,界面操作就不够用了,直接上命令行。

用命令行和文件夹监控批量自动化

CLI适合脚本化场景,一条命令完成转录与导出:

buzz add --model-size small --srt meeting.mp3

所有参数说明见 docs/cli.md。更省事的是文件夹监控:在首选项里配置监控目录后,新音频落盘即自动转录,由 buzz/widgets/transcription_task_folder_watcher.py 实现。

注意:重复导入同一批文件时,可启用 Skip Already Transcribed 插件(见 buzz/plugins/),已出结果的会被直接跳过,不重复消耗算力。

流程跑顺了,再花30秒看懂它内部在做什么。

原理速览:一段音频如何变成文字

Buzz像一个听写间:音频先经 ffmpeg 解码采样进入“听写台”,Whisper模型逐句听写并标好时间位置,结果逐条存入本地数据库,你想导出成什么格式就随时再加工。

模型文件由 buzz/model_loader.py 负责下载与缓存,首次用某个模型时需要联网下载一次,之后完全离线可用。

参数怎么配最划算,看这张表就够了。

选模型与参数:一张表配好Buzz

选项推荐值适用场景
模型大小tiny / base低配电脑、快速初稿
模型大小small日常平衡之选
模型大小large关键内容、嘈杂音频
模型类型Whisper.cpp实时录音、集显、Mac
模型类型Faster Whisper6GB以上显存的N卡
语言手动指定已知语言,明显更准
词级时间戳开启需要导出精细字幕
初始提示填入术语表医学、法律等专业内容

拿不准时选 Whisper.cpp + small + 手动指定语言,这是速度和稳定性的平衡点。

遇到异常时,先对照这张表找原因。

常见问题:症状对照表

症状可能原因解法
转录速度慢得多模型过大换 tiny 或 base 模型
点录音没反应麦克风权限被禁系统设置开启隐私权限
转写到一半崩溃模型文件不完整删除模型重新下载
术语拼写错误多缺少上下文提示初始提示填入专业词汇
字幕太密读不了未生成词级时间戳开启后重新转录
启动直接报错退出CPU不支持AVX2更换较新的处理器

Buzz把Whisper变成你电脑里的离线转写工具:音频不出机器,字幕随取随用。想参与开发,看 CONTRIBUTING.md。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询