Buzz本地转录:Whisper离线跑的3个场景
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz已经把会议录音转写完毕,带时间戳的文件正静静躺在桌面。它直接在你的个人电脑上运行OpenAI Whisper模型,音频不离开机器,断网状态下Buzz的本地转录与翻译照常工作。
Buzz是什么:离线音频转录与翻译工具
Buzz要解决的问题只有一个:云端转录服务带来的隐私风险与网络依赖。它把Whisper语音识别模型完整搬到本地,转录、翻译全程离线完成。与同类工具相比,它的差异在于既有图形界面也有命令行,覆盖从单文件到批量监听的完整链路。
它最核心的能力:
- 音频视频文件离线转录
- 麦克风实时录音转录
- 99种语言识别与翻译
- TXT/SRT/VTT多格式导出
- 文件夹监控自动处理
装好之后,第一件事是跑通一条最小流程:导入文件、选模型、出结果。
安装Buzz并完成第一次转录
macOS下用安装包装Buzz
到项目发布页下载.dmg文件,拖入应用程序文件夹即可。
Windows下用安装程序装Buzz
下载.exe安装文件并运行。程序未签名,首次安装会弹出警告,选择“更多信息”→“仍要运行”。
Linux下用Flatpak或Snap装Buzz
flatpak install flathub io.github.chidiwilliams.BuzzPython源码方式安装Buzz
先安装ffmpeg,然后:
pip install buzz-captions python -m buzz安装完成后,启动Buzz,按Ctrl/Cmd + O导入一段音频,语言选“自动检测”、模型选 tiny,点 Run。状态变成 Completed 后双击该行,就能看到你的第一份逐字稿。整个闭环不超过5分钟。
跑通基本流程后,再看三个真实使用场景。
批量转写已有的会议录音
手头有一整周的访谈录音要出稿时,批量导入是最快路径。
Ctrl/Cmd + O选入多个音频或视频文件- 逐个设置任务(转录/翻译为英文)、语言、模型
- 点 Run,任务自动排队执行
- 完成后双击任务行打开转录结果
技巧:专有名词容易被转错。点“高级”按钮,在初始提示里列出人名、术语(如“心肌梗死、心电图”),识别准确率会明显提升。完整的语言与模型选项定义在 buzz/transcriber/transcriber.py。
用麦克风实时转写一场会议
讲座、访谈进行中就需要文字时,开启录音转录。
- 切换到“录音转录”页面
- 选择任务、语言与麦克风设备
- 点红色 Record 开始,随时可暂停或停止
- 结束后双击任务行查看完整逐字稿
注意:默认Whisper模型计算量大,实时场景建议换用 Whisper.cpp 后端加小模型,延迟会更低。做现场演讲时还能打开演示窗口,把实时字幕投到大屏上。
修正文字并一键导出字幕
机器转写总有错字,Buzz的查看器把修改成本压到最低。
- 双击转录记录打开查看器
- 直接编辑文字、拖动调整时间戳
- 点 Resize 把词级时间戳合并成字幕行
- 导出为 TXT、SRT 或 VTT
技巧:转录时勾选“词级时间戳”,后续合并字幕时可按静音间隔重新断句,效果远好于按固定字数切分。
如果你要处理上百个文件,界面操作就不够用了,直接上命令行。
用命令行和文件夹监控批量自动化
CLI适合脚本化场景,一条命令完成转录与导出:
buzz add --model-size small --srt meeting.mp3所有参数说明见 docs/cli.md。更省事的是文件夹监控:在首选项里配置监控目录后,新音频落盘即自动转录,由 buzz/widgets/transcription_task_folder_watcher.py 实现。
注意:重复导入同一批文件时,可启用 Skip Already Transcribed 插件(见 buzz/plugins/),已出结果的会被直接跳过,不重复消耗算力。
流程跑顺了,再花30秒看懂它内部在做什么。
原理速览:一段音频如何变成文字
Buzz像一个听写间:音频先经 ffmpeg 解码采样进入“听写台”,Whisper模型逐句听写并标好时间位置,结果逐条存入本地数据库,你想导出成什么格式就随时再加工。
模型文件由 buzz/model_loader.py 负责下载与缓存,首次用某个模型时需要联网下载一次,之后完全离线可用。
参数怎么配最划算,看这张表就够了。
选模型与参数:一张表配好Buzz
| 选项 | 推荐值 | 适用场景 |
|---|---|---|
| 模型大小 | tiny / base | 低配电脑、快速初稿 |
| 模型大小 | small | 日常平衡之选 |
| 模型大小 | large | 关键内容、嘈杂音频 |
| 模型类型 | Whisper.cpp | 实时录音、集显、Mac |
| 模型类型 | Faster Whisper | 6GB以上显存的N卡 |
| 语言 | 手动指定 | 已知语言,明显更准 |
| 词级时间戳 | 开启 | 需要导出精细字幕 |
| 初始提示 | 填入术语表 | 医学、法律等专业内容 |
拿不准时选 Whisper.cpp + small + 手动指定语言,这是速度和稳定性的平衡点。
遇到异常时,先对照这张表找原因。
常见问题:症状对照表
| 症状 | 可能原因 | 解法 |
|---|---|---|
| 转录速度慢得多 | 模型过大 | 换 tiny 或 base 模型 |
| 点录音没反应 | 麦克风权限被禁 | 系统设置开启隐私权限 |
| 转写到一半崩溃 | 模型文件不完整 | 删除模型重新下载 |
| 术语拼写错误多 | 缺少上下文提示 | 初始提示填入专业词汇 |
| 字幕太密读不了 | 未生成词级时间戳 | 开启后重新转录 |
| 启动直接报错退出 | CPU不支持AVX2 | 更换较新的处理器 |
Buzz把Whisper变成你电脑里的离线转写工具:音频不出机器,字幕随取随用。想参与开发,看 CONTRIBUTING.md。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考