Buzz 离线音频转录指南:本地语音转文字,敏感录音不出你的电脑
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议纪要、播客素材、客户采访录音,这些文件你敢直接传到云端处理吗?多数人的答案是:不敢。Buzz 就是为这种顾虑而生的离线音频转录工具——它把 OpenAI 的 Whisper 语音模型搬到你自己的电脑上,本地语音转文字全程不联网,转完还能顺手翻译。
Buzz 实时转录界面,模型选择和语言设置一目了然
Buzz 是什么:把 Whisper 装进你的电脑 🎙️
Buzz 是一个跨平台的桌面应用,基于 OpenAI Whisper 技术,在你本机的 CPU 或 GPU 上完成音频、视频的转录和翻译。打个比方,它就像一台"家用文字冲洗店":录音往里一放,文字往出一吐,原料和成品始终都在你手里,不用托人代洗。
- 完全本地处理,数据不出设备
- 支持 TXT / SRT / VTT 导出
- 批量任务队列 + 命令行调用
- 麦克风实时转录也支持
从零跑起来:3 步启动 Buzz 🚀
第 1 步:获取代码
git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz拿到项目源码,后面安装和调试都以它为基础。
第 2 步:建虚拟环境并安装
python -m venv .venv source .venv/bin/activate # Windows 用 .venv\Scripts\activate pip install buzz-captionsBuzz 要求 Python 3.12(官方依赖里钉死了这个版本),所以建好虚拟环境再装,能避免污染系统环境。buzz-captions就是 Buzz 的包名,一条命令把所有依赖装齐。
第 3 步:启动验证
buzz等主窗口弹出,任务列表空空的摆着,就说明跑起来了。
主界面:任务列表和工具栏,跑成功长这样
如果卡住了,大概率是这几种情况:
- Python 版本不对→ 确认是 3.12,
python --version查一下 - ffmpeg 没装→ 音频解码靠它,去 ffmpeg.org 装一个并加入 PATH
- 首次转录特别慢→ 模型在后台自动下载,等它跑完就好
核心用法:单文件转录与批量队列 🎬
场景一:转一个文件
- 点击工具栏的"新建转录任务"按钮(快捷键
Ctrl+Shift+T),或直接Ctrl+O选择音频、视频文件导入 - 在任务行里选择模型(比如 Whisper.cpp 的 small)和语言(留空则自动检测)
- 点"开始转录",等状态变成 Completed
- 双击结果打开转录查看器,逐句校对文字和时间轴
- 从查看器导出 TXT、SRT 或 VTT
小技巧:
Ctrl+M开始、Ctrl+Shift+M停止;转录和翻译是两个任务类型,转中文再翻英文就选 Translate。
场景二:批量队列
- 按住 Ctrl(或 Cmd)多选文件,一次性导入多个
- 每个任务独立设置模型和参数,互不干扰
- 逐个开始,或暂停、取消不想跑的任务
转录查看器:带时间戳的逐句文本,支持直接编辑
进阶玩法:命令行一条命令直接入队,还能省掉开界面的步骤:
buzz add --model-type whispercpp --model-size small --language zh --srt --vtt meeting.mp3在偏好里启用"Watch folder"后,放进监控目录的新文件会自动开始转录。
调优与个性化:模型怎么选、字幕怎么排 ⚙️
离线 Whisper 模型怎么选
模型文件体积从model_loader.py里可以查到确切数字:
| 模型 | 文件体积 | 大致适用场景 |
|---|---|---|
| tiny | ~73 MB | 快速草稿、实时转录 |
| base | ~139 MB | 日常平衡之选 |
| small | ~462 MB | 精度与速度的折中 |
| medium | ~1.5 GB | 专业级转录 |
| large-v3 | ~2.9 GB | 最高精度,要求硬件 |
在"偏好 → Models"里勾选下载,模型统一存在本机缓存目录(可用BUZZ_MODEL_ROOT环境变量改位置)。
质量与速度的平衡
原则很简单:先快后精。用 base 跑一遍全文拿到草稿,再挑出拿不准的片段单独用 medium 或 large 重转。Whisper.cpp 后端还支持量化版本(比如 q5),同样是大模型,体积和内存占用都能降下来。
输出格式与文件名定制
Buzz 支持 TXT、SRT、VTT 三种导出。做字幕首选 SRT。"偏好 → General"里可以设置默认导出文件名模板,比如{{ input_file_name }} ({{ task }}d on {{ date_time }}),批量导出时文件不会撞名。
模型偏好:选择后端和模型版本,点下载即可
字幕行太长、断句太碎怎么办?双击结果打开查看器里的"Resize"对话框,设置每行最大字数,勾选按停顿合并,一键把时间轴重排整齐。
Resize 工具:控制每行字幕长度和合并规则
踩坑速查 💡
- 启动就报版本错误→ 大概率是 Python 版本不对,Buzz 只认 3.12
- 转出来的文件打不开或格式怪→ 检查 ffmpeg 是否装好,重装后重启 Buzz
- 第一个任务慢得像卡死→ 模型在自动下载,第二次转同样的模型就快了
- 有 N 卡但速度没提升→ 换 Whisper.cpp(Vulkan)或 Faster Whisper 后端,确认显卡驱动就绪
- 语言设置后没生效→ 语言代码要填
zh这种两字母代码,不是chinese - 磁盘空间告急→ large 系模型一个就 2.9 GB,装几个大模型前先看看剩余空间
一个完整工作流:从录音到成品字幕
- 把会议录音 MP3 导入任务列表
- 选择模型:日常内容 base 就够,重要内容上 small 或 medium
- 开始转录,等待状态变为 Completed
- 打开查看器,播放对照音频,修正个别错字
- 用 Resize 整理字幕断行,导出 SRT
批量场景可以写成脚本,省掉逐个拖文件的麻烦:
# 批量转录一个目录,全部输出 SRT for f in ~/recordings/*.mp3; do buzz add --model-type whispercpp --model-size small --language zh --srt "$f" done这个脚本能帮你省掉的是:开界面、挑文件、设参数、点开始,四步手动操作。
写在最后
回到开头那个问题:敏感录音还怕上传吗?现在你已经在本地完成了离线音频转录——单文件、批量、命令行都行,还能顺手导出字幕。想再往前一步,可以试试 Buzz 的麦克风实时转录和文件夹监控,或者看看它的插件系统,比如 AI 摘要生成,文档里有完整说明。工具在手,剩下的交给你的耳朵和审美。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考