Buzz 离线语音转文字实操指南:三步跑通你的第一个转录任务
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款基于 OpenAI Whisper 的离线语音转文字工具:音频的转录与翻译全部在你自己的电脑上完成,文件不出本机,免费且开源。它支持 99 种以上语言,适合整理会议纪要、给视频加字幕、批量处理录音等场景。这篇指南带你用最短路径装好它,并完成第一次转录。
快速上手:安装 Buzz 并运行第一个转录任务
第一步:下载。Windows 和 macOS 用户到官方发布页下载对应安装包即可;Linux 用户走包管理器:
flatpak install flathub io.github.chidiwilliams.Buzz这条命令从 Flathub 商店安装 Buzz,无需手动下载。也可以用 Snap:sudo snap install buzz,装完后执行sudo snap connect buzz:password-manager-service让它能保存 API 密钥。如果你习惯 Python 环境(建议 3.12,并先装好 ffmpeg):
pip install buzz-captions python -m buzz前者从 PyPI 安装 Buzz,后者启动程序。
第二步:安装。Windows 的应用未签名,安装时弹出警告的话,点"更多信息"再点"仍要运行"即可;macOS 把 .dmg 里的图标拖进"应用程序"文件夹就完成。
第三步:跑通首个任务。启动后按顺序操作:
- 通过"文件"菜单或工具栏的"+"图标导入一个音频文件;
- 任务选"转录",语言手动指定(比自动检测更稳,后面细说);
- 选一个模型(新手建议 base 或 small),点"运行";
- 状态变成"已完成"后,双击任务行打开查看器,边播放边核对,再导出 TXT、SRT 或 VTT 文件。
到这里,你的第一条离线转录就出活了。
视频字幕制作:词级时间戳与字幕文件导出
适用情况:手里有 MP4、MKV 等视频文件,需要挂字幕或剪辑用。
操作要点:直接导入视频,Buzz 会自动提取音轨。在高级设置里勾选"词级时间戳",转录后每个词都有独立时间;然后使用"调整大小"功能,它按静音间隔和标点把词组合成符合阅读习惯的字幕行,还能限定每行最大长度。
产出结果:标准.srt或.vtt字幕文件,播放器、剪辑软件可以直接加载,不用再手工对时间轴。
批量转录:文件夹监视与重复结果复用
适用情况:会议录音、采访素材固定存放在某个目录,文件多、不想逐个点。
操作要点:在偏好设置里指定一个监视文件夹,Buzz 检测到新音频就自动建任务;同时启用"跳过已转录"插件——重复导入同一批文件时,它发现已有结果就直接复用,不重跑模型,任务标记为"跳过"。
产出结果:新文件进目录即出文本;重复文件零额外计算。不想开图形界面时,命令行也能批量干:
buzz add -t transcribe -s small --srt /path/to/你的音频.mp3这条命令指定转录任务、small 模型,输出 SRT 文件。
实时会议录音:麦克风录音与说话人区分
适用情况:会议、多人访谈、直播等需要边说边出字的场合。
操作要点:任务选"录音",挑好麦克风,点"录音"即可边录边出文字。显示模式有三档:新句子追加在下方、追加在上方、"追加并校正"——最后一档会持续修正上一句的识别错误,最接近人工速记。多人场景下还能开启说话人识别,把不同人的话分开标注。
产出结果:实时滚动的转写文本,可以投到演示窗口的"大屏"给现场观众看;访谈结束后得到的就是分说话人的完整记录。
效率调优清单:GPU 加速、模型选择与参数设置
| 你的情况 | 做法 |
|---|---|
| 有显卡、想跑得快 | 后端切到 Whisper.cpp:Nvidia 自动走 CUDA,AMD/Intel 走 Vulkan |
| 显存紧张 | 选量化模型(如 q_5),或在偏好里开"降低 GPU 内存占用"(8 位量化) |
| 赶时间的草稿 | 用 base 或 small 控耗时;实时录音场景同样建议小模型 |
| 需要精校的终稿 | 换 medium 或 large,用时间换准确率 |
| 语言已知 | 手动指定语言,别依赖自动检测(它只看开头几秒音频) |
| 人名、产品名总拼错 | 高级设置里填"初始提示",把易错词告诉模型 |
| 环境嘈杂 | 开"语音提取",或启用 DeepFilterNet 插件先降噪再转 |
| CPU 转录想调线程 | 设环境变量BUZZ_WHISPERCPP_N_THREADS指定线程数 |
模型和后端在偏好设置里都能改,改完对后续任务立即生效:
常见问题排查:速度慢、下载慢怎么办
问:识别速度太慢? 答:先换更小的模型,再确认显卡加速是否生效;纯 CPU 机器可上调BUZZ_WHISPERCPP_N_THREADS。
问:模型下载很慢? 答:在国内网络环境把环境变量HF_ENDPOINT指向 hf-mirror.com 镜像源,下载速度会明显改善。
问:旧显卡上 GPU 模式反而更慢? 答:设置BUZZ_FORCE_CPU=true强制走 CPU 模式,绕开兼容性拖累。
问:装好后打不开或报错? 答:Linux 下大概率是缺系统依赖,用apt补装 ffmpeg 等库;仍无解可参考官方文档的故障章节。
收尾
Buzz 把"录音变文字"这件事做到了免费、离线、全程本地,隐私和成本问题一步到位。想继续深挖,可以看看这些入口:官方文档(安装、偏好、插件的完整说明)、buzz/transcriber/(转录核心模块源码)、buzz/plugins/(插件系统源码,内置降噪、跳过重复等功能都在这)。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考