Buzz 离线语音转文字完整指南:3个场景搞定音频转文字
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是一款开源的离线语音转文字工具,基于 OpenAI Whisper 模型,把转录与翻译全部放在你本机完成,支持文件导入、麦克风实时录音和 TXT、SRT、VTT 等格式导出。本文按三个典型场景走通完整流程。
📦 安装 Buzz:Windows、Mac、Linux 各走一条路
按你的系统选一条路:
- macOS:下载
.dmg安装包直接装。 - Windows:下载安装包;应用未签名,首次运行会有警告,选"更多信息" → "仍要运行"即可。
- Linux:走 Flatpak 或 Snap。
- PyPI:需要 Python 3.12 并预装 ffmpeg,执行
pip install buzz-captions后用python -m buzz启动。
首次运行要下载 Whisper 模型。若目标机器完全离线,可把联网机器上的models目录(Linux 默认在~/.cache/Buzz)复制到离线机器相同位置,仓库里的 scripts/download-models.py 就是为准备离线模型缓存写的。
flatpak install flathub io.github.chidiwilliams.Buzz # 或 Snap: sudo snap install buzz🎧 场景一:把采访录音批量转成文字
Buzz 主界面是任务列表:每个音频占一行,显示状态、所用模型和导出路径。
第一次转录的三步操作
- 菜单"文件 → 导入媒体文件",或按Ctrl/Cmd + O,选择 MP3、WAV、MP4 等文件。
- 选任务(转录或翻译成英文)、语言和模型,点"运行"。
- 状态变为 Completed 后双击该行,打开转录查看器。
右侧选项里还能设置导出格式(TXT/SRT/VTT)、开启Word-Level Timings生成逐字时间戳,或勾选Extract speech先抽取人声再转录,提升嘈杂录音的准确率。
模型尺寸与后端怎么选
尺寸从 tiny 到 large:越小越快、误差越多,日常用small起步通常够用。后端按硬件选:
- Whisper:官方实现,准确但慢、吃内存。
- Whisper.cpp:C++ 实现,独立显卡、核显甚至纯 CPU 都能跑。
- Faster Whisper:需要 6GB 以上显存的 Nvidia 显卡。
- HuggingFace:支持自定义模型和 MMS 多语言模型家族。
另外两个细节:高级设置里的Initial prompt可填入容易拼错的人名、术语,减少专名词误识别;已知语种时手动指定语言,比自动检测更稳。
🎤 场景二:讲座或会议的实时转录
切到录音界面,选好任务、语言、模型和麦克风,点Record即开始,文字随讲话滚动输出。转录模式有三种:追加在下方、追加在上方、追加并纠正(持续修正上一句尾部,负载更高)。
做现场活动时可打开演示窗口,把实时文字用大字号投到第二块屏幕。实时转录还能把文本文件持续导出,方便接进 OBS 等直播工具。
两条经验提示:
- 实时转录负载大,优先Whisper.cpp加小模型(base 及以下)。
- 环境嘈杂时调高静音阈值,低于阈值的声音直接不转。
🎬 场景三:把转录稿变成能用的字幕
转录查看器支持搜索、播放和倍速调整,可以边听音频边逐段核对、修改边界。
字幕分段调整
原始分段对字幕来说往往太长。Resize 功能把词级分片重新组合成字幕长度的段落:按标点拆句、按静音间隔合并、限定单条字幕最大长度。前提是转录时开启了词级时间戳。
🧩 用插件扩展转录流水线
1.4.5 起内置插件系统:菜单Help → Plugins里可启用/停用、拖拽调整执行顺序。自带的几个覆盖了常见需求:
- AI Summary:转录后用 OpenAI 兼容 API 生成摘要。
- DeepFilterNet:转录前先去除背景噪音。
- Enhanced Language Detection:对未知语种文件自动检测语言。
- Skip Already Transcribed:同目录已有
.srt/.txt的文件直接跳过。 - Export to DOCX:一键导出 Word 文档。
插件源码在 buzz/plugins/ 目录,读它的结构就能照着写自己的插件。
⌨️ 命令行与文件夹监控的批量自动化
文件多时用buzz add命令行:
buzz add --task transcribe --model-type whispercpp --model-size small \ --prompt "录音中常出现 AlphaGo 这个词" --srt --vtt interview.mp3加--hide-gui可隐藏主窗口后台运行;完整参数说明见 docs/docs/cli.md。整目录批处理可以写个循环:
for f in *.mp3; do buzz add --hide-gui "$f"; done偏好在 Folder Watch 选项卡里还能设监控目录:放入的音频自动排队转录,配合跳过插件就不会重复跑。
⚡ 速度不够时先做这 3 件事
- 换小一号的模型或改用 Whisper.cpp 后端;显存紧张时选
q_5这类量化版本。 - 设置环境变量
BUZZ_WHISPERCPP_N_THREADS调线程数:16 线程笔记本设为8约有 15% 提速,设得再高反而变慢。 - 老显卡比 CPU 还慢或有兼容问题,设
BUZZ_FORCE_CPU=true强制 CPU;显存不够用BUZZ_REDUCE_GPU_MEMORY=true做 8bit 量化。
另外注意:Buzz 要求 CPU 支持 AVX2,非常老的机器跑不起来。
下一步行动
- 按你的系统装好 Buzz,挑一段短音频完成第一次转录。
- 下载与硬件匹配的模型,试一次实时录音并打开演示窗口。
- 文件量大时,把 CLI 循环命令和文件夹监控配好,让机器自己跑。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考