录音别再传云端:Buzz 免费离线语音转文字实战
2026/9/18 22:56:55 网站建设 项目流程

录音别再传云端:Buzz 免费离线语音转文字实战

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

会议一场接一场,录音在硬盘里越堆越多,既没时间听,更没时间手动敲字。交给云端服务倒是快,音频却真离了手。Buzz 是一款免费开源的离线语音转文字工具,本地转录全程在你自己的机器上跑,音频一步不出门,也不用注册任何账号,特别适合会议纪要、视频字幕这类隐私敏感的场景。

适不适合你

先给结论:录音不能上传、又想要边说边出字的能力,直接选 Buzz。不介意把音频交出去,云端服务更省心;已经习惯写脚本,纯命令行工具也够用。

工具类型音频去向是否依赖网络花费能否边录边转使用方式
Buzz全程在自己机器上处理,不离开可不联网,离线也能跑完全免费边录边识别图形界面 + 命令行双支持
云端转录服务上传到服务器处理必须有网按使用量付费支持以网页端为主
纯命令行工具在本机处理离线可用免费不支持只有命令行

Buzz 的差别就在表里这一栏:隐私和实时能力两头都占住,不必牺牲任何一头。

拿到第一条结果

Buzz 有四种装法,看你的机器选。

Windows:从 SourceForge 下载官方安装包运行。安装包没有签名,系统拦你时先点更多信息展开,再点仍要运行通过。

macOS:双击 .dmg 文件,把 Buzz 拖进"应用程序"文件夹,收工。

Linux:Flatpak 和 Snap 二选一。

flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz

Python 环境:先装好 ffmpeg,版本建议 Python 3.12。

pip install buzz-captions python -m buzz

想尝鲜最新功能,直接拉源码跑:

git clone https://gitcode.com/GitHub_Trending/buz/buzz

装完之后的第一次转录,分四个阶段。

导入:文件菜单打开音频,或用工具栏的"+"把它加进任务列表。

设置:任务类型选转录。语言建议手动挑,比自动检测可靠。再选模型大小,小模型跑得快,大模型认得准。

运行:点运行,等任务状态变成已完成

导出:双击那一行打开查看器,边听音频边逐句核对,最后按需导出 TXT、SRT 或 VTT。

三种工作流实测

把视频变成字幕文件

手头有个 MP4 或 MKV,想给它配上字幕。

视频文件直接拖进来就行,Buzz 会自动把音轨抽出来,不用你单独提音频。到高级设置里打开词级时间戳,让每个词都带自己的时间标记;再用调整大小按停顿和标点把词拼成一条标准长度的字幕。最后拿到 SRT 或 VTT 文件,播放器、剪辑软件里直接可用。

最终得到:一份时间轴对齐好的字幕文件,拿来就能播。

🎙️ 边说边出字

会议录音场景:任务选录音,麦克风对准说话人,点录音,识别就跟着录音一起走,话音落下,文字立刻冒出来。

显示模式有三档:新文字追加在下方,或顶到上方。推荐追加并校正,它会回头修上一句,效果最接近人肉速记。

文字还能实时写进 TXT 文件,OBS 这类软件直接读,直播、公开课都拿得起来;想投到大屏,开个演示窗口就行。多人访谈还能区分并标注不同说话人,不用再翻录音找"这句是谁说的"。

最终得到:文字和会议一样快,散会不用回头重听。

扔进文件夹,转录自己完成

录音一次来一批,一个个点太磨人。

在设置里指定一个监视文件夹,新音频丢进这个目录,任务自动建好。再打开跳过已转录文件插件,同一批文件第二次进来会直接复用已有结果,不浪费模型的时间。

喜欢敲命令的话,一条指令就能批处理:

buzz add --task transcribe --model-type whispercpp \ --model-size small --srt --vtt /path/to/audio.mp3

最终得到:音频扔进去人就走,回来时文本全齐。

调优速查 ⚡

  • GPU 加速把模型后端换成 Whisper.cpp。Nvidia 显卡自动走 CUDA,AMD、Intel 用 Vulkan 接口跑;显存紧张就选量化模型,或勾选降低 GPU 内存占用,8 位量化能明显压占用
  • 模型档位别一上来就用大模型。base、small 跑得快,适合先出草稿;medium、large 准确度高,重要内容值得上。实时录音必须挑小模型,否则跟不上语速
  • 手动指定语言自动检测只采样开头几秒,容易判错。语言确认的话直接手动选,误识别少很多
  • 初始提示人名、产品名这类词最容易听岔。高级设置里把初始提示填上这些词,输出稳得多
  • 降噪背景音大的录音有两条路:开启语音提取把人声剥离出来,或者先用 DeepFilterNet 插件处理一遍再转录,结果干净不少

踩坑记录

  • 症状:转录速度跟不上。→处理:先换更小的模型;确认卡在 CPU 上时,用环境变量BUZZ_WHISPERCPP_N_THREADS调整线程数
  • 症状:模型下载慢。→处理:把环境变量HF_ENDPOINT改成 hf-mirror.com 镜像域名,下载速度立刻正常
  • 症状:老显卡跑起来反而更慢。→处理:设BUZZ_FORCE_CPU=true,强制整个流程走 CPU

总结与资源

音频不出门、免费不注册、还有实时能力,离线语音转文字和本地转录做到这个份上,基本够用很久。

  • 官方文档:docs/docs
  • 转录核心模块源码:buzz/transcriber/
  • 插件系统源码:buzz/plugins/

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询