录音别再传云端:Buzz 免费离线语音转文字实战
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
会议一场接一场,录音在硬盘里越堆越多,既没时间听,更没时间手动敲字。交给云端服务倒是快,音频却真离了手。Buzz 是一款免费开源的离线语音转文字工具,本地转录全程在你自己的机器上跑,音频一步不出门,也不用注册任何账号,特别适合会议纪要、视频字幕这类隐私敏感的场景。
适不适合你
先给结论:录音不能上传、又想要边说边出字的能力,直接选 Buzz。不介意把音频交出去,云端服务更省心;已经习惯写脚本,纯命令行工具也够用。
| 工具类型 | 音频去向 | 是否依赖网络 | 花费 | 能否边录边转 | 使用方式 |
|---|---|---|---|---|---|
| Buzz | 全程在自己机器上处理,不离开 | 可不联网,离线也能跑 | 完全免费 | 边录边识别 | 图形界面 + 命令行双支持 |
| 云端转录服务 | 上传到服务器处理 | 必须有网 | 按使用量付费 | 支持 | 以网页端为主 |
| 纯命令行工具 | 在本机处理 | 离线可用 | 免费 | 不支持 | 只有命令行 |
Buzz 的差别就在表里这一栏:隐私和实时能力两头都占住,不必牺牲任何一头。
拿到第一条结果
Buzz 有四种装法,看你的机器选。
Windows:从 SourceForge 下载官方安装包运行。安装包没有签名,系统拦你时先点更多信息展开,再点仍要运行通过。
macOS:双击 .dmg 文件,把 Buzz 拖进"应用程序"文件夹,收工。
Linux:Flatpak 和 Snap 二选一。
flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzzPython 环境:先装好 ffmpeg,版本建议 Python 3.12。
pip install buzz-captions python -m buzz想尝鲜最新功能,直接拉源码跑:
git clone https://gitcode.com/GitHub_Trending/buz/buzz装完之后的第一次转录,分四个阶段。
导入:文件菜单打开音频,或用工具栏的"+"把它加进任务列表。
设置:任务类型选转录。语言建议手动挑,比自动检测可靠。再选模型大小,小模型跑得快,大模型认得准。
运行:点运行,等任务状态变成已完成。
导出:双击那一行打开查看器,边听音频边逐句核对,最后按需导出 TXT、SRT 或 VTT。
三种工作流实测
把视频变成字幕文件
手头有个 MP4 或 MKV,想给它配上字幕。
视频文件直接拖进来就行,Buzz 会自动把音轨抽出来,不用你单独提音频。到高级设置里打开词级时间戳,让每个词都带自己的时间标记;再用调整大小按停顿和标点把词拼成一条标准长度的字幕。最后拿到 SRT 或 VTT 文件,播放器、剪辑软件里直接可用。
最终得到:一份时间轴对齐好的字幕文件,拿来就能播。
🎙️ 边说边出字
会议录音场景:任务选录音,麦克风对准说话人,点录音,识别就跟着录音一起走,话音落下,文字立刻冒出来。
显示模式有三档:新文字追加在下方,或顶到上方。推荐追加并校正,它会回头修上一句,效果最接近人肉速记。
文字还能实时写进 TXT 文件,OBS 这类软件直接读,直播、公开课都拿得起来;想投到大屏,开个演示窗口就行。多人访谈还能区分并标注不同说话人,不用再翻录音找"这句是谁说的"。
最终得到:文字和会议一样快,散会不用回头重听。
扔进文件夹,转录自己完成
录音一次来一批,一个个点太磨人。
在设置里指定一个监视文件夹,新音频丢进这个目录,任务自动建好。再打开跳过已转录文件插件,同一批文件第二次进来会直接复用已有结果,不浪费模型的时间。
喜欢敲命令的话,一条指令就能批处理:
buzz add --task transcribe --model-type whispercpp \ --model-size small --srt --vtt /path/to/audio.mp3最终得到:音频扔进去人就走,回来时文本全齐。
调优速查 ⚡
- GPU 加速把模型后端换成 Whisper.cpp。Nvidia 显卡自动走 CUDA,AMD、Intel 用 Vulkan 接口跑;显存紧张就选量化模型,或勾选降低 GPU 内存占用,8 位量化能明显压占用
- 模型档位别一上来就用大模型。base、small 跑得快,适合先出草稿;medium、large 准确度高,重要内容值得上。实时录音必须挑小模型,否则跟不上语速
- 手动指定语言自动检测只采样开头几秒,容易判错。语言确认的话直接手动选,误识别少很多
- 初始提示人名、产品名这类词最容易听岔。高级设置里把初始提示填上这些词,输出稳得多
- 降噪背景音大的录音有两条路:开启语音提取把人声剥离出来,或者先用 DeepFilterNet 插件处理一遍再转录,结果干净不少
踩坑记录
- 症状:转录速度跟不上。→处理:先换更小的模型;确认卡在 CPU 上时,用环境变量
BUZZ_WHISPERCPP_N_THREADS调整线程数 - 症状:模型下载慢。→处理:把环境变量
HF_ENDPOINT改成 hf-mirror.com 镜像域名,下载速度立刻正常 - 症状:老显卡跑起来反而更慢。→处理:设
BUZZ_FORCE_CPU=true,强制整个流程走 CPU
总结与资源
音频不出门、免费不注册、还有实时能力,离线语音转文字和本地转录做到这个份上,基本够用很久。
- 官方文档:docs/docs
- 转录核心模块源码:buzz/transcriber/
- 插件系统源码:buzz/plugins/
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考