Buzz 离线语音转写快速上手完整指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
一份两小时的会议录音要在下班前变成文字稿,一集长播客想拆成可编辑的文稿——逐句手敲显然不现实。Buzz 把这件事接了过去:它基于 OpenAI 的 Whisper 模型,在你的个人电脑上完成离线语音转写和翻译,音频不上传任何云端,断网也能跑。
能力速览
Buzz 是一个桌面应用,核心动作就三类:导入音视频做转写与翻译、麦克风实时录音转写、对已有文稿做搜索、改句长、识别说话人。它同时接入多个转写后端,其中 Faster-Whisper 基于 CTranslate2(一个专门加速语音模型推理的引擎)实现,对你来说意味着更短的等待和更低的内存占用。选哪个模型,先对照这张表:
| 模型 | 体积 | 速度 | 准确度 | 建议场景 |
|---|---|---|---|---|
| tiny | 约 75 MB | 最快 | 最低 | 低配机器试跑 |
| base | 约 145 MB | 快 | 一般 | 日常会议速记 |
| small | 约 485 MB | 均衡 | 较好 | 多数场景的起点 |
| medium | 约 1.5 GB | 偏慢 | 高 | 需要精细文稿的内容 |
| large-v3 | 约 3 GB | 最慢 | 最高 | 专业级要求 |
开始前的准备
先确认两件事:系统装好了 ffmpeg(Buzz 靠它读取音频),Python 环境是 3.12。然后在终端里装好并启动:
pip install buzz-captions python -m buzz当前发布版本为 1.4.5。依赖清单(含 faster-whisper、ctranslate2 等)都由包管理器一并拉取,不需要单独安装。界面能正常打开,就算准备就绪。
三步跑通第一次转录
装模型。打开 File → Preferences,切到 Models 标签页,在 Group 下拉里选 "Faster-Whisper",挑一个规格(建议 medium),点 Download。文件会存到系统缓存目录下的 models 子文件夹(Linux/macOS 一般在~/.cache/buzz,Windows 在 AppData 下)。
建任务。回到主界面,点左上角的 "+" 选择音频文件。Buzz 支持 MP3、WAV、FLAC 等常见格式。弹窗里确认两件事:Language 选音频本身的语言,Task 选 transcribe(转写原文)或 translate(翻译成英文)。
看结果。点 OK 后任务进入队列,主界面这一行会显示实时进度。
完成后点击该行的查看按钮,打开的是带时间戳的分段文稿,可以跟着音频逐段播放核对,再导出为 TXT、SRT 或 VTT。
按机器提速
这一步解决的是"同一台机器怎么转得更快"。关键旋钮只有一个:compute type,即模型推理时的数值精度——float32 最稳但最重,float16 在 GPU 上最快,int8 做量化后 CPU 也能跑得动大模型。
| 你的机器 | 怎么选 |
|---|---|
| 纯 CPU 低配 | 换 small/base 模型,或保持 medium 但精度降到 int8 |
| CPU + 内存 16 GB 以上 | medium + int8,速度和内存基本够用 |
| NVIDIA 显卡 + CUDA | 精度调 float16,large-v3 也能跑 |
| 显卡显存吃紧、任务崩溃 | 从 float16 退回 int8,显存占用明显下降 |
写成配置就两行以内:
compute_type = "int8" # 无显卡或显存不足 compute_type = "float16" # NVIDIA GPU 加速其余提速手段其实就两条:任务少排队(一次别塞几十个文件),别和重活抢资源。
遇到问题?
| 现象 | 可能原因 | 解决动作 |
|---|---|---|
| 模型下载卡住或中断 | 网络不稳定 | 手动下载对应模型文件,放进 models 缓存目录后重启 Buzz |
| 转写明显偏慢 | 模型偏大或精度过高 | 换小一档模型,或把精度降到 int8 |
| 结果错漏较多 | 模型与音频复杂度不匹配 | 升一档模型;录音嘈杂时先检查音源质量 |
| GPU 任务报错、闪退 | 显存不足或 CUDA 不匹配 | 先切 int8,仍不行就整体回到 CPU 运行 |
写在最后
先拿手边一段一分钟的录音走一遍完整流程,确认速度符合预期,再换成大模型处理正式内容。更多参数说明见 docs/ 目录,转写各后端的实现代码都在 buzz/transcriber/ 下,想核对行为时可以直接查。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考