Buzz 离线音频转录指南:本地语音转文字,敏感录音不出你的电脑
2026/9/6 16:38:39 网站建设 项目流程

Buzz 离线音频转录指南:本地语音转文字,敏感录音不出你的电脑

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

会议纪要、播客素材、客户采访录音,这些文件你敢直接传到云端处理吗?多数人的答案是:不敢。Buzz 就是为这种顾虑而生的离线音频转录工具——它把 OpenAI 的 Whisper 语音模型搬到你自己的电脑上,本地语音转文字全程不联网,转完还能顺手翻译。

Buzz 实时转录界面,模型选择和语言设置一目了然

Buzz 是什么:把 Whisper 装进你的电脑 🎙️

Buzz 是一个跨平台的桌面应用,基于 OpenAI Whisper 技术,在你本机的 CPU 或 GPU 上完成音频、视频的转录和翻译。打个比方,它就像一台"家用文字冲洗店":录音往里一放,文字往出一吐,原料和成品始终都在你手里,不用托人代洗。

  • 完全本地处理,数据不出设备
  • 支持 TXT / SRT / VTT 导出
  • 批量任务队列 + 命令行调用
  • 麦克风实时转录也支持

从零跑起来:3 步启动 Buzz 🚀

第 1 步:获取代码

git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz

拿到项目源码,后面安装和调试都以它为基础。

第 2 步:建虚拟环境并安装

python -m venv .venv source .venv/bin/activate # Windows 用 .venv\Scripts\activate pip install buzz-captions

Buzz 要求 Python 3.12(官方依赖里钉死了这个版本),所以建好虚拟环境再装,能避免污染系统环境。buzz-captions就是 Buzz 的包名,一条命令把所有依赖装齐。

第 3 步:启动验证

buzz

等主窗口弹出,任务列表空空的摆着,就说明跑起来了。

主界面:任务列表和工具栏,跑成功长这样

如果卡住了,大概率是这几种情况:

  • Python 版本不对→ 确认是 3.12,python --version查一下
  • ffmpeg 没装→ 音频解码靠它,去 ffmpeg.org 装一个并加入 PATH
  • 首次转录特别慢→ 模型在后台自动下载,等它跑完就好

核心用法:单文件转录与批量队列 🎬

场景一:转一个文件

  1. 点击工具栏的"新建转录任务"按钮(快捷键Ctrl+Shift+T),或直接Ctrl+O选择音频、视频文件导入
  2. 在任务行里选择模型(比如 Whisper.cpp 的 small)和语言(留空则自动检测)
  3. 点"开始转录",等状态变成 Completed
  4. 双击结果打开转录查看器,逐句校对文字和时间轴
  5. 从查看器导出 TXT、SRT 或 VTT

小技巧:Ctrl+M开始、Ctrl+Shift+M停止;转录和翻译是两个任务类型,转中文再翻英文就选 Translate。

场景二:批量队列

  1. 按住 Ctrl(或 Cmd)多选文件,一次性导入多个
  2. 每个任务独立设置模型和参数,互不干扰
  3. 逐个开始,或暂停、取消不想跑的任务

转录查看器:带时间戳的逐句文本,支持直接编辑

进阶玩法:命令行一条命令直接入队,还能省掉开界面的步骤:

buzz add --model-type whispercpp --model-size small --language zh --srt --vtt meeting.mp3

在偏好里启用"Watch folder"后,放进监控目录的新文件会自动开始转录。

调优与个性化:模型怎么选、字幕怎么排 ⚙️

离线 Whisper 模型怎么选

模型文件体积从model_loader.py里可以查到确切数字:

模型文件体积大致适用场景
tiny~73 MB快速草稿、实时转录
base~139 MB日常平衡之选
small~462 MB精度与速度的折中
medium~1.5 GB专业级转录
large-v3~2.9 GB最高精度,要求硬件

在"偏好 → Models"里勾选下载,模型统一存在本机缓存目录(可用BUZZ_MODEL_ROOT环境变量改位置)。

质量与速度的平衡

原则很简单:先快后精。用 base 跑一遍全文拿到草稿,再挑出拿不准的片段单独用 medium 或 large 重转。Whisper.cpp 后端还支持量化版本(比如 q5),同样是大模型,体积和内存占用都能降下来。

输出格式与文件名定制

Buzz 支持 TXT、SRT、VTT 三种导出。做字幕首选 SRT。"偏好 → General"里可以设置默认导出文件名模板,比如{{ input_file_name }} ({{ task }}d on {{ date_time }}),批量导出时文件不会撞名。

模型偏好:选择后端和模型版本,点下载即可

字幕行太长、断句太碎怎么办?双击结果打开查看器里的"Resize"对话框,设置每行最大字数,勾选按停顿合并,一键把时间轴重排整齐。

Resize 工具:控制每行字幕长度和合并规则

踩坑速查 💡

  • 启动就报版本错误→ 大概率是 Python 版本不对,Buzz 只认 3.12
  • 转出来的文件打不开或格式怪→ 检查 ffmpeg 是否装好,重装后重启 Buzz
  • 第一个任务慢得像卡死→ 模型在自动下载,第二次转同样的模型就快了
  • 有 N 卡但速度没提升→ 换 Whisper.cpp(Vulkan)或 Faster Whisper 后端,确认显卡驱动就绪
  • 语言设置后没生效→ 语言代码要填zh这种两字母代码,不是chinese
  • 磁盘空间告急→ large 系模型一个就 2.9 GB,装几个大模型前先看看剩余空间

一个完整工作流:从录音到成品字幕

  1. 把会议录音 MP3 导入任务列表
  2. 选择模型:日常内容 base 就够,重要内容上 small 或 medium
  3. 开始转录,等待状态变为 Completed
  4. 打开查看器,播放对照音频,修正个别错字
  5. 用 Resize 整理字幕断行,导出 SRT

批量场景可以写成脚本,省掉逐个拖文件的麻烦:

# 批量转录一个目录,全部输出 SRT for f in ~/recordings/*.mp3; do buzz add --model-type whispercpp --model-size small --language zh --srt "$f" done

这个脚本能帮你省掉的是:开界面、挑文件、设参数、点开始,四步手动操作。

写在最后

回到开头那个问题:敏感录音还怕上传吗?现在你已经在本地完成了离线音频转录——单文件、批量、命令行都行,还能顺手导出字幕。想再往前一步,可以试试 Buzz 的麦克风实时转录和文件夹监控,或者看看它的插件系统,比如 AI 摘要生成,文档里有完整说明。工具在手,剩下的交给你的耳朵和审美。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询