Buzz 语音转录工具指南:离线语音转文字、导出字幕,从首次运行到批量处理
2026/9/6 20:37:53 网站建设 项目流程

Buzz 语音转录工具指南:离线语音转文字、导出字幕,从首次运行到批量处理

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

整理一段 90 分钟的会议录音,光是把口述内容敲成文字并对齐时间戳,往往就要耗掉一个下午。Buzz 是一款免费开源的语音转录工具,它能在你自己的电脑上本地运行 OpenAI 的 Whisper 模型完成语音转文字,并支持翻译与字幕导出,全程离线、无需上传云端。

产品定位:Buzz 是本地化方案,不是云端服务

Buzz 是一款基于 Whisper 语音模型的桌面应用,内置 transformers、whisper.cpp 等多个本地推理引擎,核心代码位于 buzz/transcriber/。与常见的云端转录服务相比,差异集中在三点:

对比项云端转录服务Buzz
音频去向需上传到服务商服务器全程留在本机
计费方式通常按分钟收费免费,仅首次需下载模型
网络依赖全程依赖网络模型下载完成后可离线使用

如果你的音频涉及未公开的业务内容,或者转录量大、希望把成本压下来,这种离线语音转文字的思路就值得考虑。

快速上手:从安装到跑通第一条结果

这一节把安装、首次配置、跑出第一条转录结果合并成一条完整路径。

第一步:获取代码并安装依赖

git clone https://gitcode.com/GitHub_Trending/buz/buzz cd buzz pip install -e . python -m buzz

Linux 用户也可以改用 Flatpak 或 Snap 渠道直接安装,省去手动配依赖。

第二步:做一遍基础配置

首次启动后,打开偏好设置页做一次基础配置:选择默认模型(入门建议 Tiny 或 Base)、勾选需要自动导出的格式(TXT、SRT、VTT、JSON 等)。

第三步:导入音频,拿到第一条结果

通过菜单「导入文件」或快捷键 Ctrl+O 导入任意一段音频,任务会自动进入队列并开始处理。完成后在任务列表中点开记录,即可在查看器中逐段核对文本,并选择格式导出。

场景实测:三种典型用法

会议录音实时转文字

适用情况:开会、访谈、讲座时边听边记来不及。操作:按 Ctrl+R 打开录音窗口,选好麦克风和语言后开始录制,音频会按固定片段持续转写,内容可以当场看到。注意点:文字展示相对实际说话有若干秒延迟,这是分段转写的正常现象,不要据此判断识别出错;片段长度与延迟可在录音相关设置里调整。

已有音频文件批量转写

适用情况:手头有 MP3、WAV、MP4 等文件,需要拿到文本或字幕。操作:Ctrl+O 多选导入,语言默认自动检测;如果已知语种,手动指定通常更准。任务结束后打开转录查看器,文字与音频逐段对齐并带时间戳,可以直接改字、微调每段的起止时间。

转写与翻译一次完成

适用情况:外语访谈、外语课程视频、跨国会议。操作:在任务的转写选项里把任务类型从 Transcribe 改为 Translate 并选定目标语言,结果中会同时保留原文与译文,还可以只导出译文这一份 SRT 字幕,直接用于视频。

进阶调优:让批量处理更顺手的 5 个配置

  1. 固定默认模型与缓存路径:模型大小直接决定内存占用和速度。在偏好设置的模型页(models_preferences_widget.py)里设定常用模型和缓存目录,换目录、换项目时不必重复下载。
  2. 开启文件夹监听:在偏好设置中配置要监听的目录(实现见 transcription_task_folder_watcher.py),之后放进目录的音频会自动排队转写,适合固定投放录音文件的团队流程。
  3. 自定义导出文件名模板:在偏好设置中把默认命名模板改成{{input_file_name}}_{{date_time}}这类格式,批量处理同名文件时不会互相覆盖。
  4. 按手熟度改快捷键:Ctrl+O(导入文件)、Ctrl+R(打开录音窗口)、Ctrl+T(查看时间戳)等默认项都可在偏好设置的快捷键页里重新定义,清单见 buzz/settings/shortcut.py。
  5. 有独显就启用 GPU:NVIDIA 显卡按项目说明配置 CUDA 后,长音频的处理耗时会明显下降,参考 buzz/cuda_setup.py。

常见问题

转录速度很慢怎么办?先把模型换小(Tiny 或 Base);有独显的机器检查 CUDA 是否生效;再关掉同机器上吃 CPU 的程序。模型越小速度越快,精度相应下降,按内容取舍。

专业词汇反复识别错怎么解决?在任务的 Initial prompt(初始提示词)里写上正确的写法,例如人名、产品名、术语各列一句示例,Whisper 转写时会向这个拼写靠拢,这是免费的纠偏手段。

查看器里音频放不出声音?播放依赖系统的 FFmpeg 组件,Linux 上先确认已安装 ffmpeg,再检查偏好设置中的播放设备选择是否正确。

适合谁用,下一步做什么

Buzz 适合需要离线、免费做语音转文字的场景:会议整理、访谈记录、字幕制作,以及不想把音频交给第三方的用户。建议先 clone 仓库用 Base 模型转一段自己的真实音频跑通全流程,再按内容类型回头调整模型大小与导出格式。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询