免费离线语音转文字工具 Buzz:1 小时录音,几分钟变精准文字稿
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
凌晨一点,记者小林盯着电脑屏幕发呆。手机里躺着 12 段采访录音,加起来快 6 个小时。第二天就要交稿,可她连第一段还没整理完——不是不会打字,是实在没时间把 6 小时的人声一句句敲下来。外包给语音转文字服务?贵,而且客户访谈里有不能外传的内容。这个场景,你可能比我还熟悉。
今天要介绍的 Buzz,就是来解决这类问题的:它是一款完全免费、完全离线的语音转文字工具,由 OpenAI Whisper 语音识别模型驱动,装上就能用,所有音频都在你自己的电脑上处理,不联网、不上传,敏感内容永远不出设备。
一、先看四个让人头疼的痛点
- 隐私没保障:公司会议、客户访谈、医疗沟通,谁都不敢往云端传。而 Buzz 全程本地运行,断网也能转录。
- 格式太杂:MP3、WAV、FLAC、MP4、MKV……甚至 YouTube 链接,Buzz 一次性全收。
- 费用离谱:很多转写服务按分钟收费,一场会议动辄几十块。Buzz 零订阅、零按次计费。
- 导出麻烦:转录完还要手动加时间轴做字幕?Buzz 直接导出 TXT、SRT、VTT,一键搞定。
如果你满足以下任何一条,Buzz 就是为你准备的:需要整理课堂录音的学生、处理采访素材的记者、做字幕的视频创作者、经常开会又想要文字纪要的职场人,以及一切对数据隐私敏感的用户。
二、跨平台安装:四条命令搞定
Windows 和 macOS 用户直接去项目发布页面下载安装包即可;Linux 用户推荐 Flatpak 或 Snap:
# Linux (Flatpak) flatpak install flathub io.github.chidiwilliams.Buzz # Linux (Snap) sudo snap install buzz已经装好 Python 3.12 的开发者,一行命令就能跑起来:
pip install buzz-captions python -m buzz第一次启动时会自动下载所选语音模型(几百 MB 到 2 GB 不等),之后就能完全离线工作。
三、最能打的四个功能亮点
亮点 1:多任务管理,批量导入不求人
打开主界面,所有转录任务一目了然:文件名、所选模型、任务类型、实时进度都排在同一张表里。你可以一次性丢进 10 个文件,也可以直接粘贴 YouTube 链接让它去抓音频,任务在后台排队、处理、完成,全程不用盯着。
主界面把文件、模型、进度全部可视化,批量处理时心里有数。
亮点 2:实时录音转录,边说话边出字
开会、上课、采访的时候,点一下麦克风按钮,Buzz 就会一边收音一边把语音实时转成文字,还带一个适合投屏的"演示窗口",方便讲座或发布会现场直接展示字幕。会还没开完,纪要已经有了。
亮点 3:翻译与字幕精调,外文素材也不怕
转录完可以直接把内容翻译成另一种语言,做外语学习资料、双语字幕都很顺手。更贴心的是"字幕调整"功能:设定目标字幕长度(比如每行 42 个字符),Buzz 会按标点自动拆分长句、按音频间隙合并短句,让字幕节奏符合阅读习惯。
一键拆分与合并,字幕长短随心控,做视频的字幕排版再也不用手动一条条改。
亮点 4:文件夹监控与命令行,自动化工作流
设置一个"监控文件夹",新音频一放进去就自动开始转录,适合团队协作和批量流水线;偏好设置里的快捷键、默认导出路径也都能自定义。喜欢脚本化的用户还能用命令行直接提交转录任务。
所有偏好集中配置,录完自动导出到指定文件夹,省去反复点选。
四、实战演练:从安装到字幕成品
拿"给视频做双语字幕"举例,完整跑一遍:
- 导入视频:主界面点"+",选择 MP4 文件,任务类型选 Transcribe。
- 选模型:追求高准确率选 Large,电脑一般就选 Medium。想提速可选 Whisper.cpp 后端,还能用 GPU 加速(NVIDIA 走 CUDA,Apple Silicon 原生支持)。
- 点 Run 开跑:进度条走完,双击任务行打开转录详情。
- 校对:详情页里每条文字都带精确起止时间,边播边核对,改错别字立改立存。
- 精调字幕:用 Resize 把每行字数统一到 42 字符左右。
- 导出:Export 菜单选 SRT 或 VTT,直接拖进剪映、Premiere 就能用。
时间轴、文本、播放器三位一体,校对和导出字幕的效率比手打高出一个量级。
五、常见疑问与避坑提示
Q:首次转录特别慢,正常吗?正常。模型首次运行需要加载,之后会快很多。想提速就换 Tiny/Base 小模型,或启用 GPU 加速。
Q:识别准确率不够高怎么办?优先指定语言(自动检测偶尔会出错),再用 Initial Prompt 写下人名、专有名词,能显著减少错字。
Q:嘈杂音频识别效果差?开启"语音分离"选项,Buzz 会先把人声从背景噪音中剥离再转录,准确率立竿见影。
Q:录音文件很大,内存会不会爆?会自动分段处理,别慌;一次少放几个任务进队列更稳。
Q:Windows 安装时弹出警告?项目安装包没有签名,选择"更多信息 → 仍要运行"即可。
六、现在就动手
我不夸张地说,Buzz 是我见过的把"免费、离线、专业"平衡得最好的本地转录工具:Whisper 模型自由选、GPU 加速、实时转录、字幕精调、文件夹监控、命令行、还有可扩展的插件体系。它是你的个人数据管家,不是把隐私交给别人的云服务。
想马上体验?用 Git 把仓库拉下来,跟着上面的安装步骤走:
git clone https://gitcode.com/GitHub_Trending/buz/buzz把今晚的会议录音丢进去试试——几分钟后,当一份带时间轴的文字稿出现在你面前时,你会回来感谢自己的。🚀
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考