faster-whisper-GUI:离线跑完22段录音,转写全程不到两小时
2026/8/27 1:09:55 网站建设 项目流程

faster-whisper-GUI:离线跑完22段录音,转写全程不到两小时

【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI

周五下午,22段会议录音摊在桌面上,合计5小时40分钟,都要变成带时间戳的文字稿。faster-whisper-GUI 就是我为这摊事找的工具:一个基于 faster-whisper 的离线语音转文字GUI,音频全程在本地处理,不碰任何云端。

先交代一下我手上这摊事

素材是22个m4a文件,单段最短18分钟、最长74分钟,其中3段是英文访谈,其余全是中文会议。要交付的东西:每段一个带时间戳的SRT加一份TXT文字稿,3段英文还要标出说话人。纯手动听写的话,至少得熬两个通宵。下面是我实际走通的路径,按顺序做就能拿到一样的东西。

软件怎么跑起来

先克隆仓库装依赖,启动脚本就在根目录:

git clone https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI cd faster-whisper-GUI pip install -r requirements.txt python FasterWhisperGUI.py

窗口是Fluent风格的界面,语言和主题色在设置页就能改。第一次启动会在后台拉取Silero VAD等依赖模型,我这边耗时约6分钟,进度条走完才能加载Whisper模型。第一次跑卡在这一步别急着重开,我以为是网断了,其实是它在正常下载,等它自己走完就好。

模型怎么选:看你的硬件说话

这一步决定速度和准确率,核心就四个选项:

  • 模型大小:日常会议用small或medium就够,我最终用的是large-v3,单段50分钟音频实测8分钟左右出结果;
  • 设备:有N卡选cuda,没有就cpu;
  • 计算精度:float16偏快,int8省内存,float32最稳;
  • 线程数:默认4,我机器16核,调到12后CPU转写明显提速。

模型支持从Hugging Face在线下载,也支持指向本地目录直接加载,加载逻辑可以看模型加载源码。首次下载慢不慢,全看你的网络,下面避坑清单里有我后来用的离线加载做法。

三个真正影响结果的转写参数

转写参数页选项很多,但动三处就够:

  1. 语言:直接指定zh,别用Auto,省掉前30秒的语言检测;3段英文访谈我单独改成en跑;
  2. 温度(temperature):正式会议我压到0.2,内容松散的访谈放到0.5,压得太低反而容易漏词;
  3. VAD过滤(vad_filter):开着它,Silero VAD会把静音段直接跳过,22段文件实测省了约11%的转写时间。

再顺手把word_timestamps打开,后面导出逐字LRC就靠它。剩下的beam_size、patience这些保持默认就行。

批量文件怎么跑:整文件夹拖进去

模型就位后,把22个m4a全拖进文件列表,软件自动过滤掉非音频文件,点开始就排队跑。我中途去开了个会,回来时21段已经出结果,全程没看一次屏幕。列表里每个文件的状态一目了然,跑砸的单独删掉重跑就行,不用整批清空。

跑完切到结果页,起止时间、文本、单词级时间戳都在表格里,错了双击就能改,改完再导出。输出支持ASS、JSON、LRC、SMI、SRT、TXT、VTT七种格式,我这次每段导了SRT和TXT两份。

进阶:让转写结果分清谁在说话

如果你遇到多人开会分不清谁说了什么,可以打开WhisperX的说话人分离。做法是切到WhisperX选项卡,勾选说话人识别并限定人数区间(我按3人开会设了3~3)。跑完每句话前会带出speaker编号,3段英文访谈的纪要整理基本就是复制粘贴的活了。

我栽过的几个跟头

  • 转出来全是重复词,循环念同一句话:温度太高加VAD没开,模型在静音段里"幻听"。降到0.2、打开vad_filter,重跑一遍就干净了。
  • 卡在模型下载页半天不动:大模型走Hugging Face直连太慢。提前把模型下好放进本地缓存目录,界面里勾"使用本地模型"直接加载,我后来全程没再碰过在线下载。
  • CPU上medium跑得心疼:不是坏了,是模型选大了。8核机器用medium以下、线程数拉满,50分钟音频40分钟出结果,日常够用。
  • 英文访谈里夹中文专名,断词很怪:默认词表不认识这些专名。把专名填进hotwords热词栏,下一段就认对了。

它把faster-whisper那套命令行参数全搬进了图形界面,转写错了也能回头改字。今晚就能试:挑一段30分钟左右的录音,按上面的顺序走一遍。🎉

【免费下载链接】faster-whisper-GUIfaster_whisper GUI with PySide6项目地址: https://gitcode.com/gh_mirrors/fa/faster-whisper-GUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询