免费离线语音转文字实测:TMSpeech让Windows里的所有声音都变成实时字幕
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
你多半也经历过这种时刻:一场重要的线上会议开到一半,主持人忽然点名——"刚才那段方案你怎么看?"而你正低着头,把上一句话最后一个字补进笔记里。指尖一顿,脑子一片空白。不是没认真听,是真的跟不上。
TMSpeech 就是为这种瞬间准备的。这是一款完全免费、开源、全程离线的 Windows 实时字幕工具,通俗说就是"离线语音转文字"利器:它能捕获电脑里正在播放的任何声音,实时变成一行行文字,像卡拉 OK 歌词一样浮在屏幕上,而且从安装到使用都不联网,你说了什么、开了什么会,一个字都不会离开这台电脑。
先说说我那天的狼狈
上个月我参加一场两小时的评审会,负责记关键结论。前半小时我还勉强跟得上,到后面发言人语速一快、术语一多,我彻底沦为人肉速记员——听一句写半句,写完上一句下一句已经飘走了。散会时我翻开笔记,发现中间有整整二十分钟只记了三行字,还带着错别字。
最要命的是领导随口问我:"刚才提到的时间节点是几号来着?"我愣在原地,翻了三页笔记也没找到。
那一刻我就想:要是有一台"随声听写员"坐在我旁边就好了,它负责听、负责写,我只负责会后看成品。这个想法,就是 TMSpeech 干的事。
从一个"摸鱼梗"说起:它到底是个什么东西
它的作者在项目里调侃这是个"腾讯会议摸鱼工具"——开着会不用拼命抄笔记,偶尔走神也不慌,因为字幕和历史记录会替你记着,被叫起来回答问题时翻一眼就行。
听着像玩笑,但底层能力是实打实的:
- 它用系统级音频捕获技术(WASAPI)"录内音",电脑里在放什么就听什么,甚至可以完全静音运行,声音依然能被采集到;
- 识别全部在本地完成,支持中文、英文和中英双语模型;
- 识别结果实时显示在一个可以任意拖动、调大小的无边框小窗口里,还能调字体、颜色和透明度;
- 同时自动把每句话按日期存进"我的文档/TMSpeechLogs"文件夹,会后一键变成会议纪要。
一句话概括:它像给 Windows 装了一只"永不疲倦的耳朵",外加一支"永不走神的笔"。
十分钟,从下载到看见第一行字幕
我来说说真实的首次体验,整个过程比想象中顺利。
从仓库的 Release 页面下载压缩包,解压后直接双击TMSpeech.exe,首次运行它会自动创建配置文件和日志目录,什么都不用装,先跑起来再说。
进入设置界面,左侧是一排分类导航:通用、显示、通知、音频源、语音识别、资源、关于。看起来复杂,其实真正要动的只有两处。
第一处是"语音识别"。这里可以选择识别引擎,下拉菜单里提供命令行识别器、Sherpa-Ncnn 离线识别器和 Sherpa-Onnx 离线识别器。我当时心里没底,怕选错,但软件写得挺贴心,每项后面都标了用途:Sherpa-Onnx 是 CPU 方案,普通电脑直接选它就行;Sherpa-Ncnn 支持调用独立显卡加速;命令行识别器留给想接外部程序的高级玩家。
第二处是"资源"。语音识别需要语言模型,这一步相当于给"耳朵"装语言能力。列表里有 Windows 语音采集器、SherpaOnnx 识别器,以及中文、英文、中英双语三种模型,点击"安装"等它下完就行,中文模型大约三百兆,网速正常的话等不了太久。装完状态会变成"已安装"。
接下来就简单了:回到主界面,点下那个红色圆点开始录音,打开一段网课或者随便播放一段有语音的视频。不到两秒,屏幕上就跳出一行字,跟着说话人的节奏一行行滚动,末尾的字还会随着识别修正不断刷新。
说实话,第一次看到字幕追着语音走,我还是有点小激动的——这画面,不就是我开会时做梦都想要的东西吗?
它替我省下的,不只是抄笔记的手
用了一周之后,我发现自己离不开它了,而且它帮到的不止我一个人。
开会这件头疼事,第一次有了"后悔药"。我现在的习惯是:会议软件一开,TMSpeech 就在后台悄悄工作。散会后不用回忆,打开"我的文档/TMSpeechLogs",按日期找到今天的记录,把临时字幕删掉、把错别字顺一遍,一份还像样的会议纪要十分钟就出来了。更妙的是,被突然点名时我可以大大方方看一眼历史记录,再从容地回答——那种"心里有底"的感觉,比什么都值钱。
上网课、看教程,效率翻了个倍。我有个考研的朋友试了我的配置后马上入了坑。她看的是英语网课,以前一边盯字幕一边抄笔记,手忙脚乱。现在她把 TMSpeech 挂在屏幕角落,老师讲的每句话都实时变成文字,听不懂的句子直接看原文,还能复制去查词典。她原话是:"早一年知道这东西,我能多刷两轮真题。"
我还给家里长辈也装了一份。老人家听力不太好,看电视综艺总是"听个大概"。我把字幕窗口拖到屏幕下方,字体调大、透明度调低,他们看字幕就能跟上剧情,客厅里的笑声都变多了。顺带一提,TMSpeech 的音频源支持"系统音频""麦克风""进程音频"三种,想只录某个软件的声音也能做到,灵活性是够的。
三个高频问题,一次讲透
用的人多了,问题也就多了。这里挑三个最常被问到的,一次性说清楚。
识别出来怎么总有错字?别急着怪软件,先检查两件事:音频源选对了吗?模型装对了吗?要录系统里播放的声音,音频源得是"系统音频";纯人声录入就选"麦克风"。内容偏中文就装中文模型,中英混杂就装中英双语模型。另外环境太吵、离麦克风太远,识别率也会明显下降——这事儿换谁家软件都一样。
电脑风扇呼呼转,占用很高怎么办?普通电脑请优先选 SherpaOnnx 离线识别器,它是专门为 CPU 优化的。实测在 AMD 5800u 这类普通笔记本上,CPU 占用不到 5%,内存也控制在很小的范围,基本不影响干别的活。如果你有独立显卡,再试试 Sherpa-Ncnn,跑起来更快。
历史记录怎么找不到了?默认路径是"我的文档/TMSpeechLogs",按日期分文件保存。找不到的话,看看是不是被网盘同步或清理软件"顺手"挪走、删掉了,也可以进设置里把保存路径改到一个你熟悉的地方。还有一个建议:把TMSpeech.exe的快捷方式放到桌面,开机即用,能少走很多路。
开源不是门槛,是邀请
说到这你可能想问:这么好的工具,靠什么维持?答案是——它是个开源项目,全世界的使用者一起维护。
项目采用插件化架构,音频源、识别器、翻译器都做成了插件,核心代码在src/TMSpeech.Core/,各功能插件放在src/Plugins/目录下。就算你完全不懂代码,也可以用更简单的方式参与:觉得哪里不好用、希望加什么功能,去仓库里提个反馈就行;想看看开发流程,docs/Process.md里写得清清楚楚。万一你真想自己动手改一版,把仓库克隆下来慢慢研究也行:
git clone https://gitcode.com/gh_mirrors/tm/TMSpeech
不用担心门槛高,开源社区的原则很简单:提一个真诚的反馈,就是对项目最大的支持。
你的声音,值得留在本地
这几年云端语音识别越来越方便,但我越来越在意一件事:我的会议内容、私人对话,凭什么要传到别人服务器上?TMSpeech 最打动我的,恰恰是这种"笨拙"的坚持——所有音频处理都在本地完成,免费、开源、离线,把隐私牢牢握在自己手里。
如果你也烦透了开会抄笔记、听课跟不上、看视频没字幕,不妨花十分钟试试它。下载、解压、装个模型、点开始,剩下的交给它。下一次被点名提问的时候,你会感谢现在动手的自己。
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考