TMSpeech:免费离线语音转文字工具,实时字幕零配置
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
TMSpeech 是一款免费开源的 Windows 离线语音转文字工具:实时抓取电脑正在播放的一切声音,变成屏幕上的滚动字幕。识别全程在本地完成,不联网也能转写,普通笔记本上 CPU 占用不到 5%。适合开会、上网课、以及不想把声音交给云端的人。
被会议点名时,靠什么救场
不是你没在认真开会,是大脑确实走神了那几分钟。被点到名字的瞬间,眼前的一切都像外语。
这正是作者做这个项目时的处境,所以它有个外号叫"腾讯会议摸鱼工具" 😄。思路其实很朴素:记不住,就记下来。开着一个字幕窗口,等你被要求复述刚才讨论了什么,扫一眼历史记录就能从容作答。
不是你记性差,是没人替你记着。
转写工具的核心只有一条:它不能泄密。云端语音转文字要把录音发到远程服务器;TMSpeech 不,声音从头到尾在你这台机器里进出,断网状态下照样转写。
三步跑通首次离线识别 🚀
这事真不复杂,三步走完不到五分钟。
第一步:拿到程序。从项目 Release 页面下载最新 release 包,解压后直接运行里面的 exe,不用安装。想读代码的话,把仓库克隆到本地:
git clone https://gitcode.com/gh_mirrors/tm/TMSpeech一行命令,整个项目源码就落到了你电脑上。
第二步:装语言模型。识别要先有"字典"。打开程序进入设置窗口的「资源」页,给中文模型点一下安装,等下载完成即可。
内置插件放在应用目录的 plugins/ 文件夹,你自己装的资源会进 %AppData%/TMSpeech/plugins/,同一个页面统一管理,装过一眼就能看状态。
第三步:点开始。计时器跑起来,字幕窗口开始跟随电脑里的声音滚动。识别会按日期自动归档到「文档/TMSpeechLogs」,回头要看,直接打开历史窗口,右键复制,纪要的半成品就有了。
为什么关掉声音它也能识别
这是 TMSpeech 最反直觉的一点:把系统音量调到零,字幕不停。
原因是它走 Windows 的 WASAPI 环回通道,在系统内部"偷听"。声音还没走到扬声器就被截走了,所以扬声器发不发声,它根本不关心。相关实现在 src/Plugins/TMSpeech.AudioSource.Windows/,想折腾的同学看这里。
字幕窗口是无边框的,屏幕哪个角落都能拖过去、随便缩放。锁定是它的杀手锏:一锁,窗口不再响应鼠标点击,底下的画面照常操作,浮在视频上也一点不碍事。程序常驻系统托盘,开始、停止、锁定、退出,右键全搞定,不用碰主窗口。
整条链路可以看成三站:音频源抓声音 → 识别引擎把声音翻成字 → 语言模型决定翻得准不准。识别是流式的,一句话还没说完,上一句的字幕已经上屏了。
识别不出门,才谈又快又安全。
两个常见小问答
- 问:只能听系统声音吗?不是。音频源设置里可以切到麦克风,或指定某个进程的音频。
- 问:今天识别到的东西去哪找?默认在「文档/TMSpeechLogs」,按日期分文件;设置里可改保存路径。
三套识别引擎,怎么选 🔧
"大脑"有三档,在设置的「语音识别」页切换:
- Sherpa-Onnx:跑在 CPU 上,最省电,日常首选;
- Sherpa-Ncnn:能上 GPU 加速,给延迟敏感的场景用;
- 命令行识别器:不想用内置大脑?接你自己的程序。
命令行识别器是最好玩的一档。它启动你指定的外部程序,外部程序输出里出现一个换行,当前句子就刷新;出现多个换行,表示这句定了,TMSpeech 照单显示并落进历史。仓库里的 external_recognizer/ 放着现成的 Python 示例,想接 Whisper、SenseVoice 这类引擎,照着抄一个下午的事。
显示相关的细节——字体、字号、颜色、阴影、对齐——都在「显示」页。想看全部配置项长什么样,都定义在 src/TMSpeech.Core/ConfigTypes.cs,一个文件看完。
引擎可换,模型可换,工具长什么样由你说了算。
值不值得装,看三条标准
不劝你尝鲜,只给三个判断条件。满足任意一条,它就有资格进你的工具箱:
- 开会、上课,总怕漏掉重点;
- 不想让任何录音出你的门,走云端;
- 电脑配置一般,要免费、无广告、轻量的方案。
免费、离线、本地、低占用,这四个词都是承诺,也都能当场验证。模型装好、识别点起来之后,剩下的就交给你的字幕窗口了。
【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考