TMSpeech免费开源指南:Windows离线实时语音转文字工具,从摸鱼神器到会议纪要生成器
2026/8/20 11:16:38 网站建设 项目流程

TMSpeech免费开源指南:Windows离线实时语音转文字工具,从摸鱼神器到会议纪要生成器

【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech

还在担心开会走神被突然点名?还在为记不全老板讲的要点而焦虑?或者上网课时老师语速飞快、手写笔记根本跟不上?如果你曾经经历过这些手忙脚乱的瞬间,那么今天介绍的这款Windows实时语音转文字工具——TMSpeech,可能就是你的救星。

它是一款完全免费、开源的离线语音识别软件,能把电脑播放的任何声音实时转成文字字幕,CPU占用不到5%,你的对话内容全程留在本地,隐私安全有保障。无论是会议记录、在线学习,还是想看视频时顺便留下文字稿,它都能轻松胜任。

它到底是个什么样的工具?

一句话概括:TMSpeech 是一个常驻屏幕的"语音速记员"。它通过 WASAPI 音频捕获技术监听电脑声音,把语音实时转成文字,像歌词字幕一样悬浮在屏幕上。开会、上课、看视频,全程自动记录,识别结果按日期自动存档,随时可以回看。

  • 适合谁?上班族、网课学生、直播主播、视频剪辑爱好者,以及一切"不想手动打字"的人
  • 解决什么问题?会议走神、笔记跟不上、回看找不到重点、担心语音上传云端泄露隐私
  • 它有多轻?实测在 AMD 5800u 笔记本上 CPU 占用稳定在 5% 以下,内存占用不到 500MB,挂着它办公几乎无感

三步完成离线安装,最快一分钟上手

第1步:获取程序

克隆项目仓库:git clone https://gitcode.com/gh_mirrors/tm/TMSpeech,然后在 Release 页面下载最新的安装包解压即可。

第2步:启动

双击运行TMSpeech.exe,程序会自动创建配置文件。顺手在桌面建个快捷方式,以后用起来更方便。

第3步:首次识别

打开主界面,点击红色按钮开始识别,屏幕上马上就会出现实时字幕:

就这么简单,不用注册、不用联网,三分钟就能跑起来。

核心能力拆解:按场景选配置

TMSpeech 的强大之处在于"识别器"和"音频源"都可以自由组合,按场景灵活切换。进入设置界面即可配置:

识别器三选一,怎么选?

识别器类型适用场景性能特点推荐人群
Sherpa-Onnx 离线识别器日常办公、会议记录CPU优化,资源占用低普通用户,默认首选
Sherpa-Ncnn 离线识别器直播、追求速度可调用 GPU,识别极快游戏主播、性能党
命令行识别器集成任意外部引擎可接入 Whisper、云端API等开发者、技术爱好者

音频源怎么选?

音频源类型捕获什么声音典型场景
系统音频电脑播放的全部声音会议软件、视频、网课
麦克风你的说话声个人录音、口述
进程音频指定程序的输出只想录某个应用的声音

进程音频有个妙用:开会时只捕获腾讯会议这一个进程的声音,其他软件的提示音完全不会干扰识别,背景干净、准确率更高。相关实现可以在src/Plugins/TMSpeech.AudioSource.Windows/目录下查看。

一次完整演练:从"开会"到"自动生成会议纪要"

假设你正在开一场腾讯会议,我们走一遍完整流程:

第1步:装模型

打开设置 → 资源页面,看到中文、英文、中英双语三种模型,点击"安装"按钮等待下载完成:

模型存储位置:内置资源在[应用目录]/plugins/,用户安装的资源在%AppData%/TMSpeech/plugins/,后者可以放心删除。

第2步:选识别器与音频源

推荐配置:识别器选"Sherpa-Onnx 离线识别器",音频源选"系统音频"或"进程音频",采样率保持默认的 16kHz 即可。

第3步:开启识别

点击红色按钮,字幕开始实时滚动。右下角的计时器会记录本次会话时长,红色即代表正在识别中。

第4步:会后复盘

识别结果会自动按日期保存到"我的文档/TMSpeechLogs"文件夹,再也不用对着录音一笔一笔地听写。想看某句话?打开历史记录窗口,右键即可复制或全选:

一段会议开完,会议纪要初稿已经躺在文档里了,剩下的只是简单整理。这就是"一键生成会议纪要"的完整链路。

进阶玩法:让工具更懂你

个性化字幕样式

字幕窗口支持无边框悬浮、任意拖动和缩放。在设置里你可以自由调整字号、字体、颜色、阴影、背景,甚至做成半透明字幕条叠在视频上,观感几乎和视频网站的歌词字幕一样。锁定按钮可以防止误触拖动,识别运行中字幕纹丝不动。

敏感词提醒

担心错过关键信息?在"通知"设置里配置敏感词(比如"方案""预算""截止"),一旦识别到这些词,系统就会弹出通知提醒你——摸鱼也能精准回魂。

接入你自己的识别引擎

命令行识别器让 TMSpeech 变成万能平台:它启动你指定的子进程,把标准输出当作字幕,单个换行更新当前句、多个换行表示句子完成。示例脚本在external_recognizer/目录下。比如你想接入 Whisper,只需写一个脚本输出标准格式文本即可,参考代码结构如下:

print("临时识别结果", end='\n', flush=True) # 单个换行:更新当前句 print("\n", flush=True) # 多个换行:本句结束,存入历史

避坑指南:新手常踩的五个坑

识别不准怎么办?先确认环境安静;其次确认选对了语言模型(中文场景别用英文模型);最后可以在资源页面更换效果更好的流式模型,或改用 GPU 加速的 Ncnn 识别器。

为什么抓不到系统声音?部分电脑需要先启用"立体声混音"设备:右键托盘音量图标 → 声音设置 → 录制 → 启用立体声混音,再在 TMSpeech 中选择对应音频源即可。

进程音频一直报错?检查所选进程是否还在运行,或者该进程的音频会话是否被独占。Windows 版本低于 10.0.20348 时进程音频不可用,这时切回系统音频即可。

命令行识别器启动就退出?给批处理脚本加上@前缀隐藏命令回显,不要在结尾加pause;参数带空格时记得用双引号转义。日志文件记得填上,报错信息都写在 stderr 日志里。

识别结果存哪了?默认在"我的文档/TMSpeechLogs",按日期组织文件;也可以在"通用"设置里自定义保存路径。

横向对比:它凭什么值得推荐?

对比项TMSpeech云识别服务其他本地字幕工具
是否联网完全离线依赖网络部分离线
隐私安全数据不出本机音频上传云端视工具而定
资源占用CPU<5%,内存<500MB无明显占用普遍偏高
扩展性插件化,可换引擎固定接口大多封闭
成本免费开源按量付费部分收费
会议场景系统音频直录+自动存档需单独录屏支持较少

它最大的差异化在于三点:完全离线保护隐私、系统音频直接捕获(开会神器)、插件化架构自由扩展。核心与插件分离的设计(见src/TMSpeech.Core/src/Plugins/)意味着你可以像搭积木一样自由组合音频源、识别器甚至翻译器。

现在就开始,让 TMSpeech 成为你的效率搭子

自测清单:你适合用 TMSpeech 吗?

✅ 开会怕走神,想要一份自动生成的会议纪要 ✅ 上网课记笔记跟不上,想要实时字幕 ✅ 担心语音上传云端,坚持本地处理 ✅ 电脑配置一般,想要轻量级低占用工具 ✅ 想给视频生成文字稿、字幕文件 ✅ 想要免费开源、可自己动手扩展的软件

只要符合任何一项,现在就动手吧:git clone https://gitcode.com/gh_mirrors/tm/TMSpeech,装好模型,点下那个红色按钮,让每一句重要的话都留在你的文档里。

TMSpeech 还是一个活跃发展的开源项目,如果你发现更好的模型、有新的功能想法,或者愿意一起参与开发和文档编写,随时欢迎加入。每一份反馈和贡献,都在让这个本地方案变得更强大——毕竟,最好的工具永远是"大家一起来打磨"的那一个。愿你再也不用在会议里手忙脚乱,愿每一次关键信息都不被错过。

【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询