Handy:免费完全离线语音转文本工具,从安装到模型选择一次讲清
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
会议刚结束,你还在逐字补纪要;采访录音有四十分钟,传到在线转录服务又总归不太放心。其实你要的很简单:说出来的话,自动变成文字落到文档里。Handy 就是干这件事的——一款免费、开源、完全离线语音转文本的桌面应用。按下快捷键开口说话,本地模型负责转写,文字直接填进任意输入框,全程不往云端发一个字节。
为什么不联网的语音转写工具值得考虑
云端方案不是不能用,但对下面这些情况,本地语音识别更合适:
| 维度 | 云端转录 | Handy 本地方案 |
|---|---|---|
| 隐私 | 录音要上传给第三方 | 声音和文本都留在本机 |
| 网络依赖 | 弱网、飞机上直接失效 | 断网照常工作 |
| 费用 | 常按分钟或字数计费 | 免费开源,模型一次下载 |
| 可控性 | 词表、流程黑盒 | 词表、模型、输出策略全由你定 |
对敏感对话、内部会议和长期使用来说,"数据不出机器"这一条通常就够了。
离线语音转文本怎么安装,第一次怎么转录
三个平台各一行命令或一步下载:
# macOS brew install --cask handy # Windows winget install cjpais.Handy # Linux:到发布页下载 x64 安装包(AppImage)后运行第一次使用只需要两件事:
- 授予系统权限:macOS 上要开"麦克风"和"辅助功能",后者用于把文字写进目标应用。
- 在设置里选一个全局快捷键,然后按住它说话,松开结束。
几秒后,转写结果就会出现在你刚才输入文字的输入框里。🎙️
核心功能怎么用:五个高频场景
- 随手说话,当场出字。按住快捷键录音、松开即停,也可以切成"点按开关"模式,适合长时间口述。录音时屏幕上会出现一个悬浮条,实时显示已转写的进度。
专业词不再被听错。设置里有自定义词表(对应 CustomWords 组件),把项目代号、药品名、人名、行业缩写加进去,识别结果会优先向词表靠拢。医疗、法务、技术会议这类场景收益最明显。
快捷键全局唤起。不用切窗口,在任何应用里都能触发。行为支持三种:按住录音、点按开关、自动(两者皆可),在设置里随时切换。
- 输出策略可选。既能模拟键盘逐字敲入,也能走剪贴板粘贴;还有"末尾自动补空格"这类细节开关,方便适配不同应用。
- 接 LLM 润色(可选)。本地转完稿后,可再交给一个 LLM API 修标点、顺语句、去口水词。注意这一步走网络,默认关闭;关掉它,整个链路依然是纯离线。
幕后流程一图看懂
整条链路只有四站:界面层(React 写的设置窗口)→音频采集(跨平台录音并做重采样)→静音过滤(Silero VAD 把空白段剪掉,只把有效语音交给模型)→本地推理与后处理(Whisper 或 Parakeet 出文字,再做词表与标点修正,写回输入框)。相关代码集中在 音频工具包 和 模型管理模块,想深挖可以翻一翻。
一句话总结:声音进你电脑,文字出你电脑,中间没有任何服务器参与。
本地 Whisper 模型怎么选、参数怎么调
| 模型 | 速度 | 精度 | 硬件门槛 | 适合谁 |
|---|---|---|---|---|
| Parakeet V3 | 约 5 倍实时(纯 CPU) | 高 | i5 级别 CPU 即可 | 只有集显/核显、要自动识别语言 |
| Whisper Small | 快 | 良好 | CPU 或任意 GPU | 日常实时口述 |
| Whisper Medium | 中等 | 更好 | 建议 GPU | 速度与质量取平衡 |
| Whisper Large v3 / Turbo | 较慢 | 最高 | 需要较强 GPU | 对准确率要求高的专业场景 |
直接给结论:
- 只有普通 CPU:选 Parakeet V3,它专为 CPU 设计,还支持自动语言检测,不用手动切语言。
- 有 NVIDIA 独显或 Apple Silicon:选 Whisper 系列,追求极限准确率上 Large v3 Turbo。
模型都在设置界面里点选下载,带进度显示和断点续传,不用自己去找模型文件。
常见问题(FAQ)
系统一直弹麦克风权限?在系统设置里确认已授予"麦克风";macOS 还需要"辅助功能"权限,否则文字贴不进其他应用。
快捷键没反应或跟别的软件冲突?换一个组合键即可。macOS 上带 fn/Globe 键的快捷键只在 Apple 键盘上生效。Linux 的 Wayland 桌面(GNOME/KDE/Sway)无法注册系统级快捷键,需要把handy --toggle-transcription配成桌面环境的自定义命令来触发。
模型从哪来,要手动下载吗?不用。设置面板里选模型后直接下载,来源是官方镜像,带进度条,中断后重试会续传。
Linux 的 X11 和 Wayland 有什么区别?文本输入工具不同:X11 用 xdotool,Wayland 用 wtype。另外录音悬浮条在 Linux 上默认关闭,避免它抢占焦点导致粘贴失败,可以改用声音反馈来确认录音状态。
怎么排查"转写结果不对劲"?按 Ctrl+Shift+D(macOS 为 Cmd+Shift+D)打开调试面板,能看到日志和运行状态,方便定位是麦克风选错还是模型没加载。⚙️
写在最后
Handy 证明了语音转文本这件事,不依赖云端也能做到免费、好用、可控——本地 Whisper 与 Parakeet 模型、自定义词表、全局快捷键、LLM 后处理,全部装在一台普通电脑里。想试试它,搜一下开源项目 Handy 拿最新发行版即可;代码完全公开,欢迎直接读源码、fork 一份改成自己的版本。
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考