Handy:完全免费的离线语音转文本,5 分钟上手的完整指南
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
刚开完的会,还要花一小时听录音补纪要?访谈口述时,云端语音识别要订阅费,内容还得上传服务器,心里不踏实。Handy 是一款免费、开源、完全离线的语音转文本桌面应用:断网照样能用,录音和文本全部在本机处理,数据不出电脑。
离线语音转文本怎么安装
安装基本就是一行命令的事。Windows 用户直接:
winget install cjpais.HandymacOS 和 Linux 可以下载对应安装包,也能自己构建。装好后按下面三步走:
- 选个模型:首次启动会引导你下载一个本地语音识别模型,大小几百 MB 上下。
- 按住录制键:默认快捷键按住就开始说话,松开即结束。
- 看结果:转录文本自动出现在你当前的输入位置,就像语音版的打字机。
第一次转录可能要等模型加载几秒,之后就是即说即出。
实时转录会议 / 访谈
🎙️ 最实用的场景。在设置里开启始终麦克风,或干脆按住全局快捷键,屏幕角落会浮出一个小窗,边说边把文字转出来。
浮层里能看到正在写入的文本和当前录音进度,随时确认转写了多少。配合语音活动检测(可以理解为一个"只在有人说话时才开工的开关"),静音和背景噪音不会乱切句,长访谈一遍就能得到干净的结果。
自定义热词,让术语不再认错
录音里如果有大量专有名词、品牌名或行业黑话,识别率会掉。这时打开设置里的自定义词汇,把热词一条条加进去:
- 医疗:药名、病症
- 编程:库名、框架缩写
- 学术:术语、人名
原理很朴素:提前给模型一张"小抄",这些词被写对的可能性就大得多。
外接 LLM API 润色文本
Handy 本体完全离线,但你可以在后处理里选配外部大模型 API:转录完成后,把草稿发给大模型做语法检查、标点修复和语气整理。配上之后润色一步到位;不配,依然是纯离线体验。关键是:原始录音不会被传出去,只发你选处理的文本。
语音识别模型怎么选
⚡ Handy 内置两大系模型,取舍很直接:
| 模型 | 特点 | 适合谁 |
|---|---|---|
| Whisper Small | 快、轻 | 日常速记,低配机器 |
| Whisper Medium | 速度与精度均衡 | 普通笔记本 |
| Whisper Turbo / Large | 精度最高 | 重活重场景,有显卡 |
| Parakeet V3 | CPU 优化,约 5 倍实时速度,自动识别语言 | 纯 CPU、中英混用 |
几句建议:
- 没有独显:选 Parakeet V3,CPU 上跑得很顺。
- 有显卡、追求最准:Whisper Turbo。
- 只是随手记两句:Small 足够,最省资源。
模型支持动态加载和卸载,空闲时自动释放内存,不用一直挂着占地方。
三大平台的差异与隐藏技巧
macOS— 体验最顺滑。Apple Silicon 芯片有原生加速,转录明显更快;还能把Globe 键设为触发键,按住空格旁边的地球键就能说话,比组合快捷键自然得多;麦克风和辅助功能权限也会自动申请,不用手动翻系统设置。
Windows— 除了 winget 一行装好,全局快捷键走 rdev 监听,后台、锁屏状态下都稳定可靠。
Linux— X11 和 Wayland 都支持。录音浮层依赖 gtk-layer-shell,个别 Wayland 环境下显示不出来时,启动前加一个环境变量即可:
HANDY_NO_GTK_LAYER_SHELL=1关掉浮层不影响核心转录功能,只是少个屏幕提示。
进阶配置:快捷键、剪贴板与硬件加速
快捷键行为:默认"按住录音、松开结束"。如果你习惯"按一下开始、再按一下停",把 Shortcut Behavior 改成 Toggle,录长段口述就方便了。
剪贴板策略:Handy 提供直接输入、剪贴板粘贴等多种方式把文字放进文档。遇到个别输入框(某些远程桌面、特殊控件)接收不到直接输入时,切换成剪贴板粘贴模式就好。
硬件加速:NVIDIA 显卡选 CUDA,Apple Silicon 选 Metal,其他环境试 OpenCL;配置弱的机器就用纯 CPU 模式,它本身也做了 SIMD 和多线程优化,速度并不慢。
写给想二次开发的读者
🛠️ 三个点快速上手:
- 设置界面在 src/components/settings/,每个开关就是一个 React 组件,新增设置项就是在这个目录里加一个组件,再补上状态逻辑。
- 核心逻辑在 Rust 侧:src-tauri/src/managers/transcription.rs 负责转录流程的协调,src-tauri/src/managers/model.rs 管模型的加载卸载,语音检测逻辑在 src-tauri/src/audio_toolkit/vad/。
- 调试模式:按 Cmd+Shift+D(macOS)或 Ctrl+Shift+D(Windows/Linux)打开调试面板,实时日志、模型推理耗时、波形和语音检测状态一目了然,排查"麦克风到底有没有收到声音"很有用。
- 接入自己的模型:把 Whisper GGML(.bin)文件放进应用数据目录的 models 文件夹,重启 Handy,它就会出现在模型列表里。
整体是 Tauri + React + Rust 的结构,三者懂哪门,就从哪层切入。
Handy 可以一句话概括:装好、选模型、开始说话,免费、开源、离线,隐私敏感的场合用它最省心。随着本地模型越来越快、越来越准,在自己设备上"说出来就是写出来",会很快成为日常习惯。
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考