pot-desktop:免费跨平台的划词翻译和截图 OCR,把"复制、切窗口、粘贴"压成一次按键
【免费下载链接】pot-desktop🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognition.项目地址: https://gitcode.com/GitHub_Trending/po/pot-desktop
你正在读一篇英文文档,拖选一个生僻词,按下绑好的组合键,一个小窗口贴着光标弹出来,把中文释义直接递到眼前——不切窗口,不翻标签页。这就是 pot-desktop:免费开源,Windows、macOS、Linux 三端通用,专门做划词翻译和截图 OCR。它只把一件事做到极致:把"选中、复制、切换、粘贴、等结果"这条链路,压成一次按键。
先跑通:三步用上 ⚙️
1. 安装。包管理器各一条命令:
# Windows 一条命令装好 winget install Pylogmon.pot # macOS 先加源再装 brew tap pot-app/homebrew-tap && brew install --cask potLinux 到 Release 页下载对应架构的 deb 或 rpm 包,Arch 系可以用yay -S pot-translation。
2. 选一个引擎。装完它不会弹窗,安静地缩在系统托盘里。点托盘图标进偏好设置,在"服务设置"里挑一个翻译引擎:要免配置就选离线的(Ollama、系统 OCR),要填 Key 的,去对应平台申请一个填进来。
3. 绑一个快捷键。到快捷键页给"划词翻译"指定一个组合键。回到任意文档选中一段英文,按下它——小窗出来的那一刻,你就上手了。
功能:四个卡住的位置,四个解法 📌
下面每个功能,都对应你读外文、抠图片时会卡住的一个具体位置。
划词翻译:把"复制—切窗口—粘贴"整条砍掉
以前遇到不认识的词:选中,Ctrl+C,切到浏览器,找到翻译站的标签页,粘贴,等几秒,再切回来——两次窗口切换,五个动作,你还得记着自己开的是第几个标签。现在你只选中,按快捷键,译文窗口就出现在光标旁边,源语言自动检测,它不占你现有的任何一个窗口。内置翻译接口有 20 多个:Google、DeepL、百度这类商业服务,OpenAI、Gemini Pro 这类大模型,完全离线的 Ollama,还有剑桥词典这类专门查词的。读到的生词也能一键导出到 Anki 或欧路词典,攒成自己的词汇库。
截图 OCR:图片里的字,框一下就能复制
扫描件、截图、课件里的文字没法"划词"——它不是可选中的文本。以前想复用这些字,只能逐个手敲,或者去 OCR 网站:上传图片、等处理、复制结果,三步走。现在按下截图 OCR 的快捷键,在图上拖一个框,松手就得到可编辑、可复制的文本。接口分两路:离线的是系统自带 OCR(Windows.Media.OCR、Apple Vision、Linux 上的 Tesseract)和 Tesseract.js,在线的有百度、腾讯、火山、讯飞。按内容挑:中文文档优先百度、腾讯,英文文档用 Tesseract;图糊了换什么引擎都救不回来。
截图翻译:从"框一张图"直接到"读一个意思"
只识别还不够,图片里的外文还得再翻译一遍——以前是 OCR 完把文本复制走,等识别,再等翻译,两步、两次等待。现在按"截图翻译"的快捷键框选区域,直接给译文。四个动作各有独立快捷键:划词翻译、输入翻译、截图 OCR、截图翻译,在快捷键页分开绑定,谁也不抢谁的。
多引擎并行:同一段话,并排给你几份答案
同一个词,不同引擎翻得往往不一样。以前要比着看,你得在几个标签页之间来回开。现在在翻译面板里同时开几个引擎,同一段话并排给出多份结果,扫一眼挑表达最顺的那个;面板支持深浅色两套主题,每个引擎都是各自独立的实现,在 src/services/translate/ 里。
进阶:把 pot 接进你自己的流程 🔌
不满足于手动按快捷键,它留了三个口子。
本地 HTTP 接口。默认监听127.0.0.1:60828(端口可在设置里改),一条 curl 就能触发:
# 触发一次划词翻译 curl "127.0.0.1:60828/selection_translate" # 触发一次截图 OCR curl "127.0.0.1:60828/ocr_recognize"Windows 上还能配 SnipDo、macOS 上配 PopClip:选中文字后工具条里直接出现"翻译"按钮,连快捷键都省了。
插件系统。新翻译引擎、OCR 服务、生词本平台,都能以.potext插件装进来:偏好设置 → 服务设置 → 添加外部插件,选文件装完就和内置服务一样用。想自己写,参考 src/services/recognize/ 里的现有实现。
Wayland 兜底。纯 Wayland 环境(如 Hyprland)下,应用内快捷键和内置截图都不一定好使,用"系统截图 + 接口"替代:
# Hyprland 绑定:先用系统工具截一块图,再让 pot 识别这张图 bind = ALT, X, exec, grim -g "$(slurp)" ~/.cache/com.pot-app.desktop/pot_screenshot_cut.png && curl "127.0.0.1:60828/ocr_recognize?screenshot=false"screenshot=false表示跳过软件内置截图,直接读你存到缓存目录com.pot-app.desktop/pot_screenshot_cut.png的那张图。
快捷键没反应?先查这三处 🔍
- 组合键被占用、或 macOS 没给权限。按了没反应,多半是组合键被别的软件抢走,换一个试试;macOS 上是辅助功能权限没给对,到"设置 → 隐私与安全性 → 辅助功能"里把 pot 移除、重新添加。
- 你在 Wayland 上较劲。应用内快捷键在 Wayland 下本来就指望不上,直接走上一节的系统级绑定,别花时间。
- Windows 上点托盘图标没界面。多半是系统缺 WebView2 或被禁用了,手动安装或恢复即可。
边界也说清楚:它适合经常读外文文档、论文、技术资料的读者。要 Key 的占多数——翻译和云端 OCR 接口大多要填 API Key,只有 Ollama、系统 OCR、Tesseract.js 这几个离线方案免配置。核心卖点是文本和图片,长音频、视频不在它的场景里。
先装上,按那三步把划词翻译跑通一次——你就知道"切窗口、找标签页、粘回去"这几步,平时到底偷走了你多少注意力。
【免费下载链接】pot-desktop🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognition.项目地址: https://gitcode.com/GitHub_Trending/po/pot-desktop
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考