LEANN 完整上手指南:如何 5 分钟在本地跑一个省 97% 存储的私有 RAG
【免费下载链接】LEANN[MLsys2026]: RAG on Everything with LEANN. Enjoy 97% storage savings while running a fast, accurate, and 100% private RAG application on your personal device.项目地址: https://gitcode.com/GitHub_Trending/le/LEANN
想找几年前的聊天记录、某封邮件、或某篇 PDF 里的结论,你不必再一个文件一个文件翻。LEANN 是跑在本地笔记本上的私有 RAG 系统:把文档、邮件、聊天记录、浏览历史一次性索引成可语义搜索的知识库,数据全程不出本机,索引体积比传统向量库小 97%,而且不损失检索精度。它开源免费,装完几分钟,你就能对自己的一堆数据直接发问。
开跑前核对这 4 项:LEANN 环境检查清单
别急着敲命令,先把环境过一遍,能省掉一半报错。
- Python 版本:3.10 及以上(3.9–3.13 都可用)。
- 包管理器 uv:LEANN 用 uv 管依赖,先确认
uv能跑,没有就先装一个。 - 操作系统:Ubuntu/Arch/WSL、macOS(ARM64 或 Intel)、Windows 都支持;纯 CPU 的 Linux 记得装
leann[cpu]。 - 想要完全离线🔒:可选装 Ollama 拉一个轻量模型,这样连生成回答都不走云。
首次运行验证点:装完跑leann --help,能吐出帮助说明环境通了;再建一个索引、搜一次能出结果,就算真正跑通。
最快上手路径:3 个动作跑通本地文档 RAG
核心体验就三步:装 → 建索引 → 搜。
动作一,把 LEANN 装进虚拟环境,顺便拿到全部示例:
git clone https://gitcode.com/GitHub_Trending/le/LEANN leann cd leann uv venv source .venv/bin/activate uv pip install leann动作二,给一个文档目录建索引,把my-docs和./docs换成你自己的索引名和文档目录:
leann build my-docs --docs ./docs动作三,搜索或连续追问,--interactive模式下连续提问、输入quit退出:
leann search my-docs "机器学习的核心概念" leann ask my-docs --interactive到这里,你的个人文档就能被自然语言检索了。📦 整个索引通常只有几百 MB 到几 GB,随手丢哪个盘都行——下面这张图就是它和传统向量库的体积差距:
除了 build / search / ask,CLI 还给了leann watch(检测文件变更)、leann list(列出所有索引)、leann remove(删索引),够你管一整批个人数据。
进阶玩法:把邮件、聊天、代码库也纳入搜索
跑通文档只是开始。下面三个最能代表 LEANN 的玩法,每个都告诉你怎么开、开完能换来什么。
把 Apple Mail 和浏览器历史变成搜索对象
怎么开:仅邮件需要先在「系统设置 → 隐私与安全性 → 完全磁盘访问」给终端放行,然后直接跑:
python -m apps.email_rag --query "我主要用 DoorDash 或 Uber Eats 点了什么?" python -m apps.browser_rag --query "我搜过哪些机器学习的资料?"换来什么:78 万封邮件块只占 78MB、3.8 万条浏览记录只占 6MB,你能像搜 Google 一样搜自己的邮件和历史。🔍
让 Claude Code 直接对代码库做语义检索
怎么开:全局装一次,再注册成 MCP 服务:
uv tool install leann-core --with leann claude mcp add --scope user leann-server -- leann_mcp换来什么:在 Claude Code 里不再只有grep式关键词搜索,而是真正懂语义的代码检索;同一套 MCP 机制还能实时拉 Slack、Twitter 等在线数据,不用手动导出。🚀
多模态 PDF:连图、表、版式一起搜
怎么开:用 ColQwen 系列视觉模型建索引再检索:
python -m apps.colqwen_rag build --pdfs ./my_papers/ --index research_papers python -m apps.colqwen_rag search research_papers "注意力机制是怎么工作的?"换来什么:检索不再只看文字,图、表、复杂排版都能理解,特别适合科研论文和技术文档。✨
卡住了怎么办:LEANN 常见问题对照表
报错别慌,绝大多数卡壳都落在这张表里,对号入座即可 💡。
| 现象 | 可能原因 | 对策 |
|---|---|---|
| 编译报缺 libomp / boost / protobuf | 源码构建时系统依赖没装齐 | 直接装 PyPI 版uv pip install leann,少折腾系统包 |
| 微信数据导出失败 | 微信没运行,或 WeChatTweak 没装好 | 先重启微信,再确认wechattweak-cli已安装 |
| 读不到 Apple Mail / iMessage | 终端没有「完全磁盘访问」权限 | 系统设置里给终端开权限,重启终端后再试 |
| 浏览器历史搜不到东西 | Chrome profile 路径指错了 | 找到真实 profile 目录,用--chrome-profile显式指定 |
| 老机器 / 低配跑得吃力 | 默认嵌入或生成模型偏重 | 换轻量模型,参考配置指南的 Low-resource 章节 |
想深入时看哪里:LEANN 文档与源码导读
想搞懂它为什么能省 97%,去 packages/leann-core/ 看核心 API 与后端实现,原理见下图:它存的是剪枝后的图而非全部向量,搜索时才按需重算嵌入。
想查它到底支持哪些能力,翻 docs/features.md;被报错卡住,第一站是 docs/faq.md。
LEANN 的核心就一句话:让你的个人数据可被语义搜索,索引小到能塞进任何笔记本,且全程不出本机。现在就对文档目录跑leann build my-docs --docs ./你的目录,再用leann search my-docs "你常找的那句话"搜一次,看看到底省了多少空间。
【免费下载链接】LEANN[MLsys2026]: RAG on Everything with LEANN. Enjoy 97% storage savings while running a fast, accurate, and 100% private RAG application on your personal device.项目地址: https://gitcode.com/GitHub_Trending/le/LEANN
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考