LEANN 完整上手指南:如何 5 分钟在本地跑一个省 97% 存储的私有 RAG
2026/8/24 1:53:43 网站建设 项目流程

LEANN 完整上手指南:如何 5 分钟在本地跑一个省 97% 存储的私有 RAG

【免费下载链接】LEANN[MLsys2026]: RAG on Everything with LEANN. Enjoy 97% storage savings while running a fast, accurate, and 100% private RAG application on your personal device.项目地址: https://gitcode.com/GitHub_Trending/le/LEANN

想找几年前的聊天记录、某封邮件、或某篇 PDF 里的结论,你不必再一个文件一个文件翻。LEANN 是跑在本地笔记本上的私有 RAG 系统:把文档、邮件、聊天记录、浏览历史一次性索引成可语义搜索的知识库,数据全程不出本机,索引体积比传统向量库小 97%,而且不损失检索精度。它开源免费,装完几分钟,你就能对自己的一堆数据直接发问。

开跑前核对这 4 项:LEANN 环境检查清单

别急着敲命令,先把环境过一遍,能省掉一半报错。

  • Python 版本:3.10 及以上(3.9–3.13 都可用)。
  • 包管理器 uv:LEANN 用 uv 管依赖,先确认uv能跑,没有就先装一个。
  • 操作系统:Ubuntu/Arch/WSL、macOS(ARM64 或 Intel)、Windows 都支持;纯 CPU 的 Linux 记得装leann[cpu]
  • 想要完全离线🔒:可选装 Ollama 拉一个轻量模型,这样连生成回答都不走云。

首次运行验证点:装完跑leann --help,能吐出帮助说明环境通了;再建一个索引、搜一次能出结果,就算真正跑通。

最快上手路径:3 个动作跑通本地文档 RAG

核心体验就三步:装 → 建索引 → 搜

动作一,把 LEANN 装进虚拟环境,顺便拿到全部示例:

git clone https://gitcode.com/GitHub_Trending/le/LEANN leann cd leann uv venv source .venv/bin/activate uv pip install leann

动作二,给一个文档目录建索引,把my-docs./docs换成你自己的索引名和文档目录:

leann build my-docs --docs ./docs

动作三,搜索或连续追问--interactive模式下连续提问、输入quit退出:

leann search my-docs "机器学习的核心概念" leann ask my-docs --interactive

到这里,你的个人文档就能被自然语言检索了。📦 整个索引通常只有几百 MB 到几 GB,随手丢哪个盘都行——下面这张图就是它和传统向量库的体积差距:

除了 build / search / ask,CLI 还给了leann watch(检测文件变更)、leann list(列出所有索引)、leann remove(删索引),够你管一整批个人数据。

进阶玩法:把邮件、聊天、代码库也纳入搜索

跑通文档只是开始。下面三个最能代表 LEANN 的玩法,每个都告诉你怎么开开完能换来什么

把 Apple Mail 和浏览器历史变成搜索对象

怎么开:仅邮件需要先在「系统设置 → 隐私与安全性 → 完全磁盘访问」给终端放行,然后直接跑:

python -m apps.email_rag --query "我主要用 DoorDash 或 Uber Eats 点了什么?" python -m apps.browser_rag --query "我搜过哪些机器学习的资料?"

换来什么:78 万封邮件块只占 78MB、3.8 万条浏览记录只占 6MB,你能像搜 Google 一样搜自己的邮件和历史。🔍

让 Claude Code 直接对代码库做语义检索

怎么开:全局装一次,再注册成 MCP 服务:

uv tool install leann-core --with leann claude mcp add --scope user leann-server -- leann_mcp

换来什么:在 Claude Code 里不再只有grep式关键词搜索,而是真正懂语义的代码检索;同一套 MCP 机制还能实时拉 Slack、Twitter 等在线数据,不用手动导出。🚀

多模态 PDF:连图、表、版式一起搜

怎么开:用 ColQwen 系列视觉模型建索引再检索:

python -m apps.colqwen_rag build --pdfs ./my_papers/ --index research_papers python -m apps.colqwen_rag search research_papers "注意力机制是怎么工作的?"

换来什么:检索不再只看文字,图、表、复杂排版都能理解,特别适合科研论文和技术文档。✨

卡住了怎么办:LEANN 常见问题对照表

报错别慌,绝大多数卡壳都落在这张表里,对号入座即可 💡。

现象可能原因对策
编译报缺 libomp / boost / protobuf源码构建时系统依赖没装齐直接装 PyPI 版uv pip install leann,少折腾系统包
微信数据导出失败微信没运行,或 WeChatTweak 没装好先重启微信,再确认wechattweak-cli已安装
读不到 Apple Mail / iMessage终端没有「完全磁盘访问」权限系统设置里给终端开权限,重启终端后再试
浏览器历史搜不到东西Chrome profile 路径指错了找到真实 profile 目录,用--chrome-profile显式指定
老机器 / 低配跑得吃力默认嵌入或生成模型偏重换轻量模型,参考配置指南的 Low-resource 章节

想深入时看哪里:LEANN 文档与源码导读

想搞懂它为什么能省 97%,去 packages/leann-core/ 看核心 API 与后端实现,原理见下图:它存的是剪枝后的图而非全部向量,搜索时才按需重算嵌入。

想查它到底支持哪些能力,翻 docs/features.md;被报错卡住,第一站是 docs/faq.md。

LEANN 的核心就一句话:让你的个人数据可被语义搜索,索引小到能塞进任何笔记本,且全程不出本机。现在就对文档目录跑leann build my-docs --docs ./你的目录,再用leann search my-docs "你常找的那句话"搜一次,看看到底省了多少空间。

【免费下载链接】LEANN[MLsys2026]: RAG on Everything with LEANN. Enjoy 97% storage savings while running a fast, accurate, and 100% private RAG application on your personal device.项目地址: https://gitcode.com/GitHub_Trending/le/LEANN

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询