如何把 arXiv 论文变成可查询知识图谱:graphify /graphify add 完整实战流程
2026/8/29 12:16:57 网站建设 项目流程

如何把 arXiv 论文变成可查询知识图谱:graphify /graphify add 完整实战流程

【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify

如果你平时要读大量 arXiv 论文,大概率被一个问题困扰:论文看完就忘,概念之间的关联全靠脑子记。开源项目graphify解决的正是这个问题——它能把你的代码库、文档、SQL 配置、PDF 和论文一起变成一个可查询的知识图谱:本地 tree-sitter AST 解析、每条边都解释得清楚、不依赖向量数据库。而其中最实用的一招,就是/graphify add命令:一条命令抓取 arXiv 论文,自动并入图谱。本文带你完整走一遍这条流程。

先认识 graphify:它和普通论文管理工具有什么不同

特性说明
本地确定性解析代码用 tree-sitter AST 解析,无 LLM、不出机器
每条边都有解释边被标记为EXTRACTED(源文件里明确存在)或INFERRED(图谱解析推断)
不是向量索引没有 embedding,是真正可遍历的图,支持提问、追踪两概念间最短路径

它的三大处理流程(详见 docs/how-it-works.md 中的设计说明):

  1. Pass 1 代码结构:本地 AST 解析,免费、无 API 调用
  2. Pass 2 音视频:本地 faster-whisper 转写,同样不出机器
  3. Pass 3 文档/论文/图片:用你 AI 助手的模型做语义抽取(论文摘要就属于这一步)

论文抓取逻辑的核心实现在 graphify/ingest.py 中,它会自动识别 arXiv 链接,抓取标题、作者和摘要。

三步准备环境

前提条件:Python 3.10+,推荐用uvpipx

# 第 1 步:安装 CLI(PyPI 包名是双 y 的 graphifyy) uv tool install graphifyy # 第 2 步:把技能注册给你的 AI 助手(Claude Code、Cursor、Codex、Gemini CLI 等) graphify install # 第 3 步:在 AI 助手里对目录跑一次建图 /graphify .

运行完成后会生成三个文件:graph.html(浏览器打开可点击交互)、GRAPH_REPORT.md(图谱报告)、graph.json(完整图数据,后续随时查询)。

💡 安装后如果提示graphify: command not found,运行uv tool update-shell再开一个新终端即可。

/graphify add 抓取 arXiv 论文的完整流程

在 AI 助手中直接输入:

/graphify add https://arxiv.org/abs/1706.03762

以 Transformer 那篇经典论文Attention Is All You Need为例,graphify 会自动完成四件事:

第 1 步:识别 URL 类型。内置逻辑(见graphify/ingest.py中的_detect_url_type)检测到arxiv.org,走 arXiv 专用抓取路径。

第 2 步:抓取摘要与元数据。从 arXiv 页面提取标题、作者列表和摘要正文。

第 3 步:落盘为带元信息的 Markdown。文件保存到语料目录(默认./raw),文件名形如arxiv_1706_03762.md,内容大致长这样:

--- source_url: "https://arxiv.org/abs/1706.03762" arxiv_id: "1706.03762" type: paper title: "Attention Is All You Need" paper_authors: "Vaswani, Ashish; Shazeer, Noam; ..." --- # Attention Is All You Need **Authors:** ... **arXiv:** 1706.03762 ## Abstract ...

第 4 步:自动更新图谱。技能文档(graphify/skills/claude/references/add-watch.md)要求抓取成功后立即对语料目录跑增量更新,新论文节点会并入现有图谱,无需手动重建。

整个过程大约几十秒,且论文抓取本身不需要任何 API key。

抓取之后:把论文"问"起来

图建好之后,你就开始查图而不是读文件了:

graphify query "what connects attention to the optimizer?" # 用自然语言提问 graphify explain "Attention" # 解释某个概念 graphify path "Attention" "PositionalEncoding" # 追踪两个概念的最短路径

论文里的"自注意力"、"位置编码"会变成图中的节点,和你代码里的对应实现连成边。graphify 仓库自带了这个场景的完整案例:worked/karpathy-repos/README.md 展示了 3 个代码仓库 + 5 篇 arXiv 论文(包括 1706.03762、FlashAttention 等)组成的语料,最终得到约 285 个节点、17 个社区,每次查询比直接读 52 个原始文件节省 71.5 倍 token。

进阶玩法:不只是 arXiv

/graphify add对多种链接自动识别,一条命令通吃:

链接类型处理结果
arXiv抓取摘要 + 元数据,存为.md
YouTube / 视频 URL用 yt-dlp 下载音频,本地转写成.txt
Twitter/X 推文抓取推文内容和作者,存为.md
PDF 直链直接下载.pdf
图片链接下载后由模型做视觉抽取
任意网页转成 Markdown 入库

还可以给语料打标签,方便团队区分"谁加的":

/graphify add https://arxiv.org/abs/2205.14135 --author "Vaswani" --contributor "你"

另外,--watch模式可以后台监听语料目录:代码文件变更会自动重建图谱,论文/文档变更则提示你跑一次/graphify --update,适合长期维护论文库的场景。

新手常见问题

Q:不加--author会有什么影响?不影响功能,只是元数据里的贡献者字段会记为unknown,方便日后溯源。

Q:抓多篇论文怎么组织?把语料集中在一个目录(比如./raw),每加一篇都自动增量并入;定期跑/graphify ./raw --update只重抽有变化的文件,未改动文件走 SHA256 缓存直接跳过,不花重复成本。

Q:想要完整仓库自己跑一遍?克隆仓库https://link.gitcode.com/i/312dae422eb1884dc10d5efed8f7acd1worked/目录下每个文件夹都保留了原始输入和真实输出(GRAPH_REPORT.mdgraph.json),可以直接复现验证。

总结

graphify 的/graphify add让"读论文"变成了一条流水线:粘贴链接 → 自动抓取摘要 → 并入知识图谱 → 用自然语言追问。没有向量库、没有黑盒,每条关系都能解释。装好只需两行命令,第一次抓论文只需一条/graphify add,值得每个经常泡在 arXiv 上的工程师试试。

【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询