ARIS 现有技术检索数据库指南:专利与学术文献数据源、IPC/CPC 分类与五步搜索策略
2026/9/23 12:28:27 网站建设 项目流程
  • AI 技能/插件
  • AI 评测
  • 科研
  • 人工智能
  • MCP 服务
  • dsh-plugin

【免费下载链接】Auto-claude-code-research-in-sleep

ARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.

项目地址:https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep
点击查看免费下载

本文是 ARIS(Auto-Research-In-Sleep)技能包中 prior-art-search 技能使用的共享参考(prior-art-databases.md),面向在专利与论文写作流程中需要做现有技术检索的用户。它系统梳理了免费可用的专利数据库与学术文献数据库(非专利文献 NPL)、IPC/CPC 分类体系的结构与检索策略,并给出五步搜索协议与标准化的记录输出模板。读完本文,你可以直接套用这套检索协议完成专利查新、可专利性评估(配合 patent-novelty-check)以及自由实施权(FTO)的初步排查,并能把检索结果与 ARIS 仓库中的 arXiv、Semantic Scholar、OpenAlex 检索工具及反幻觉验证管线无缝衔接。

一、这份指南在 ARIS 技能体系中的位置与使用时机

在 ARIS 的 Markdown-only 技能结构中,prior-art-databases.md是一份共享参考(shared reference),本身不独立执行,而是被上层技能按需加载。prior-art-search 在 "Shared References" 一节明确规定:Load ../shared-references/prior-art-databases.md for search strategy templates and IPC/CPC classification guidance,即执行现有技术检索时,先用本指南确定检索哪些数据库、用什么分类代码、按什么顺序搜、结果如何记录

根据原文档的 "When to Read" 部分,以下三种场景应读取本指南:

  • 执行现有技术检索(prior art search)时——无论是专利还是文献检索;
  • 为专利构造检索式时——需要把发明描述转化为关键词、分类代码与申请人/发明人组合查询;
  • 按 IPC/CPC 代码对检索结果进行分类整理时——用于看清技术全景,而不只是罗列结果。

在完整链路中,prior-art-search产出patent/PRIOR_ART_REPORT.md,随后 patent-novelty-check 以该报告为输入做新颖性(Anticipation)与创造性(Obviousness)分析,最终形成patent/NOVELTY_ASSESSMENT.md。本指南处于这条专利流水线的最前端,决定了"往哪搜、搜多全"。

二、专利数据库(免费、网页可访问)

原文档明确强调所有专利数据库均为免费、网页可访问,不要求注册即可完成大部分检索。在 ARIS 技能中,这些数据库通过WebSearchWebFetch两类工具接入:WebSearch负责关键词级发现(典型写法是WebSearch "site:patents.google.com [keywords]"),WebFetch负责抓取具体专利页面或检索结果页的结构化信息。

2.1 Google Patents

  • 域名patents.google.com
  • 覆盖范围:美国(US)、欧洲(EP)、中国(CN)、WIPO、日本(JP)、韩国(KR)等 100+ 司法辖区
  • 检索语法:全文检索,并支持inventor:assignee:CPC:before:after:等字段限定符
  • 优势:免费数据库中最强的全文检索能力;自动翻译 CN/JP/KR 专利文本;自动进行专利族(family)分组
  • 劣势:无法律状态(legal status)数据;与官方数据库相比可能滞后数周

技能中的用法prior-art-search明确把 Google Patents 作为首选专利数据源,检索式模板为:

WebSearch: "site:patents.google.com [keywords]" WebSearch: "[keywords] patent"

要点包括:每个检索概念都要尝试"核心关键词 + 技术问题关键词"组合;无论目标辖区是哪里都先用英文检索;对于中国发明,再用中文关键词补一轮WebSearch

2.2 Espacenet(EPO)

  • 域名worldwide.espacenet.com
  • 覆盖范围:来自 100+ 专利局的 1.5 亿+ 专利文献
  • 检索语法Classification=(CPC/IPC)Applicant=、标题/摘要/权利要求全文
  • 优势:覆盖最全的免费数据库;机器翻译;经 INPADOC 提供法律状态数据
  • 劣势:界面不够直观,部分功能需要注册
  • 技能中的用法:通过WebFetch worldwide.espacenet.com/search抓取关键查询的结果页;按预测的 IPC/CPC 分类代码检索是 Espacenet 的典型用法(与 Google Patents 的关键词优先互补)。

2.3 CNIPA 专利检索(中国及多国专利审查信息查询)

  • 域名pss-system.cponline.cnipa.gov.cn(或同类入口)
  • 覆盖范围:中国专利(CN),是中国专利申请的权威来源
  • 优势:官方数据、全中文文本、审查状态信息
  • 劣势:界面仅中文,国外覆盖有限
  • 技能中的用法:针对中国专项检索时通过WebFetch访问。这与prior-art-search中"检索目标辖区语言(中国发明用中文检索)"的规则直接对应。

2.4 USPTO 专利全文数据库

原文档将 USPTO 拆成三个互补入口:

  • PatFT:美国已授权专利(granted patents);
  • AppFT:美国已公开申请(published applications);
  • PAIR:美国专利申请审查过程(prosecution history),域名patentcenter.uspto.gov

技能中的用法是针对具体美国专利号用WebFetch获取详情,用于验证美国专利的存在性与状态。

2.5 WIPO PATENTSCOPE

  • 域名patentscope.wipo.int
  • 覆盖范围:PCT 国际申请(WO 公开文本)
  • 优势:完整 PCT 申请全文;CLIR 跨语言检索(Cross-Lingual Information Retrieval)
  • 技能中的用法:通过WebFetch获取 PCT 申请文本。

三、学术文献数据库(非专利文献 NPL)

原文档特别强调:学术论文同样是现有技术。专利法语境下的现有技术包含优先权日之前公开的一切信息,论文对新颖性与创造性(inventive step)审查同样有效。原文档给出了如下数据源总表:

数据库覆盖范围API 可用性
Google Scholar最广的学术覆盖无 API,用 WebSearch
Semantic ScholarCS、生物医学,2 亿+ 论文有(SEMANTIC_SCHOLAR_API_KEY)
arXiv预印本(CS、物理、数学等)有(arxiv_fetch.py
DBLP计算机科学文献目录有(XML API)
CrossRef所有已出版作品的 DOI有(免费、无需密钥)
OpenAlex2.5 亿+ 学术作品有(免费、无需密钥)

说明:上表覆盖数据来自原文档与 research-lit 的 Source Table;具体 API 能力以仓库内工具实现为准(见下文第七节)。

原文档提示的决策逻辑(在 citation-discipline 中有更完整的版本):

需要检索 ML 论文 -> Semantic Scholar / DBLP 已有 DOI -> CrossRef 内容协商 只有 arXiv 线索 -> arXiv + CrossRef / Semantic Scholar 交叉验证 需要第二个验证来源 -> OpenAlex / Semantic Scholar / arXiv

同时 citation-discipline 对 Google Scholar 给出明确约束:不要把手动在 Scholar 里"找到"当作干净、可信、结构化的元数据——Scholar 定位是发现入口,验证必须走结构化 API。

prior-art-search技能中,学术文献检索按此顺序执行:

  1. Google Scholar(WebSearch):WebSearch "[keywords] site:scholar.google.com"
  2. arXiv(若有/arxiv技能则复用,否则 WebSearch):检索预印本;
  3. Semantic Scholar(若配置了 API 密钥则走/semantic-scholar,否则 WebSearch)。

每条相关论文记录需要提取:标题、作者、发表载体(venue)、年份、核心贡献。

四、IPC/CPC 分类体系:读懂专利"坐标"

IPC(国际专利分类)与 CPC(合作专利分类)将专利按层级组织,是专利检索绕不开的坐标系。

4.1 层级结构

原文档用A 61 K 39 / 395这个经典例子展示五级结构:

A 61 K 39 / 395 │ │ │ │ │ │ │ │ │ └─ Subgroup(小组,最具体) │ │ │ └─ Group(组) │ │ └─ Subclass(小类) │ └─ Class(大类) └─ Section(部:A=人类生活必需,B=作业、运输,C=化学、冶金,D=纺织、造纸,E=固定建筑物,F=机械工程,G=物理,H=电学)

4.2 软件 / 机器学习发明最相关的分类(Section G 与 H)

原文档列出了对软件与 ML 发明最常用的分类:

  • G06F:电数字数据处理
  • G06N:基于特定计算模型的计算机装置(AI/ML)
  • G06K:数据识别;数据表示
  • G06T:图像数据处理或生成
  • G06Q:用于商业/金融/行政的数据处理系统
  • H04L:数字信息的传输(网络)
  • H04N:图像通信(视频、图像)

prior-art-search的 Step 1(Extract Search Concepts)中,技能会要求从发明描述中预测相关 IPC/CPC 分类(例如 G06N、G06F),这正是本节的直接应用。

4.3 基于分类的检索策略

原文档给出的四步分类检索策略:

  1. 从发明描述中确定相关 IPC/CPC 大类;
  2. 在这些大类内做定向检索;
  3. 向父级/子级分类扩展以获得更广覆盖;
  4. 将分类限定检索与关键词检索结合使用。

五、五步搜索策略模板

对每一项发明,prior-art-search按原文档定义的标准协议执行五步检索:

Step 1:关键词检索

Primary: [核心发明构思关键词] Secondary: [技术问题关键词] Tertiary: [优势/特征关键词]

Step 2:分类检索

IPC/CPC: [已确定的分类代码] Cross-reference: [相关分类代码]

Step 3:申请人/发明人检索

Key assignees: [该领域已知的公司/高校] Key inventors: [该领域已知的研究者]

Step 4:引证分析

  • 正向引证(Forward citations):谁引用了最接近的现有技术?
  • 反向引证(Backward citations):最接近的现有技术引用了谁?

Step 5:专利族分析

  • 按专利族分组(同一发明在不同司法辖区的申请);
  • 只需对族中最相关的成员做详细分析。

prior-art-search技能对检索过程的工程化约束还包括:

  • MAX_PATENT_RESULTS = 20——最多详细分析 20 件专利文献;
  • MAX_PAPER_RESULTS = 15——最多详细分析 15 篇学术论文;
  • SEARCH_YEARS = 10——回溯 10 年;
  • PATENT_DATABASES = "google-patents, espacenet"——专利数据库组合。

六、输出格式:每条现有技术的标准记录模板

原文档要求对每条检索到的现有技术按固定表格记录,这一模板在prior-art-search的最终报告patent/PRIOR_ART_REPORT.md中落地:

| Field | Content | |-------|---------| | Reference ID | [专利号或论文 DOI] | | Type | Patent / Paper / Other | | Title | [完整标题] | | Date | [公开/优先权日] | | Assignee/Authors | [权利人/作者] | | IPC/CPC | [分类代码] | | Key Teaching | [它教导了什么,2-3 句] | | Relevant Claims | [相关权利要求,若为专利] | | Overlap Risk | HIGH / MEDIUM / LOW | | Relationship | [Anticipating / Relevant / Background] |

其中的Overlap Risk三档判定在技能层有更明确的定义:

  • HIGH:预判了(anticipates)权利要求中的一个或多个要素;
  • MEDIUM:披露了相关但不同的方案;
  • LOW:同一大领域、不同方案。

Relationship三档(Anticipating / Relevant / Background)用于区分"直接占先"、"相关"与"仅背景"。此外,prior-art-search的 Step 5 会基于这些结果做初步自由实施权评估(FTO):识别权利要求可能覆盖本发明的专利、标记已过期(进入公有领域)的专利、指出权利要求范围重叠显著的领域——并明确声明这只是初步评估,正式 FTO 分析应由专利律师完成。

七、学术文献检索的工程化实现:ARIS 仓库中的检索工具

原文档的学术数据库表中标注了多个 API 入口,ARIS 仓库为此提供了对应的 Python CLI 工具,全部位于 tools/ 目录:

7.1 arXiv:tools/arxiv_fetch.py

arxiv_fetch.py 是 arXiv 官方 API(export.arxiv.org/api/query)的 CLI 封装,支持两个子命令:

  • search:按查询或 arXiv ID 检索,输出 JSON 结构化元数据(标题、摘要、完整作者列表、分类、日期);
  • download:按 arXiv ID 下载 PDF 到本地目录。

典型用法(与 research-lit 中的调用一致):

python3 tools/arxiv_fetch.py search "attention mechanism" --max 10 python3 tools/arxiv_fetch.py download 2301.07041 --dir papers

从源码可以看到几处与检索纪律直接相关的实现细节(arxiv_fetch.py):

  • UA 标识:发送描述性 User-Agent,读取ARIS_VERIFY_EMAIL环境变量作为联系邮箱,可进入 arXiv 更宽容的限流池;
  • 429/限流重试:最多 3 次退避重试,处理 HTTP 429 与Rate exceeded.纯文本响应;
  • PDF 校验:下载后校验文件大小(≥ 10 KB)与%PDF-魔数头,防止把错误页当论文缓存(arxiv_fetch.py)。

7.2 Semantic Scholar:tools/semantic_scholar_fetch.py

semantic_scholar_fetch.py 与 arXiv 工具互补:arXiv 管预印本,S2 管已发表载体论文(IEEE、ACM、Springer 等),并带回引文数、venue 元数据与 TLDR。其过滤参数非常贴合质量优先的检索需求:

python3 tools/semantic_scholar_fetch.py search "semantic communication" --max 10 \ --publication-types JournalArticle --min-citations 10

支持--fields-of-study--publication-types--min-citations--year--venue--open-access等过滤项,并读取SEMANTIC_SCHOLAR_API_KEY环境变量(对应原文档表中的 API 标识)。research-lit技能用它填补 arXiv 覆盖不到的 IEEE/ACM 期刊论文。

7.3 OpenAlex:tools/openalex_fetch.py

openalex_fetch.py 是 OpenAlex 开放引用图谱的客户端(api.openalex.org/works),无需 API 密钥即可使用,支持年份、作品类型、开放获取状态、最低引用数等过滤,并支持通过OPENALEX_EMAIL进入 polite pool 提高响应速度。research-lit中它的独特价值是机构归属与资助来源数据以及跨学科覆盖(不止 CS)。

7.4 验证层:verify_papers.py与三层回退

原文档强调"学术论文是有效现有技术",而 ARIS 对检索到的论文可信度有一套强制验证管线,定义在 citation-discipline 的 "Pre-Search Verification Protocol" 中,由tools/verify_papers.py实现,三层回退:

  1. arXiv API 批量验证(每请求最多 40 个 ID)——最廉价权威,优先执行;
  2. CrossRef DOI 查询——验证 DOI 可解析;
  3. Semantic Scholar 模糊标题匹配——仅在前两层都未命中时执行。

每条候选论文得到四态之一:verified/unverified/verify_pending/error。核心规则(也是prior-art-search的 Key Rules 之一):

Never fabricate patent numbers or citations. Mark uncertain references with[VERIFY].

未验证论文不得被静默删除,而应带[UNVERIFIED]标记保留在输出中供审计;当幻觉率超过 20% 时向用户暴露high_hallucination_rate警告,提示收窄检索式重跑。

八、从指南到完整工作流:prior-art-search的实际执行路径

综合以上内容,prior-art-search技能把本指南落地为如下六步(详见 prior-art-search/SKILL.md):

  1. 提取检索概念:核心发明构思、技术问题、4-6 个关键技术特征、预测 IPC/CPC 分类;
  2. 专利检索:Google Patents(WebSearch)→ Espacenet(WebFetch)→ 申请人/发明人组合检索;对每件潜在相关专利 WebFetch 提取标题、摘要、代表权利要求、申请日、权利人与当前状态,并记录 IPC/CPC 代码;
  3. 学术文献检索:Google Scholar(WebSearch)→ arXiv(/arxiv或 WebSearch)→ Semantic Scholar(配置密钥时)——即原文档第三节数据源表的直接应用;
  4. 分类与分析:评估相关性、重叠风险(HIGH/MEDIUM/LOW)与关系类型,并按 IPC/CPC 组织结果以呈现技术全景;
  5. 初步自由实施权评估:识别潜在障碍专利、过期专利与权利要求重叠区域,并附专业律师复核声明;
  6. 输出:写入patent/PRIOR_ART_REPORT.md,包含发明摘要、检索策略、专利文献表、非专利文献表、现有技术全景、FTO 初步评估与建议。

最终报告中的检索策略部分会明确记录:使用过的关键词、检索的 IPC/CPC 分类、覆盖的数据库(Google Patents、Espacenet、Google Scholar、arXiv)与日期范围(距今 N 年)。

九、检索纪律:不可逾越的质量底线

原文档与相关技能共同沉淀了以下硬性规则:

  • 绝不编造专利号或引文:不确定的引用一律标记[VERIFY](prior-art-search Key Rules);
  • 双语言检索:用英文及目标辖区语言检索(中国发明必须补中文关键词);
  • 现有技术定义:优先权日之前公开的一切信息都是现有技术,不仅限专利;学术论文对新颖性与创造性均有效;
  • 过期专利仍相关:已过期专利进入公有领域,但仍影响新颖性判断;
  • 专利新颖性与研究新颖性不同(patent-novelty-check):研究新颖性问"有没有人发表过",专利新颖性问"是否有单篇文献披露了全部权利要求要素";
  • 查新是早期闸门(novelty-check):判断要校准——既不能放过已被论文占先的想法,也不能因为"领域拥挤"就误杀可行想法;放弃(ABANDON)的唯一资格条件是能点名一篇具体已发表论文已包含该结果

这套规则与 citation-discipline 的核心原则一致:绝不凭记忆生成引文,验证不了就显式留空并告知用户。本指南提供的数据库清单、IPC/CPC 坐标与五步搜索协议,正是让"显式留空"尽可能少发生、让每个引用都有据可查的第一道工序。

  • AI 技能/插件
  • AI 评测
  • 科研
  • 人工智能
  • MCP 服务
  • dsh-plugin

【免费下载链接】Auto-claude-code-research-in-sleep

ARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.

项目地址:https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询