- AI 技能/插件
- AI 评测
- 科研
- 人工智能
- MCP 服务
- dsh-plugin
【免费下载链接】Auto-claude-code-research-in-sleep
ARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.
本文是 ARIS(Auto-Research-In-Sleep)技能包中 prior-art-search 技能使用的共享参考(prior-art-databases.md),面向在专利与论文写作流程中需要做现有技术检索的用户。它系统梳理了免费可用的专利数据库与学术文献数据库(非专利文献 NPL)、IPC/CPC 分类体系的结构与检索策略,并给出五步搜索协议与标准化的记录输出模板。读完本文,你可以直接套用这套检索协议完成专利查新、可专利性评估(配合 patent-novelty-check)以及自由实施权(FTO)的初步排查,并能把检索结果与 ARIS 仓库中的 arXiv、Semantic Scholar、OpenAlex 检索工具及反幻觉验证管线无缝衔接。
一、这份指南在 ARIS 技能体系中的位置与使用时机
在 ARIS 的 Markdown-only 技能结构中,prior-art-databases.md是一份共享参考(shared reference),本身不独立执行,而是被上层技能按需加载。prior-art-search 在 "Shared References" 一节明确规定:Load ../shared-references/prior-art-databases.md for search strategy templates and IPC/CPC classification guidance,即执行现有技术检索时,先用本指南确定检索哪些数据库、用什么分类代码、按什么顺序搜、结果如何记录。
根据原文档的 "When to Read" 部分,以下三种场景应读取本指南:
- 执行现有技术检索(prior art search)时——无论是专利还是文献检索;
- 为专利构造检索式时——需要把发明描述转化为关键词、分类代码与申请人/发明人组合查询;
- 按 IPC/CPC 代码对检索结果进行分类整理时——用于看清技术全景,而不只是罗列结果。
在完整链路中,prior-art-search产出patent/PRIOR_ART_REPORT.md,随后 patent-novelty-check 以该报告为输入做新颖性(Anticipation)与创造性(Obviousness)分析,最终形成patent/NOVELTY_ASSESSMENT.md。本指南处于这条专利流水线的最前端,决定了"往哪搜、搜多全"。
二、专利数据库(免费、网页可访问)
原文档明确强调所有专利数据库均为免费、网页可访问,不要求注册即可完成大部分检索。在 ARIS 技能中,这些数据库通过WebSearch与WebFetch两类工具接入:WebSearch负责关键词级发现(典型写法是WebSearch "site:patents.google.com [keywords]"),WebFetch负责抓取具体专利页面或检索结果页的结构化信息。
2.1 Google Patents
- 域名:
patents.google.com - 覆盖范围:美国(US)、欧洲(EP)、中国(CN)、WIPO、日本(JP)、韩国(KR)等 100+ 司法辖区
- 检索语法:全文检索,并支持
inventor:、assignee:、CPC:、before:、after:等字段限定符 - 优势:免费数据库中最强的全文检索能力;自动翻译 CN/JP/KR 专利文本;自动进行专利族(family)分组
- 劣势:无法律状态(legal status)数据;与官方数据库相比可能滞后数周
技能中的用法:prior-art-search明确把 Google Patents 作为首选专利数据源,检索式模板为:
WebSearch: "site:patents.google.com [keywords]" WebSearch: "[keywords] patent"要点包括:每个检索概念都要尝试"核心关键词 + 技术问题关键词"组合;无论目标辖区是哪里都先用英文检索;对于中国发明,再用中文关键词补一轮WebSearch。
2.2 Espacenet(EPO)
- 域名:
worldwide.espacenet.com - 覆盖范围:来自 100+ 专利局的 1.5 亿+ 专利文献
- 检索语法:
Classification=(CPC/IPC)、Applicant=、标题/摘要/权利要求全文 - 优势:覆盖最全的免费数据库;机器翻译;经 INPADOC 提供法律状态数据
- 劣势:界面不够直观,部分功能需要注册
- 技能中的用法:通过
WebFetch worldwide.espacenet.com/search抓取关键查询的结果页;按预测的 IPC/CPC 分类代码检索是 Espacenet 的典型用法(与 Google Patents 的关键词优先互补)。
2.3 CNIPA 专利检索(中国及多国专利审查信息查询)
- 域名:
pss-system.cponline.cnipa.gov.cn(或同类入口) - 覆盖范围:中国专利(CN),是中国专利申请的权威来源
- 优势:官方数据、全中文文本、审查状态信息
- 劣势:界面仅中文,国外覆盖有限
- 技能中的用法:针对中国专项检索时通过
WebFetch访问。这与prior-art-search中"检索目标辖区语言(中国发明用中文检索)"的规则直接对应。
2.4 USPTO 专利全文数据库
原文档将 USPTO 拆成三个互补入口:
- PatFT:美国已授权专利(granted patents);
- AppFT:美国已公开申请(published applications);
- PAIR:美国专利申请审查过程(prosecution history),域名
patentcenter.uspto.gov。
技能中的用法是针对具体美国专利号用WebFetch获取详情,用于验证美国专利的存在性与状态。
2.5 WIPO PATENTSCOPE
- 域名:
patentscope.wipo.int - 覆盖范围:PCT 国际申请(WO 公开文本)
- 优势:完整 PCT 申请全文;CLIR 跨语言检索(Cross-Lingual Information Retrieval)
- 技能中的用法:通过
WebFetch获取 PCT 申请文本。
三、学术文献数据库(非专利文献 NPL)
原文档特别强调:学术论文同样是现有技术。专利法语境下的现有技术包含优先权日之前公开的一切信息,论文对新颖性与创造性(inventive step)审查同样有效。原文档给出了如下数据源总表:
| 数据库 | 覆盖范围 | API 可用性 |
|---|---|---|
| Google Scholar | 最广的学术覆盖 | 无 API,用 WebSearch |
| Semantic Scholar | CS、生物医学,2 亿+ 论文 | 有(SEMANTIC_SCHOLAR_API_KEY) |
| arXiv | 预印本(CS、物理、数学等) | 有(arxiv_fetch.py) |
| DBLP | 计算机科学文献目录 | 有(XML API) |
| CrossRef | 所有已出版作品的 DOI | 有(免费、无需密钥) |
| OpenAlex | 2.5 亿+ 学术作品 | 有(免费、无需密钥) |
说明:上表覆盖数据来自原文档与 research-lit 的 Source Table;具体 API 能力以仓库内工具实现为准(见下文第七节)。
原文档提示的决策逻辑(在 citation-discipline 中有更完整的版本):
需要检索 ML 论文 -> Semantic Scholar / DBLP 已有 DOI -> CrossRef 内容协商 只有 arXiv 线索 -> arXiv + CrossRef / Semantic Scholar 交叉验证 需要第二个验证来源 -> OpenAlex / Semantic Scholar / arXiv同时 citation-discipline 对 Google Scholar 给出明确约束:不要把手动在 Scholar 里"找到"当作干净、可信、结构化的元数据——Scholar 定位是发现入口,验证必须走结构化 API。
在prior-art-search技能中,学术文献检索按此顺序执行:
- Google Scholar(WebSearch):
WebSearch "[keywords] site:scholar.google.com"; - arXiv(若有
/arxiv技能则复用,否则 WebSearch):检索预印本; - Semantic Scholar(若配置了 API 密钥则走
/semantic-scholar,否则 WebSearch)。
每条相关论文记录需要提取:标题、作者、发表载体(venue)、年份、核心贡献。
四、IPC/CPC 分类体系:读懂专利"坐标"
IPC(国际专利分类)与 CPC(合作专利分类)将专利按层级组织,是专利检索绕不开的坐标系。
4.1 层级结构
原文档用A 61 K 39 / 395这个经典例子展示五级结构:
A 61 K 39 / 395 │ │ │ │ │ │ │ │ │ └─ Subgroup(小组,最具体) │ │ │ └─ Group(组) │ │ └─ Subclass(小类) │ └─ Class(大类) └─ Section(部:A=人类生活必需,B=作业、运输,C=化学、冶金,D=纺织、造纸,E=固定建筑物,F=机械工程,G=物理,H=电学)4.2 软件 / 机器学习发明最相关的分类(Section G 与 H)
原文档列出了对软件与 ML 发明最常用的分类:
- G06F:电数字数据处理
- G06N:基于特定计算模型的计算机装置(AI/ML)
- G06K:数据识别;数据表示
- G06T:图像数据处理或生成
- G06Q:用于商业/金融/行政的数据处理系统
- H04L:数字信息的传输(网络)
- H04N:图像通信(视频、图像)
在prior-art-search的 Step 1(Extract Search Concepts)中,技能会要求从发明描述中预测相关 IPC/CPC 分类(例如 G06N、G06F),这正是本节的直接应用。
4.3 基于分类的检索策略
原文档给出的四步分类检索策略:
- 从发明描述中确定相关 IPC/CPC 大类;
- 在这些大类内做定向检索;
- 向父级/子级分类扩展以获得更广覆盖;
- 将分类限定检索与关键词检索结合使用。
五、五步搜索策略模板
对每一项发明,prior-art-search按原文档定义的标准协议执行五步检索:
Step 1:关键词检索
Primary: [核心发明构思关键词] Secondary: [技术问题关键词] Tertiary: [优势/特征关键词]Step 2:分类检索
IPC/CPC: [已确定的分类代码] Cross-reference: [相关分类代码]Step 3:申请人/发明人检索
Key assignees: [该领域已知的公司/高校] Key inventors: [该领域已知的研究者]Step 4:引证分析
- 正向引证(Forward citations):谁引用了最接近的现有技术?
- 反向引证(Backward citations):最接近的现有技术引用了谁?
Step 5:专利族分析
- 按专利族分组(同一发明在不同司法辖区的申请);
- 只需对族中最相关的成员做详细分析。
prior-art-search技能对检索过程的工程化约束还包括:
MAX_PATENT_RESULTS = 20——最多详细分析 20 件专利文献;MAX_PAPER_RESULTS = 15——最多详细分析 15 篇学术论文;SEARCH_YEARS = 10——回溯 10 年;PATENT_DATABASES = "google-patents, espacenet"——专利数据库组合。
六、输出格式:每条现有技术的标准记录模板
原文档要求对每条检索到的现有技术按固定表格记录,这一模板在prior-art-search的最终报告patent/PRIOR_ART_REPORT.md中落地:
| Field | Content | |-------|---------| | Reference ID | [专利号或论文 DOI] | | Type | Patent / Paper / Other | | Title | [完整标题] | | Date | [公开/优先权日] | | Assignee/Authors | [权利人/作者] | | IPC/CPC | [分类代码] | | Key Teaching | [它教导了什么,2-3 句] | | Relevant Claims | [相关权利要求,若为专利] | | Overlap Risk | HIGH / MEDIUM / LOW | | Relationship | [Anticipating / Relevant / Background] |其中的Overlap Risk三档判定在技能层有更明确的定义:
- HIGH:预判了(anticipates)权利要求中的一个或多个要素;
- MEDIUM:披露了相关但不同的方案;
- LOW:同一大领域、不同方案。
而Relationship三档(Anticipating / Relevant / Background)用于区分"直接占先"、"相关"与"仅背景"。此外,prior-art-search的 Step 5 会基于这些结果做初步自由实施权评估(FTO):识别权利要求可能覆盖本发明的专利、标记已过期(进入公有领域)的专利、指出权利要求范围重叠显著的领域——并明确声明这只是初步评估,正式 FTO 分析应由专利律师完成。
七、学术文献检索的工程化实现:ARIS 仓库中的检索工具
原文档的学术数据库表中标注了多个 API 入口,ARIS 仓库为此提供了对应的 Python CLI 工具,全部位于 tools/ 目录:
7.1 arXiv:tools/arxiv_fetch.py
arxiv_fetch.py 是 arXiv 官方 API(export.arxiv.org/api/query)的 CLI 封装,支持两个子命令:
search:按查询或 arXiv ID 检索,输出 JSON 结构化元数据(标题、摘要、完整作者列表、分类、日期);download:按 arXiv ID 下载 PDF 到本地目录。
典型用法(与 research-lit 中的调用一致):
python3 tools/arxiv_fetch.py search "attention mechanism" --max 10 python3 tools/arxiv_fetch.py download 2301.07041 --dir papers从源码可以看到几处与检索纪律直接相关的实现细节(arxiv_fetch.py):
- UA 标识:发送描述性 User-Agent,读取
ARIS_VERIFY_EMAIL环境变量作为联系邮箱,可进入 arXiv 更宽容的限流池; - 429/限流重试:最多 3 次退避重试,处理 HTTP 429 与
Rate exceeded.纯文本响应; - PDF 校验:下载后校验文件大小(≥ 10 KB)与
%PDF-魔数头,防止把错误页当论文缓存(arxiv_fetch.py)。
7.2 Semantic Scholar:tools/semantic_scholar_fetch.py
semantic_scholar_fetch.py 与 arXiv 工具互补:arXiv 管预印本,S2 管已发表载体论文(IEEE、ACM、Springer 等),并带回引文数、venue 元数据与 TLDR。其过滤参数非常贴合质量优先的检索需求:
python3 tools/semantic_scholar_fetch.py search "semantic communication" --max 10 \ --publication-types JournalArticle --min-citations 10支持--fields-of-study、--publication-types、--min-citations、--year、--venue、--open-access等过滤项,并读取SEMANTIC_SCHOLAR_API_KEY环境变量(对应原文档表中的 API 标识)。research-lit技能用它填补 arXiv 覆盖不到的 IEEE/ACM 期刊论文。
7.3 OpenAlex:tools/openalex_fetch.py
openalex_fetch.py 是 OpenAlex 开放引用图谱的客户端(api.openalex.org/works),无需 API 密钥即可使用,支持年份、作品类型、开放获取状态、最低引用数等过滤,并支持通过OPENALEX_EMAIL进入 polite pool 提高响应速度。research-lit中它的独特价值是机构归属与资助来源数据以及跨学科覆盖(不止 CS)。
7.4 验证层:verify_papers.py与三层回退
原文档强调"学术论文是有效现有技术",而 ARIS 对检索到的论文可信度有一套强制验证管线,定义在 citation-discipline 的 "Pre-Search Verification Protocol" 中,由tools/verify_papers.py实现,三层回退:
- arXiv API 批量验证(每请求最多 40 个 ID)——最廉价权威,优先执行;
- CrossRef DOI 查询——验证 DOI 可解析;
- Semantic Scholar 模糊标题匹配——仅在前两层都未命中时执行。
每条候选论文得到四态之一:verified/unverified/verify_pending/error。核心规则(也是prior-art-search的 Key Rules 之一):
Never fabricate patent numbers or citations. Mark uncertain references with
[VERIFY].
未验证论文不得被静默删除,而应带[UNVERIFIED]标记保留在输出中供审计;当幻觉率超过 20% 时向用户暴露high_hallucination_rate警告,提示收窄检索式重跑。
八、从指南到完整工作流:prior-art-search的实际执行路径
综合以上内容,prior-art-search技能把本指南落地为如下六步(详见 prior-art-search/SKILL.md):
- 提取检索概念:核心发明构思、技术问题、4-6 个关键技术特征、预测 IPC/CPC 分类;
- 专利检索:Google Patents(WebSearch)→ Espacenet(WebFetch)→ 申请人/发明人组合检索;对每件潜在相关专利 WebFetch 提取标题、摘要、代表权利要求、申请日、权利人与当前状态,并记录 IPC/CPC 代码;
- 学术文献检索:Google Scholar(WebSearch)→ arXiv(
/arxiv或 WebSearch)→ Semantic Scholar(配置密钥时)——即原文档第三节数据源表的直接应用; - 分类与分析:评估相关性、重叠风险(HIGH/MEDIUM/LOW)与关系类型,并按 IPC/CPC 组织结果以呈现技术全景;
- 初步自由实施权评估:识别潜在障碍专利、过期专利与权利要求重叠区域,并附专业律师复核声明;
- 输出:写入
patent/PRIOR_ART_REPORT.md,包含发明摘要、检索策略、专利文献表、非专利文献表、现有技术全景、FTO 初步评估与建议。
最终报告中的检索策略部分会明确记录:使用过的关键词、检索的 IPC/CPC 分类、覆盖的数据库(Google Patents、Espacenet、Google Scholar、arXiv)与日期范围(距今 N 年)。
九、检索纪律:不可逾越的质量底线
原文档与相关技能共同沉淀了以下硬性规则:
- 绝不编造专利号或引文:不确定的引用一律标记
[VERIFY](prior-art-search Key Rules); - 双语言检索:用英文及目标辖区语言检索(中国发明必须补中文关键词);
- 现有技术定义:优先权日之前公开的一切信息都是现有技术,不仅限专利;学术论文对新颖性与创造性均有效;
- 过期专利仍相关:已过期专利进入公有领域,但仍影响新颖性判断;
- 专利新颖性与研究新颖性不同(patent-novelty-check):研究新颖性问"有没有人发表过",专利新颖性问"是否有单篇文献披露了全部权利要求要素";
- 查新是早期闸门(novelty-check):判断要校准——既不能放过已被论文占先的想法,也不能因为"领域拥挤"就误杀可行想法;放弃(ABANDON)的唯一资格条件是能点名一篇具体已发表论文已包含该结果。
这套规则与 citation-discipline 的核心原则一致:绝不凭记忆生成引文,验证不了就显式留空并告知用户。本指南提供的数据库清单、IPC/CPC 坐标与五步搜索协议,正是让"显式留空"尽可能少发生、让每个引用都有据可查的第一道工序。
- AI 技能/插件
- AI 评测
- 科研
- 人工智能
- MCP 服务
- dsh-plugin
【免费下载链接】Auto-claude-code-research-in-sleep
ARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.
相关推荐
SearXNG学术搜索:集成学术数据库和论文检索功能
SearXNG学术搜索:集成学术数据库和论文检索功能 概述 SearXNG作为一款开源的元搜索引擎,不仅提供常规的网络搜索功能,还集成了强大的学术搜索能力。通过
后端搜索引擎终极大数据技术指南:如何快速掌握Awesome BigData完整资源目录
终极大数据技术指南:如何快速掌握Awesome BigData完整资源目录 在当今数据驱动的时代,大数据技术已成为企业和开发者必须掌握的核心技能。Awesome
文档教程Manticore Search 技术解析:高性能全文搜索与数据分析数据库
Manticore Search 技术解析:高性能全文搜索与数据分析数据库 什么是 Manticore Search Manticore Search 是一款专
搜索引擎数据库全文检索后端
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考