scientific-agent-skills:假设生成技能的 Dated Source Ledger 机制——构建可验证、带日期边界的科学证据来源台账
【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000+ scientists worldwide. 165 ready-to-use validated skills plus 100+ scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills
本文基于 scientific-agent-skills 仓库中假设生成(hypothesis-generation)技能包内的 Dated Source Ledger 文档,完整解析该技能如何为"文献依据"设定带日期、可审计、可机器校验的证据边界:从搜索边界声明、核心方法论来源分级、预注册与报告规范来源,到因果推断、负责任 AI 与伦理监管来源,再到 2025 年美国双重用途(dual-use)政策的过渡期状态记录。读完后你将掌握一套可复用的"来源台账"方法论,并能结合仓库内置的审计脚本(audit_evidence_ledger.py)与模板文件,在自己的研究中建立同样的证据溯源与合规核验流程。
一、定位:Dated Source Ledger 是什么,不是什么
该台账(verification cutoff2026-07-23)是 hypothesis-generation 技能在 2026-07 进行"技能刷新(skill refresh)"时对权威来源做的带日期核查记录,机器可读版本为 assets/source_ledger.csv,人读版本为 references/source_ledger.md。
文档对自身的性质做了明确限定,这是理解整套机制的前提:
- 它是一次定向的技能刷新,不是系统性综述(systematic review)、专利检索,也不能作为科学新颖性的证明;
- 搜索优先命中官方域与一手出版物(primary publications),并通过对全文抽取或搜索摘要来核验标题、日期、版本与相关段落;
- 台账记录的"是这个技能刷新查到了什么",不能从台账推断用户研究课题的新颖性——这是文档"Source-use rules"第 5 条的硬性规定。
这一设计对应了 SKILL.md 工作流第 4 步"Establish a dated evidence boundary"的要求:在依赖文献下结论之前必须先搜索,并记录搜索日期与截止时间、数据库/索引、查询与筛选边界、纳入排除的来源类型、支持/挑战各论断的来源,以及已知的访问、语言、数据库与时间限制。
二、搜索边界(Search Boundary):十个核查方向
台账在"Search boundary"一节完整列出了本次刷新使用parallel-cli搜索所覆盖的十个方向,全部限定在官方或一手域、采用聚焦式查询:
- NIH 关于严谨性、可重复性(rigor, reproducibility)与 2026 年复制计划(replication initiative)的内容;
- Cochrane PICO 以及"构建良好临床问题(well-built clinical question)"的原始文章;
- FINER 助记符的被归属历史来源与当前解读;
- Platt 的 strong-inference(强推断)原始论文;
- COS/OSF 的预注册(preregistration)与注册报告(Registered Reports);
- SPIRIT 2025 与 CONSORT 2025 报告规范;
- 因果问题、反事实、estimand(效应估计目标)与偏倚;
- 阴性对照、HARKing、多重性(multiplicity)、可重复性与复制;
- NIST/UNESCO 负责任 AI 规范,以及输出同质化(output homogenization)的一手证据;
- 人、动物、生物安全、生物安保、双重用途、数据与监管关口。
这十个方向与 references/literature_search_strategies.md 中"分离搜索目标"的方法一致——现象、机制、竞争解释、测量、设计、反向证据、安全与治理、优先级/新颖性应各用独立查询,避免把机制检索误当新颖性检索。
三、核心方法论来源(Core Methodology Sources)
台账把方法论来源分成三个子类,每个条目都有稳定的SRC-*标识符,与 CSV 台账中的source_id一一对应。
3.1 问题构建(Question formulation)
| 标识符 | 来源 | 台账核验说明 |
|---|---|---|
SRC-COCHRANE-PICO | Cochrane Handbook 第 2 章(现行版本) | PICO 用于干预-效应类综述问题;目标应在预定义阶段确定,并在适当时纳入利益相关方意见 |
SRC-PICO-ORIGINAL | Richardson et al., 1995,The well-built clinical question | 四段式临床问题的奠基性文章 |
SRC-FINER-1988 | Hulley and Cummings,Designing Clinical Research第一版(1988)元数据 | 本次刷新中定位到的、最早的 FINER 归属来源 |
SRC-FINER-CURRENT | Werner and Willis, 2023 | FINER 的当前解读 |
历史局限(Historical limitation)的诚实声明值得单独强调:本次定向搜索只确认了 1988 年书籍的书目元数据与后人的归属说法,未能证明 FINER 助记符的确切首次印刷使用或提出(coinage)。因此该技能"不把这一溯源声明当作已证明"(does not claim that provenance as proven)。在 CSV 中,这条记录对应的status字段被标记为historical_metadata_limited,而不是current_official——台账用状态字段把"元数据有限"与"现行官方"明确区分开。
FINER(Feasible, Interesting, Novel, Ethical, Relevant)在 SKILL.md 中同样被定位为问题精炼助记符而非评分系统,"Novel"必须在有文档支撑的、fit-for-purpose 的检索与专家评审支持之前一律视为未解决。
3.2 多假设与可证伪性(Multiple hypotheses and falsification)
SRC-PLATT-1964— John R. Platt, "Strong Inference,"Science146:347–353,DOI10.1126/science.146.3642.347。这是"先生成多个候选、再设计关键实验"模式的原始出处;SRC-NEG-CONTROL— Lipsitch, Tchetgen Tchetgen, and Cohen, 2010,用阴性对照检测混杂与偏倚,DOI10.1097/EDE.0b013e3181d61eeb;SRC-HARKING— Kerr, 1998,HARKing(hypothesizing after the results are known)的定义性文章,DOI10.1207/s15327957pspr0203_4;SRC-ASA-PVALUE— 美国统计学会(ASA)声明:阈值本身不构成科学结论的依据;p 值不衡量假设真实性或效应重要性;要求完整报告。
这四条来源分别支撑了技能工作流的第 5 步(先于选择检验方法生成竞争假设)、第 7 步(阴性对照必须"不可能经由目标机制起作用,同时共享相关偏倚通路")与第 10 步(防 HARKing、暴露偏离)。
3.3 严谨性、可重复性与复制(Rigor, reproducibility, replication)
SRC-NIH-RIGOR— NIH 关于科学前提、严谨设计、相关生物学变量、资源认证(authentication)与透明度的指导;SRC-NIH-REPLICATION— NIH 全机构范围的复制与可重复性计划(页面于 2026-06-22 审阅);SRC-NASEM-RR— 美国国家科学院 2019 年共识报告,定义了可重复性(reproducibility:同一数据/代码/条件下获得一致的计算结果)与可复现性(replicability:用新数据收集对同一问题的一致性验证);SRC-TOP— Transparency and Openness Promotion 指南;SRC-NIH-DMS— NIH 数据管理与共享(DMS)政策。
台账在此节末尾附加了一条保留条款:开放实践仍然受制于知情同意、隐私、社区治理、知识产权、出口管制与安全限制。这与 references/literature_search_strategies.md 中"权威不等于免于批判性评价"的原则呼应。
四、预注册与干预试验(Preregistration and intervention trials)
| 标识符 | 来源 | 台账核验说明 |
|---|---|---|
SRC-COS-PREREG | Center for Open Science 预注册官方页 | 预注册把计划内工作与计划外工作分离;透明的探索性工作仍然有价值 |
SRC-OSF-REG | OSF 注册/预注册现行实施指南 | 带时间戳的计划、模板指南、分析细节、预期偏离 |
SRC-COS-RR | Center for Open Science 注册报告 | 结果盲评(results-blind protocol review)与原则性接收(in-principle acceptance) |
SRC-SPIRIT-2025 | SPIRIT 2025 声明 | 现行 34 项随机试验方案报告规范,取代SPIRIT 2013 |
SRC-CONSORT-2025 | CONSORT 2025 声明 | 现行 30 项随机试验结果报告规范,涵盖开放科学、 harms、结局、干预细节与重要变更报告 |
台账明确给出定性结论:SPIRIT 与 CONSORT 是报告规范,不是设计质量、伦理、监管或疗效的认证。CSV 中这两条的version_or_date分别记录为"Published 2025-04-28"与"Published 2025-04-14",status为current_primary——日期与"现行版"属性被同时钉死在台账里,这正是"dated"二字的意义所在。
五、因果推断与 Estimand
SRC-WHATIF— Hernán 与 Robins 的Causal Inference: What If;作者页面链接到核验期间找到的最新修订版;SRC-ICH-E9R1— ICH E9(R1) 附录,把estimand定义为精确的治疗效应目标,并对齐计划、设计、分析、敏感性分析与解释五个环节。
台账指出,这些来源共同支撑了技能中"目标因果对比(target causal contrast)、估计量(estimator)、估计值(estimate)三者区分"的框架,以及对混杂、选择、对撞(collider)、测量与干预定义等假设的显式处理。在 SKILL.md 的第 6 步中,因果目标必须在分析前定义目标总体、干预/暴露与对照、结局与时间窗、总体层面汇总量、治疗版本与间发事件(intercurrent-event)处理、识别假设与目标试验/设计类比——台账正是这些要求背后的权威出处。
六、负责任 AI(Responsible AI)
SRC-NIST-GENAI— NIST AI 600-1 生成式 AI 风险框架,覆盖编造(confabulation)、隐私、有害偏倚/同质化、信息完整性、危险建议与人-AI 配置;SRC-UNESCO-AI— UNESCO AI 伦理建议书,涵盖人权、隐私、问责、透明、多样性与人类监督;SRC-DOSHI-HAUSER— Doshi 与 Hauser, 2024,DOI10.1126/sciadv.adn5290。
对 Doshi & Hauser 的结果,台账做了极为克制的表述边界:其一手同质化结果是任务特定的(在该研究的写作任务中,AI 辅助产出彼此更相似,同时部分个体创造力指标提升)。因此技能把"想法同质化"当作**一种合理风险(plausible risk)**处理,而不是跨科学领域被测量的普遍效应。这种"引用一手结果但拒绝过度外推"的写法,是整份台账的通用风格。
七、伦理与监管来源(Ethics and oversight)
7.1 人类受试者
SRC-HHS-COMMON-RULE— 美国共同规则(45 CFR 46)官方门户;SRC-BELMONT— 《贝尔蒙特报告》三原则:尊重人、行善、公正;SRC-HELSINKI— 世界医学协会《赫尔辛基宣言》,2024 年 10 月修订版。
台账附带的操作性结论:是否有适用性必须由有权限的 IRB/REC 或同等机构判定,技能不自我声明豁免(the skill does not self-declare exemption)。
7.2 动物
SRC-OLAW-PHS— PHS 政策及覆盖工作的 IACUC/Assurance 要求;SRC-ARRIVE— ARRIVE 2.0 报告指南(注意:是报告指南,不是伦理批准或设计质量证书)。
7.3 生物安全与双重用途
SRC-NIH-RSNA— NIH 重组/合成核酸分子研究指南;SRC-NIH-BIOSEC— NIH 现行生物安全/生物安保门户;SRC-BMBL— CDC/NIH《实验室生物安全手册》(BMBL)第六版;SRC-WHO-LIFE— WHO 生命科学负责任使用全球指导框架。
八、美国双重用途政策的过渡期状态(关键时效记录)
台账中"U.S. dual-use transition status"一节是整份文档里时效性最强的部分,它精确记录了核验日(2026-07-23)时三个相互交叉的信号:
SRC-EO-14292(2025-05-05 签署):要求修订/取代 2024 年 DURC/PEPP 政策,并对覆盖范围内危险的基因获得(gain-of-function)研究采取暂停/终止措施;SRC-NIH-NOT-25-112:声明该行政令使 NIH 2024 年的实施方案失效,并撤销 NOT-OD-25-061;SRC-ASPR-DURC页面在核验时仍描述 2024 年政策"等待修订或取代",并承诺修订版政策可用时更新页面。
CSV 中三条记录的状态分别标记为current_official、current_official和current_transition_notice——过渡状态被显式编码而非笼统标为"现行"。台账由此给出两条硬规则:此状态是时间敏感的,任何相关工作前必须重新核查现行联邦、资助方、课题、机构与司法管辖区规则;不得把本台账当作放行许可(clearance)。
九、机器可读台账:source_ledger.csv 的结构
人读版 references/source_ledger.md 与机读版 assets/source_ledger.csv 是同一台账的两种形态。CSV 的表头为:
source_id,organization,title,version_or_date,source_type,url,verified_on,status,notes各字段的实际用法(以 CSV 中真实行为例说明):
source_id:稳定标识符,如SRC-NIH-RIGOR,与人读版条目一一对应,供下游工具交叉引用;version_or_date:记录"版本+日期"双重信息,例如Page updated 2024-10-16(NIH Rigor 页面)、First edition 1988(FINER 书籍)、Step 4 2019; implemented 2020(ICH E9(R1));source_type:对来源分级的受控词汇,如official guidance、foundational_primary、current reporting guideline、executive order、consensus report;verified_on:全部记录统一为2026-07-23,即台账的验证截止日;status:状态机字段,取值如current_official(现行官方)、foundational_primary(奠基性一手来源)、historical_metadata_limited(历史元数据有限)、current_transition_notice(过渡期通知)——FINER 1988 条目是historical_metadata_limited,ASPR DURC 条目是current_transition_notice;notes:一句话核验说明,同时承载关键限定,例如 SPIRIT 2025 的 notes 写明"34 项最小方案条目;取代 SPIRIT 2013",Doshi & Hauser 条目写明"不得在缺乏证据的情况下把该实验的结论外推到所研究任务之外"。
这种"状态+备注"双字段设计把"来源是否现行""证据强度""限定条件"分离开,避免了单一"可用/不可用"标签造成的信息丢失。
十、来源使用规则(Source-use rules)
台账末尾给出 6 条使用规则,它们是整个机制落地的行为约束:
- 发布或注册前,逐条对照在线一手来源核验每个引用与标识符;
- 在截止日期之后,重新核查时间敏感的政策;
- 把每一条科学论断都链接到 assets/evidence_ledger_template.csv 中的证据;
- 必须包含挑战性、空结果与局限性证据,而不仅仅是支持性证据;
- 不得从本来源台账推断新颖性——它记录的是技能刷新,不是用户的研究课题;
- 未经授权,不得把敏感研究问题暴露在任何外部搜索查询中。
第 3 条直接连接到技能内置的证据审计工具链,下面从源码层面看它是如何被执行的。
十一、源码级验证:审计脚本如何执行台账规则
scripts/audit_evidence_ledger.py 是"Source-use rules"第 3、4 条的机器执行器,它离线(无网络)审计本地证据台账 CSV 与带日期的搜索边界 JSON:
字段级校验(对应 assets/evidence_ledger_template.csv 的 13 列表头):source_id必须是形如字母开头的受控标识符;url必须是 HTTPS;accessed_on必须是 ISO 日期;publication_date允许YYYY、YYYY-MM、YYYY-MM-DD三种部分日期格式;source_type限定为 11 种受控值(official_guidance、primary_research、systematic_review、consensus_report 等);relation限定为supportive、challenging、contextual、method、safety、mixed六种。
规则级校验,其中两条直接对应台账文档的语义:
- 若某来源的
accessed_on晚于搜索边界的searched_on,发出SOURCE_ACCESSED_AFTER_SEARCH_BOUNDARY警告——即"带日期边界"在数据结构层面被强制表达; - 若台账中没有任何
relation=challenging的来源,发出NO_CHALLENGING_SOURCE_DECLARED警告——即第 4 条"必须包含挑战性证据"被编码为可检查项; - 若
novelty_status被声明为supported_by_documented_comprehensive_search,则强制发出NOVELTY_STATUS_REQUIRES_QUALIFIED_HUMAN_REVIEW警告——新颖性声明永远需要合格人类复核,机器只允许最高档"有文档支撑的有边界搜索",且仍打警告。
交叉核对:传入可选--record假设记录后,脚本会检查记录引用的search_boundary_id是否一致、记录声明的来源是否都在台账中(缺失则报RECORD_SOURCE_MISSING_FROM_LEDGER错误)、台账来源是否都出现在记录中(缺失则告警)、claim_ids是否都是记录中合法的主张 ID(未知则报UNKNOWN_CLAIM_ID)。
边界声明:脚本输出的报告自带notice字段,明确"本本地审计不访问 URL、不验证来源存在性或内容、不评价证据、不确立新颖性、不判定来源是否支持论断,请人工逐条核验来源与链接"。这与台账文档的自限定完全一致。
运行边界:共享工具模块 scripts/_common.py 对所有 CLI 施加统一安全约束——拒绝 URL 型路径与符号链接输入;输入上限 2 MiB、CSV 数据 1,000 行、单元格 8,000 字符;拒绝重复 JSON 键;要求 CSV 表头精确匹配且有序;输出使用0600私有权限与原子替换写入,且默认拒绝覆盖已存在文件(需--force)。退出码约定为:0结构有效、1完成校验但存在一致性错误、2输入格式非法或不安全。完整的 CLI 参数与推荐执行序列见 references/tool_reference.md。
审计命令形态:
python3 skills/hypothesis-generation/scripts/audit_evidence_ledger.py \ local-evidence.csv local-search-boundary.json \ --record local-record.json其中local-search-boundary.json应基于 assets/search_boundary_template.json 填写——模板固定了schema_version、search_boundary_id、searched_on、searched_by、purpose、databases_or_indexes、queries、date_limits、language_limits、inclusion_scope、exclusion_scope、known_limitations、last_result_screened_or_stop_rule与三值枚举novelty_status(not_assessed/requires_specialist_review/supported_by_documented_comprehensive_search)。
十二、方法论要点总结
Dated Source Ledger 机制的核心可以归纳为四条可迁移原则:
- 证据必须带日期:每个来源都有
version_or_date与verified_on,时间敏感政策(如美国 dual-use 过渡状态)用专门章节与current_transition_notice状态显式标记,并要求"截止日期后重新核查"; - 状态分级而非布尔判定:
current_official/foundational_primary/historical_metadata_limited/current_transition_notice等状态区分了"现行官方""奠基一手""元数据有限""过渡期",FINER 1988 的溯源局限就是靠这一机制被如实表达的; - 人读版与机读版双轨一致:Markdown 台账与 CSV 台账共享同一套
SRC-*标识符,CSV 可被审计脚本消费,规则(挑战性证据、新颖性状态、日期一致性)从文档条款变成可执行的检查项; - 工具只验结构、人类核验内容:审计脚本的
notice与台账第 1 条规则同向——机器确认"链接、格式、一致性",来源是否真的支持论断、新颖性是否成立,最终由合格人类对照在线一手来源完成。
这套机制的适用前提是:研究或技能维护场景需要向读者/评审证明"文献依据何时、在什么边界下、按什么标准被核查过";它的边界同样明确——它不构成系统性综述、不证明新颖性、不替代任何伦理、生物安全或双重用途审查。
十三、相关资源导航
- 技能主文档(12 步工作流、不可协商边界、本地工具索引):SKILL.md
- 来源台账人读版:references/source_ledger.md
- 来源台账机读版:assets/source_ledger.csv
- 证据台账模板:assets/evidence_ledger_template.csv
- 搜索边界模板:assets/search_boundary_template.json
- 文献检索策略与来源追溯:references/literature_search_strategies.md
- CLI 完整参考与安全模型:references/tool_reference.md
- 证据审计脚本:scripts/audit_evidence_ledger.py
- 共享校验工具(输入边界、退出码、原子写):scripts/_common.py
- 因果推断与论断类型:references/causal_inference_and_claims.md
- 预注册与开放科学:references/preregistration_and_open_science.md
【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000+ scientists worldwide. 165 ready-to-use validated skills plus 100+ scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考