Open-Science组学数据档案库:GEO/PRIDE/MGnify/MetaboLights新手完整实操指南
2026/9/17 9:42:03 网站建设 项目流程

Open-Science组学数据档案库:GEO/PRIDE/MGnify/MetaboLights新手完整实操指南

【免费下载链接】open-scienceAIPOCH Open-Science is an open-source, local-first, model-agnostic AI research workbench for macOS, Windows, and Linux, with scientific agents, Python/R notebooks, data connectors, and reproducible provenance.项目地址: https://gitcode.com/GitHub_Trending/open/open-science

Open-Science是一款开源、本地优先的 AI 科研工作台,内置Omics Archives(组学数据档案库)连接器,让你在对话中直接检索GEO、PRIDE、MGnify、MetaboLights、ArrayExpress五大组学数据库,支持按关键词、物种、仪器、疾病、样本特征查询 GSE / PXD / MTBLS / MGYS 号,并自动带回结构化元数据与补充文件清单——全程可追溯来源(provenance),数据不出本机。

为什么科研人员需要组学数据档案库

做生物信息学研究时,数据分散在各个公共档案库:

档案库数据域编号格式典型用途
GEO(NCBI)基因表达 / 转录组GSE131907查表达谱数据集与样本元数据
PRIDE Archive(EBI)蛋白质组PXD010154查质谱蛋白组项目、蛋白↔项目互查
MGnify(EBI)宏基因组MGYS00000410按自由文本或生物膜系谱查研究
MetaboLights(EBI)代谢组MTBLS1查代谢组研究、原始数据文件(.mzML 等)
ArrayExpress / BioStudies(EBI)功能基因组E-MTAB-5061查 ChIP-seq / 阵列实验

Open-Science 的omics-archives连接器把这 5 个库收敛为17 个工具,实现代码见 omics-archives.ts,连接器注册信息见 catalog.ts。所有分页检索都会与 API 报告的总数做计数校验,避免"少拉了几页"导致的数据缺失。

快速上手:安装与启用连接器

一键获取项目

git clone https://gitcode.com/GitHub_Trending/open/open-science cd open-science npm install

按 README.md 的指引启动应用(macOS / Windows / Linux 均支持),或直接从发布页下载安装包。

启用 Omics Archives 连接器

  1. 打开Settings → Connectors,在内置的 24 个科研连接器中找到Omics Archives并启用;
  2. 该连接器依赖 NCBI E-utilities(GEO 查询走db=gds),首次使用需在凭据设置中填入NCBI API Key(无 Key 也能访问,但速率限制更严,代码通过ncbiEtiquette自动附加);
  3. 建议权限模式选Ask for approval,连接器调用会先征求你的批准。

实操一:GEO 检索基因表达数据集

按关键词搜索(geo_search_series)

直接用自然语言告诉 Agent:

"帮我在 GEO 里搜一下哮喘相关的表达谱数据集,只要 series 级别的"

Agent 会调用geo_search_series,查询词为完整 E-utilities 语法(如asthma AND gse[ETYP]),返回标题、摘要、物种、样本数、发布时间和 FTP 链接。

按 GSE 号拉取完整元数据(geo_get_series)

"把 GSE131907 的详细信息拉下来,包括每个样本的特征"

内部会解析 GEO 的 SOFT 文件头(仅头部,不下载数据表),返回:series 设计描述、平台、样本数、每个样本的characteristics(组织/处理/分组等标签)、文库策略、补充文件 URL。拿到supplementary_files清单后,可以直接让 Agent 写 Python 下载并做初步质控。

实操二:PRIDE 蛋白组项目检索

关键词 + 面组合并过滤(pride_search_projects)

"找一下人类磷酸化蛋白组的项目,用 Orbitrap Fusion Lumos 做的"

pride_search_projects支持keywordorganism(精确面,如Homo sapiens (human))、instrumentdisease四类条件 AND 组合,结果按 accession 升序稳定返回,api_total保证计数准确。

按 PXD 号与"蛋白反查项目"

  • pride_get_projects:传入['PXD010154']即可拿到项目全量元数据(物种、疾病、仪器、定量方法、提交人、文献 DOI/PubMed);
  • pride_find_projects_for_protein:输入 UniProt 号(如P04637)反向查找"哪些 PRIDE 项目测过这个蛋白",是文献调研时非常好用的冷门入口。

实操三:MGnify 宏基因组研究检索

MGnify 支持两种互斥的检索方式(源码中会强制校验二选一):

  • 自由文本mgnify_search_studiesquery: "coral",找到所有珊瑚相关宏基因组研究;
  • 生物膜系谱:传biome_lineage,如root:Engineered:Wastewater,按 GOLD 风格系谱精确圈定污水工程等环境组学数据(含子系谱)。

拿到 MGYS 号后:

  • mgnify_get_studies(加include_analyses: true):附带每篇研究的分析总数,以及按流水线版本 / 实验类型的分布统计;
  • mgnify_get_study_analyses:列出该研究下全部 MGYA 分析记录,含流水线版本、运行/组装/样本编号,方便挑选与你自己实验匹配的分析结果。

实操四:MetaboLights 代谢组研究与原始数据文件

"MTBLS1 这个研究用了什么技术?样本表发我看看"

  • metabolights_get_studies:返回研究状态、发布年份、物种/组织部位、技术平台(如 LC-MS)、实验因子、描述物(descriptors)、样本数,加include_samples: true可附带每样本表格;
  • metabolights_get_study_files:列出研究文件夹(ISA-Tab、MAF)及递归的 FILES 数据目录完整清单;
  • metabolights_search_data_files:用文件名 glob 搜原始数据,如*.mzML*.raw*.zip,服务端匹配后还会在客户端再校验一遍,防止语义漂移。

由于 MetaboLights 没有服务端研究搜索,metabolights_list_studies会先拉回全部公开 MTBLS 编号,再按标题/描述物过滤——Agent 会自动处理这一步。

让结果可复现:数据预览与 Provenance

检索到数据只是第一步。Open-Science 的价值在于执行与证据同处一个工作区

  1. 表格预览:返回的样本表、文件清单可内联预览,像普通 CSV 一样浏览;
  2. Notebook 衔接:让 Agent 用 Python/R kernel 写下载、质控、分析代码,运行历史、依赖环境全部记录在案;
  3. Provenance 溯源:生成的每个产物(表格、图、报告)都是不可变版本,附带生产者代码、执行证据与输入清单,随时可复核"这个结果是怎么来的"。

新手避坑清单 ✅

场景建议
GEO 查询偶发变慢/限流配置 NCBI API Key;geo_search_seriesretmax默认 500,大检索注意countretrieved是否一致
编号写错(如 GSE123 不存在)工具会把未命中放进not_found/missing而非整体报错,注意检查返回结构
PRIDE 经典质谱项目查蛋白pride_find_projects_for_proteinpride_search_project_proteins仅服务 affinity-proteomics 项目
隐私与敏感数据连接器的网络请求参数会展示给你审批;不要在不熟悉的工作流用Full access模式
想核对实现细节工具定义与返回结构见 omics-archives.ts,行为回归测试见 omics-archives.test.ts

小结

Open-Science 的Omics Archives 连接器把 GEO、PRIDE、MGnify、MetaboLights、ArrayExpress 五大组学档案库统一成一套对话式检索入口:关键词找数据集、编号取元数据、glob 找原始文件、蛋白反查项目,四步走完,且每一步都有计数校验与可追溯证据。对新手来说,不必再手写 API 请求,把研究目标用一句话描述清楚,剩下的交给工作台即可 🧪

【免费下载链接】open-scienceAIPOCH Open-Science is an open-source, local-first, model-agnostic AI research workbench for macOS, Windows, and Linux, with scientific agents, Python/R notebooks, data connectors, and reproducible provenance.项目地址: https://gitcode.com/GitHub_Trending/open/open-science

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询