Open-Science组学数据档案库:GEO/PRIDE/MGnify/MetaboLights新手完整实操指南
【免费下载链接】open-scienceAIPOCH Open-Science is an open-source, local-first, model-agnostic AI research workbench for macOS, Windows, and Linux, with scientific agents, Python/R notebooks, data connectors, and reproducible provenance.项目地址: https://gitcode.com/GitHub_Trending/open/open-science
Open-Science是一款开源、本地优先的 AI 科研工作台,内置Omics Archives(组学数据档案库)连接器,让你在对话中直接检索GEO、PRIDE、MGnify、MetaboLights、ArrayExpress五大组学数据库,支持按关键词、物种、仪器、疾病、样本特征查询 GSE / PXD / MTBLS / MGYS 号,并自动带回结构化元数据与补充文件清单——全程可追溯来源(provenance),数据不出本机。
为什么科研人员需要组学数据档案库
做生物信息学研究时,数据分散在各个公共档案库:
| 档案库 | 数据域 | 编号格式 | 典型用途 |
|---|---|---|---|
| GEO(NCBI) | 基因表达 / 转录组 | GSE131907 | 查表达谱数据集与样本元数据 |
| PRIDE Archive(EBI) | 蛋白质组 | PXD010154 | 查质谱蛋白组项目、蛋白↔项目互查 |
| MGnify(EBI) | 宏基因组 | MGYS00000410 | 按自由文本或生物膜系谱查研究 |
| MetaboLights(EBI) | 代谢组 | MTBLS1 | 查代谢组研究、原始数据文件(.mzML 等) |
| ArrayExpress / BioStudies(EBI) | 功能基因组 | E-MTAB-5061 | 查 ChIP-seq / 阵列实验 |
Open-Science 的omics-archives连接器把这 5 个库收敛为17 个工具,实现代码见 omics-archives.ts,连接器注册信息见 catalog.ts。所有分页检索都会与 API 报告的总数做计数校验,避免"少拉了几页"导致的数据缺失。
快速上手:安装与启用连接器
一键获取项目
git clone https://gitcode.com/GitHub_Trending/open/open-science cd open-science npm install按 README.md 的指引启动应用(macOS / Windows / Linux 均支持),或直接从发布页下载安装包。
启用 Omics Archives 连接器
- 打开Settings → Connectors,在内置的 24 个科研连接器中找到Omics Archives并启用;
- 该连接器依赖 NCBI E-utilities(GEO 查询走
db=gds),首次使用需在凭据设置中填入NCBI API Key(无 Key 也能访问,但速率限制更严,代码通过ncbiEtiquette自动附加); - 建议权限模式选
Ask for approval,连接器调用会先征求你的批准。
实操一:GEO 检索基因表达数据集
按关键词搜索(geo_search_series)
直接用自然语言告诉 Agent:
"帮我在 GEO 里搜一下哮喘相关的表达谱数据集,只要 series 级别的"
Agent 会调用geo_search_series,查询词为完整 E-utilities 语法(如asthma AND gse[ETYP]),返回标题、摘要、物种、样本数、发布时间和 FTP 链接。
按 GSE 号拉取完整元数据(geo_get_series)
"把 GSE131907 的详细信息拉下来,包括每个样本的特征"
内部会解析 GEO 的 SOFT 文件头(仅头部,不下载数据表),返回:series 设计描述、平台、样本数、每个样本的characteristics(组织/处理/分组等标签)、文库策略、补充文件 URL。拿到supplementary_files清单后,可以直接让 Agent 写 Python 下载并做初步质控。
实操二:PRIDE 蛋白组项目检索
关键词 + 面组合并过滤(pride_search_projects)
"找一下人类磷酸化蛋白组的项目,用 Orbitrap Fusion Lumos 做的"
pride_search_projects支持keyword、organism(精确面,如Homo sapiens (human))、instrument、disease四类条件 AND 组合,结果按 accession 升序稳定返回,api_total保证计数准确。
按 PXD 号与"蛋白反查项目"
- pride_get_projects:传入
['PXD010154']即可拿到项目全量元数据(物种、疾病、仪器、定量方法、提交人、文献 DOI/PubMed); - pride_find_projects_for_protein:输入 UniProt 号(如
P04637)反向查找"哪些 PRIDE 项目测过这个蛋白",是文献调研时非常好用的冷门入口。
实操三:MGnify 宏基因组研究检索
MGnify 支持两种互斥的检索方式(源码中会强制校验二选一):
- 自由文本:
mgnify_search_studies传query: "coral",找到所有珊瑚相关宏基因组研究; - 生物膜系谱:传
biome_lineage,如root:Engineered:Wastewater,按 GOLD 风格系谱精确圈定污水工程等环境组学数据(含子系谱)。
拿到 MGYS 号后:
- mgnify_get_studies(加
include_analyses: true):附带每篇研究的分析总数,以及按流水线版本 / 实验类型的分布统计; - mgnify_get_study_analyses:列出该研究下全部 MGYA 分析记录,含流水线版本、运行/组装/样本编号,方便挑选与你自己实验匹配的分析结果。
实操四:MetaboLights 代谢组研究与原始数据文件
"MTBLS1 这个研究用了什么技术?样本表发我看看"
- metabolights_get_studies:返回研究状态、发布年份、物种/组织部位、技术平台(如 LC-MS)、实验因子、描述物(descriptors)、样本数,加
include_samples: true可附带每样本表格; - metabolights_get_study_files:列出研究文件夹(ISA-Tab、MAF)及递归的 FILES 数据目录完整清单;
- metabolights_search_data_files:用文件名 glob 搜原始数据,如
*.mzML、*.raw、*.zip,服务端匹配后还会在客户端再校验一遍,防止语义漂移。
由于 MetaboLights 没有服务端研究搜索,metabolights_list_studies会先拉回全部公开 MTBLS 编号,再按标题/描述物过滤——Agent 会自动处理这一步。
让结果可复现:数据预览与 Provenance
检索到数据只是第一步。Open-Science 的价值在于执行与证据同处一个工作区:
- 表格预览:返回的样本表、文件清单可内联预览,像普通 CSV 一样浏览;
- Notebook 衔接:让 Agent 用 Python/R kernel 写下载、质控、分析代码,运行历史、依赖环境全部记录在案;
- Provenance 溯源:生成的每个产物(表格、图、报告)都是不可变版本,附带生产者代码、执行证据与输入清单,随时可复核"这个结果是怎么来的"。
新手避坑清单 ✅
| 场景 | 建议 |
|---|---|
| GEO 查询偶发变慢/限流 | 配置 NCBI API Key;geo_search_series的retmax默认 500,大检索注意count与retrieved是否一致 |
| 编号写错(如 GSE123 不存在) | 工具会把未命中放进not_found/missing而非整体报错,注意检查返回结构 |
| PRIDE 经典质谱项目查蛋白 | 用pride_find_projects_for_protein,pride_search_project_proteins仅服务 affinity-proteomics 项目 |
| 隐私与敏感数据 | 连接器的网络请求参数会展示给你审批;不要在不熟悉的工作流用Full access模式 |
| 想核对实现细节 | 工具定义与返回结构见 omics-archives.ts,行为回归测试见 omics-archives.test.ts |
小结
Open-Science 的Omics Archives 连接器把 GEO、PRIDE、MGnify、MetaboLights、ArrayExpress 五大组学档案库统一成一套对话式检索入口:关键词找数据集、编号取元数据、glob 找原始文件、蛋白反查项目,四步走完,且每一步都有计数校验与可追溯证据。对新手来说,不必再手写 API 请求,把研究目标用一句话描述清楚,剩下的交给工作台即可 🧪
【免费下载链接】open-scienceAIPOCH Open-Science is an open-source, local-first, model-agnostic AI research workbench for macOS, Windows, and Linux, with scientific agents, Python/R notebooks, data connectors, and reproducible provenance.项目地址: https://gitcode.com/GitHub_Trending/open/open-science
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考