告别假阳性:ParaRef如何“清洗”寄生虫参考基因组污染
2026/7/24 1:05:30 网站建设 项目流程

简介:ParaRef是首个经严格去污染的寄生虫参考基因组数据库,清除5.28亿外源碱基,将宏基因组检测精度从7.9%提升至94.3%,为寄生虫学研究与临床诊断提供"金标准"参考。

寄生虫感染是全球重大公共卫生问题,每年影响数十亿人口。在宏基因组测序时代,研究人员通过比对参考基因组来识别样本中的寄生虫DNA,但公共数据库中大量参考基因组存在污染序列(宿主DNA、微生物DNA、实验室试剂残留等),导致分析中产生海量假阳性结果——这不仅浪费计算资源,更可能误导临床诊断、疫情监测和考古病原研究。

近日,哥本哈根大学Jonas Niemann团队在《Genome Biology》上发表研究,推出ParaRef——首个经过系统去污染处理的寄生虫参考数据库。该研究对831个已发表的内寄生虫基因组进行全面“清洗”,构建了高质量的参考数据集,使宏基因组寄生虫检测的精度从不足8%提升至94%以上,为考古、临床和兽医领域的病原筛查提供了可靠的“基准线”。

数据库链接

https://github.com/schroeder-group/ParaRef

ParaRef数据库内容总结

数据库概览

基因组数据

  • 规模:涵盖831个内寄生虫基因组,包括扁形动物(100个)、线虫(338个)、真菌(227个)及真核病原体(157个)。

  • 污染处理:使用FCS‑GX和Conterminator双工具联合筛查,共清除5.28亿个污染碱基,涉及818个基因组。最终保留经严格验证的纯净序列,构建ParaRef v1.0。

污染来源分析

  • 细菌污染(86%):主要为肠道共生菌(如大肠杆菌)及线虫相关菌群。

  • 宿主DNA污染(8.4%):人类、猪、小鼠等宿主序列常见于寄生虫基因组,甚至有基因组完全被宿主细菌取代的极端案例。

  • 试剂污染:超纯水和DNA提取试剂盒中的痕量污染(如Bradyrhizobium、Afipia)。

性能提升指标

  • 模拟粪化石数据中,污染导致的错误比对从平均38,000条/重复降至约200 条。

  • 检测精度(Precision)由7.9%飙升94.3%,同时保持对真实病原体的高灵敏度。

  • 真实古代样本中,假阳性读段减少97%(从310万降10万),真阳性信号保持不变。

参考基因组污染的产生及其导致假阳性检测的机制

核心功能模块

模块

功能

去污染参考基因组

提供831个寄生虫物种的纯净组装,

兼容KrakenUniqBowtie2等主流分类器

污染源追溯

每个基因组的污染来源(细菌、宿主、试剂)已注释,便于质控

覆盖均匀性评分

内置covPosRelEntropy1000指标,自动评估候选检出是否由污染驱动

DNA损伤兼容

保留损伤模式验证能力,适配古代DNA研究中的真假判别

多数据库交叉验证

支持与NCBI原始版本对比,精准识别污染产生的假阳性

命令行工作流

提供Snakemake管道pathopipe,一键完成从分类到验证的全流程

应用案例

古代样本中的“拨云见日”

  • 哈尔施塔特盐矿粪化石:原始数据库中,Trichuris trichiura检出覆盖极度不均,被判定为假阳性;使用ParaRef后,覆盖恢复均匀,且能匹配已发表的线粒体基因组证据,确认真阳性。

  • 中世纪犬粪化石:成功检出Ancylostoma caninum、Toxocara canis等真正寄生虫,而此前因污染干扰无法确认。

    对参考基因组进行去污染处理可提高寄生虫检测的精确度和整体准确性

现代临床与生态监测

  • 哈扎狩猎采集者粪便:原始数据库错误分配1670万条读段至T.trichiura;ParaRef消除这些假阳性,同时新发现Schistosoma mansoniTaenia solium等16例真实感染。

  • 猪场粪样筛查:去除T.solium参考基因组中的猪宿主污染后,不再误报,转而正确检出Ascaris suumOesophagostomum dentatum

总结:参考基因组污染是寄生虫宏基因组检测的长期隐患。本研究对831个基因组进行系统去污染,构建了首个纯净数据库ParaRef。应用表明,ParaRef在保留真阳性信号的同时,将假阳性读段减少97%,检测精度从7.9%跃升至94.3%。无论是古代粪化石还是现代粪便样本,ParaRef均能显著提升鉴定可靠性,为寄生虫研究与临床诊断提供了坚实的“金标准”参考。

参考文献

Niemann, J., Huang, Y., Lanigan, L.T.et al. ParaRef: a decontaminated reference database for parasite detection in ancient and modern metagenomic datasets. Genome Biol 26, 365 (2025).

VGsoft Team(凌恩开发团队)于2015年成立,致力于为多组学相关生命科学研究,提供数据库和信息化解决方案。开发团队骨干由十年以上项目经验的资深软件工程师和生信工程师构成,可提供灵活多样的数据库构建及信息化服务。服务项目包括物种数据库、多组学数据库、eDNA数据库、育种平台、生信云平台等,客户涵盖高校、科研院所、三甲医院及上市公司等,项目成果发表在Cell, Nucleic Acids Research, Molecular Therapy, Horticulture Research等国际著名期刊上。每一个研究领域都至少需要一个数据库,凌恩生物开发团队秉持“数据驱动创新,客户赋能未来”的理念,为客户提升科研价值,巩固数据成果,锁定领域影响。更多凌恩项目案例见:http://vgsoft.biozeron.com/bmstor/database/anima

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询