摘要
噬菌体(bacteriophage,phage)为耐药菌感染治疗与微生物组工程提供了有前景的抗生素替代方案,但其应用受限于“如何为特定细菌菌株筛选感染性噬菌体”这一难题。作者提出一种**不依赖系统发育(phylogeny-agnostic)的机器学习框架,仅依据基因组序列即可跨多个细菌属预测菌株水平噬菌体—宿主互作(phage-host interaction,PHI)。在 6 个数据集、949 个细菌菌株、518 个噬菌体、115,037 条互作关系上系统优化超过 1320 万次训练运行后,该框架达到与物种特异性方法相当的性能(AUROC 0.67–0.94),同时消除系统发育约束。对 1240 条预测的大肠杆菌(Escherichia coli)噬菌体—宿主互作进行实验验证,确认其可泛化(AUROC 0.84);全基因组随机条形码转座子位点测序(random barcode transposon-site sequencing,RB-TnSeq)**显示,68.6% 的实验鉴定感染介质被计算模型捕获。模型引导的噬菌体鸡尾酒(phage cocktail)设计用 5 个噬菌体即可覆盖多达 97.5% 的细菌菌株,单噬菌体选择较“广宿主范围(promiscuity)”策略提升至多 3.1 倍。该平台支持理性噬菌体治疗设计与精准微生物组工程,可应用于临床、农业与工业场景。
keywords:噬菌体—宿主互作;菌株水平预测;不依赖系统发育;蛋白质家族特征;CatBoost;RB-TnSeq;噬菌体鸡尾酒;精准微生物组工程
文献信息
- Noonan, A. J. C., Moriniere, L., Rivera-López, E. O., Patel, K., Pena, M., Svab, M., Kazakov, A., Deutschbauer, A., Dudley, E. G., Mutalik, V. K., & Arkin, A. P. (2026). Phylogeny-agnostic strain-level prediction of phage-host interactions from genomes using machine learning.Nature Microbiology. https://doi.org/10.1038/s41564-026-02482-5
- 期刊:Nature Microbiology(IF=18.1)
- 发表时间:2026 年 9 月 29 日
研究总结
背景介绍
噬菌体宿主特异性是“进化军备竞赛”的产物:噬菌体持续响应宿主受体、细胞壁结构与防御系统的变化。这种菌株级识别可用于靶向单个病原菌,同时减少对有益共生菌的附带损伤,因而在抗生素耐药背景下极具价值。然而,随着噬菌体库规模扩大,针对新病原体逐株实验测定敏感性变得不可行。
既有工具多停留在科/属级宏基因组宿主分类,或依赖已知受体机制做单属模型,无法在不预设遗传决定因子的情况下预测“未知菌株 × 未知噬菌体”。单菌株预测需要一对一确认感染成败的数据集,且通常高度不平衡(阳性互作仅占 2%–36%)。作者因此主张:跨系统发育、跨实验室数据联合建模,才能提高统计功效并捕捉共同感染机制。本文目标即是构建仅用基因组、不依赖系统发育、可解释、可指导鸡尾酒设计的 PHI 预测工作流。
重要结果
跨细菌属的多样噬菌体—宿主互作汇编与建模工作流
作者整合 6 个已发表数据集,共 115,037 条互作、949 个细菌菌株、518 个噬菌体。工作流先将蛋白质和氨基酸 k-mer 转为存在—缺失特征,用 MMSeqs2 以 40% 序列同一性、80% 覆盖度聚类蛋白质家族;再用递归特征消除(recursive feature elimination,RFE)筛选稳定特征;最后以CatBoost(梯度提升决策树)配合按噬菌体加权的类别权重处理不平衡。该流程在高位稀疏、类别不平衡与高维特征表下保持稳健,并可把新基因组通过相似搜索映射到参考蛋白质簇,实现未知菌株/噬菌体推理。
Fig. 1 | a 从基因组到数值特征再经机器学习预测 PHI 的总体工作流;b 特征表示策略(蛋白质家族、k-mer、混合表示);c 用 MMSeqs2 构建蛋白质家族存在—缺失矩阵;d 以 CatBoost 做菌株水平二分类,并按噬菌体正/负样本比加权;e 新基因组通过相似搜索分配特征后预测未知互作。Created in BioRender: Noonan, A.
跨属菌株水平预测达到与物种特异性模型相当的性能
在“预测未知细菌菌株”配置下,蛋白质家族、较长 k-mer 与混合表示性能无显著差异,仅 k=3 在 4 个数据集中 3 个最差。作者选蛋白质家族表示以兼顾性能、成本与可解释性。各数据集 AUROC 为 0.67–0.94,Matthews 相关系数(MCC)为 0.13–0.54,归一化精确率—召回率面积(normalized AUPR)为 0.07–0.60。大肠杆菌模型 AUROC 0.87,与原 E. coli 专用方法(AUROC 0.86)接近,但本文方法不依赖已知 E. coli 感染介质。数据集越大,性能越好(AUROC 与样本量 Pearson r=0.60,MCC r=0.47,均 P<1×10⁻⁶)。
Figure 2. a 不同基因组表示策略的 AUROC(k=3 最差,其余无显著差);b 五个开发数据集的 AUROC、MCC、normalized AUPR;c 数据集规模与性能正相关(AUROC r=0.595,MCC r=0.467,BH 校正后显著);d 合并两个 Klebsiella 数据集较单数据集 MCC 提升 0.04–0.07。虚线表示随机预测 AUROC=0.5。
模型引导的噬菌体鸡尾酒设计优于广宿主策略
作者将连续概率转为可执行选择:先按互作谱将噬菌体无监督聚为“活性组(activity groups)”,再跨簇选预测概率最高的噬菌体,以兼顾预测感染概率与机制多样性。在 20 折交叉验证中,模型引导的 1/3/5 个噬菌体鸡尾酒在 E. coli、Klebsiella-2、Vibrionaceae 三个最大数据集上均优于“选最广宿主噬菌体”的基线。单噬菌体选择分别覆盖 66.9%、66.7%、39.4% 菌株,相对广宿主基线提升 1.1、3.1、2.7 倍;5 噬菌体鸡尾酒覆盖 97.5%、87.8%、57.5% 菌株。
Figure 3. a 模型概率 → 噬菌体聚类 → 跨簇选代表噬菌体;b 预测概率排序与广宿主排序对比,模型选中噬菌体以黑色粗边框标出;c 在三大高表现数据集中,模型引导鸡尾酒对 1/3/5 个噬菌体的菌株覆盖率均高于 promiscuity-based cocktail。Panel a created in BioRender: Noonan, A.
对未知噬菌体的实验验证与 RB-TnSeq 介质确认
为验证泛化能力,作者用 52 个未参与训练的 BASEL 集合噬菌体点种 25 个 E. coli ECOR 菌株,得到 1300 条互作,其中 60 条表型不清被剔除;剩余 1240 条中模型 AUROC 为 0.84,略低于交叉验证的 0.87,但证明框架可迁移到不同实验室、不同_protocol 的新噬菌体。随后在 E. coli ECOR27 中做全基因组 RB-TnSeq,用 19 个噬菌体筛选 3804 个基因敲除库,鉴定出 51 个高得分感染相关基因。通过基因邻域与 STRING 蛋白关联库比对,35 个预测特征与 RB-TnSeq 命中基因相连,占遗传验证介质的 68.6%;直接匹配较随机高 5.0 倍,邻域/STRING 扩展集高 3.0 倍。
Figure 4. a 52 新噬菌体 × 25 E. coli 菌株的点种矩阵;b 1240 条实验表型 vs 预测概率,AUROC=0.84;c SHAP 特征重要性显示预测特征与 RB-TnSeq 命中基因的关系:深棕=直接匹配,中棕=邻域匹配,浅棕=STRING-DB 匹配;右图为 goaG(puuE)与 gabT 的 STRING 网络及 ybdK 邻接共线性图。
预测特征可恢复已知与未知感染决定因子
用 SHAP 值量化特征方向:存在某蛋白质家族若提高感染概率即为正向特征,降低则为负向特征。在 E. coli 数据集中,前 25 个最重要特征涵盖细胞壁生物合成、可移动遗传元件(mobile genetic elements,MGEs)、限制修饰(restriction-modification,RM)系统、病毒来源基因;其中 8 个无清晰机制注释,可能为未表征介质。防御系统通常负向、抗防御系统通常正向。STRING 与邻域分析进一步提示腐胺分解代谢、已知受体 lepA 的调控参与感染,说明模型常捕获“通路/操纵子级调控”而非单基因效应。
Figure 5. a E. coli 前 25 预测特征的功能分类与 SHAP 方向(细胞壁、MGE、RM、病毒源、未知);b goaG/puuE 与 gabT 的 STRING 蛋白关联网络;c lepA 与预测特征 ybdK 在 3 个含 ybdK 菌株与 3 个不含菌株中的共线性图。
方法学参考
可复用要点包括:用蛋白质家族存在—缺失代替手工受体注释以实现跨属泛化;以按噬菌体加权的 CatBoost 处理极端不平衡;RFE 跨多轮训练跟踪特征出现频率以防过拟合;用 RB-TnSeq/DubSeq/CRISPRi 等遗传筛选作为“生物学真值”校验机器学习特征;鸡尾酒设计先聚类机制再跨簇选代表,而非只追广宿主噬菌体。
总结
该研究的核心贡献是把菌株水平 PHI 预测从“属内、已知受体、单实验室”推进到“跨属、无系统发育预设、可外部实验验证”的框架。作者证明:在高位稀疏基因组特征下,算法与特征选择策略比“换一种基因组表示”更重要;大模型性能受阳性样本量与平衡度限制,但跨团队 Klebsiella 数据集合并可带来切实提升。实验上,1240 条新互作与 RB-TnSeq 共同说明,模型捕获的不只是相关噪声,而是部分真实感染介质(包括调控基因与未注释因子)。
局限同样明确:跨属留一预测接近随机,说明蛋白质家族特征难以跨越极远进化距离;RB-TnSeq 只能验证非必需基因,必需基因需 CRISPRi 等补充;不同数据集固体/液体培养与阈值不统一会限制联合训练。未来若引入蛋白语言模型嵌入、环境条件和主动学习,可进一步提升跨属迁移与临床噬菌体鸡尾酒设计效率。
参考文献
- Noonan, A. J. C., Moriniere, L., Rivera-López, E. O., Patel, K., Pena, M., Svab, M., Kazakov, A., Deutschbauer, A., Dudley, E. G., Mutalik, V. K., & Arkin, A. P. (2026). Phylogeny-agnostic strain-level prediction of phage-host interactions from genomes using machine learning.Nature Microbiology. https://doi.org/10.1038/s41564-026-02482-5
- Gaborieau, B. et al. Prediction of strain level phage-host interactions across the Escherichia genus using only genomic information.Nature Microbiology(2024).
- Mutalik, V. K. et al. High-throughput mapping of the phage resistance landscape in E. coli.PLoS Biology18, e3000877 (2020).
- GenoPHI 代码库:https://github.com/Noonanav/GenoPHI
- Zenodo 数据:https://doi.org/10.5281/zenodo.21696332
- MMSeqs2:https://github.com/soedinglab/MMseqs2
- CatBoost:https://catboost.ai
- RB-TnSeq 方法:Wetmore, K. M. et al., mBio 6, e00306-15 (2015)