Towards Applying Large Language Models to Complement Single-Cell Foundation Models
2026/10/1 17:54:16
网站建设
项目流程
文章主要内容总结
本文聚焦于大语言模型(LLMs)与单细胞基础模型(如scGPT)的互补应用,旨在解决单细胞基础模型无法利用生物文本信息的局限性。
- 研究背景:单细胞基础模型(如scGPT)在单细胞组学任务中表现优异,但仅基于基因表达数据训练,无法利用海量生物文本知识;而LLMs因预训练时涵盖生物知识,被尝试用于单细胞分析,但现有研究多将其作为替代方案,对其性能驱动因素及与单细胞模型的互补性探索不足。
- 核心方法:
- 通过可解释性方法(集成梯度、LIME)和消融实验,探究LLMs在单细胞数据分析中的性能机制;
- 提出融合模型scMPT,结合scGPT与LLMs(Ember-V1文本编码器)的表征,利用两者协同效应;
- 实验对比不同融合方法(如生成式LLMs与scGPT结合),验证互补策略的有效性。
- 主要发现:
- LLMs通过预训练的生物知识(尤其是标记基因)和简单基因表达模式(如基因排序)实现高性能;
- scMPT在细胞类型分类和疾病表型预测中表现优于单一模型,且性能更稳定;
- 具有推理能力的LLMs与scGPT结合可进一步提升性能,为未来研究提供方向。
创新点
- 揭示LLMs性能机制:首次通过可解释性分析和消融实验,明确LLMs在