Nature Methods|华盛顿大学团队:HiCFoundation把三维基因组转成可迁移表征
2026/7/29 13:14:14 网站建设 项目流程

导读

  1. 2026 年 Nature Methods 文献,DOI:10.1038/s41592-026-03097-8;核心机构为华盛顿大学基因组科学系与 Allen 计算机学院。

  2. 研究聚焦 Hi-C 三维基因组数据与 ATAC-seq、ChIP-seq 等调控组学之间的格式、分辨率和分析管线差异。

  3. HiCFoundation 以大规模 Hi-C 数据训练通用表征,在重现性分析、分辨率增强、环检测、表观活动预测和单细胞 Hi-C 适配中形成闭环。

  4. 主要结论是三维结构可以被转化为可迁移、可解释的模型表示;边界在于结果仍依赖输入 Hi-C 质量、物种覆盖和任务定义。

研究背景与目的

三维基因组研究长期面对一个结构性难题:Hi-C 描述的是染色质空间接触,ATAC-seq 和 ChIP-seq 描述的是开放染色质与蛋白结合,三类数据在矩阵形态、分辨率和噪声来源上并不一致。传统分析往往围绕单个任务建模,模型能解决环检测或分辨率增强,却很难同时解释结构变化怎样影响调控功能。

这篇文献的目标不是再做一个单点工具,而是把 Hi-C 变成可迁移表征。它试图回答三件事:三维接触图能否形成跨细胞类型、跨物种的基础表示;这种表示能否支持多个 3D genome 任务;结构信息能否反推表观基因组活动,从而把空间组织与调控状态放在同一套模型语言里。

这一问题的核心在于,Hi-C 数据本身并不是普通序列表达矩阵,而是带有空间距离、染色质区段和技术噪声的接触图。不同实验室、不同分辨率、不同细胞状态产生的数据很难直接放在同一个模型中比较。文献把目标放在通用表征上,实质是在寻找三维基因组分析的共同底层语言。

研究方法

研究团队构建 HiCFoundation,以大量 Hi-C 接触矩阵作为预训练对象,让模型学习局部染色质接触模式和更高层级的结构上下文。模型训练后并不只在单一任务上报告结果,而是被放入重现性分析、分辨率增强、loop detection、表观组学活动预测和 single-cell Hi-C 适配等场景中反复检验。


Fig. 1:HiCFoundation 的预训练与跨任务评测框架。

方法设计的关键在于“同一表征,多任务迁移”。如果模型只在某个数据集上提升指标,贡献仍然停留在工具层面;如果它能在不同物种、不同细胞类型、不同解析任务中保持性能,说明模型捕捉到的不是局部噪声,而是三维基因组结构中更稳定的组织规律。

Fig. 2:模型在三维基因组重现性、分辨率增强和环检测中的表现。

方法上最关键的处理,是让模型先学习染色质接触模式本身,再进入具体任务。这样做减少了每个任务重新训练一套模型的割裂感,也使模型能够把局部接触增强、TAD 边界、loop 结构和远距离调控信号放进同一套表示空间。多任务验证因此不是附加展示,而是检验基础模型是否真正可迁移的核心环节。

从数据结构看,Hi-C 接触矩阵具有明显的多尺度特征:近距离接触反映局部染色质折叠,远距离接触反映增强子—启动子、区室和跨区域相互作用。模型若要在多任务中稳定工作,就必须同时理解局部纹理和长程依赖,这也是基础模型路线区别于传统特征工程的地方。

主要发现

第一,HiCFoundation 在多类 3D genome 任务中表现出泛化能力。重现性分析、分辨率增强和 loop detection 分别对应质量评估、数据补全和结构元素识别,三者难点不同,但都依赖对空间接触模式的理解。模型在这些任务中的一致表现,说明预训练表征覆盖了 Hi-C 数据的核心结构信息。

第二,文献把 Hi-C 与调控功能之间的联系推进了一步。模型可从 Hi-C 预测 ATAC-seq、ChIP-seq 等表观活动,含义并不是空间结构可以替代所有实验,而是三维结构中确实包含与调控活性相关的可学习信号。这个结果使 Hi-C 不再只是“结构图谱”,而成为解释细胞状态和基因调控的入口。

第三,single-cell Hi-C 的适配扩大了方法使用边界。单细胞 Hi-C 稀疏、噪声高、覆盖不均,传统管线很难稳定提取结构特征。HiCFoundation 能够迁移到该场景,提示预训练模型可能缓解单细胞三维基因组数据稀疏带来的分析不稳定。

这些结果共同指向一个更深的判断:三维结构不是静态背景,而是可以被模型压缩、迁移并重新用于功能推断的信息载体。分辨率增强说明模型能补足稀疏接触图中的结构规律;loop detection 说明模型能识别稳定结构单元;表观活动预测则说明结构信号与调控状态之间存在可计算联系。

单细胞 Hi-C 场景尤其能体现这种路线的意义。单细胞数据极度稀疏,许多结构信号在单个细胞内并不完整。预训练表征相当于提供了结构先验,使模型在低覆盖条件下仍能提取有生物学意义的模式,这对发育轨迹和细胞异质性分析很重要。

结论与意义

这篇文献把三维基因组分析从任务驱动工具推进到基础模型框架。它的意义不只在于某个 benchmark 数字更高,而在于建立了“结构表征—调控预测—跨场景迁移”的证据链。对于生命科学研究,空间结构、调控活性和细胞状态之间的连接越清晰,后续解释发育、疾病和物种差异时就越有抓手。

更重要的是,HiCFoundation 将多组学整合的问题提前到表征层面处理。过去常见做法是把不同组学结果在后处理阶段拼接;本文的路线是先让模型理解结构,再把结构信号迁移到功能任务。这种思路对后续单细胞多组学、空间组学和调控网络建模都有参考价值。

对生命科学内容生产而言,这篇文献的价值在于把“基础模型”从序列和表达扩展到染色体空间结构。基因组调控过去常被拆成序列、染色质开放、转录和空间接触几个模块,HiCFoundation 提供了一种把空间结构提前纳入解释框架的方式,使疾病样本、发育阶段和物种差异能够在更统一的坐标系中被比较。

局限性与未来方向

局限在于,基础模型的表现仍取决于预训练数据的覆盖范围。物种、细胞类型、实验平台、测序深度和批次效应都会影响模型学到的结构空间。当前证据证明模型具备较强泛化能力,但在罕见细胞状态、疾病样本和低质量临床样本上的稳定性仍需更多验证。

未来方向包括扩大跨物种和疾病数据覆盖,加入更多扰动实验来区分相关性和因果调控,并在真实单细胞多组学队列中测试模型输出能否直接支持生物机制发现。

后续验证还需要关注模型输出是否能进入可实验检验的机制链条。若模型只提升 benchmark,应用边界仍然有限;若它能指出特定结构改变对应的调控元件、基因表达变化或细胞状态转换,三维基因组基础模型才会从分析工具进一步转向机制发现平台。

参考文献

Nature Methods,2026年7月。原文题名:A generalizable Hi-C foundation model for chromatin architecture, single-cell and multiomics analysis across species。 DOI:10.1038/s41592-026-03097-8。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询