DAP-seq技术实操指南:从建库到生信分析,绕开ChIP-seq抗体的全基因组结合位点方案
2026/9/24 22:39:03 网站建设 项目流程

转录因子结合位点研究这行当里,ChIP-seq 几乎成了默认选项。但它真的有传说中那么顺手吗?我在非模式植物上吃过亏:一个转录因子的抗体预约了三个月,供应商中途告诉我做不了;换做 DAP-seq,我只需要把蛋白体外表达出来,加上亲和标签,和基因组 DNA 文库混一混、洗一洗、测一测,就能在全基因组范围内拿到结合位点。DAP-seq 全称 DNA 亲和纯化测序,优势不在于炫技,而在于把传统 ChIP-seq 最大的两个堵点——高质量抗体和体内交联——直接绕开了。这篇文章我会把 DAP-seq 的湿实验和干实验流程掰开揉碎,讲清楚每个环节为什么这么做,以及我实际踩过的坑。无论你是刚进实验室的研究生,还是已经跑过几轮 ChIP-seq 想换方案的老手,我觉得都应该认真比一比 DAP-seq 这个选项。

1. 被 ChIP-seq 的抗体卡住三次之后,我才认真读 DAP-seq 的设计逻辑

1.1 ChIP-seq 在实际项目中到底难在哪

ChIP-seq 的全称是染色质免疫沉淀测序。它的逻辑是在活细胞内用甲醛把蛋白质和 DNA 交联在一起,然后把染色质打断,用针对目标蛋白的抗体把这个蛋白连同它结合的那段 DNA 一起沉淀下来,最后把 DNA 收集起来测序。听起来很顺,真做起来到处都是坎。第一个坎就是抗体。要拿到一支 ChIP 级别的抗体,你得知道这个转录因子的抗原表位,得免疫动物、纯化血清、做 ChIP 级别的验证,整个周期短则三四个月,长则一年;如果碰上同源蛋白多、序列相似度高的情况,抗体特异性还要打折扣。我在一个水稻转录因子上就栽过跟头,抗体公司收了钱先出一版多克隆抗体,结果 ELISA 阳性、ChIP 出来背景比信号还高,换一个单克隆重新排名额,又是三个月。

第二个坎是交联条件。甲醛交联的时间和浓度需要针对每个细胞类型优化,交联不足拉不到靶点,交联过度又会掩盖表位。等你好不容易拿到了好看的峰图,你得到的其实是"在活细胞里该转录因子和这些位点发生过接近"的证据,并不直接等于"该转录因子体外直接结合"。

1.2 DAP-seq 绕开了什么,又保留了什么

DAP-seq 换了一条路。它的核心是把转录因子在体外通过无细胞转录翻译系统表达出来,在蛋白上挂一个亲和标签(比如 HALO 或 GFP),再将这个重组蛋白与一个"已经接好测序接头的基因组 DNA 文库"直接孵育。转录因子会特异性地跟基因组上的目标序列结合,随后用标签对应的磁珠进行亲和纯化,洗掉非特异结合的 DNA,把留下的 DNA 洗脱、扩增、测序。数据就是全基因组上该转录因子的结合位点。

和 ChIP-seq 相比,它最关键的变化是:抗体这一步被标签亲和纯化取代了。一支抗体对应一个蛋白、要单独开发;而 HALO 标签或 GFP 磁珠是通用耗材,谁都能买到,换一个转录因子只需要换表达载体。另一个变化是不需要交联,因为结合反应发生在体外,也就不存在"交联过度导致表位被遮住"的问题。它保留的好处是整套流程仍然在全基因组层面扫描,不需要预知结合基序,依然是无偏的。

当然,DAP-seq 也不是万能药。因为它脱离了活细胞环境,结合位点不受染色质可及性的限制,所以它拿到的是"在裸 DNA 上可能的结合位点",而不是"细胞内真实占位的位点"。这两者之间有差异,最后要怎么解读,我会在第五章讲验证策略时再说。

1.3 一张表看清 DAP-seq 和 ChIP-seq 的适用边界

维度ChIP-seqDAP-seq
抗体依赖高,需要 ChIP 级特异性抗体低,依赖通用亲和标签
实验体系需要活细胞/组织,需交联体外无细胞体系,无需交联
物种跨度模式生物数据库成熟,非模式困难任意物种,只要能得到基因组 DNA
蛋白状态检测内源蛋白,能反映体内部分状态检测外源重组蛋白,反映体外直接结合
实验周期抗体和交联优化占大量时间建库后数天即可完成
重复性容易受细胞状态波动影响重复性更好,但缺少染色质背景
变异体研究难,需要改内源基因很容易,表达点突变/截短蛋白即可

这张表是我自己在选择实验方案时反复对照的底稿。如果你的研究问题里,转录因子的体内状态很重要,比如你想看发育过程中蛋白的动态占位,那 ChIP-seq 仍然不可替代;但如果你只需要弄清"这个转录因子能结合哪些位点",尤其是做非模式物种、或者要大批量筛选多个转录因子时,DAP-seq 的效率优势是很明显的。

2. 湿实验全流程拆解:从收到基因组 DNA 到上机前一刻

DAP-seq 的湿实验流程可以用五步概括:提 DNA、打断加接头、体外表达转录因子、结合纯化、扩增上机。每一步都有一些不能省的小心思,下面按顺序讲。

2.1 基因组 DNA 质量是后续所有环节的地基

DAP-seq 的第一份原料是待研究物种的基因组 DNA,它既要拿来构建文库,也是转录因子结合的靶标。如果 DNA 里带着 RNA、多糖、酚类等杂质,后续的超声断裂效果和连接酶效率都会受影响。

我一般倾向于用改良 CTAB 法抽提,再用试剂盒过柱纯化一次;如果物种组织多糖多,建议加一步高盐沉淀。质量要求大致是:A260/A280 在 1.8~2.0 之间,A260/A230 大于 1.8,电泳显示主带完整且没有明显 RNA 拖尾。拿到高纯度 DNA 后,别忘了做一次 Qubit 精确定量,因为下一步打断需要用固定的起始量,宁可用同样的量和体积多做几个平行管,也不要一把梭把全部 DNA 都丢进同一个管子里。

2.2 片段化与接头连接:这一步的偏差会直接传导到峰值分辨率

片段化这一步决定了最终峰图的分辨率。DAP-seq 通常打断到 200~300 bp 的峰值,这个区间和 ChIP-seq 类似。打断用 Covaris 或 Bioruptor 都可以,关键在于保证平行样品之间的打断条件一致,否则不同样本的片段分布不同,后续峰宽和比对率都会出现人为差异。

打断完成后,先跑胶或拿 Bioanalyzer 确认片段分布,再进入末端修复和加 A 尾,最后连接 Y 型 Illumina 接头。接头连接效率不高的时候,后面 PCR 会出现大量接头二聚体,这个我后面会专门讲。连接产物用 SPRI 磁珠纯化一次,去除没有连接上的接头和短片段。

需要提醒的是,如果你同时做多个转录因子,最好在这一步就把接头连接好的基因组 DNA 文库分装成小管,避免反复冻融。因为后续转录因子结合、洗涤、洗脱的步骤要在同样的 DNA 文库上重复操作,每管冻融一次,文库质量就往下掉一点。

2.3 体外转录翻译:把转录因子蛋白"造"出来

转录因子蛋白在体外怎么造,最常用的是无细胞表达系统。常用的无细胞表达系统主要有两种选择:TNT T7 快速小麦胚芽裂解物系统和兔网织红细胞裂解物系统。小麦胚芽系统对植物转录因子的兼容性普遍不错,表达量高,尤其适合那些带有复杂结构域的真核蛋白;兔网织红细胞系统更便宜、操作快,有些蛋白也能表达得挺好。我习惯先在 10 µL 体系里小筛一轮,用 Western blot 或 Halo 标签荧光底物确认大小对不对、表达量够不够,再放大去跑正式的实验。

表达载体上的标签位置也很关键。转录因子的 DNA 结合域通常靠近 N 端或 C 端,如果标签正好挡在结合域附近,可能会影响 DNA 结合活性。遇到表达量正常但结合效率偏低的蛋白,我第一个会检查的就是标签位置,必要时把 HALO 标签从 N 端换到 C 端再试。

2.4 结合反应与亲和纯化:耐心与严谨都在这一环

转录因子和基因组 DNA 文库的结合反应要在合适的缓冲液里进行。缓冲液里一般会加 poly(dI-dC) 或鲑精 DNA 作为竞争剂,用来吸附那些非特异结合能力强的蛋白和杂质;盐浓度也要控制好,太高会降低特异性结合,太低又容易产生背景。我通常参照原始方案里的结合缓冲液配比,氯化钠浓度设在 50~100 mM 之间,再加 5~10 ng/µL 的 poly(dI-dC),在室温孵育 1 小时左右。

随后加入 HALO 或抗标签磁珠。HALO 标签与磁珠上的配体是共价结合,结合强度高,后续洗涤可以做得比较充分,这是它的优势;GFP 标签则用抗 GFP 的磁珠,靠抗体抗原亲和作用,洗涤强度要适当温和一点。洗涤一般做 3 次,每次用含有 0.05%~0.1% NP-40 的洗涤缓冲液重悬磁珠,把非特异吸附的 DNA 洗掉。整个过程最怕的是磁珠吸走不干净或重悬不充分,宁可多花费一点时间,也不要"意思意思"转两圈就吸废液。

2.5 洗脱扩增与上机:控制 PCR 轮数,别让噪声盖过信号

洗涤完成后,用洗脱缓冲液把结合在磁珠上的 DNA 洗下来。如果是 HALO 体系,可以用含 SDS 的洗脱液在加热条件下把蛋白-DNA 复合物从磁珠上解离,再用蛋白酶 K 消化掉蛋白,然后过柱回收 DNA。

回收到的 DNA 量通常很少,必须经过 PCR 扩增才能达到上机量。PCR 轮数建议控制在 15~18 轮,不要贪多。每多一轮 PCR,非特异扩增产物占比就会上升,最终测序数据里"背景噪音峰"会明显增加。扩增完后用 SPRI 磁珠做一次双轮筛选,把太长和太短的片段都去掉,上机前再跑一次 Agilent 2100 或 Fragment Analyzer 看文库片段分布,确认主峰在 250~400 bp 之间、没有接头二聚体峰,就可以送测序了。

3. 建库翻车实录:接头二聚体、对照污染和蛋白不表达

这一章写几个我在 DAP-seq 实际建库中踩过、也帮别人排查过的坑,按照"症状—排查链路—解决方案"来写,比直接甩结论更实用。

3.1 接头二聚体:跑胶时那道"明星条带"

做过建库的人都认识接头二聚体:文库片段分布图里本该有一个 250 bp 左右的主峰,结果 120 bp 附近突然冒出一个尖峰,那个小东西就是接头直接互连形成的二聚体。它的危害在于,二聚体片段在测序时会占掉大量有效读数,导致目标数据量打折。

我经历过一次四个平行样本里有三个二聚体峰量都超过主峰量。回头排查发现是两个原因叠加:一是接头连接后 SPRI 磁珠纯化时,磁珠比例偏低,短片段没有被充分去除;二是打断后的 DNA 实际量偏低,导致接头与 DNA 的摩尔比过高,连接产物以接头自身连接为主。

解决方案分两步。第一步是防:打断后必须定量,接头用量按照说明书推荐的摩尔比来,不要直接用"统一体积"的接头硬加;连接后纯化时使用双轮 SPRI 或者按厂家说明书选一个适合 200~300 bp 回收的磁珠比例,把短片段去掉。第二步是救:如果已经发现在 PCR 后二聚体比例很高,可以在纯化阶段做一次 Pippin Prep 或琼脂糖凝胶回收,把 200 bp 以下的部分切掉,再上机。

3.2 DNA 空白对照的"度":没有对照的峰全是空中楼阁

DAP-seq 的一个关键对照是不加转录因子蛋白、但同样经过结合缓冲液和磁珠处理的基因组 DNA 文库,通常叫 DNA-only 对照或 input 对照。这个对照能反映出磁珠本身吸附了多少非特异 DNA、这些非特异 DNA 在基因组上的分布偏好。不做对照,你调出来的峰很可能有一大半来自磁珠背景,而不是转录因子的真实结合。

我见过不止一个实验室为了省试剂省时间省掉 DNA-only 对照,最后生信阶段峰多得吓人,却没法解释;只能回头补实验,反而耽误了整个项目周期。另外,对照文库要和样本文库用同一批接头连接、同一轮 PCR 扩增,这样对比才有意义。换句话说,对照组不是随便拿个公共基因组 DNA 库就行的,它必须跟你处理的样本经历完全一致的流程。

3.3 无细胞表达蛋白不溶解或表达量低时怎么办

体外表达最常见的失败,是 Western blot 信号很弱,或者蛋白虽然表达但结合实验一直做不出信号。第一种情况可以尝试:调整模板 DNA 用量、更换表达系统、延长表达时间、降低表达温度;第二种情况优先检查标签位置,或使用截短的 DNA 结合结构域替代全长蛋白。

一个实操技巧是:在正式建库之前,先做一次小规模 pull-down 再加 qPCR 验证,用已知结合位点引物检测信噪比。比如某个转录因子之前报道过结合某个启动子区域,那就在小试结合实验后,用该区域引物做 qPCR。如果能检测到明显富集,再放大体系做全基因组测序;如果连已知位点的富集都看不到,那就先不要在文库上浪费钱。

现象可能原因处理建议
接头二聚体峰明显接头摩尔比过高 / SPRI 纯化不彻底精确定量 DNA、双轮 SPRI 或凝胶回收
峰背景整体偏高DNA-only 对照缺失或表达蛋白过量补做对照、降低蛋白投入量
蛋白表达量低模板结构或表达系统不匹配换无细胞系统、优化模板量
富集信号弱标签位点影响结合域功能更换标签位置或使用截短结构域

4. 生信流程:从 FASTQ 到可靠结合峰的完整命令行

湿实验结束,数据下机,后面的生信步骤决定你最终能拿到什么结论。这部分的整体思路是:数据清洗、比对、去重、call peak、注释和重复性评估。

4.1 fastp 清洗与比对前质控

下机数据第一步永远是把低质量碱基和残留接头去掉。虽然建库时已经切过接头,但序列里仍可能混入少量接头序列,尤其是在片段长度接近读长时。用 fastp 处理即可:

fastp -i sample_R1.fastq.gz -I sample_R2.fastq.gz \ -o sample_R1.clean.fastq.gz -O sample_R2.clean.fastq.gz \ --detect_adapter_for_pe --thread 8

如果是第一次处理这个物种的数据,建议先跑一次 FastQC 看看原始质量分布、GC 含量、duplication 水平、接头含量。fastp 会自己识别并修剪接头,省去手动写 adapter 序列的麻烦。对 DAP-seq 来说,如果重复率(duplication rate)特别高,先不要急着怀疑 PCR 扩增过度,先看看样本是不是在同一个 lane 里和其他样本混合测序时产生了 index hopping,这在上机前加样时就要留意。

4.2 bowtie2 比对与 BAM 清洗

比对我一般选 bowtie2。先把参考基因组 index 建好,然后跑比对:

bowtie2 -p 8 -x genome_index \ -1 sample_R1.clean.fastq.gz -2 sample_R2.clean.fastq.gz \ | samtools view -bS - | samtools sort -o sample.sorted.bam samtools markdup -r sample.sorted.bam sample.dedup.bam samtools index sample.dedup.bam

比对率能反映建库质量:正常 DAP-seq 的比对率应该和同物种普通 WGS 接近,如果比对率明显偏低,回查一下参考基因组版本和建库片段大小。我一般不会在比对阶段过度限制参数,保留默认模式就行,只要文库片段分布正常,默认参数结果都不会差。

markdup这一步很多人会省掉,但我建议保留。DAP-seq 的 PCR 扩增轮数虽然不高,但重复仍然会存在,尤其在富集区域。标记并去除重复后,峰的形状会更干净,定量也更可信。有一点要提一下:如果你后面需要跑某些不接受去重 BAM 的工具,记得把原始 BAM 留一份,别一股脑把去重后的文件覆盖掉。

4.3 MACS2 峰值调用:参数并不需要魔改,但基因组大小别填错

峰值调用我通常使用 MACS2,用处理样本加 DNA-only 对照:

macs2 callpeak -t DAP_tf.dedup.bam -c DAP_input.dedup.bam \ -f BAMPE -g 1.35e8 -n DAP_tf --outdir macs2_peaks

这里最容易被忽略的是-g参数,也就是有效基因组大小。拟南芥大约是 1.35e8,水稻约 3.5e8,不同物种差别很大。如果填错,MACS2 会按错误背景模型估算峰显著性,导致峰数剧烈波动。另外,-f BAMPE是因为 DAP-seq 建的是 paired-end 文库,用 BAMPE 模式可以让 MACS2 利用真实的插入片段长度来建模,比单端模式更准。

call 完之后,我会用 IGV 随机抽几个峰做可视化检查,确认峰确实呈现"处理样本富集、对照样本不富集"的模式。这一步虽然不生成新图,但很多时候能发现样本标签互换、index 污染这类头疼的问题。

4.4 从峰到生物学解释:注释、基序和重复性

拿到 BED 格式的峰之后,下一步是注释和基序分析。注释可以确定峰落在启动子、基因体、基因间区等哪个功能区域;基序分析用 HOMER 或 MEME 来找出这段蛋白偏好的 DNA 序列模体:

findMotifsGenome.pl DAP_tf_peaks.bed tair10 . -size 200 -len 8,10,12

HOMER 会输出已知 motif 和新发现的 motif,我一般先看注释结果里是否有该转录因子所属家族的已知 motif。如果已知 motif 没有出现在 top 列表里,不一定是实验失败,也可能是数据库覆盖不够,需要结合 MEME 的从头预测结果来判断。重复性评估可以用 IDR,技术重复之间预期应有高度重叠,如果 IDR 峰占比很低,说明湿实验或建库环节存在较大的批次波动。

5. 我踩过的坑和几个实验前的决定性建议

写到这里,最后分享几个我实战之后最大的体会。

5.1 先做技术重复,再追生物学重复

DAP-seq 实验涉及的变量主要来自建库、PCR 和磁珠操作,而不是来自细胞状态,所以技术重复(同一样本重复建库)比生物学重复更容易反映真实的实验误差。我建议在一个新转录因子第一次跑 DAP-seq 时,先做两个技术重复,加上一个 DNA-only 对照,用 IDR 评估一致性。如果技术重复之间的一致性已经不好,那就先别急着加更多生物学重复,回头优化建库流程才是关键。

5.2 用 qPCR、EMSA、瞬时表达报告基因交叉验证

DAP-seq 的峰本质上来自体外结合,不代表体内会发生同样的结合。我通常会用几个手段交叉验证:选 2~3 个高置信度峰所在的启动子区域,设计引物做 ChIP-qPCR,或者用 EMSA 验证体外直接结合;更简单一点的做法是瞬时共表达转录因子和报告基因,看是否能激活荧光素酶或 GFP 信号。这一步不需要对所有峰都做,选 top 几个关键靶点验证即可,但它决定了整篇论文的结论是否站得住。

5.3 善用公共数据,但注意协议差异

很多模式植物和非模式物种的 DAP-seq 公共数据已经发布,做分析前可以先比对自己同家族转录因子的公共 peak 数据。如果别人同样用 DAP-seq 得到的基序和你的一致,那是很好的互相佐证;如果某个位点在别人的数据集里特别强、在你的数据集里根本看不到,再检查一下是否用了不同的标签、不同的表达系统或不同的洗涤强度。DAP-seq 看起来流程简单,但一个缓冲液的盐浓度差异就可能让 peak 强度排名发生明显变化。

如果让我给刚打算做 DAP-seq 的人一句话,我会说:把 DNA-only 对照做扎实,把 PCR 轮数控制住,再花半天时间把 IDR 跑明白,后面自然顺。转录因子结合位点这件事,DAP-seq 不是全能的,但它是目前把"体外直接结合"和"全基因组扫描"结合得最省力的一条路。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询