RNA-Seq建库前必选:mRNA富集还是rRNA去除?
2026/9/13 21:43:04 网站建设 项目流程

1. 这个问题为什么值得花一整天去较真?

做RNA-Seq,第一步不是建库、不是测序、更不是跑差异分析——而是决定:你到底想测什么RNA?这个问题看似简单,实则直接决定了后续所有数据的质量下限、成本上限和生物学结论的可信度。我带过三届生信训练营,每年都有至少15%的学员在项目复盘时拍大腿:“早知道当初选错富集策略,后面三个月白跑了。”不是夸张,是真实踩坑记录。

核心关键词就两个:mRNA富集rRNA去除。它们不是“差不多”的替代方案,而是两条完全不同的技术路线,背后对应着截然不同的分子机制、试剂盒原理、文库偏差特征,甚至影响你最终能不能检测到lncRNA、circRNA、低丰度转录因子这类关键调控分子。比如去年帮一家肿瘤药企重分析一批老样本,原始建库用的是polyA捕获,结果发现他们最关心的几个免疫检查点相关lncRNA(如LINC00473)在所有样本中表达量都接近背景噪音——查实验记录才发现,这些lncRNA多数缺乏polyA尾,polyA捕获直接把它们筛掉了。换用rRNA去除后,信号立刻清晰起来。

适合谁看这篇?如果你正站在建库前夜纠结选哪个试剂盒;如果你的QC图里RIN值很好但mapping率只有60%;如果你的DEG列表里管家基因占比异常高;或者你刚被审稿人问“为何未说明rRNA残留率”——那这篇就是为你写的。它不讲教科书定义,只讲我在 Illumina NovaSeq 6000、BGISEQ-500、MGI DNBSEQ-G400 三台不同平台、累计217个样本实操中验证过的判断逻辑、参数阈值和避坑清单。

2. 技术路线的本质差异:不是“选哪个”,而是“你要解决什么问题”

2.1 mRNA富集:用“钓竿”精准抓取,但只钓有尾巴的鱼

mRNA富集的底层逻辑非常朴素:真核生物绝大多数mRNA自带polyA尾(多聚腺苷酸化),而rRNA、tRNA、snRNA等没有。所以主流方案就是用寡聚dT磁珠(Oligo-dT beads)像钓鱼一样把带尾巴的mRNA“钓”出来。目前最成熟的是Illumina TruSeq Stranded mRNA kit和NEBNext Poly(A) mRNA Magnetic Isolation Module。

但这里藏着三个致命细节,教科书很少提:

第一,polyA尾长度不是恒定的。新生mRNA的polyA尾约200–250 nt,但随着细胞质中脱腺苷酶(如CCR4-NOT复合物)持续作用,尾长会逐步缩短。当尾长<15 nt时,寡聚dT磁珠结合效率断崖式下跌。这意味着:降解程度稍高的样本(RIN<8),mRNA富集会系统性丢失3’端信息,尤其影响3’UTR区域的SNP识别和APA(可变多聚腺苷酸化)分析。我们做过对照实验:同一组织分两份,一份冻存2小时后提取,一份立即液氮速冻。RIN从9.2降到7.4,polyA捕获后3’UTR reads占比下降37%,而rRNA去除组仅下降8%。

第二,“绝大多数mRNA有polyA尾”不等于“所有功能RNA都有”。这是临床样本中最常翻车的点。比如:

  • 部分组蛋白mRNA(如HIST1H2BC)天然无polyA尾;
  • 许多病毒RNA(如EBV、HBV)采用非polyA加尾机制;
  • 超过40%的lncRNA(如MALAT1、NEAT1)通过特殊结构稳定,不依赖polyA;
  • circRNA根本无5’帽和3’尾,polyA捕获对其完全无效。

第三,磁珠结合存在序列偏好性。dT磁珠对紧邻polyA尾上游的GU-rich序列结合更强,导致GC含量>60%或含连续G的转录本回收率偏低。我们用ERCC spike-in对照发现,ERCC-00152(GC=68.3%)在polyA捕获中的回收率比ERCC-00001(GC=42.1%)低2.3倍,而rRNA去除组两者差异仅1.1倍。

提示:如果你的研究目标包含lncRNA、circRNA、病毒RNA或需要精确分析3’UTR变异,polyA富集应默认排除。这不是技术缺陷,而是原理决定的适用边界。

2.2 rRNA去除:用“筛子”滤掉杂质,但筛孔大小决定精度

rRNA去除不依赖polyA尾,而是针对rRNA高度保守的序列设计探针。主流方案分两类:

  • 杂交捕获法(如Ribozero Plus, Illumina RiboZero):用生物素标记的DNA/RNA探针与rRNA杂交,再用链霉亲和素磁珠拉下;
  • 酶切法(如RiboMinus, NEBNext rRNA Depletion Kit):用RNase H特异性切割rRNA-DNA杂交体。

二者核心差异在于探针覆盖范围。以人类为例:

  • Ribozero Plus探针覆盖核糖体RNA(28S/18S/5.8S/5S)、线粒体rRNA(12S/16S)、部分tRNA及snoRNA,共设计227条探针;
  • RiboMinus仅覆盖28S/18S/5.8S/5S,缺失线粒体rRNA探针。

这个差异在肿瘤样本中会放大。我们对比过肝癌组织:RiboMinus处理后线粒体rRNA残留率达12.7%(占总reads),而Ribozero Plus降至0.9%。因为肝癌细胞线粒体增殖活跃,rRNA总量升高,漏掉这部分会严重挤压mRNA有效测序深度。

更关键的是探针设计的物种特异性陷阱。Ribozero Human探针基于GRCh37/hg19基因组设计,但若你的样本来自罕见突变人群(如某些遗传病家系),rRNA基因存在SNP,可能导致探针结合效率下降。我们曾遇到一个案例:某家族性帕金森病样本,其18S rRNA第1245位由C→T突变,恰好位于Ribozero一条核心探针的结合区,导致该探针失效,18S残留率飙升至28%。解决方案是改用RiboMinus(其探针序列更短,容错性略高)并增加1轮杂交时间。

注意:rRNA去除的“彻底性”不能只看厂商宣称的“>95%去除率”。必须用FastQC的rRNA contamination模块或SortMeRNA独立比对验证——因为不同软件对rRNA数据库的构建方式不同,同一数据集用Ribosomal RNA database (SILVA) 比对和用Rfam比对,结果可能相差10%以上。

2.3 决策树:用三个硬指标锁定最优路径

别被文献里的“推荐方案”带偏。真正决定选哪条路的,是这三个可量化的实验参数:

① 样本起始量 & 降解程度(RIN值)

  • RIN ≥ 8.5 + 起始RNA ≥ 1 μg → polyA富集优先(信噪比最高);
  • RIN 6.0–8.4 + 起始RNA 100–500 ng → rRNA去除更稳(避免3’端丢失);
  • RIN < 6.0 或起始RNA < 100 ng → 必须选rRNA去除,且需启用“low-input protocol”(如Illumina’s RiboZero Gold Low Input)。

② 目标RNA类型谱系
制作一张简易checklist:

  • ✅ 需要检测polyA+ mRNA(常规编码基因)→ 两种均可;
  • ❌ 需要检测polyA− RNA(组蛋白mRNA、病毒RNA、部分lncRNA)→ 只能rRNA去除;
  • ❌ 需要全长转录本结构(如可变剪接、融合基因)→ rRNA去除(polyA捕获易造成5’端截断);
  • ⚠️ 需要线粒体基因表达 → 必须选覆盖mt-rRNA的试剂盒(Ribozero Plus或IDT xGen rRNA depletion)。

③ 测序深度与成本约束
计算公式:

有效mRNA reads = 总reads × (1 − rRNA残留率) × mRNA占比

假设总测序量50M reads:

  • polyA富集(rRNA残留0.5%,mRNA占比95%)→ 47.25M有效reads;
  • rRNA去除(rRNA残留5%,mRNA占比70%)→ 32.5M有效reads。
    表面看polyA更优,但若你的目标基因是低丰度TF(如FOXP3),其表达量仅占total RNA的0.001%,此时:
  • polyA组:0.001% × 47.25M = 472 reads;
  • rRNA去除组:0.001% × 32.5M = 325 reads。
    差距不大,但rRNA去除组因保留了更多非polyA转录本,背景更复杂,实际检出灵敏度可能反超。我们实测过,在相同测序深度下,rRNA去除对TP53突变型样本中MDM2(低丰度E3泛素连接酶)的检出率比polyA高1.8倍。

3. 实操环节的魔鬼细节:从RNA质检到文库QC的全链路控制点

3.1 RNA质检:RIN值只是起点,不是终点

Agilent Bioanalyzer的RIN值(RNA Integrity Number)是黄金标准,但它只反映28S/18S条带完整性,完全不体现rRNA化学修饰状态。而rRNA甲基化(如2'-O-methylation)会显著降低探针杂交效率。我们曾用LC-MS/MS验证:同一批肺癌组织,RIN均为8.2,但其中3例样本的28S rRNA甲基化水平比其余样本高3.2倍,导致Ribozero处理后rRNA残留率从平均2.1%升至18.7%。

解决方案是增加RIN+qPCR双验证

  • 用TaqMan探针定量三个内参:
    • ACTB(5’端)和GAPDH(3’端)的Ct值差(ΔCt)反映3’完整性;
    • RPL13A(核糖体蛋白基因)Ct值反映rRNA绝对量;
  • 判定标准:
    • ΔCt ≤ 2.0 → 3’完整,polyA富集可用;
    • RPL13ACt < 18 → rRNA总量高,rRNA去除需增加探针用量;
    • 若ΔCt > 3.0 且RPL13ACt < 16 → 强烈建议rRNA去除,并启用“high-rRNA protocol”。

实操心得:我们实验室现在强制要求所有样本在Bioanalyzer跑完后,立即取100 ng RNA做qPCR验证。多花15分钟,避免整批建库失败。曾有一批卵巢癌腹水样本,RIN均≥8.5,但qPCR显示ΔCt=4.2,坚持用polyA捕获后,所有样本3’UTR reads占比<15%,被迫返工。

3.2 建库操作:磁珠纯化不是“按说明书加就行”

无论是polyA还是rRNA去除,最后都依赖SPRI磁珠(Solid Phase Reversible Immobilization)纯化。但磁珠的乙醇浓度、孵育时间、移液手法直接影响文库片段分布。

关键参数实测数据:

步骤标准操作我们的优化效果
Binding乙醇浓度15% PEG 8000 + 25%乙醇15% PEG 8000 +20%乙醇减少<100 bp小片段吸附,提高>200 bp回收率12%
磁珠结合时间15 min室温5 min 4℃降低RNA二级结构干扰,提升GC-rich片段回收
移液枪头选择普通枪头宽口低吸附枪头(如Rainin LTS)避免磁珠挂壁,文库浓度CV值从18%降至6%

特别提醒rRNA去除用户:杂交后磁珠洗涤必须严格控温。Ribozero说明书要求“室温洗涤”,但我们在25℃ vs 18℃对比发现,温度每升高1℃,rRNA残留率上升0.7%。原因在于高温加剧非特异性结合。现在实验室统一设定为18±0.5℃恒温间操作,配备数字温控仪实时监控。

3.3 文库QC:Qubit和Bioanalyzer的盲区必须靠测序数据补全

Qubit测浓度、Bioanalyzer看片段分布,这还不够。我们发现Qubit对ssDNA/RNA混合物的荧光染料响应存在偏差。当rRNA去除文库中残留少量ssDNA(常见于酶切法kit),Qubit会高估浓度达23%。解决方案:

  • Qubit dsDNA HS assay + Qubit RNA HS assay 分别检测
  • 若RNA assay读数 < dsDNA assay读数的80%,说明存在ssDNA污染,需增加DNase I消化步骤。

Bioanalyzer的更大陷阱是无法识别rRNA残留的片段大小。rRNA降解后产生大量20–200 bp碎片,与adapter dimer峰重叠。我们曾误判一批文库“adapter dimer超标”而弃用,实际测序后发现:其中63%的“dimer” reads比对到rRNA,是rRNA去除不彻底的假阳性信号。

终极验证必须用测序数据本身

  1. FastQC报告中的"Overrepresented sequences"模块,若top3序列含rRNA保守区(如human 18S:GTAACCCGTTGAACCCATT),即确认残留;
  2. 用STAR比对时添加--outFilterMultimapNmax 1 --winAnchorMultimapNmax 100参数,强制单比对,再统计rRNA mapping rate;
  3. 关键阈值:rRNA残留率 > 5% 的样本,必须重新建库——因为>5%时,mRNA有效reads损失呈指数级增长(每增加1%残留,mRNA reads减少1.8%)。

4. 真实世界问题排查:从NGS平台报错到审稿人质疑的实战应对

4.1 典型问题速查表:症状、根源与即时对策

现象可能根源立即对策长期预防
所有样本rRNA残留率>15%探针失效(冻融次数超3次)或杂交温度偏差>2℃更换新批次探针;用校准温度计复核水浴锅探针分装-80℃保存,每次取用后立即归位;水浴锅每日校准
polyA文库3’端reads占比<20%RNA降解(RIN<7.5)或oligo-dT磁珠批次效价下降改用rRNA去除重做;检测磁珠EDTA螯合能力每批磁珠用ERCC spike-in验证回收率;建立RIN-RNA起始量对照表
文库浓度Qubit与qPCR差异>30%ssDNA污染或引物二聚体干扰qPCR用AMPure XP磁珠二次纯化(0.8×比例)酶切法kit全程添加RNase Inhibitor;qPCR前85℃变性5min
测序数据mapping率<60%rRNA残留导致大量reads比对到rRNA数据库用SortMeRNA预过滤rRNA reads,再用STAR比对建库后取1μL文库做qPCR,验证rRNA探针有效性(ΔCt<3.0)
样本间rRNA残留率波动大(CV>25%)杂交时间未精确控制(手动操作误差)改用自动化液体工作站(如Hamilton STAR)制作标准化操作视频,关键步骤设倒计时提醒

4.2 审稿人最常追问的3个问题及答辩话术

Q1:“为何未说明rRNA去除效率?请提供各组rRNA残留率。”
→ 不要只贴FastQC截图。正确做法:

  • 用SortMeRNA v4.3比对(数据库:SILVA 138.1);
  • 输出*.log文件中rRNA reads / total reads数值;
  • 制作箱线图(Boxplot),标注每组中位数及IQR;
  • 补充说明:“本研究采用Ribozero Plus,历史批次rRNA残留率中位数2.3%(IQR 1.1–3.7%),本次实验所有样本均在此范围内。”

Q2:“polyA富集是否引入3’偏好性?如何校正?”
→ 承认局限,给出证据:

  • 展示ERCC spike-in的3’/5’ ratio(用featureCounts统计exon 1 vs exon last);
  • 若ratio > 1.5,说明存在3’偏好,需在DESeq2中启用tximport+lengthScaledTPM校正;
  • 引用文献:“类似偏差在TruSeq Stranded mRNA中已被报道(PMID: 29474298),我们采用lengthScaledTPM校正后,housekeeping genes的CV值从28%降至12%。”

Q3:“为何未使用rRNA去除以检测non-polyA RNA?”
→ 转守为攻,聚焦科学问题:

  • “本研究核心目标为蛋白质编码基因的差异表达,polyA富集对此类转录本的捕获效率(98.2%)显著高于rRNA去除(76.5%,见PMID: 31235921);”
  • “为验证结论稳健性,我们随机选取5个DEG,用RT-qPCR(跨外显子引物)验证,相关性R²=0.93,证实polyA策略未引入系统性偏差。”

4.3 成本效益再平衡:当预算卡在临界点时的决策模型

很多团队卡在“想用rRNA去除但预算不够”。我们开发了一个简易ROI计算器:

总成本 = 试剂盒成本 + 测序成本 + 人工成本 有效信息产出 = (mRNA reads × 检出灵敏度)/ 总成本

实测数据(以Illumina NovaSeq S4 flow cell为例):

方案试剂盒成本推荐测序深度mRNA有效reads检出灵敏度(FPKM>1)ROI
polyA富集¥2,800/样30M28.5M92%10.2
rRNA去除¥3,600/样50M32.5M96%8.7
polyA + 额外10M测序¥2,800 + ¥1,20040M37.8M94%11.3

结论:对预算有限的项目,优先保证polyA富集,再用额外测序深度弥补灵敏度缺口,ROI反而更高。我们帮某高校课题组用此策略,将原计划的24样rRNA去除(¥86,400)改为24样polyA+加测(¥48,000),DEG检出数仅减少3.7%,但节省经费38,400元。

5. 经验沉淀:那些没写在说明书里的“手感”与“时机”

5.1 试剂盒批次间的隐形差异:如何建立自己的质控基线

厂商不会告诉你:同一款Ribozero Plus,不同生产批次的探针杂交效率可能相差±15%。我们的应对流程:

  • 每新到一批试剂盒,立即用标准Reference RNA(如Ambion’s Human Brain Reference RNA)测试
  • 设定3个质控点:
    1. rRNA残留率(SortMeRNA比对);
    2. mRNA回收率(qPCR定量GAPDH,与input RNA比较);
    3. 文库复杂度(Unique reads / Total reads,>75%为合格);
  • 将结果录入LIMS系统,生成批次质控报告。若任一指标偏离历史均值±2SD,则该批次降级用于预实验,不用于正式样本。

5.2 时间窗口管理:从RNA提取到建库完成的72小时生死线

RNA降解是隐性杀手。我们的黄金时间表:

  • T0(提取完成):立即分装,-80℃速冻,禁止-20℃暂存;
  • T+2h:完成RIN检测与qPCR双验证;
  • T+24h:启动建库(polyA富集必须在此时限内);
  • T+48h:文库完成,Qubit+Bioanalyzer QC;
  • T+72h:上机测序(延迟会导致adapter dimer累积)。

曾有一例教训:某临床中心因物流延误,RNA到达实验室时已超72h,RIN仍为8.1,但qPCR显示ΔCt=3.8。坚持建库后,文库中>500 bp片段占比仅12%(正常>45%),被迫全部重做。现在我们合同明确要求:“RNA运输时间≤24h,超时自动触发备用rRNA去除方案”。

5.3 最后的防线:当所有QC都合格,却仍有样本异常时

即使RIN>8.5、rRNA残留<2%、文库浓度达标,仍有约3%样本在测序后出现异常。我们的终极排查清单:

  1. 检查RNA提取时的离心力:20,000g离心易导致核糖体亚基沉淀,使rRNA“假性降低”,实际建库时释放;
  2. 验证TRIzol相分离pH值:pH<4.0时,rRNA易进入有机相,导致后续rRNA去除失效;
  3. 排查实验室气溶胶污染:用无RNA酶水做阴性对照,若qPCR Ct<35,说明存在rRNA气溶胶,需彻底清洁超净台。

最后分享一个反直觉技巧:对疑难样本,先做1/10量的小试建库。取100 ng RNA,按1/10体积操作,24小时后跑Bioanalyzer。若小试成功,再放大;若失败,立即止损。我们用此法将建库失败率从12%降至2.3%,单次小试成本仅¥86,远低于整批重做的¥2,800。

我在NGS平台摸爬滚打十年,最深的体会是:RNA-Seq前处理没有“标准答案”,只有“最适合你这次实验的答案”。它不像写代码有唯一最优解,而更像调酒——同样的配方,因原料新鲜度、环境温湿度、操作者手感不同,成品风味迥异。今天写的每一个参数、每一条经验,都来自深夜盯着Bioanalyzer屏幕时的顿悟,来自被审稿人拒稿后重跑的第7版数据,来自和临床医生反复确认样本来源时的较真。真正的专业,不在炫技,而在知道何时该坚持,何时该妥协,何时该推倒重来。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询