☰
AI自主发现类CRISPR新酶系统:从宏基因组到基因编辑的假说引擎
2026/10/3 10:09:11 网站建设 项目流程

CRISPR 基因编辑的新闻每隔一阵就会来一条,但这次确实不太一样:不是实验室里的科学家设计实验发现了新酶,而是 AI 模型 Claude 在公开基因组数据库里翻来翻去,自己找了一批“类 CRISPR”的新酶系统。功能还不知道,张锋的回应也很克制,只说“值得研究”。

我第一反应是,这又是一条被标题党放大的新闻。可仔细看公开报道的细节,发现事情比表面上有意思得多。这个事件的核心不在于“AI 又抢了科学家的活”,而在于“AI 从海量数据里提出假说的能力,已经越过了一个临界点”。对做基因编辑的人来说,这可能是未来几年值得盯住的方向;对做生信、做开发、甚至单纯把大模型当生产力工具的人来说,这套“AI 提假说 + 人工验证”的流程,也完全能迁移到自己的日常研究里。

这篇文章我不打算复述一遍新闻,而是把它拆开来讲清楚:AI 到底是怎么找到这些类 CRISPR 系统的,张锋那句话的分量在哪里,以及这套方法我们能不能自己上手复现。

1. 事件还原:AI 找到的“类 CRISPR”新酶系统,到底是靠什么发现的

1.1 解剖“自主发现”:AI 实际干的三件事

公开报道里只说 Claude“自主发现”,这听起来很玄乎,但拆开看,它干的其实是生物信息学里三件并不新鲜的事,只是方式和速度变了。

第一件事,是拿着公开数据库里的海量基因组做扫描。数据来源主要是 NCBI、MGnify 这类公共库,里面存放着大量细菌、古菌的基因组序列。人类基因组只有一套,但微生物基因组是几万套、几十万套,很多还是环境样本里直接拼出来的,从来没人仔细看过。

第二件事,是识别 CRISPR 阵列。CRISPR 系统在细菌身上有一套非常有辨识度的“档案记录”结构:一段段短的重复序列,中间夹着长度不一的外源 DNA 片段,也就是间隔序列。这种“重复-间隔-重复-间隔”的模式,计算机非常容易识别。传统工具如 PILER-CR、MinCED、CRISPRCasFinder 都是干这个的,AI 做的也是同样的事,但容忍度更高,能识别出那些不那么典型、被传统规则漏掉的阵列。

第三件事,是搜索 Cas 样蛋白。完整的 CRISPR-Cas 系统除了记忆档案,还得有武装力量,也就是 Cas 蛋白。II 型系统的 Cas9、V 型的 Cas12、VI 型的 Cas13,这些都已经被研究得很透。AI 要做的是在 CRISPR 阵列附近寻找那些编码“看起来像 Cas 但又不完全像”的蛋白序列。在这个环节,常用的不是直接跑 BLAST 比对,而是把蛋白序列转成高维向量,用聚类的方式把“功能相似但序列差异大”的候选捞出来。

换个生活化的比喻,传统方法像拿着通缉令上的照片去认人,必须长得够像才能发现;AI 的方法像根据一个人的生活习惯反推他可能住在哪个片区,哪怕从没见过照片,也能圈出几个可疑地址。这就是“自主发现”四个字背后最实在的技术变化。

1.2 “类 CRISPR”不是“坏的 CRISPR”:先搞懂这套系统长什么样

很多人看到“类 CRISPR”这三个字,会下意识以为这是“类似但不好用”的东西。这个理解需要纠正。

完整的 CRISPR-Cas 免疫系统需要两大件:前面说的 CRISPR 阵列,负责记录入侵者的 DNA 片段作为“通缉档案”;后面跟着的 Cas 蛋白,负责根据档案去识别并切割入侵者的核酸。两个部分缺一不可,否则免疫就会失效。

而“类 CRISPR”系统,指的是与已知系统同源、但结构上不完整的基因簇。可能的情况有三种:

  • 有阵列,但旁边的 Cas 基因缺了大半,只剩一个作用不明的蛋白;
  • 有完整的 Cas 样蛋白,但找不到典型的阵列结构,可能它已经被改造成了别的调控元件;
  • 蛋白结构域的排列组合非常奇怪,和已知的 Cas 家族都对不上号。

这三种情况在微生物基因组里其实很常见,因为细菌基因组演化速度很快,很多防御系统会退化、重组、被挪作他用。传统工具遇到这类基因簇,处理方式通常是直接过滤掉,因为“不够典型”;但 AI 恰恰相反,它会把那些“说不清是什么”的当作高价值异常点单独挑出来。

每个做科研的人都明白,未知比已知更值钱。自然界里已知的 CRISPR-Cas 系统已经被翻来覆去研究了几十年,新东西的空间越来越窄;而一个不知道能干什么的蛋白酶,反而可能是下一把还没被发现的“分子剪刀”。这就是“功能未知”四个字真正的价值。

2. 张锋的“值得研究”,为什么是这轮新闻里最值钱的一句话

2.1 一句话读懂“值得研究”

张锋这个名字,做基因编辑的人没有不知道的。他是 CRISPR-Cas9 真核基因编辑技术的奠基人之一,也是利用宏基因组数据挖掘新 CRISPR 系统的代表人物。他所在团队过去这些年干的事,就是从各种奇怪的环境样本里找新的 Cas 蛋白,然后改造成好用的基因编辑工具。

所以“值得研究”这四个字从他嘴里说出来,基本等同于一个资深猎手看到了一块陌生的兽径时说“这里有东西”。他不会轻易对新闻事件做评价,一旦说了,说明这批候选系统在专业判断上确实有追踪价值。

为什么他有这个判断力?因为张锋自己的实验室就有“从多样性里挖工具”的成功记录。通过分析宏基因组数据,他们找到过体积更小、更便于递送的 Cas9 同源物,还参与推动了 Cas12、Cas13 的发现和应用。这条路他不是第一次走,也不是只凭直觉,他是切切实实知道自然界里还剩多少没被发现的系统的人。

2.2 功能未知的酶系统,为什么是工具库的下一块拼图

判断一个新发现的酶系统有没有价值,可以看它可能变成什么。功能未知不意味着没有功能,一个被自然选择保留下来的基因大概率是有用的,只是我们还没测出来。

做个简单的推演:

如果这个新酶具备……它可能成为……对标现有工具
核酸酶活性新的基因编辑工具Cas9 / Cas12 的替代或补充
只结合不切割的能力新的基因调控工具dCas9 / dCas12
RNA 切割活性新的 RNA 检测与编辑工具Cas13
与转座子相关的结构域新的大片段基因插入系统CAST / INTEGRATE
只在特定古菌里存在的特征新的分子诊断靶点反向应用于临床检测

每一种可能性对应一个具体应用场景。比如现有 Cas9 的问题在于分子量太大,递送困难;Cas12 的问题在于 PAM 序列限制;Cas13 对 RNA 的检测灵敏度虽然高,但特异性还有提升空间。如果这批新酶系统里有一两个能在这些环节上做出改善,那它们就是实打实的新工具起点。

这跟在地里捡到一块金属差不多。普通人看到一块锈迹斑斑的金属,不知道是什么;但经验老到的考古队员看一眼出土地点,会告诉你“值得研究”——因为那个位置底下可能埋着一个没被打开过的器物层。

2.3 比单个发现更重要的事:AI 参与假说生成

张锋点评里最值得琢磨的,其实不是他认可了某一个酶,而是他认可了“AI 可以参与科学假说生成”这个路径本身。

过去发现新 CRISPR 系统,基本靠科学家肉眼加运气。一个实验室可能花好几年筛几万个基因组,才能找到一两个候选。而 AI 的扫描能力是人力完全没法比的:它可以在几天内把公共数据库里的数十万条基因组全过一遍,把所有“看起来异常”的 CRISPR 相关基因簇都捞出来。科学家的工作从“找”变成了“选”——在一个已经缩小很多倍的池子里判断哪些最值得进实验室。

这就是质变。以前是新酶在自然界里等着被人类发现,平均速度以年为单位;现在变成 AI 批量提交候选名单,科学家的判断和实验验证才是瓶颈。这个转变,对任何一个依赖“先发现、后验证”的领域都是通用的,不只是 CRISPR。

3. 这套“AI 找酶”的思路,普通人怎么迁移到自己的研究里

3.1 一个研究生可以落地的“AI 生信”最小复现流程

这套逻辑并不是只有顶级实验室才能跑。就算不碰 CRISPR,任何一个手里有数据集、想找异常模式的研究者,都可以走一遍下面这个最小流程。

我把它整理成六个步骤,每一步都有明确产出:

  1. 准备环境。Python 3.10 以上,装好 biopython、pandas、scikit-learn,有 GPU 更好,没有也能跑小规模数据。
  2. 拿数据。从 NCBI 下载基因组序列,或者从 MGnify 拉宏基因组的 contigs。先别贪多,拿一万条以内练手就够。
  3. 跑常规工具。用 MinCED 或 CRISPRCasFinder 扫一遍,把标准 CRISPR 位点找出来,作为基线数据。
  4. 提取非典型位点。这一步是关键,把工具没识别出来、但序列特征看起来像阵列的区域全部标记出来。传统工具留下的“废弃产物”,恰恰是 AI 二次筛查的好素材。
  5. 调用大模型做二次筛查。把候选区域的序列上下文、预测注释信息丢给模型,请它挑出“结构组合异常”的位点。注意,这一步要给模型足够的上下文信息,而不是只给它一段 DNA 序列。
  6. 用结构预测验证优先级。对候选蛋白跑 AlphaFold 或 ESMFold,看看折叠出来的结构和哪些已知结构域相似,再把结果按“全新结构 > 已知结构域的新组合 > 已知结构域的突变体”排序。

这个流程里,AI 不是替代品,它的作用是把你从“海量数据里扫雷”的低级劳动里解放出来,让你把精力集中在判断和验证上。

3.2 用 Claude Code 跑数据分析的真实体验

既然热搜里到处都是 Claude Code 相关话题,我顺带说说我用它做生信分析的实际体验,因为这件事和 AI 辅助发现其实是一脉相承的。

Claude Code 本质上是一个能在终端里直接干活的 AI 工程师。你给它一个任务,它自己写脚本、跑命令、看报错、改代码,整个过程都在终端里。我在处理序列数据的时候会直接让它写提取 CRISPR 特征的脚本,速度确实比我手动敲代码快。举一个实际例子:我要从一个大型 FASTA 文件里统计所有候选区域的重复单元长度分布,我只需要把文件格式说明和任务目标告诉它,它几分钟就能给出能跑的代码。

但这不是说它没有坑。最典型的坑是它会“一本正经地写出看起来对、实际缺一步”的代码。比如我在处理 GenBank 的 feature 表时,它写出的解析代码漏掉了嵌套注释结构,导致注释信息丢失了一部分,报错还没暴露问题。后来我把大任务拆成几个小步骤让它单独执行,每一步结果先人工核对一遍,再进下一步,这种情况就少了很多。

我的建议是,Claude Code 适合当“高级助理”用,不适合当“全权负责人”用。大任务拆成 5 到 10 个小任务,每个小任务都给足上下文,最后你只需要审一遍核心逻辑,省下的是大量机械性的编码时间。

3.3 实验结果之前的三个质量闸门

AI 给出的候选最终要上实验台,但在此之前必须过三个质量闸门。任何一步没有通过,这个候选就只能停留在“数据挖掘结果”层面,不能进入实验验证。

第一个闸门是数据检查。候选区域是否真的有回文重复序列、间隔序列与前导区?CRISPR 的特征是否经得起重新审视?如果连基本特征都不成立,那就是纯假阳性,直接丢弃。

第二个闸门是同源检查。把候选蛋白序列拿去跑 BLAST,看它跟已知 Cas 蛋白的相似度。如果相似度高于百分之三十,那不叫新系统,叫新变体;只有相似度足够低、或者存在完全不同的结构域组合,才配得上“类 CRISPR 新系统”这个标签。

第三个闸门是结构检查。用 AlphaFold 等工具预测候选蛋白的三维结构,和已知 Cas 蛋白的结构比对。如果预测结果里出现了从未见过的结构域折叠方式,这是最理想的状况;如果结构高度相似,那它大概率只是已知蛋白的远亲。

这三个闸门都过了,候选才值得拿进湿实验室做功能验证。这套标准并不是我拍脑袋定的,它其实就是科研里最基本的“可重复、可验证”要求,只不过以前靠审稿人把关,现在 AI 时代需要自己提前把关。

4. 把 AI 当科研搭子:踩坑清单与可复用的避坑方法

4.1 大模型不是专家,是“会检索的实习生”

很多人用 AI 做科研,最大的误区是把它当成了“什么都知道的专家”,问什么就信什么。这个认知需要修正。

大模型的回答本质上是基于训练数据的概率预测。你给它一段序列,它说“这可能是 Cas9 同源物”,不代表它真的看过这个序列,只能说明它的训练材料里存在大量类似序列的特征。它是在做模式匹配,不是在用分子生物学知识做推演。

这就像你请了一个读过几百万篇文献、但没有任何实验经验的实习生。他能在五分钟内给你列出一个靠谱的文献清单,但他没法区分“文献里的说法”和“已经被重复验证的结论”之间的差别。所以跟 AI 协作的正确方式,是让它提供线索和假设,而不是让它提供结论。

4.2 高频翻车场景与现场处置

我把实际使用中遇到的高频问题整理成了一张表,每个问题都附上处理办法:

翻车场景具体表现处理办法
编造数据库编号AI 给了一个看似合理的 GenBank accession,实际不存在所有编号必须回数据库原始页面复核,不直接使用
生成代码有隐患脚本能跑,但大数据量时会内存溢出或死循环先在小数据集上跑通,再扩大规模,逐步验证
混淆同源与功能等价因为序列相似就直接判定功能相同要求它补充系统发育分析,看进化关系而非相似度
忽略数据版本引用的数据版本过时,结果无法复现固定下载脚本版本,记录数据获取时间戳
上下文丢失多轮对话后,它忘了最初的任务限制条件把核心约束写进每轮提示词,不让它“自由发挥”

这张表里的问题,我自己基本都遇到过。最让我印象深刻的是第一个:它曾给出一串看起来十分规范的数据库编号,我拿去一比,发现是它“根据常见格式杜撰”的。从那以后,我所有的数据来源都只信官方检索,不信任 AI 声称的编号。

4.3 怎样给 AI 布置一个“可证伪”的任务

科研的核心是提出可证伪的假设。给 AI 布置任务也是一样,好的任务设计能让 AI 的输出变成可以验证的命题,而不是一堆模糊的描述。

举个反例。你问“这个蛋白是什么”,AI 大概率给你一段“看起来像核酸酶”的模糊描述,这种答案没法验证。但如果你把任务改一下:

请根据已知 Cas 蛋白的 RuvC 和 HNH 结构域特征,逐条检查这个候选蛋白序列,列出它与哪些结构域的匹配度最高,给出每个关键保守残基的位置列表;如果要做点突变验证其是否影响切割活性,请推荐排名前三的突变位点并说明理由。

这样 AI 输出的就不是结论,而是“候选位点 + 理由 + 验证方案”的打包材料,你可以直接拿到实验台上去试。如果实验结果和 AI 预测一致,说明它的推理路径值得信任;如果不一致,你也能精确定位是哪个环节出了问题。

这就是我理解的“可证伪任务”:AI 提供的不是一个最终答案,而是一个可以被实验推翻或支持的假说包。把任务设计到这个颗粒度,AI 辅助科研的效率会明显提升。

5. 如果这波发现走向应用,真正的受益者是谁

5.1 三类应用场景可能最快受益

假设这批类 CRISPR 新酶系统最终被验证有功能,最先受益的场景不会太远。

第一个是基因编辑工具开发。现有工具的三个痛点,PAM 序列限制、脱靶效应、大尺寸蛋白难以递送,任何一个新酶能解决其中一个,就有应用价值。特别是体积小的新酶,在体内基因治疗里是很有吸引力的方向,因为递送载体容量有限,越小的工具越容易进入临床。

第二个是分子诊断。基于 CRISPR 的检测工具,比如 SHERLOCK 和 DETECTR,依赖 Cas 蛋白的特异性切割来实现信号放大。新的 Cas 样蛋白一旦具备 RNA 或 DNA 切割活性,就意味着新的识别位点、新的灵敏度和特异性组合,诊断窗口会扩大不少。

第三个是农业育种。定点编辑、抗病性改良、大片段插入,这些需求一直存在,但现有工具在不同物种里的效率差异很大。新的酶系统可能是那个“在特定作物里效率更高”的趁手工具。

这三个领域有一个共同特点:它们都长期被少数几种工具卡着脖子,而自然界里天然存在的酶多样性,就是突破这些限制的种子库。

5.2 再往远处想一步:AI 从“发现工具”变成“设计引擎”

这次事件让我更在意的一层是:AI 的位置正在从“发现工具”慢慢变成“设计引擎”。

过去我们找到一个新酶,要花很长时间去理解它、改造它,让它变得好用。但在 AI 参与之后,这条流水线有望被大幅压缩。AI 可以从大自然里找原始的类 CRISPR 系统,然后用蛋白质语言模型去预测哪些位点突变能提升活性、降低脱靶,再让实验人员去验证优化后的版本。换句话说,自然界提供一个起点,AI 负责缩短“从起点到可用工具”的旅程。

这个判断目前还只能说是合理推测,毕竟这次发现的系统功能还没被实验证实,AI 设计酶的能力也还在早期。但从 AlphaFold 解决结构预测、到这次 AI 发现新系统,方向已经明确:AI 在生命科学里的角色会越来越接近一个能提出新东西的参与者,而不再只是处理旧数据的工具。

5.3 最后说点个人体会

看到这条新闻时,我想到四个字:效率跃迁。

我做科研那会儿,从数据到假说,全靠一本本文献和一遍遍试错。现在一个大模型能在几分钟内给出我可能要翻几个月文献才能想到的候选方向,而且它给出的还是“带可验证方案”的完整假说包。这个变化对老一代研究者是压力,对新一代研究者则是红利。

我想说的是,AI 发现类 CRISPR 新酶系统、张锋说值得研究,这些都是引子。更值得关注的是一件事:所有手里握着数据、之前不知道怎么开展方向的人,现在都有了从数据里提出假说的新能力。就算不研究 CRISPR,这套“AI 提假说 + 人做验证”的方法也适用。

如果你有兴趣,建议不要只看热闹,直接拿自己手头的数据试一次。先让 AI 给你找几个“异常点”,再亲自去核实每一个。这个过程里你会体验到 AI 是高效的协作者,也会意识到它离真正的科学家还差多少个实验验证的距离。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询