多做几年研发或者数据工作的人,应该都体会过这种绝望:明明数据库里躺着几万份临床记录,想要的信息却永远找不到;明明某个药物在别的适应症上已经显露出惊人潜力,却被淹没在海量的论文和试验数据里。传统检索工具不是不好,但面对生物医学领域那种指数级增长的信息,人力已经明显罩不住了。
最近Science上有一项工作,把“多智能体AI”这个概念直接拉进了真实的药物研发场景——搞了3.7万多个AI智能体,去梳理55984项临床试验数据,最后还能自动产出新的科学假说。我第一次看到这个数字的时候也愣了一下,3.7万个智能体,这已经不是一个简单的“自动化脚本”,而是一套完整的“AI劳动力组织了”。这篇文章不打算复述论文摘要,我想从一个从业者的角度,把这套多智能体AI方案到底做了什么、怎么做到的、能迁移到什么场景里,一步步拆给你看。
1. 先聊清楚:多智能体AI到底动了药物研发的哪块奶酪
1.1 早期药物研发的“信息洪灾”到底有多严重
先说一个最扎心的现状:药物研发前期的信息整理,至今仍在用相当原始的方式。研究人员要回答一个很基础的问题——“这个靶点跟疾病到底有没有关系”,往往要读几百篇论文、翻几十个数据库、再对照好几套临床试验注册信息。光是读懂一份临床试验记录,就涉及疾病名称、用药方案、受试者条件、终点指标、不良事件等十几个维度的信息,而且这些信息的表述在不同机构之间存在巨大差异。
Commons:同一个药,在一份试验里叫“化合物A”,在另一份试验里可能叫“XX胶囊”,同一类疾病,在不同数据库里可能归到完全不同的编码系统里。人工做这件事,速度慢是其次,更麻烦的是不同人之间标准不一致——今天A研究员标注的“有效”,明天B研究员可能判定为“无效”。这种不一致直接导致早期的假设筛选充满噪声。
这种背景之下,2.6万多个智能体去整理5.6万多项临床试验,本质上是把一个“目录级”的工作变成了“语义级”的工作。系统不是单纯做全文检索,而是把每一条试验记录里谁在研究什么病、用什么药、有没有结果、结果可信度如何,这些要素全部结构化,并且让不同智能体反复交叉验证。
1.2 为什么是“多智能体”而不是“一个大模型硬扛”
你可能第一反应是:难道不能把5万多份资料一次性丢给GPT-4这类大模型,让它输出答案?我自己在项目里试过这条路,结果非常尴尬。上下文窗口再大,塞进几千份文档之后,大模型就开始犯迷糊,前面的信息被后面覆盖,输出的结果会出现明显的“注意力漂移”。而且大模型面对超大规模任务时,你没法精细控制它每一步在做什么,一旦中间环节错了,后面很难排查。
多智能体的思路,本质上是把“一个无所不能的大家伙”拆成“一群各有分工的小角色”。就好比一个公司,不是让某一个人从头干到尾,而是分成研发部、市场部、财务部,每个部门再分小组,各自处理各自擅长的工作,最后通过流程把结果汇总起来。落到药物研发场景里,就是让一部分智能体专门去识别疾病,一部分专门去提取药物信息,一部分专门去做推理验证,各干各的活,谁出错了,定位起来也简单。
这套架构还有一个隐形优势——它天然具备并行性。3.7万个智能体不是排队干活,而是几千个任务同时跑。论文里用55984项临床试验作为输入,假设其中涉及几万个药物-疾病组合的候选关系,如果让一个模型逐个处理,时间和算力都是灾难。多智能体系统把任务切碎之后分发到不同智能体上并行执行,成本反而可控。
1.3 3.7万个智能体里的“角色分工”
我拆解了一下这个系统的工作流,智能体大致有四种角色。
采样智能体(Agent)负责从海量文档里找出与当前问题最相关的片段;提取智能体负责从片段中抽取结构化信息,比如药物名、疾病名、试验结果、样本量;验证智能体负责交叉检查提取结果和原始文本,防止大模型“脑补”;推理智能体负责综合多条证据,评判“某药物对于某疾病是否存在真实疗效信号”。四种角色形成了一条流水线,一份原始文本交替经过“抽取→验证→再抽取→推理”多轮处理,最终变成一条条带证据链的结论。
这当中最让我觉得妙的设计,是让验证智能体和提取智能体互相“挑刺”。提取智能体输出一个结论,验证智能体必须回到原文,把对应信息所在的位置、上下文重新拉出来核对。一旦对不上,就退回重做。这种对抗式校验,是纯单模型方案完全做不到的。
2. 核心系统拆解:从临床试验数据到可行动假说
2.1 两条核心流水线:信息提取与假说生成
这篇Science工作的系统,围绕着两大模块搭建。第一条是信息提取流水线,处理的是“旧信息”——把已经存在的临床试验数据、论文文本,批量转换成结构化表示。第二条是假说生成流水线,处理的是“新信息”——基于提取出来的结构化数据,让智能体去推断那些“还没有被正式验证过的关系”。
信息提取流水线中,系统不是一次性读取所有临床试验数据,而是把数据拆成块,每个块分配独立任务。每个任务由一个或多个智能体负责,通过并行调度把55984项临床试验分批处理掉。每项试验至少经过独立的两轮提取,提取结果不一致时,系统自动发起仲裁,由更高级的验证智能体介入。
假说生成模块则像一个“智能化的大脑”。它把提取出的“药物A→试验B→对应疾病C→有一定阳性结果”这类关系,和外部数据库(比如药物靶点数据库、基因-疾病关联数据库)连接起来,构建一个巨大的知识图谱。然后智能体在这个图谱上进行路径推理,比如“药物A作用于靶点X,靶点X在疾病Y的信号通路里被激活,那药物A是不是有可能治疗疾病Y?”每一条路径都附上证据评分和来源引用。
从工程角度看,这两条流水线最关键的设计是格式统一。无论上游是ClinicalTrials.gov的XML文件、论文PDF还是纯文本摘要,系统都会先统一转成标准格式,再用统一的模板让智能体去填充。没有这一步,后面所有推理都会变成垃圾进垃圾出。
2.2 智能体怎么理解“这场试验该归谁”
这可能是整个系统最复杂的部分。临床试验数据极其混乱。同一个药物在不同试验里可能用不同名称,有的是化学名,有的是商品名,还有的是代号;同一疾病在不同数据库里编码不同。智能体首先要做实体消歧——判断“ABT-888”和“Veliparib”是不是同一个东西。
系统用的是“检索增强生成”方式:当智能体遇到一个无法确认的实体名,它会主动去外部知识库查询,比如去PubChem、DrugBank里比对分子结构或同义词表,而不是靠模型内部记忆硬猜。查完之后,把候选的标准实体名和原始文本中的表述同时提供给后续的推理智能体,由它们裁决这两个表述是否指向同一个实体。
这种“主动查证而不是凭记忆猜测”的做法,我觉得是这套系统能在真实科学场景里站住脚的关键。大模型天生有幻觉风险,如果指望它背下所有药物别名,那一定出错。但如果允许它在不确定时“查资料”,错误率就会大幅下降。
实体消歧之后,智能体还需要判断“这个试验跟当前药物-疾病对匹配不匹配”。系统把这个任务变成一种问答任务:给定一个药物-疾病候选对,比如“奥拉帕尼—胰腺癌”,让智能体去查阅所有相关试验,判断这些试验是支持还是反对这个候选关系。结论以自由文本生成,但必须附带引用编号,读者(或者另一个智能体)可以点开编号去核对原始信息。
2.3 假说生成与证据链构建
提取和匹配做完之后,系统开始进入真正“科研”的阶段——生成新假设。它不会直接说“这个药可以治那个病”,而是会生成一条完整的证据链。
比如系统在整理过程中发现,患某类乳腺癌的患者中,有一批人携带BRCA基因突变,而BRCA突变又会影响到DNA修复通路。如果同时存在一个已知能抑制DNA修复相关酶的药物,那系统就会自动生成一条推理链:“药物X可能因为影响DNA修复机制,对携带特定基因突变的某类肿瘤有效。”这其实是一条相当专业的科研推论,背后涉及基因-蛋白-通路-疾病四级逻辑链的串联。
这个设计最打动我的地方,是它没有要求智能体“无中生有”,而是把所有的推理都锚定在真实证据上。系统每生成一个假说,都会附带“支持证据数”“冲突证据数”“证据质量评分”三组数据。后续如果研究者想跟进,可以直接把假说丢进临床试验设计流程里做预验证,而不是像以前那样靠天马行空的猜想。
2.4 人力在环:为什么不能把它做成全自动
我知道很多人对AI系统的期待是“全自动”——丢进去数据,出来结论。但稍微接触过真实科研流程的人都清楚,自动化的边界必须谨慎。论文里的系统也保留了明显的“人在回路”环节,尤其是在假说生成进入终审阶段之前,需要人类专家对智能体产出的高置信假说做复核。
从平台设计角度看,这其实是三方面的考虑。科学推理涉及因果性判断,目前的AI系统本质上做的还是相关性挖掘,AI认为“药物A和疾病B存在统计关联”,但并不意味着临床上就该给患者用这个药,这种因果跃迁必须由人来把关;数据噪声客观存在,即使有对抗验证,一些来源质量差的试验仍可能带偏结论;监管合规要求,医学相关的任何结论最终要落到人体试验,必须经过伦理和监管审核,AI不能替代这部分流程。
我自己的经验是,凡是宣称能端到端替代人类的AI医疗系统,要么在实验室里自嗨,要么在真实应用时被各种现实问题打脸。好的系统设计,一定是把AI放在“加速探索、放大生产力”的位置,而不是“替代决策、消灭人类”的位置。这篇文章里的3.7万智能体,本质上是帮科研人员把阅读和整理的时间压缩了,让人类把精力放在真正需要创造力的地方。
3. 实操视角:如果我想复现或上手这套思路,该抓哪些关键点
3.1 数据准备与清洗:先把55984项临床试验标准化
看完概念,我们来点能落地的。如果你想把多智能体思路引入自己的数据工作流,第一步一定是数据治理。系统处理5.6万项临床试验之前,做了大量的预处理工作。
临床试验数据的来源通常是不同格式的XML、CSV和PDF,字段差异巨大。有的数据库叫“official_title”,另一个叫“public_title”。我的经验是,第一步先把所有来源统一成JSON格式,并且定义一套内部schema。这步是纯苦力,但没做好后面全崩。
我这边的实操建议是把数据清洗拆成几个子任务并行:字段映射(把不同数据库的字段对应到统一schema)、实体统一(药物名统一到标准名,疾病名统一到ICD编码)、去重合并(同一试验在不同数据库的重复记录合并)、质量分级(区分高质量同行评审数据和低质量注册信息)。这些子任务完全可以分配给不同智能体执行,每个智能体只做一种操作,这样可以大幅度降低出错的耦合度。
参考论文,系统的输入里包含了大量非结构化文档,比如PDF论文全文和临床试验方案书。这类文档的解析比结构化数据库更麻烦。系统采用的是“分块+多轮抽取”,每份文档切分成若干个语义块,让智能体逐块提取信息,随后再做跨块汇总。单文档抽取和跨文档汇总分开,各自独立验证,最后统一进知识库。这个设计在小规模试验中效果不如直接读全文档,但到了几万份文档的规模,分块并行几乎是唯一选择。
3.2 智能体编排的三大件:记忆、工具、路由
如果你现在要自己搭一套多智能体系统,核心就三件事:记忆、工具、路由。
记忆是智能体跨任务保持上下文的机制。比如验证智能体在检查“这个试验结果是否支持药物有效”时,它需要知道前面提取智能体给出的结论是什么,也要知道后边推理智能体如何利用这些信息。记忆不能无限存,实践中一般用向量数据库做短期记忆,用结构化知识库做长期记忆。每次任务开始时,智能体会从长期记忆里拉取相关背景知识,比如标准术语表、历史判断逻辑。
工具是智能体调用外部能力的方式。多智能体的价值很大程度来自工具使用能力。之前的系统里,智能体可以调用查询药物-靶点关系的数据库API,也可以调用检索文献的搜索引擎。设计工具时要特别注意权限分离,不同角色智能体只能调用自己职责范围内的工具,比如提取智能体不能直接调推理接口,否则系统行为会不可控。
路由逻辑则决定了任务怎么分配。路由模块是整个系统的调度中枢,它根据任务类型把请求分发到对应智能体。比如“判断药物-疾病关联”的任务路由到推理组。“验证引用是否准确”的路由到验证组。路由策略在实现上并不复杂,简单场景用规则匹配,复杂场景用分类模型动态决策。
我见过很多人在搭多智能体时,一上来就堆大模型API,不考虑记忆和路由设计,结果系统就像一个没组织过的草台班子,互相之间信息不同步,效率反而下降。真正的多智能体系统,重心不在“智能”而在“组织”。
3.3 质量控制与去幻觉设计
在医学领域,AI幻觉不是“有点瑕疵”,而是原则性错误。论文中系统的质量保障体系,我觉得每个想用大模型处理严肃数据的人值得学习。
首先是“二次独立抽取”。每份临床试验文档不是只交给一个智能体处理,而是由两个独立智能体分别抽取,如果结果不一致,系统会触发仲裁,交第三位验证智能体去原始文档核对。这样能拦截大量无根据的“脑补”。
其次是“引用强制绑定”。输出任何结论,必须附带引用编号。如果一句话没有任何引用支撑,那么这条结论直接判无效。医学数据场景里,我强烈建议你采用同样的规则:允许模型自由表达,但每个表达必须关联一个可回溯的证据源。这会消耗更多token,但换来的是可核查性,非常值得。
第三是“置信度分层”。系统不是对所有结论一视同仁,而是根据证据数量、来源质量、智能体间一致性,赋予不同置信等级。高置信输出可以直接用于假说生成,低置信输出则只作为检索线索,不能进入最终结论。分层的好处是,后续人类专家可以优先审核高置信结果,不用大海捞针。
3.4 评估指标:怎么知道系统真的靠谱
最后聊聊评估。很多做AI应用的人有一种病,叫“感觉良好病”——模型输出看起来还行,就觉得系统没问题。在严肃领域必须把评估指标量化。
论文工作里的评估大概从三方面来看。抽取精度,对比智能体提取出来的药物-疾病-试验结果三元组,和人工标注的黄金标准数据集之间的重合度。假说质量,让领域专家对生成假说的科学合理性、证据充分性打分,这个指标主观性较强,但必不可少。流程效率,衡量同样一批数据,多智能体系统处理的时间和成本相比纯人工方案的节省比例。
实操中我建议你还要加一个“错误模式分析”。不只关注平均准确率,还要看错误集中在哪些场景。比如系统在识别罕见病名称时容易出错,在遇到缩写指标时容易混淆。找出这些薄弱场景,针对性地补充数据或调整提示词,比一味加大算力有效。
这里可以给出一份评估框架参考:
| 评估维度 | 具体指标 | 实现方式 |
|---|---|---|
| 抽取精度 | 实体识别F1、关系抽取F1 | 与人工标注对照 |
| 消歧准确率 | 实体链接accuracy | 抽样人工复核 |
| 假说支持证据数 | 每条假说附带证据链长度 | 系统自动统计 |
| 人类复核通过率 | 专家认可比例 | 专家盲审打分 |
| 端到端成本 | 处理单文档的token消耗 | 统计API调用量 |
4. 落地情景:多智能体药物研发的真实收益与边界
4.1 从乳腺癌到胰腺癌:系统如何发现药物的新用途
论文里有个案例特别值得一提。系统在分析大量乳腺癌临床试验时,注意到某类PARP抑制剂药物在携带BRCA突变的乳腺癌患者身上表现出显著疗效。由于BRCA突变在胰腺癌中也同样存在,系统就自动推理了一条新假说:这种PARP抑制剂是否也可能对携带BRCA突变的胰腺癌有效?
这个推理方向并不新颖,但系统能把它自动化生成,而且是在几万份临床试验中自动筛出来,就很有价值了。对临床医生来说,这种“重新定位”意味着很多已经做完安全性评估的药物,有机会在新适应症上缩短临床前研发周期。
这个案例告诉我们要关注“跨疾病共性机制”,而多智能体系统擅长做的就是高通量筛选这些机制上的相似性。以往这种工作可能需要一个经验丰富的药理学家团队数周的检索和阅读,现在让智能体系统跑一遍,得到候选假说列表,人类再集中精力验证最靠谱的几个。
4.2 对早期研发流程的重塑
早期药物研发的传统流程是:确定靶点、高通量筛选、优化先导化合物、动物实验、临床试验申请。多智能体AI切入的是最前端那个“靶点和适应症论证”环节,也就是“这个病到底有没有药可治、已知药物里有没有能治它的”这个决策点。
这种重塑体现在三个方面。信息获取速度从“周”压缩到“天”,系统可以在一天内完成对几万份文档的全量扫描和结构化;结论可回溯性比以前更强,每个AI判断都有引用清单,团队内部能高效复核;假说覆盖范围更广,以前受人力限制只能聚焦两三个候选方向,现在可以同时让几千个假说并行竞争,按置信度排序。
有些研发团队可能担心这套系统会冲击数据分析师的岗位。从我接触的情况看,工具变革淘汰的是纯搬砖型工作,比如低效的文献摘编和人工比对,但把能把数据解释出价值的人才推向了更高的位置。系统出结果之后,谁来设计验证实验、谁来解读临床意义,这些仍然是高壁垒的人类工作。
4.3 现在的局限:算力、注释与真实世界验证
冷静说,多智能体药物研发离全面落地还有肉眼可见的距离。
算力成本仍然偏高。3.7万个智能体同时运行,背后是大量的token开销。如果系统用在商业药物研发流程里,需要认真算一笔账:是几万美金的机器分析成本划算,还是聘用几个博士做三个月弱人力分析划算。现阶段可能前者略贵,但这个差距在快速缩小。
高质量标注数据的瓶颈也越来越凸显。就算做实体消歧,也需要准确的标准术语库支撑。涉及基因、蛋白、通路这些底层生物学实体时,免费公共库经常更新滞后,商业数据库又很贵。
真实世界验证是最大的边界。系统生成的假说再漂亮,也只是“起点”。从假说到临床获益,中间隔着细胞实验、动物实验、人体临床的层层验证。多智能体AI如果说能帮人类把“前探索”阶段跑得更快更远,这我信;但它不能替代任何一个关键的“后验证”环节。
5. 我的实操体会与避坑清单
5.1 为什么这种研究能到顶刊——做对了哪几件事
最后说点我认为对做同类系统最有启发的地方。这篇Science工作之所以能被顶刊接受,一个很重要的原因是它没有停留在“AI跑出了好结果”的层面,而是把AI系统放进了真实的科研工作流里,并且做到了人类专家可介入、可验证。这是任何AI应用能真正撬动严肃领域的必要条件。
对想在类似方向做点东西的人,我的建议是:永远不要只追求AI的“答对率”,要追求整个系统的“可解释性”和“可信度”。同行评议的人想知道的不只是模型输出了什么,还有它为什么输出这个,证据在哪里,推理路径是否合理。
5.2 几个容易被忽略的坑
第一个坑是把多智能体当成万能药。不是所有任务都需要拆给多个智能体。如果一个任务只有三个步骤,且彼此之间没有并发和交叉验证需求,那用普通RAG方案就行。多智能体的复杂度是实打实的,引入了额外的调度和错误传播风险。
第二个坑是忽略任务之间的依赖关系。在药物数据场景里,抽取错误会直接导致假说推理错误。如果上游智能体的准确率是90%,下游基于上游结果再做推理,即使推理准确率有95%,端到端准确率已经降到85%了。多智能体系统要在每个关键节点设置质量拦截,而不是等最终输出再检查。
第三个坑是提示词层面的“角色扮演陷阱”。很多多智能体框架让你随便定义角色,比如“你是一位资深肿瘤学家”,这种在严肃系统里意义不大。真正重要的是给智能体定义明确的输入输出接口和行为约束。角色设定可以增加拟人感,但替代不了结构化的任务规范。
5.3 这套思路还能迁移到哪些领域
多智能体AI在药物研发里的方法论,其实是可以复用到其他强专业领域的。我想到的几个方向:第一是法律领域,合同审查和判例检索,同样是“文档多、术语细、容错率低”的场景,可以拆出文档解析、条款比对、风险识别三类智能体;第二是金融尽调,从海量财报、公告、舆情中提取风险信号,让不同智能体分别处理数据源,最后汇总成风控结论;第三是科研文献综述,尤其是交叉学科综述,让AI智能体分头读不同子领域的论文,然后合起来跨领域找联系,这条路子对写grant或者做方向预判的人来说可能很实用。
多智能体AI的核心优势恰恰在于“分工”。凡是问题能拆成几个相对独立、又能汇总整合的子任务,且每个子任务有明确的质量标准,就可以考虑用这套思路。药物研发只是它表现最亮眼的一个舞台,背后的组织逻辑,才是真正可以带走的财富。