📋 目录
- 🎯 开场:为什么"Coding Agent 是最成功的商业闭环"
- 🔍 一个必须先分清的术语:AI4S ≠ AI4AI ≠ RSI
- ⚡ 为什么是现在:两个前提同时成熟
- 🔬 AI 在科研里的两个角色,别搞混
- 🧪 A-Lab 的硬数据:自动化实验室到底能走多远
- 🔍 实验选择:一个搜索问题
- 🚧 三个真正的卡点
- 🏢 三大实验室的路线差异
- 🏗️ 验证瓶颈这个判断,对企业落地同样成立
- 📋 一个可以直接用的判断清单
- 🎯 写在最后
🎯 开场:为什么"Coding Agent 是最成功的商业闭环"
这期《硅谷101》的切入角度很特别。
主持人问曹原:AI for Science 这几步里,技术上最难的是哪一步?
他几乎没犹豫:verification(验证)。
但他的论证方式是从反方向来的——从 coding 讲起。
曹原的逻辑是这样的:Coding agent 之所以是目前 AI 里最成功的商业闭环、唯一产生指数级增长的形态,是因为它能闭环。
程序员写完一段程序,马上能知道对不对。不用等,不用外部方裁定。就在那个反馈瞬间,用户才敢把整个任务外包给 AI。
科学做不到这一点。科学的验证在物理世界里。
然后是这期访谈里最锋利的一句判断:
如果理想情况下每分钟能拿到一次实验验证,AI4S 就退化成了一个数据生成问题——模型可以无限生成假设、即时验证、即时更新。
所以卡住科学的不是"AI 不够聪明",而是反馈太慢、太贵。
核心逻辑:科学不是"更复杂",而是反馈更贵。
🔍 一个必须先分清的术语:AI4S ≠ AI4AI ≠ RSI
这期节目里曹原把三个常被混用的词做了极清晰的区分,值得单独列出来,因为很多行业讨论就是从概念混淆开始的:
| 术语 | 定义 | 区别在哪 |
|---|---|---|
| AI4S(AI for Science) | 把 AI 当研究员,研究科学问题 | 目标不同 |
| AI4AI(AI for AI) | 把 AI 当研究员,研究AI 自身 | 例如在限定 GPU 预算下提高训练效果、搜索 Transformer 之外的架构、寻找不需要反向传播的优化器 |
| RSI(递归式自我改进) | 模型基于自身输出的反馈不断迭代改进 | 这不是任务,是一种方法——可同时用于 AI4S 与 AI4AI |
这个区分为什么重要?因为RSI 是方法,不是目标。很多公司说"我们在做递归式自我改进",实际上只是在描述一个技术手段,而不是在描述一个可交付的价值。
而 AI4S 和 AI4AI 的区分则决定了商业路径:AI4AI 的客户是模型厂商自己,AI4S 的客户是药企、材料企业、能源公司。后者的销售周期、决策链条、验证要求都完全不同。
⚡ 为什么是现在:两个前提同时成熟
曹原认为 2026 年的爆发有两个前提同时到位:
第一,大模型在数学和编程上的推理能力已经过验证。
第二,agent harness 体系成熟。所谓 harness,就是把工作流一步步串起来的"挽具"——包括记忆管理、工具调用、失败迭代这些基础设施。
这两项能力迁移到科学问题上,模型就可以做三件事:
| 能力 | 对应的科学动作 |
|---|---|
| 推理 | 提出下一个实验假设 |
| 编程能力 | 写代码分析实验数据 |
| 迭代 | 根据异常结果自我修正 |
用曹原自己的话说:“现在就是一个天时地利人和,该到了我们用 AI for Science 的时候了。”
不过要补一句:这个领域并非突然出现。在爆发之前已经有缓慢铺垫——AlphaFold、RoseTTAFold 这一系列模型已经是先行者。
🔬 AI 在科研里的两个角色,别搞混
曹原把 AI 在科研中的角色分成两类,这个区分很实用:
| 角色 | 代表 | 做什么 |
|---|---|---|
| 共同科学家(co-scientist) | Claude Science 这类 workbench | 加速科学家自己的分析与实验设计 |
| 自主发现者 | AlphaFold、AlphaEvolve | 自主发现新算法、新结构 |
而他反复强调一个限制:问题定义仍必须由人给出。
“AI 目前还做不到说自己有这个品位去找出合适的问题。”
他能做的,是把问题结构化——辅助搜索文献、整理假设。
什么样的问题适合交给 AI?
曹原给的三个判据非常干脆:
- 可计算
- 能被干净地建模
- 能被快速验证
AlphaFold 是典型:输入氨基酸序列,输出三维结构,问题定义明确且验证相对容易。
反过来说,"新药到底有没有效"就不满足第三条——不到最后环节很难真正知道效果;核聚变装置设计的实验代价可能极高。
为什么生物制药跑在最前面
这一点值得单独讲,因为答案可能和大多数人想的不一样。
曹原说得很直接:“传统上,生物技术、生命科学和药物发现就是一个巨大的市场——这跟 AI 没关系。”
也就是说,生物制药领先不是因为 AI 更适合它,而是因为它本身就足够值钱:新药研发动辄数年、成本数亿美元,AI 无论加速哪个中间环节还是降低失败成本,价值都巨大。
| 领域 | 市场与价值链 | 流程结构 | AI 可捕捉的价值 |
|---|---|---|---|
| 生物制药/药物发现 | 市场巨大;研发耗时长、成本数亿美元起 | 标准化、数据丰富 | 靶点与分子结构等中间产物已可商业化 |
| 材料 | 市场大但高度碎片化(金属、皮革、生医材料、半导体、稀土各有上下游) | 依应用而异,难标准化 | 价值链过碎,难以整体捕捉 AI 创造的价值 |
| 芯片设计、电池、量子 | 新兴探索阶段 | 尚未成型 | 多处于早期研究 |
“做大容易,做小难”这个判断在这里也成立——材料科学的价值链太碎,你很难用一个标准化流程把 AI 创造的价值整体捞出来。
🧪 A-Lab 的硬数据:自动化实验室到底能走多远
曹原提到的具体参照是 Google DeepMind 与劳伦斯伯克利国家实验室合作的 A-Lab:
17 天内执行了 353 次实验,57 个目标材料中合成出 36 个。
他指出自动化实验室当前的瓶颈在机器人的操作精度与速度。
相比之下,in silico(数字模拟)因为容易衡量进步,进展远快于物理侧。
这个对比很值得记住:我们能可靠度量"进展"的那一侧(模拟)发展快,不能可靠度量进展的那一侧(湿实验)发展慢。而"能不能可靠度量进展"这件事本身,就是科学的核心难题。
他给出的理想测试是一个假设性标准:如果一分钟能拿到一次实验验证,AI4S 就退化成一个数据生成问题。
🔍 实验选择:一个搜索问题
这期节目里有一段技术密度很高的分析,值得完整拆出来。
曹原把"下一个实验做什么"本质上定义为一个搜索问题:
- 每个候选方案是搜索树上的一个节点
- 模型用一个价值函数(value function,即"直觉分")评估节点的潜在回报
- 再叠加**"这条路径已经被采样多少次"的惩罚**
- 在exploitation(深耕当前最好方案)与exploration(探索不确定但可能突破的方案)之间取得平衡
他的类比是:这与后训练中的强化学习机制一致。
这个框架的价值在于——它把"科研选题"这件看起来很玄的事,翻译成了一个有工程解的问题。而 RL 里关于探索-利用平衡的那套方法论,是可以直接借用的。
但紧接着他给了另一条更本质的判断,关于表征(representation):
“如果你没法测量,就没法表征。”
以及一条对做工程的人更有用的原则——表征取决于模型在架构中的位置:
| 模型类型 | 例子 | 角色 | 表征限制 |
|---|---|---|---|
| 通用模型 | GPT、Gemini | “实验室主管”(orchestrator),驱动整个科研流程 | 可内化任何格式的多模态输入 |
| 垂直模型 | AlphaFold、GNoME、MatterGen | 某领域的专家工具 | 只能接受特定格式的表征 |
🚧 三个真正的卡点
卡点一:验证(最大瓶颈)
回到开头的判断。曹原的原话:
“最难,对于 AI for Science,肯定是 verification。它是一个瓶颈,一旦这个瓶颈被打破了,你就可以很快地迭代。”
他的论证里有一个我觉得很关键的层次划分:
coding agent 为什么成功?因为验证是即时的——写完马上知道对错。
科学为什么不行?药物是否有效可能要等上市才知道,核聚变装置的实验成本高到无法反复试错。
AI4S 的迭代速度完全取決于验证速度。
卡点二:因果与元递归
因果建模有悠久的历史(Judea Pearl、Do-Calculus),但曹原认为语言模型目前"不可靠":它对因果的理解依赖于输入的措辞与语序,因为训练资料只涵盖最常见的表述方式。一旦换一种说法、或引入反事实干预(“如果把某个变量调高会怎样”),模型就可能出错。
出路之一是他认同 Yann LeCun 的判断——需要世界模型,让模型的理解独立于语言表征。
他还补充了闭环里常被忽略的一环——元递归(meta-recursive):
模型不仅自己要改进自己的假设,还要改进自己的工作流本身——包括何时更新自己的代码、如何调整 agent harness。
这一条对做 Agent 平台的人特别有参考价值:它意味着"改 prompt"和"改架构"是两种不同层级的迭代,而后者才是真正的杠杆。
卡点三:概念抽象(“最后一英里”)
这是曹原认为更深的那道坎。他给出的判断相当直接:
当前模型擅长在既有知识、定义、定理内部搜索,但难以像顶尖科学家那样抽象出新的数学对象、定义和理论。
他称这种概念抽象能力是 AGI 的"最后一英里",甚至补充说——可能不一定在图灵可计算的范围内。
商业化的判断是分层的:
| 阶段 | 判断 |
|---|---|
| 药物开发的中间产物(靶点、分子结构) | 已经可以市场化了 |
| 以"AI 自主做出诺贝尔奖级发现"为标准 | 至少还需二三十年 |
他还引用了诺奖得主、CRISPR 基因编辑科学家 Jennifer Doudna 的话作为佐证:
“我们也用 AI,但是从 AI 给我们的 proposal 里面,没有一个是我们之前不知道的。”
曹原的转述是:目前 AI 的"发现"多半是在既有知识空间里做排列组合。要同时满足"有创新性"与"可行",是当前模型能力上一个尚未解决的挑战。
⚠️ 需要说明的是:Doudna 这句话是节目转引,本文中未找到她的原始出处或上下文。请把它当作访谈观点的转述,而不是她完整的正式表态。
顺带说一个值得警惕的信号
曹原提到一个当下的现象:数学界已经从"证明稀缺"进入了"证明过剩"的时代——收集未解问题的网站上,每个问题下面堆了几十个 AI 生成的解法,但没有人类专家愿意去验证它们。
他补的那半句更难:一个正确的结果,不自动是一个值得拥有的正确结果。即使自动验证说它成立,仍然要有人理解它、判断它。因为人携带价值判断。
这些问题里可能已经有答案了。缺的只是人类去检查的时间、精力和能力。
这段话的现实意义可能比技术讨论更大:AI 生成能力的提升速度,已经超过了人类验证能力的提升速度。这个剪刀差会在越来越多的领域出现。
🏢 三大实验室的路线差异
节目把 Google、OpenAI、Anthropic 的 AI4S 布局做了对比。这部分对想理解行业格局的人有用:
| 公司 | 布局深度 | 代表动作 | 结构性约束 |
|---|---|---|---|
| Google/DeepMind | 最早、最深、最广 | Alpha 系列、Co-Scientist、Gemini for Science、Isomorphic Labs、A-Lab | Gemini 必须先达到 SOTA,商业优先顺序挤压长期研究 |
| OpenAI | 激进追赶 | GPT-5 白皮书、GPT-Rosalind、GPT-5 + Ginkgo 闭环实验、2027 年自动 AI 科学家目标、Astra 数学模型 | 产品线过长(广告、硬件、企业版);AI4S 团队并入 Codex,押注通用模型 |
| Anthropic | 后发追赶 | Claude Science 平台(2026 年 7 月中旬)、vibe physics、BioMysteryBench、挖角 John Jumper | 尚无垂直科学模型;短期优先在 coding 与上市 |
OpenAI 这条线最值得单独说,因为它最激进也最值得警惕。
原本负责 AI4S 的负责人Kevin Weil 在 2026 年 4、5 月间离职,之后 AI4S 的努力被并入 Codex 团队——等于赌"通用 GPT 模型 + agent 自然会解决科学问题"。但同期 OpenAI 正在扩张广告、硬件、企业版多条产品线。
曹原的判断是:“战略和管理的优先顺序会是问题。”
还有一个细节值得记:Astra 模型在论文中声称解决了 10 个前沿数学问题,但科学界对此有争议——这涉及数学可靠性的问题。
而 Anthropic 的John Jumper(AlphaFold 共同发明人、诺奖得主)加入,被外界看作 Anthropic 终于要补上垂直生物医药模型这块拼图。
不过要注意:这些"布局"的描述反映的是访谈时点(2026 年 8 月)的情况,不是长期定论。半年后再看,优先级很可能又变了。
🏗️ 验证瓶颈这个判断,对企业落地同样成立
聊到这儿可以往企业侧推一步了。
曹原这个"验证决定迭代速度"的框架,跟企业做 AI 落地是同一个结构。我把对照关系列出来:
| 科研的约束 | 企业 AI 落地的对应 | 可操作的设计含义 |
|---|---|---|
| 湿实验慢且贵 → 迭代慢 | 业务上线慢、验证周期长 | 先找出那个"每次都要等三天才能判断对错"的环节,它就是你的湿实验 |
| 一分钟一次验证 = 数据生成问题 | 反馈越快,模型迭代越快 | 投资方向应该是"缩短反馈周期",不是"换更大的模型" |
| in silico 进展快于湿实验 | 离线评测跑得漂亮,一上线就崩 | 因为离线指标容易被优化到失真——你需要线上真实反馈 |
| 表征取决于模型在架构中的位置 | 同一份数据,喂给不同环节价值不同 | 数据要按"给谁用"分层,不是按"从哪来"分层 |
| 元递归:模型改自己的工作流 | Agent 要能改自己的流程而不只是改 prompt | 架构级的迭代杠杆远大于 prompt 级 |
| 探索-利用平衡(RL 类比) | 探索新场景 vs 深耕已知场景 | 要给探索留预算,否则系统只会在已知场景里局部最优 |
| “没法测量就没法表征” | 指标没定义清楚,数据就白采 | 指标定义要前置到采集之前,不是之后 |
最有价值的一条:找到你的"湿实验"
如果把这期访谈压缩成一句可执行的话,就是:你那条业务线的迭代速度,不取决于你用多强的模型,而取决于你的验证要等多久。
这不是抽象判断,是可以直接算的。举两个对照:
| 环节 | 验证周期 | 同等模型下的迭代速度 |
|---|---|---|
| 一个纯代码/规则变更 | 改一行、跑测试、看结果,几分钟 | 快 |
| 一个依赖新数据积累的判断(比如投放素材效果) | 三天 | 慢两个数量级 |
同一个模型、同样的 Agent,迭代速度差两个数量级。差别不在模型能力,在于验证的成本。
这个判断一旦接受,投入方向就变了:
- ❌ 不是"换一个更强的模型"
- ✅ 而是"怎么把这条线的反馈周期从三天压到三小时"——哪怕只是先建立一个能自动出报表的流程
再说一遍边界
SPARK 融合平台在这套逻辑里的位置,是把"数据从哪来、怎么对齐、谁能看到"变成可执行、可追溯的流程——iPaaS 接数据,治理中心把质量校验和口径统一前置到入库之前,全域守卫划权限边界。
而**“多快算一次有效验证”"什么结果算成功"这两个判断,平台做不了。** 这恰恰是曹原说的那类问题——问题定义必须由人给出。
平台能做的是:当专家定义了标准之后,让这个标准被一致地执行,且每一步都留得下痕迹。
标准由专家定,执行和追溯由平台保——这条边界和前四篇讲的完全一致。
📋 一个可以直接用的判断清单
先量出你的验证周期。不是模型响应时间,是"从做出一个改动到能判断它对不对"的完整时间。这个数字决定了你的迭代速度上限。
别在瓶颈上投资。如果反馈要等三天,把模型从 Opus 换到本地小模型不会有任何帮助。要投的是缩短反馈周期。
区分"能不能被快速验证"。曹原的三条判据——可计算、可干净建模、可快速验证——可以直接拿来筛项目。三个都不满足的,别指望 AI 闭环。
警惕离线指标。离线跑得漂亮而线上失真,科研里的对应就是"in silico 进展快于湿实验"。因为前者容易被优化到失真,后者才是真相。
看项目是在"搜索既有知识"还是在"创造概念"。前者 AI 已经很强了(可以商业化),后者还需要二三十年。别把两者的进展速度混为一谈。
留探索预算。如果你的系统只在已知场景里做局部最优,指标会很好看但能力不长进。这在 RL 里是探索-利用问题,在业务里是同一回事。
🎯 写在最后
这期访谈最让我反复想的是那个"Coding Agent 是最成功的商业闭环"的观察。
因为它揭示了一个大部分人忽略的因果链:不是 coding 任务更容易,而是 coding 任务的验证成本足够低。
低到用户愿意把整个任务外包。低到模型可以在几分钟内知道自己错在哪、然后立刻改。
而科学没有这个便利。这不是因为科学"更复杂",而是因为科学要穿过物理世界那一层。
曹原把这个层次讲得很直白:宇宙的基本元素是信息、物质和能量。AI 做数学、做编码都活在信息层;即使 AI 做科学——提出假设、跑模拟——仍然是信息。但要做科学,你必须到达物质层。你必须跑湿实验。
一家公司的一条业务线,跑动的速度不是你的模型有多快,是你的验证有多快、多贵。
这个判断有一个很实际的推论:你最该投资的地方,可能不是模型能力,而是"让验证变便宜"。
自动化实验室、更好的表征、更便宜的材料——这些方向看起来都很"科研",但它们解决的是同一个问题:如何把反馈周期从几个月压到几分钟。
而这跟前四篇讲的东西都指向同一个方向:技术能不能落地,取决于反馈回路的长度,不取决于技术演示的漂亮程度。
触手可及的那个按钮、真实的那一次点击、线上那一条真实的数据、SCI 论文里那一次同行评议——反馈回路越短,迭代越快。这个朴素得近乎无聊的规律,在这五个不同的话题里重复出现了五次。
参考资料
- 《硅谷 101》对话前 DeepMind 曹原:AI for Science 爆发,一个新时代到来了(2026-08-15 上线,片长 109 分钟)
- Silicon Valley 101 Episode 262 官方页面
- A-Lab(Google DeepMind 与劳伦斯伯克利国家实验室合作)实验数据
- Intismeran autogene 三期数据见本系列第4 篇
- 受访者观点为节目口述;文中标注的存疑处(Jennifer Doudna 引语)已说明为访谈转引,未找到原始出处