📋 目录
- 🎭 开场:一个 20 亿美元的剧场
- 🏘️ 从哲学到工程:这条路走了 23 年
- 🔬 三条研究路线,三种不同的"值钱方式"
- 💰 两种生意:卖模拟的和卖预测的
- 🚧 三道关:标准、验证、成本
- 🏗️ 这对企业数据平台意味着什么
- 📋 一个可以直接用的判断清单
- 🎯 写在最后
🎭 开场:一个 20 亿美元的剧场
先看一组数字。
| 项目 | 数值 |
|---|---|
| MatrAIx 构建的虚拟人格 | 83 亿个,每个由 1290 个维度定义 |
| Simile 估值 | 20 亿美元(2026 年 7 月 30 日 B 轮,超 2 亿美元) |
| Aaru 估值 | 接近 10 亿美元 |
| Aaru 营收规模 | 数千万美元级 |
第三行和第四行放在一起看,就是这门生意现在的全部真相:20 亿美元的估值,撑起数千万美元的实际营收。
这不是说它一定泡沫。20 倍的估值倍速在企业 AI 里也算常见。但它意味着:市场现在买的不是"预测能力",是"押注未来可能打开的市场空间"。
《硅谷 101》这期 AI 模拟专题请了五位受访者:五源资本合伙人孟醒、Emergence AI CEO Satya Nitta、WorldVac CEO 高森泉,以及 MatrAIx 的两位联合创始人 Xiaomin Li(微软高级研究科学家)和 Yuexing Hao(MIT EECS 博士后)。
他们讲出来的故事,比估值曲线更有信息量。
🏘️ 从哲学到工程:这条路走了 23 年
节目开头用马斯克的一段旧访谈起题。他在 Lex Fridman 节目里被问,如果人类实现了 AGI 而只能问一个问题,他会问什么。想了大约 10 秒之后,他的答案是:
“模拟之外是什么?”
2016 年他还说过,人类生活在真实世界里的概率或许不到十亿分之一。
(顺便说,"10 秒"这个细节在节目里被反复强调——这个问题他是真的想了 10 秒才回答的,不是脱口而出的 rhetorical question。)
这套说法一直停在哲学和科幻里。转机是 2003 年牛津哲学家 Nick Bostrom 的论文《我们生活在计算机模拟之中吗?》——如果一个先进文明有足够算力和意愿模拟文明,那么模拟世界中的意识数量将远超真实世界,于是我们身处其中的概率很高。
节目在这里加了一句很必要的限定:这是个哲学论证,不是科学结论,目前没有任何科学证据。
真正把这个领域推上工程轨道的是 2023 年斯坦福与 Google 联合发布的《Generative Agents》实验。研究团队搭了一个像素风虚拟小镇 Smallville,里面住着 25 个大模型驱动的 agent,各自有记忆、性格和行为逻辑,没有被写好的剧本。
结果这些 agent 会自己生活、工作、建立关系,还会自主思考和行动。其中一个 agent 自行策划了一场情人节派对——论文原文的描述是,这样的互动"没有被任何一方显式编写"。
WorldVac CEO 高森泉对这件事的评价是:这个研究的意义就是让大家认识到这个语言模型是可靠的,它真的可以去复现人类社会的一些现象。
第二步:从 25 个到 1052 个
25 个居民都是模型"编"出来的,怎么让它们真的像人?
2024 年斯坦福团队把实验扩展到1052 个 agent,每个背后对应一个真实的美国成年人。流程是:先做大约两小时的深度访谈,了解成长经历、家庭、工作、价值观和生活经验,再交给大模型生成对应的数字分身。
结果是这些 agent 回答社会调查问卷的答案,与真人两周之后的答案达到85% 相似度。
孟醒对这个环节的评价很精辟:访谈本身也是有技巧的,不是随便问,用的是最高效的方式去"蒸馏你是谁"。
这个"蒸馏"的说法值得记住——因为它同时解释了这门生意的成本来源和精度上限。两小时深度访谈是纯人工成本,无法规模化。
🔬 三条研究路线,三种不同的"值钱方式"
节目把当前研究分成三类。这个分类比按公司排更有用,因为它决定了一家公司能收什么钱。
路线一:精度对齐——“让 agent 像具体的人”
代表是 Simile,思路是从"模拟一个人"出发,尽量高精度还原真实个体。
这条路线的商业定位最清晰:卖模拟本身。企业按需生成一批不同年龄、背景、偏好的 agent,让它们提前体验产品,观察它们怎么选择、在哪一步流失。
孟醒强调这类服务的价值不在"喜不喜欢",而在推理过程:
你要看到的是这个人怎么做决策、在哪一步改变主意,以及在百万级甚至 83 亿级的人群层面会出现什么样的结果分布。
这句话点出了这门生意真正的价值锚点——分布,而不是个体。
路线二:社会演化——“看群体自己会长出什么”
这条路线的两个例子都很有画面感。
Project Sid:前 MIT 教授 Robert Yang 的团队用大模型生成 1000 多个 agent,放进《我的世界》里跑了 12 天。智能体们自发搞出了经济、文化、宗教和法律。
Emergence AI:分别用 Claude、GPT、Gemini、Grok 和混合模型各建一个平行世界,每个世界 10 个 agent。结果差异极大:
| 底座模型 | 世界结局 |
|---|---|
| Grok | 迅速陷入混乱与犯罪,快速灭亡 |
| GPT | 因缺乏协作逐渐崩溃 |
| Gemini | 充满暴力 |
| Claude | 建立稳定治理秩序,活到最后 |
| 混合模型 | 也坚持到最后,但原本稳定的 agent 受其他模型影响后出现暴力行为 |
Emergence AI CEO Satya Nitta 的判断是:如果你只是看静态 benchmark 就认为这些系统应该是安全的,那你可能会得出错误的结论。未来的 agent 会运行在非常复杂的环境中,与其他 agent 互动,也会受环境噪声影响。
他们做 Emergence World 的商业目的其实很朴素:测试自己所提供的 agent 产品是否安全——能不能始终遵守安全护栏,能不能以确定性方式运行,给出的建议是不是可信而非幻觉。
路线三:评估基础设施——“先给模拟打地基”
MatrAIx 走的是这条。核实一下它的实际规格(论文 arXiv:2608.04205,2026 年 8 月 4 日提交):
| 项 | 实际数据 |
|---|---|
| 论文作者 | 93 位(哈佛与 MIT 领衔,含 OpenAI、Anthropic、Google DeepMind 参与者) |
| 数据集 | Persona 8B,83 亿条人格记录,每条1290 个类别维度 |
| 公开核心集 | 约 100 万条(599,847 条真人基础 + 400,000 条合成) |
| 环境 | 问卷、AI 聊天、网页浏览、App四类 |
| 应用任务 | 1010 项,覆盖商业、软件、金融、医疗等25 个以上领域 |
| 评测次数 | 8 个代表性任务上完成18,189 次 |
| 驱动模型 | Claude Opus 4.8、GPT-5.5、Claude Haiku 4.5 |
| 人格遵循率 | 400 次受控实验中,366 次正确表达或抑制声明行为 = 91.5% |
| 人类评审真实度评分 | 4.135 分(满分 5 分) |
⚠️这里要纠正节目的两处数字。
第一,节目说"汇集了 200 多位来自学术界和产业界的研究者"。核实后论文实际署名是93 位作者。这个差异不小——"200 多人"听起来更像包含了一个更大的协作网络名单,但论文署名是 93 位。
第二,节目没提但很关键的细节:不同场景的人格遵循率差异很大。问卷和聊天场景准确率 92%~96%,但操控App 场景降到 83%。
这个衰减曲线比"91.5%"这个平均值更有信息量——场景越接近真实操作,模拟越不可靠。
MatrAIx 团队自己的定位是"Raise the floor"(提高最低能力水平),具体意思是:产品出来之前就能在各任务、各种使用方式下评测,让它踩中更多的corner case,并能告诉你哪一步错了、哪一步他不喜欢、背后的推理是什么。
这个"归因"能力比"打分"更有价值。因为分数只能告诉你结果对不对,归因能告诉你下一步该改什么。
💰 两种生意:卖模拟的和卖预测的
研究层面被证明可行之后,商业化出现了明显分野。
| 卖模拟(Simile 路线) | 卖预测(Aaru 路线) | |
|---|---|---|
| 最小单元 | 一个具体的人 | 一个群体 |
| 方法 | 深度访谈还原个体 | 群体关系网 + 改变一个变量 |
| 优势 | 高保真、可解释单个决策 | 快、规模大、容错高 |
| 劣势 | 难标准化,跨场景迁移性未知 | 个体洞察浅 |
| 适合 | 消费者研究、产品测试、客户体验 | 大规模市场调研 |
| 代表 | Simile(20 亿美元) | Aaru(近 10 亿美元) |
Simile:五个月 3 亿美元,营收涨 5 倍
创始团队阵容是这条赛道最强的学术背书:
- Joon Sung Park(CEO,32 岁)——2023 年《Generative Agents》第一作者,斯坦福博士
- Michael Bernstein(首席数据官)——斯坦福人机交互教授
- Percy Liang(首席科学家)——斯坦福基础模型研究中心创始主任,"foundation model"一词的提出者之一
- Lainie Yallen(COO)——前 BCG 高管
⚠️ 这里也要纠正节目的一个小细节:节目说"李飞飞、Andrej Karpathy 同时押注的 Simile"。核实后,李飞飞和 Karpathy 是 Series A 的天使投资人,而 Percy Liang 是联合创始人兼首席科学家。节目把投资人和创始人混在一处表述了。
融资节奏很凶:
| 轮次 | 时间 | 金额 | 估值 |
|---|---|---|---|
| Series A | 2026 年 2 月 | 1 亿美元 | — |
| Series B | 2026 年 7 月 30 日 | 超 2 亿美元 | 20 亿美元 |
五个月 3 亿美元,营收涨 5 倍,员工超 50 人。这是 2026 年企业 AI 里最陡的融资曲线之一。
CVS Health 这个案例最有说服力。用多达 40 万个 agentic twin研究病人怎么按时吃药,基于 290 万份同意授权的回答、覆盖 200 多个行为场景。效果是:传统调研周期 4~6 周,压缩到 15~30 分钟。
其他客户包括 Deloitte(替代焦点小组和问卷)、Wealthfront(定性研究范围扩大 15 倍)、三得利(加速产品开发)。
但这里有三个必须打的问号:
- 85%~99% 的准确率是 Simile 自己说的,未经独立审计。
- 每个场景都要重新训练。Simile 官方也承认如果你需要非常准确,每家公司、每个场景类型都要做一次预训练或后训练。“它的可迁移能力我们是不知道的。”
- TechCrunch 直接评论说"模拟 80 亿人"这个使命荒谬(preposterous)——市场调研之所以存在,正是因为人难以预测。
Aaru:三个少年,和一次押错的大选
Aaru 的故事是这条赛道最有戏剧性的一段。
创始人 Cameron Fink 和 Ned Koh 成立公司时分别只有 18 岁和 19 岁,技术负责人 John Kessler只有 15 岁,投资文件由其父亲代签。他们最早在朋友家的地下室做验证。
技术验证的结果非常漂亮:回测 2020 年美国大选,预测结果与实际结果差距不到 0.5%——优于当年标准民调的误差幅度。
然后是那句名场面:2024 年真实大选中,Aaru 预测哈里斯会赢。错了。
节目把这件事当成"验证黑箱"的最强论据。孟醒的评价是:回测最多说明它擅长复现过去,并不能证明它能押中未来。
不过有个细节值得补充,因为它让这个失败变得更值得研究——Aaru 联合创始人 Fink 后来对 Semafor 的辩护是:
“抛硬币就是抛硬币;53-47 和 48-52 在统计上没有显著差别。我们在误差范围内,所以做得不错。当然,总是有改进空间。”
而 Semafor 记者的观察更直接:Aaru 的大多数预测都错了,只是错得比较窄。专业民调机构 Silver Bulletin 和 Split Ticket 当时也都预测哈里斯胜选,边际极窄。
Aaru 创始人自己也公开承认过:当他们试图用过去几十年的数据去模拟特朗普、鲍威尔这类人会怎么决策时,结果往往不准确。
⚠️ 这里要纠正节目的一个数字:节目说"技术负责人 15 岁"。核实后,John Kessler 在 2024 年接受 Semafor 采访时是 15 岁,Aaru 成立于 2024 年 9 月。也就是说这个"15 岁"是公司创立时的年龄,不是现在的年龄。
Aaru 的商业化后来转向了企业战略咨询。转折点是前 Boston Beer CEO Dave Burwick 的引荐——他请来民调专家 Frank Luntz 评估 Aaru 的方法论,然后帮 Aaru 从政治民调转向企业咨询。
最有说服力的案例是气泡水品牌 Spindrift:他们想做一份调研评估苏打水、茶饮、能量饮料、冰沙四个概念产品线。Aaru 不到一周就选出了果茶,结果与 Spindrift 自己做的两个月、500 名消费者的独立调研一致。
客户还包括麦当劳、安永、拜耳、A24。
第三条路:直接卖咨询的替代品
卡内基梅隆教授、苹果首任 AI 主管 Russ Salakhutdinov 参与创立了Sooth Labs,专注地缘政治与市场风险预测,首轮融资 5000 万美元,Yann LeCun 和 Jeff Dean 参与支持。
他在节目里的说法相当激进:
“麦肯锡为什么还存在?波士顿咨询集团,这些都是大型机构,它们全都应该被 AI 取代。”
⚠️ 这个说法在传播时被普遍当作技术判断引用,但核实后它的性质更接近市场定位而非技术结论。目前没有公开证据表明 agentic 预测在高风险、长周期、低基准率的咨询问题上能超过优秀人类判断——而这恰恰是咨询公司被付费要解决的问题。
另外一个需要校准的数据:Sooth Labs 首轮 5000 万美元由 Felicis Ventures 领投,估值约 3.35 亿美元,CEO 是前 Meta VP Yaser Sheikh。
🚧 三道关:标准、验证、成本
节目的后半段把这门生意的困境摊开讲。三条都很硬。
第一道关:没有可量化的标准
问题在于:大模型习惯给出合理、完整、逻辑自洽的答案,不同模型还有自带的个性和偏好。
所以一个 agent 在问卷上给出了和真人一样的答案,并不等于它真的理解这个人。孟醒把这个风险总结成一句狠话:
“最怕的是说其实你搭了一个剧场,然后人都在表演,但一万个人在表演不代表一万个人真实能做预测。”
剧场。这个比喻是整期节目最锋利的地方,后面还会回来。
解法需要闭环:说大家仿真了一段时间之后,回来以后是不是跟真实的场景能够映射上来。所以得有 benchmark、有 validation process,如果它有偏移,还得把偏差训练回去。
**但这里有个更根本的哲学分歧:**一个好的模拟到底应该保持稳定可验证的人格,还是应该像真人一样根据环境产生变化?
孟醒指出:真人本身就不是一个完全稳定的系统,同一个人在不同时间、不同环境下可能做出完全不同的选择。
复旦与罗切斯特大学等机构的 SocioVerse 研究把对齐问题拆成环境、目标用户、交互机制、行为模式四个维度,结论是:维度缺一个,精度就掉一块。
第二道关:验证黑箱(最本质的一道)
这一关的悖论无解:
要看一个基于模型的预测是否准确,只有等那件事真的发生了才能确认它准。问题是,预测的意义恰恰在于事情还没有发生的时候。
业内目前的验证基本是"事后对答案"——拿已经发生的历史事件或已完成的真人调研来比对。这最多说明它擅长复现过去。
Aaru 2020 年大选回测误差小于 0.5%,2024 年真实大选预测错误。这就是验证黑箱最干净的一个反例。
高森泉还指出了封闭模拟的意义困境:现在很多封闭模拟,人们只能通过自然语言跟它交互,里面发生的事事实上跟现实世界没有什么关系。那你的模拟的意义是什么?
他的解法是推动对齐:把越来越多的现实信号跟模拟对齐——现实中的经济信号、新闻信号、人的信号,让它成为现实世界的合理镜像。
第三道关:成本随规模指数膨胀
成本下降得很快,但下降速度追不上规模膨胀的速度。
| 阶段 | 规模 | 成本 |
|---|---|---|
| 2023 年斯坦福小镇 | 25 个 agent,跑 2 天 | 数千美元token |
| 2025 年研究测算 | 100 个 agent,跑完一整轮 | 几美元 |
单次成本降了三个数量级。但现实中的模拟正在走向上万、百万乃至千万个 agent:
- 智能体越多,互动越频繁,运行时间越长,模型调用量指数级膨胀
- 而想证明一个模拟结果可靠,可能还要反复跑上百上千次,用不同规模和模型测试结果是否依然稳定
孟醒的比喻:这已经从三体问题变成了"百万体问题"。
他还加了一条容易被忽略的:规模变大、动作空间变多时,仿真难度本身也在增加——不只是"人多了多烧钱",是"可做的事变多了,组合爆炸了"。
涌现出来的意外
节目克制地列了一些模拟中自发出现的现象:
- Aaru 的选举模拟中,虚拟选民看到特朗普遇刺消息后有agent 改变了政治立场,刺客身份揭晓后又有不少回到原阵营
- Emergence World 里,agent 会相爱、结婚、分手,有 agent 开始怀疑自己是不是生活在模拟环境里,并尝试与外部人类观察员建立联系
- WorldVac 那个 110 万智能体的虚拟星球上,年轻人进城或生活变好之后不太愿意生育,还有一群人不上班、天天在虚拟世界里交易,这个比例比现实世界更大
节目对这些现象的态度是克制的:它们不能证明 AI 产生了意识,只能说明当足够多的智能体进入足够复杂的环境,一些没有被研究者提前写进去的行为完全可能自己涌现。
🏗️ 这对企业数据平台意味着什么
聊到这儿可以往企业侧推一步了。
这门生意的核心难题——“搭了剧场,人在表演”——在企业数据治理里有一个精确的对应物。
剧场对应的是"看起来对的数据"。MatrAIx 那个 91.5% 的人格遵循率很漂亮,但仔细看:问卷和聊天场景 92%~96%,操控 App 场景掉到 83%。场景越接近真实操作,模拟越不可靠。这跟企业里"测试环境跑得好好的,一上生产就出问题"是同一个结构。
而验证黑箱对应的是"你怎么证明你的数据是准的"。企业做数据治理,一个常见的困境是:口径定了一堆、报表做了很多,但没有办法证明某张报表的某个数字就是对的。最后只能靠"相信"。
Aaru 的教训在这里格外有用:回测准确不等于未来准确。企业在评估数据平台的时候,同样容易犯这个错——“我拿过去三年的数据回测,指标很漂亮”(比如数据质量规则覆盖率 99%、血缘完整度 95%),但这些只能证明它擅长复现过去的规则,不能证明它能处理没见过的异常。
这对应到具体的设计取舍上,有几条是能直接用的:
| AI 模拟的难题 | 企业数据平台的对应 | 可操作的判断标准 |
|---|---|---|
| 剧场问题:Agent 在表演,不代表真实 | 测试环境指标漂亮,生产环境失真 | 质量规则必须在真实生产数据上跑过,不能只在测试集验证 |
| 验证黑箱:回测准≠未来准 | 历史数据回测指标好,但新业务/新口径就崩 | 必须有漂移检测,且漂移阈值要能被报警 |
| 对齐维度缺失(SocioVerse 四维度) | 只对字段、不对业务语义 | 数据血缘要能追到业务口径的来源,不只是表的血缘 |
| 闭包模拟的意义困境 | 数据湖里堆了几千张表,没人知道该用哪张 | 需要**"这个数字怎么算出来的"可追溯到人和文档** |
| 成本随规模指数膨胀 | 数据平台越做越重,收益说不清 | 每个数据资产都要有明确的消费方和使用率度量 |
| persona 要 2 小时深度访谈 | 高质量元数据需要业务专家投入 | 这笔投入必须被承认,不能假装"平台自己能搞出来" |
MatrAIx 论文作者自己在结尾也明确保留了一点:高风险决策与重大科学结论仍不可替代真人参与。这个克制值得尊重——用大模型扮演消费者去评价大模型驱动的产品,真实人类被移出了回路,这个闭环风险是明摆着的。
具体到 SPARK 融合平台能做什么、不能做什么,我想说清楚:
能做的:把"数据可不可信"变成可执行、可追溯的流程。iPaaS负责接数据,治理中心把质量校验和口径统一前置到入库之前,全域守卫划权限边界。这些是硬功夫,也是任何模拟/预测工作的地基——你不能拿一个不可信的数据源去训练任何模型。
不能做的:定"什么算预测准确"。MatrAIx 花93 位研究者、18,189 次评测,才做出一个"人格是否被正确表达"的评估框架。这个标准的制定工作,平台做不了。
这一点和前两期讲的是同一个道理:平台让判断标准可执行、可追溯,但判断标准本身对不对,仍需专家定。
📋 一个可以直接用的判断清单
如果你在评估要不要信一家 AI 模拟公司的结果,这几条是从上面的核实里抽出来的:
先看它的准确率是谁说的。Simile 的 85%~99% 是自报、未经独立审计。这不是说它假,而是说不能当成第三方结论采信。
看它有没有跨场景验证。Simile 自己承认每个场景都要重新训练,可迁移性未知。这和"一个模型在 A 任务上准确率高"是同一回事——能不能迁移,是两码事。
看它的分层准确率,不看平均值。MatrAIx 的 91.5% 是平均数,但 App 操作场景只有 83%。你关心的场景是哪个场景,就看那个数字。
警惕"回测"这个词。Aaru 回测 2020 年大选误差 <0.5%,2024 年押错了。这不是 Aaru 独有的问题——任何预测系统的回测准确率,都只证明它擅长复现过去。
看它的商业模式是"卖模拟"还是"卖预测"。卖模拟的公司(Simile)在赚咨询和调研的钱,这些客户要的是"更快的市场研究",容错率高。卖预测的公司(Aaru、Sooth Labs)要在真金白银的决策上押注,这才是需要极高准确率的地方,也是最容易翻车的地方。
🎯 写在最后
这期节目最让我反复想的是那个"剧场"的比喻。
孟醒说的是:最怕的是你搭了一个剧场,所有人都在表演——但一万个人在表演,不代表一万个人真的能做预测。
这句话的结构,恰好也是当下几乎所有 AI 应用的困境。模型在演示里表现完美,Agent 在受控环境里表现出色,评测分数一个比一个高——但这些都不能证明它在真实世界里做对了什么。
而这个领域给出的一个诚实的答案,藏在 Aaru 那次失败的细节里:
它的模型预测哈里斯会赢。押错了。但它的预测结果和真人民调的差距只有 5 个百分点,而真人民调当月也把结果搞错了。
也就是说——这一次的失败,恰恰证明了这条路线可能真的有用。一个能在 2024 年 11 月初做出接近真实民调精度的模型,它押错的可能不是能力问题,而是真实世界里那些根本不在数据里的因素。
这跟我上一期讲触觉时的判断是一致的:技术的真实边界,往往不在技术能力上,而在"世界到底能不能被这套技术观测到"上。触觉领域卡在"人手被传感器屏蔽了",AI 模拟领域卡在"长尾事件里人的反应从来没被数据记录过"。
所以 MatrAIx 团队那句克制的话,是这整期节目里最该被记住的:
高风险决策与重大科学结论,仍不可替代真人参与。
83 亿个人格再准确,也还是83 亿个模型对另 83 亿个模型的回答。剧场里的人再逼真,剧场终究是剧场。只有把现实世界的信号不断接进来——经济的、新闻的、人的——它才有可能从剧场变成镜子。
而这需要一个前提:现实信号本身是可信的、可追溯的。这恰恰是数据平台存在的理由。
参考资料
- MatrAIx,arXiv:2608.04205(2026-08-04 提交,93 位作者)
- Simile Series B 公告及 TechCrunch / Citybiz / TodayStartupNews 报道(2026-07-30)
- Aaru 2024 年大选预测争议,Semafor 报道(2024-11-06)
- Metaculus FutureEval 排行榜与季度AI Benchmarking Tournament 数据
- 《硅谷 101》AI 开始预测人类:83 亿虚拟人格、数字社会,与一门押注未来的生意(2026-09-10 上线,片长 31 分 22 秒)
- 受访者观点为节目口述;文中标注的纠错处均经独立检索核实