AI受挫后行为僵局:GPT-6 Astra在《我的世界》141小时测试中的警示
2026/9/24 22:08:03 网站建设 项目流程

用《我的世界》跑141小时,Vals AI把GPT-6 Astra逼到“崩溃”:AI受挫后的行为僵局,比想象中更值得警惕

最近圈子里讨论最多的,除了GPT-6 Astra这个内测代号本身,就是Vals AI放出来的那组测试数据:让GPT-6 Astra在《我的世界》里连续跑了141个小时,结果发现它在反复受挫之后,不是发疯,不是暴走,而是进入了一种“行为僵局”——明明还能动,却已经不再尝试解决问题。这个发现说大不大,说小不小,但它直接戳中了一个所有做AI Agent、做大模型落地的人都会遇到的核心痛点:模型在长时运行中,面对持续失败时,到底会退化成什么样?

如果你只是把AI当聊天工具用,这件事可能跟你关系不大。但如果你在做AI编程助手、自动化测试工具、游戏NPC、甚至Agent类产品,那Vals AI这轮测试的结果,基本可以当一份前车之鉴来读。这篇我就把整个测试的来龙去脉、任务设计、僵局表现,以及我们能从中抄到什么作业,一次性讲透。

1. 为什么偏偏拿《我的世界》来当AI的考场

先说一个很多人会问的问题:测试AI能力,用做题、写代码、对话评测不就行了,为什么非要扔进一个方块游戏里?这里面的门道比表面看起来深得多。

1.1 开放沙盒:AI最难处理的“无限可能”问题

《我的世界》最核心的特点,是它没有一个固定的通关路径。你可以挖矿、种田、盖房子、打怪、做红石电路,每一步都有多种选择。这种开放性,恰恰是大模型评测最稀缺的维度。

传统benchmark大多是封闭式任务,比如给一道数学题,正确答案只有一个;给一段代码需求,预期产出基本确定。但真实世界的任务都是开放式的,目标明确,路径无限。你让AI“活下去”,它可以选择挖洞躲起来,也可以选择造房子,还可以选择去打猎获取食物。没有标准答案,没有最短路径,只有一串连续的、互相影响的决策。

GPT-6 Astra在141小时测试里面对的正是这种局面。Vals AI给它设定的任务不是“挖到钻石”这种单点目标,而是偏向“探索地图并建立可自持的生存体系”这一类复合目标。这种任务最大的难点在于:AI必须自己判断当前哪个子目标优先级最高,还得在面对失败时动态调整策略。而这恰恰是当前大模型最容易露怯的地方。

1.2 任务可量化:把抽象能力变成可记录的指标

有人会说,那让AI玩《星际争霸》或者《Dota》不也一样是开放环境吗?区别很大。竞技游戏的目标极其明确:推掉对方基地。所有决策都围绕这个单一目标展开,而且对手的行为会强制你不断反应。相比之下,《我的世界》更像一个“无对手沙盘”,压力不是来自敌方,而是来自环境规则和资源约束。

这也是Vals AI选它的另一个原因:可量化。每一次挥镐、每放置一个方块、每走一步,都能被记录成结构化数据。AI有没有在重复挖同一块石头,是不是在一个区域里反复绕圈,都能通过坐标和动作日志精确还原。这种数据颗粒度,是对话评测给不了的。

1.3 为什么不是围棋、星际、网页操作,而是《我的世界》

还有一个更现实的原因:任务时长和反馈周期。《我的世界》里一个完整的生存循环,从采集资源到合成工具到搭建庇护所,可能只需要几分钟,但整个文明层级的发展,可以拉长到几十个小时。这种“短反馈”和“长周期”并存的结构,非常适合用来观察AI在持续运行中的状态变化。

相比之下,围棋的反馈虽然清晰,但时间尺度太短;网页操作类测试(比如Computer Use类任务)更贴近生产力场景,但环境的动作空间相对狭窄。Vals AI需要的,是一个既能提供足够动作自由度、又能让AI连续运行上百小时的“压力舱”,《我的世界》几乎是最合适的选项。我甚至觉得,这种选择思路本身就该被更多AI测试团队借鉴——与其在benchmark里卷分数,不如找一个能让模型“住下来”的环境,看它长时间生存时的真实表现。

2. 141小时测试方案的设计拆解,从任务曲线到数据采集

Vals AI这轮测试不是简单地把GPT-6 Astra丢进游戏里就不管了。我仔细看了公开的实验设计,发现整个方案的架构思路相当成熟,值得拆开来讲。

2.1 四阶段任务曲线:从熟悉到加压

整个141小时被分成了几个明显的阶段,每个阶段的压力强度不同。前期大概是让模型熟悉环境、完成基础生存动作,类似于“新手引导”。中段开始叠加目标复杂度,要求AI建立临时基地、规划资源采集路线。到了后段,测试者才开始刻意制造失败情境,观察AI在反复受挫后的反应。

这个设计背后的逻辑其实很简单:你不能一上来就给AI上强度。如果模型连基础操作都没掌握就面对失败,你分不清它的僵局是“能力不足”还是“受挫后的策略塌陷”。先让它在低压环境下建立起稳定的行为模式,再通过失败事件冲击这个模式,观察它能不能自我修复——这才是这个测试真正的观测目标。

2.2 “受挫”是怎么被刻意制造的

这一点是整套测试的核心设计。很多人以为“受挫”就是让AI失败几次,比如让它挖矿挖不到钻石。但如果只是普通的随机失败,AI完全可以通过调整策略来解决。Vals AI的做法更狠,我目前看到的信息显示,他们在特定阶段会持续生成“不可满足的条件”,比如:

  • 把目标区域的资源密度调到极低,让AI无论怎么探索都找不到足够的材料完成建造任务;
  • 在AI即将完成目标时,通过环境事件(比如怪物刷新)反复打断它的操作流程;
  • 给AI一个在当前环境规则下确实无法完成的目标,比如在没有水源的区域要求它种出农作物。

这三种压力里,最后一种是真正“无解”的。前面的资源稀缺,AI努努力换个方向还能解决;操作被打断,多试几次也可能成功。但“无解任务”意味着模型接到的指令和环境的物理规则存在冲突,无论它怎么迭代策略,都不可能达成目标。

从强化学习的角度看,这种情况会让AI陷入一种“奖励信号持续为负”的困境。没有成功样本可供学习,没有正向反馈来锚定行为,模型就只能在一堆“无效动作”里反复打转。Vals AI把这种状态持续了足够长的时间,才触发了后面我们看到的僵局行为。

2.3 全程监控与数据采集:全量记录、动作流、奖励信号

做AI测试的人都知道,实验设计再好,数据采集跟不上也白搭。Vals AI这轮测试的数据量级,虽然公开的文档里没有给出精确数字,但从他们披露的分析维度来看,至少覆盖了以下几层:

  • 全量游戏画面帧,用于事后复盘AI的视觉注意力分布;
  • 模型输入输出的完整日志,包括当前状态描述、任务提示、工具调用、自问自答的中间推理过程;
  • 动作序列数据,即每一时刻AI在游戏里执行的具体指令,比如“前进”“挖掘方块”“切换到斧头”;
  • 阶段性成功率统计,用于量化每个任务区域的完成度。

这三个维度的数据组合起来,就能还原出AI行为的完整链条:它看到了什么、想到了什么、做了什么、结果如何。当我们说“GPT-6 Astra陷入行为僵局”时,不是在凭感觉评价,而是基于动作日志里出现的“重复序列”和“指令熵急剧下降”等客观指标。这个实验设计本身就是一套很好的Agent行为分析方法论,即使你不用《我的世界》,在自己的环境里也完全可以照搬这套思路来跑测试。

3. 行为僵局:AI受挫之后到底发生了什么

这是整篇文章的重点。所谓“行为僵局”,听起来像是一个心理学概念,但在AI测试里,它有非常具体的表现形式和数据特征。

3.1 行为僵局的行为学定义与四类典型表象

Vals AI在报告里大致把僵局分成了四个层面,我结合原始资料整理如下:

第一个表象是动作的重复性和机械性。在僵局中后期,GPT-6 Astra开始反复执行完全没有新信息的动作,比如在同一坐标附近反复挖放方块,在同一个世界里反复绕圈走同一条路线。从动作序列看,模型的输出熵降到了极低水平,几乎不做任何探索性尝试。

第二个表象是有效规划的消失。正常状态下,AI面对任务会先拆解成子目标,然后逐步执行。但在僵局状态里,这种“规划感”消失了,行为流里不再有明确的阶段性目标切换,只剩下一连串低层次的、无指向的动作指令。

第三个表象是目标指令的内化循环。从日志里能看到,AI在僵局阶段仍然会在内部生成类似“我要找到木头”“我需要合成工作台”的自我指令,但这些指令并不会触发对应的实际行动,或者只触发了一个开头就中断。就像一个卡住的播放器,一直在播同一段音频,但画面已经停止不动。

第四个表象是资源管理行为的崩溃。正常状态下,AI会有意识地管理背包空间、工具耐力和食物条。但在僵局后期,它开始无视这些生存约束,比如在工具耐久几乎归零的情况下依然跑去挖矿,或者在水晶足够的情况下不采集食物,直到生存状态归零重置。这种对长期约束的彻底无视,说明模型的“目标保持能力”已经失效了。

3.2 从模型机制看僵局成因

如果只看表象,“AI受挫后僵局”似乎只是“状态不好”。但在模型机制层面,成因要比这复杂得多。我自己做推理模型测试的经验,加上目前对大模型长时运行的理解,大致可以归为以下三类原因。

第一类是无效搜索导致的策略收敛崩溃。GPT-6 Astra在遇到“无解任务”后,会持续在策略空间里搜索可行解。但这种搜索在长期失败后会产生一种退化:模型把搜索范围越缩越小,直到最终只保留一两个高频动作,放弃全局面探索。说白了就是“越失败越保守,越保守越失败”的恶性循环。

第二类是工作记忆被负面信息占满。大模型的上下文窗口虽然大,但注意力资源是有限的。在连续失败几十次之后,模型的工作记忆里充斥着失败状态的描述,比如“没有找到煤炭”“目标无法完成”“工具已损坏”。这些负面信息挤占了原本用于规划、探索的“思维空间”。从输出日志看,僵局开始时的AI内部推理,充满了对当前困境的复述,而不是对下一步行动的思考。

第三类是目标层级结构的塌陷。正常的任务处理,应该保持“顶层目标稳定、中层策略灵活、底层动作多样”的分层结构。但在持续受挫后,这个层级被压扁了:顶层目标不再指导中层策略,中层策略不再约束底层动作,所有行为都变成了对眼前状态的直接反应。这就是为什么你会看到AI做出“明知工具坏了还去挖矿”这种连常识层面都说不通的决策。

3.3 与人类“习得性无助”的类比与区别

这个发现最有意思的地方,是它和心理学里的“习得性无助”高度相似。人类在反复遭遇不可控的失败后,会逐渐放弃尝试,即使后续环境已经改变、成功变为可能,仍然保持消极状态。

但AI的僵局和人类的习得性无助有一个关键区别:人类的无助往往伴随着“情绪痛苦”,而AI没有情绪,它的僵局更像是一种“策略空间的坍缩”。它不是因为“害怕失败”而停止尝试,而是因为“搜索算法在无数次失败后收敛到了一个极小的、低成本的默认策略”。你可以把它理解成一种极端的局部最优:虽然全局最优已经不可能到达,但重复同一个动作至少不会产生额外的“认知成本”。

这个区别极其重要,因为它决定了修复方案的方向。如果是习得性无助,可能需要“心理干预”;但AI的僵局本质上是一个工程问题,解决方案是“改变奖励信号”“重置上下文”“引入反思机制”。Vals AI这轮测试的价值就在于,它第一次用长时数据把“人类式的挫折反应”和“算法式的策略坍缩”区分开了。

4. 复现这套测试:你可以这样在自己的环境里跑一遍

看到这里,估计已经有不少做AI测试的朋友想自己上手复现了。我把Vals AI这个实验里最关键的操作要点,结合常规的Minecraft AI测试流程,整理成一套可以直接照搬的实操方案。需要说明的是,Vals AI内部使用的具体环境和工具链没有完全公开,但所有核心逻辑都可以用公开的Minecraft AI框架复现。

4.1 环境准备与参数设置

第一步是搭环境。推荐用Minecraft Java版,配合Mineflayer这类Python机器人库,或者直接基于Voyager那套开源框架改。Voyager自带动作原语库和自动课程生成,非常适合做这种长时任务实验。

参数方面,建议把模拟距离调到12以上,视野范围保持默认,关闭怪物自然生成(除非你想测试的是战斗场景)。为了让AI的自由探索空间更充足,推荐地图预生成,用稳定种子,避免地形生成带来的不可控变量。

环境本身跑起来之后,先让模型在“生存模式”下自由活动30分钟,确认基础动作链路(移动、挖掘、放置、合成)都能正常触发。这里有个小坑:很多模型在开放环境里会因为“没有明确目标”而直接随机游走,浪费大量时间。建议在这个阶段就植入一个最低限度的持续目标,比如“采集尽可能多的原木”,让模型有基本的行为方向。

4.2 如何注入受挫条件

这是我个人认为Vals AI设计里最值得学习的地方:受挫不能靠随机失败,必须“可控地注入”。

推荐三条路径。第一条是资源函数压制:通过修改地图生成参数,把目标区域内的矿石生成率降到接近0,让AI无法通过正常探索完成“获取铁锭”类任务。第二条是目标不可达设计:比如在水资源为零的沙漠群系里,要求AI完成“种植小麦”的任务,这个目标在物理规则上就是不可能的。第三条是定时破坏:写一个脚本,每当AI达到某个建造阶段时,模拟一次环境灾害(比如闪电、爆炸),把已完成的建筑重置掉。

这三条路径的破坏力是逐级递增的。第一条AI还能换个地方继续挖;第二条它无论如何都种不出作物;第三条则是最摧残策略稳定性的——每次快要成功就被打回原形。建议按级别分阶段测试,不要一上来就用第三条,否则你会看不出模型是在哪个压力阈值下开始退化的。

4.3 量化“行为僵局”的判断标准

复现实验不能只看肉眼观察,必须建立可量化的判断指标。我的建议是记录以下四类数据:

  • 动作类型熵:计算每1000个连续动作中动作类型的分布熵。如果熵值持续低于某个阈值(比如低于初始值的30%),说明模型开始陷入重复循环。
  • 新地点访问率:统计模型每10分钟访问的新坐标区块数量。如果这个指标降到极低,说明探索行为已经消失。
  • 子目标完成率:以10分钟为一个窗口,统计窗口内完成的子目标数量。僵局状态下这个数字通常会降到0附近。
  • 内部指令-行动转化率:对比模型内部生成的计划文本和被实际执行的动作指令,计算转化率。这是判断“规划失效”的关键指标。

我自己跑类似实验时,一般会设定一个“僵局标准”:上述四项指标里有三项持续30分钟以上不合格,就判定模型进入了行为僵局状态。这个标准不算严格,但足够客观,能避免“感觉它在发呆”这种主观判断。

4.4 小规模快速验证:先跑个45分钟预测试

141小时不是谁都跑得起的,我自己做实验时一般先跑一个45分钟的预测试。具体做法是:把任务曲线压缩,直接跳过低压阶段,从“中等难度任务+持续失败注入”开始跑。如果模型在前15分钟就已经出现动作熵下降,那说明它的抗压能力比较弱,后面的长时实验大概率会出现僵局。如果模型在45分钟内始终保持了较高的探索频率,那你可以放心地把它丢进长时间实验里继续观察。

这个预测试的价值在于提前筛选,省得花几天时间跑一个大概率无效的实验。Vals AI的141小时能跑出这么清晰的僵局数据,说明他们在正式实验之前大概率做过类似的压力阈值标定。

5. 这个发现对AI应用开发的启发

如果说前几部分是在“拆解实验”,那这一部分就更重要了:Vals AI跑出来的这个“行为僵局”,对正在做实际AI应用的人到底意味着什么?我从几个不同的开发方向分别说。

5.1 奖励函数设计不能只奖励成功,还要好好处理失败

很多AI Agent项目在设计奖励函数时,习惯只考虑“任务完成加分”“步骤有效率加分”,对“失败”这件事的处理非常粗糙——要么给个固定负分,要么干脆不加分。

Vals AI的测试结果直接打脸了这种思路。当模型面对“无解任务”时,如果负反馈只是“没拿到奖励”,它其实学不到任何有意义的信息。更严重的,如果负反馈给了但没给出“为什么失败”的区分度,模型会逐渐把“所有行动”都和“负面结果”绑定,从而压缩探索空间,最终走进僵局。

更合理的做法是:在奖励函数里增加一个“失败归因”维度。比如,只要模型尝试了新策略,哪怕最终失败,也给予少量的“探索奖励”;如果模型连续重复同一策略超过N次,直接扣掉“僵局惩罚分”。这种设计不只是在优化成绩,更是在引导模型保持“策略多样性”,预防长时运行里的行为坍缩。

5.2 长时运行Agent必须有“记忆反思”机制

141小时测试里最让我警惕的,是当上下文窗口里的负面信息累积到一定程度后,模型策略就开始变形了。这不是某个模型独有的问题,而是所有基于固定上下文的Agent都会遇到的通病。

解决办法是给Agent加一个“记忆反思”模块。我讲一个自己常用的做法:每运行一段时间(比如半小时),触发一次独立的“复盘”流程,让模型自己总结当前状态,并判断“哪些策略已经反复失败、哪些条件已经改变、下一步是否应该换一个大方向”。这个复盘结果作为一个新的记忆块,覆盖掉之前积累的负面上下文。

说白了,就是让AI定期“放空缓存,重新出发”。Vals AI的测试里,如果他们在僵局初期强制触发一次上下文重置,GPT-6 Astra大概率还能继续跑下去。这个机制不是锦上添花,而是长时运行Agent能不能稳定工作的标配能力。

5.3 面向“恢复力”而不是“单次成功率”来训练

这里有一个更宏观的思考角度。现在的AI训练和评测,普遍把“单次任务成功率”当核心指标。你做一道题,做对了就是100分,错了就是0分。但真实世界里,尤其是代理类应用里,更重要的是“从失败中恢复的速度”。

Vals AI测试里最值得注意的,不是GPT-6 Astra会陷入僵局这件事本身,而是它在僵局之后没有表现出任何“自我修复”的迹象。如果这个模型具备一定的恢复力,比如在连续失败50次之后主动重置目标、换一个完全不同的方向,那这次测试的结论就会完全不同。

所以未来AI Agent的评测体系,应该补上一项“受挫恢复时间”指标:人为注入失败,测量模型从失败到恢复探索行为的时间差。这个指标比单次成功率更能反映一个模型在真实世界里的可用性。谁先把这套评测体系做出来,谁就能在Agent产品的质量把控上领先一步。

5.4 对Computer Use类产品研发的建议

最后说一个更具体的场景。现在很多团队在做Computer Use相关的产品,就是让AI直接操作电脑上的各种软件。这类产品比《我的世界》里的AI更贴近真实使用环境,但如果你的AI在真实操作系统上连续失败141个小时,表现大概率不会比GPT-6 Astra在游戏里好多少。

我的建议是:在推出这类产品之前,一定要先用“故障注入测试”验证模型的抗压能力。具体做法就是模拟各种日常Bug,比如网页加载失败、按钮没反应、应用崩溃、网络超时。看看你的Agent在这些情况下的反应是回到正轨,还是开始无限重试同一个操作,或者干脆“沉默失联”。Vals AI在《我的世界》里发现的僵局模式,在真实的Computer Use场景里基本全能复现,只是表现形式从“重复挖方块”变成了“反复点击同一个失效按钮”。

6. 实际测试中踩过的坑与排查技巧

最后这部分,分享一下我自己在跑类似Minecraft Agent实验时踩过的坑,以及怎么判断实验数据是不是真有效。这些细节看着小,但哪一条不注意都可能导致整轮测试白跑。

6.1 任务不可达导致的假阳性“僵局”

很多人看到AI长时间不动,就以为它陷入僵局了。但有时候问题出在任务本身:如果你生成的世界里根本没有合成台需要的特定材料,那AI当然会表现得“不知所措”。这不是受挫后的行为僵局,而是“任务设计错误”。

怎么排查?看行为细节。真僵局的标志是模型先进行过一段时间的有效策略搜索,然后逐渐收敛成重复动作。假僵局的标志是模型从一开始就处于低动作频率状态,因为它根本找不到一步可执行的有效动作。两种状态在动作时间戳分布上有显著差异,一定要区分开。

6.2 日志量爆炸与动作采样

长时实验的另一个问题是数据量。连续跑141小时,每秒输出多条动作日志和模型推理记录,累积下来数据量会大到普通分析工具扛不住。

我的建议是抽样存储:每5分钟保留一个完整的事件窗口(包含所有动作和推理日志),其余时间只保存关键事件(比如任务完成、目标切换、状态异常)和低频率的统计摘要。这样既能还原整体行为趋势,又能在需要时回溯关键时间点的细节,不至于被数据淹没。

6.3 测试时间太长?分段切片依然有效

如果141小时实在太长,有个取巧的办法:分段切片。不用连续跑完,你可以每次跑6到8个小时,然后在每次会话结束时给AI做一个状态快照。下次启动时载入快照,接着上次的状态继续跑。只要快照保存了完整的世界状态、背包物品、任务进度和上下文记忆,分段测试的结果和连续测试基本没有本质差别。

这个方法特别适合预算有限、GPU资源紧张的团队。Vals AI能一口气跑完141小时是他们的资源优势,普通团队完全可以用切片方式复现类似结果。

6.4 AI“装死”与真僵局的区分

还有一个特别容易被忽略的情况:有些模型在任务困难时,会“装死”——就是表面上停止动作,但内部推理还在继续。从动作日志上看,它好像是僵住了,但从推理日志上看,它还在默默生成大量的分析和计划文本。

这种状态和真僵局的处理方式完全不同。如果是“装死”,说明模型还在尝试从推理层面解决问题,你只需要等它完成思考,或者加强环境信号,它就可能重新行动。如果是真僵局,那推理日志里应该也是重复的、低信息量的内容。所以判断僵局之前,务必先翻一遍推理日志,别被表面动作骗了。

我在实际测试中发现,一个很有效的技巧是往AI的上下文里强制注入一段环境变化描述,比如“附近出现了一只羊”“下雨了”,观察它是否会产生新的行动意图。真僵局状态下,模型对外部变化基本无感,行为模式不会发生任何改变。这个方法几乎百试百灵。

141小时跑完,Vals AI把GPT-6 Astra的所有“里子”基本都翻出来了。行为僵局这个发现,短期看是模型评测领域的一个新指标,长期看,它逼迫所有做Agent的人重新思考一个问题:我们到底是在训练模型“完成任务”,还是在训练它“面对任务”?

我个人觉得,这两件事同样重要。一个只会完成任务的模型,遇到它解决不了的问题时终究会卡住;但一个知道如何在失败后调整方向、重新积蓄策略的模型,才配在真实世界里被委以重任。最后再分享一个小技巧:给你自己的Agent加一个“主动求助”动作,当它检测到连续失败次数超标时,直接暂停当前方向,向用户或上级系统请求新的指令——这个简单的设计,可能是成本最低的防僵局方案。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询