"AI干活,人拍板":769条人机协作记录首次公开,96.5%的AI使用率有了官方数字
【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview
2026年9月14日,上海人工智能实验室将智能体大模型 Atria Dawn Preview 的权重与配套论文一同推向开源社区。相比"744B 参数 MoE""16 项基准 5 项第一"这类常规卖点,真正在技术圈引发讨论的,是论文里一项此前极少有厂商愿意公开展示的实证研究:研发团队把开发 Atria Dawn 这一模型本身的过程当作人机协作案例,公开了来自 56 名参与者的 769 条任务记录与完整 agent 日志。数据给出了一组此前只有感受、没有数字的答案——在 739 个对"是否使用 AI"有明确回复的任务中,713 个实际启用了 AI,使用率高达 96.5%;但与此同时,人类在 85.5% 的方法与参数决策中握有最终拍板权。
"AI 干活、人拍板"从一句直觉判断,第一次有了可审计的官方样本。本文基于论文全文(arXiv 2609.15818)与本仓库源码,拆解这三组数字背后的实验设计、分工真相与叙事含义。
一、769 条记录怎么来的:把研发过程本身做成实证样本
从"研究问题"到"可验证结果"的训练设计
要理解这批协作数据的可信度,先得看 Atria Dawn 的训练范式。仓库的 README_CN.md 将其定位为"面向需要持续理解环境、调用工具并完成多步任务的研究与工程场景"的智能体模型,基于 744B MoE 的 GLM-5.2 基座训练。而论文中披露的训练核心是一条Verifiable Experience Pipeline(可验证经验流水线):每一条训练任务都被连接到真实执行环境,模型观察状态、调用工具、产出中间产物、根据反馈迭代,最终结果必须通过测试、指标、文件状态、几何结构、来源证据或人工定义标准等外部信号验证,只有"任务—轨迹—产物—验证证据"完整闭环的经验才会沉淀为模型能力。
架构层面可以从仓库的 config.json 读出具体支撑:78 层隐藏层、256 个路由专家、每 token 激活 8 个专家、max_position_embeddings高达 1,048,576(1M),权重以 BF16 分片为 353 个文件(model.safetensors.index.json 显示总大小约 1.5TB)。结合 chat_template.jinja 中完整的<tool_call>/<observation>/<think>结构,可以看到这套模板为"思考—工具调用—环境反馈—再思考"的长链智能体行为做了显式编码,thinking 推理与工具协议是模型默认能力的一部分,而非事后补丁。
56 人、769 条任务:一个 4 周的真实研发样本
论文的实证部分没有另起炉灶设计实验室场景,而是直接采集了 Atria Dawn 自身研发周期内的协作记录:56 名参与者、769 条任务记录,连同 agent 日志一并分析。其中 739 个任务对"是否使用 AI"有明确回复,713 个使用了 AI——96.5% 的使用率由此而来。
更有信息量的是参与度的时间演变。对同一批 22 名参与者,从 8 月 7 日到 9 月 4 日,"每人类提示对应的 agent 动作数"的日度中位数从 11.0 攀升到 28.5,且四分位距同步扩大——协作强度在整体加深,但个体之间的分化也在加大。也就是说,短短四周内,同样一句人类指令平均会触发近 30 个 agent 动作。论文特别指出,参与者委托给 AI 的任务呈现高度规律的模式:汇报运行状态、在指定数据集上跑训练-评估循环、调试失败的实验、准备数据与扩容资源、总结 agent 改动内容——这些全部集中在执行与汇报,而非"研究什么"。
二、数据里的分工真相:提案权与拍板权是两回事
55.4% 的提案来自 AI,85.5% 的最终决策留在人类手中
这组数字是全篇最容易被误读、也最值得细读的部分。论文将研发决策拆成三类——目标/范围、方法/参数、验收标准——并分别统计"谁提出选项"与"谁做最终选择":
- 在方法/参数类决策中,"AI 提出、人类选择"是最常见的模式,占55.4%;人类在 85.5% 的方法决策中做出最终选择(无论选项来自人类还是 AI),AI 最终拍板的仅 9.2%;
- 目标/范围决策中人类最终选择占93.4%,验收标准占81.9%;
- 关键对比在于:AI 的提案份额从目标/范围类的 16.9% 摆动到方法/参数类的 55.4%(三倍以上),而最终决策份额始终被压在 6.1%–9.2% 的窄区间。
随决策类型变化的是"谁生成选项",而不是"谁拍板"。这在那些被评定为"离开 AI 不可行"的任务上体现得更极端:151 个此类任务中,人类在 144 个(95.4%)任务上选择了最终目标。依赖度最高的任务,恰恰是人类主权保留最完整的任务——"把任务整体划给某一方"的二分法叙事,在这里站不住脚。
33.2% 的任务"没有 AI 不可行":AI 改变的不只是效率
论文让参与者对已完成任务做反事实评估:在任务范围、质量要求与资源条件不变的前提下,自己负责的部分"离开 AI 是否还能完成"。在 455 个有可用回复的已完成 AI 辅助任务中,151 个(33.2%)被评定为不可行,且这些任务分散在 56 名参与者中的 27 人——接近一半的样本量,排除了"少数重度用户拉高均值"的解释。
论文由此区分了两个常被混为一谈的量:节省的时间与被创造出来的可能性。33.2% 不是"慢一点也能做完"的工作量,而是"根本不会被尝试"的工作量。只测前者,会系统性低估 AI 对研发边界的改变。
76% 的困难任务靠人推:人类介入以"喂信息"为主,而非"替动手"
当任务卡住时,分工真相更为清晰。在 588 个记录了"最重大困难"的任务中:
- 76.0% 靠人类干预推进,agent 自行恢复的占 23.0%,仅 1.0% 未解决;
- 人类帮助的构成才是重点:添加上下文/澄清需求占35.2%,诊断问题/改变方法占34.7%,而直接改代码的"部分编辑"仅 3.2%,"接管任务"仅 0.7%——人类帮助"改变 agent 知道什么"的可能性,是"改变谁来做"的约 18 倍;
- 输出修订呈现同样结构:627 个有明确处置记录的任务中 354 个(56.5%)发生实质修订,其中75.4% 由 AI 在收到人类反馈后自行重写,人类直接编辑仅 19.2%;95.9% 的 AI 输出以某种形式进入最终交付物。
这三组数据合在一起,论文给出的分工结论是:人类决定目标是什么、补充失败运行缺失的上下文、指出必须改什么;agent 生成绝大多数选项,并产出几乎全部代码、文本与修订。稀缺输入是判断,而非执行。这也解释了为什么"每提示的 agent 动作数"从 11.0 涨到 28.5 不应被读作自主性上升——每一次人类判断如今通过更多 agent 动作来传播,而非通过更少。
三、从"AI 替代人"到"项目级伙伴关系":叙事切换意味着什么
96.5% 的使用率与 9.2% 的 AI 决策权并不矛盾
论文把 AI 研发中人与模型的关系划为三个阶段:早期模型只是研究对象,完全由人操控实验全流程;随着代码生成与指令遵循能力成熟,模型成为人类设计工作流中的任务执行者;而具备智能体能力后,模型可以在人类给定的目标与评估标准下自行制定计划、根据实验反馈迭代方案,进入项目级伙伴阶段。Atria Dawn 研发中观察到的正是第三阶段——agent 承担了方案设计与迭代修订,人类收缩到更高层的判断与关键节点的定向干预。
这一叙事切换的关键在于:"AI 使用率 96.5%"与"AI 决策权 9.2%"在同一份数据里同时为真。此前的讨论往往把"用了多少 AI"直接等同于"AI 取代了多少人",而这份记录表明两者正交——使用深度上升时,人类的权重没有按比例让渡,而是转移到了提案之外的选择端。论文还援引了同行的独立观察:OpenAI 报告称 4–8 小时的多数成功任务仍需至少一次人类干预,与这里 76% 的困难任务介入率相互印证。
通往 RSI 的两道坎:研究方向生成与经验内化
论文没有停留在"伙伴关系"的乐观叙事上,而是明确指出了从"项目级伙伴"到"递归自我改进(RSI)"之间的技术缺口:
第一道坎是研究方向生成。AI 在 55.4% 的方法/参数决策中提出选项,但在目标/范围决策中只提出 16.9%——绝大多数提案是对研究者已确定方向内的变体。且 agent 共享的先验会产生相关性盲区:部署更多 agent 可能只是把同样的尝试重复更多次,而没有真正拓宽探索范围。论文据此建议在不同工作 agent 之间建立沟通渠道,并承认在 Atria 开发中,同一个 agent 在研究者以其特定问题、偏好与权衡进行引导时,探索范围会显著拓宽。
第二道坎是经验内化。论文观察到,agent 从一次失败运行中获得的经验往往停留在该会话或记录中,而研究者则把教训带入了下一个任务;通用基准的进步无法暴露研究能力的真实变化。所谓 RSI,只有当模型能在连续轮次中生成更有价值的研究问题、识别更隐蔽的错误时才真正开始——这需要系统"吸收"经验而非仅仅"检索"经验,甚至可能要求从根本上重新设计当前"记忆与能力分离"的架构。
人类角色的再定义:剪枝、破盲区与"谁为授权负责"
既然执行已近乎全部交给 agent,人类剩下的价值是什么?论文给出三个可审计的答案:其一,研究者凭积累的经验与直觉在投入资源前低成本剪枝研究空间,这种"结果未知时的判断力"目前仍难以被 AI 内化;其二,人类以多样背景对抗 agent 的同质化盲点;其三,跨项目迁移试错教训的能力仍主要积累在人类身上。
论文同样坦诚了授权边界的现状:许多研究者以 Codex 的 yolo 模式、Claude Code 的 skip-permissions 模式运行 agent,授予宽泛执行权以避免长任务卡在审批上——边界由便利性而非深思熟虑的权限设计决定。论文对"AI 是否应被授予像其他权限一样的安全保障权"给出明确回答:不该。每一轮能力跃升都应匹配成比例的 alignment 与监督投入,并需明确"谁的意图塑造对齐目标、谁承担风险、谁负责"。
结语:这份数据值得反复读,因为它自证了方法
Atria Dawn Preview 的价值不止于基准分。AutomationBench 53.8、BFCL v4 77.0、DeepSearchQA 96.0、BrowseComp 92.5、CyberGym 86.5 这五项第一(完整对比见仓库 assets/evaluation.png 与 README_CN.md 的评测表),回答的是"模型能干什么";而 769 条协作记录回答的是一个更难的问题——"当它被真实地用于生产自己的同类时,人和它各自守住什么"。
96.5% 的使用率是执行侧的深度,85.5% 的人类决策权是判断侧的保留,76% 的人类干预是困难侧的兜底。三者并列,恰恰是论文标题副题"人类-AI 协作中不断演变的分工"最浓缩的注脚:每个决策背后是一条人类无法逐行检查的长链 agent 工作,而人类的主权不在于看得更细,而在于决定什么值得做、证据如何引导研究。在通向递归自我改进的路上,这组数据既是一个里程碑,也是一面镜子——它照出的不是"AI 将取代人",而是"人的判断正成为稀缺资源"。
【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考