调度层三强争霸、神秘模型指向智谱:AI的战场已不在模型里
这个八月的最后一周,AI 圈最热闹的不是谁又刷了某个 benchmark,而是谁先做出了那个能“装下别人家模型”的调度层。DeepSeek Harness 一周三更,OpenAI 把 Codex Harness 直接开源,NVIDIA 的 AVO 在 ARC-AGI-3 上 183 道关卡全满分——三家不约而同指向同一件事:当模型本身越来越同质化,工程层的“壳”才是下一道分水岭。
一、Harness 成了新战场,调度层三强同台
先说事实。8 月 21 日,DeepSeek 在自家 API 平台放出实验性多模态模型 V4-Flash-Vision-Exp,配套更新的 Harness 跑到 0.1.1-rc.1。最值得关注的不是模型本身——多模态各家都在做——而是 Harness 的子代理体系:Claude Code 和 Codex 现在可以作为 Profile Bundle 被装进 DeepSeek 的工作流,在同一个项目里挂多个命名实例,分别干不同的活。DeepSeek 给这套架构的定位很直白:Model + Harness = Agent,模型负责思考,Harness 负责让思考真正落地。这是直接把竞争对手的招牌产品变成了别人框架里的“零件”。
OpenAI 也没闲着。同一天前后,OpenAI 正式宣布把 Codex Harness 全面开源。Harness 是 Codex 背后的 Agent 运行时,负责连接模型、用户和工具,管理任务执行、上下文和会话流程。一个被反复提到的内部数据是:一个 OpenAI 内部产品在过去 5 个月里生成了约 100 万行代码、约 1500 个 PR,团队的工作方式从“手写代码”彻底转向“人设目标、Agent 执行”。把底层 Harness 开放出来,等于告诉整个行业:模型可以换,但调度工作流的那层壳才是壁垒。
NVIDIA 则给出了另一份答卷。其通用编程 Agent 系统 AVO 在 ARC-AGI-3 公开测试集的全部 25 个环境中拿到 100% 满分,完成全部 183 道关卡。TechCrunch 在评论里直接写了一句“NVIDIA 证明了 Harness 才是真正的英雄”。这和 OpenAI 开源 Harness、DeepSeek Harness 周更形成一组有趣的呼应:行业共识正在形成,Agent 的核心竞争力已经从底层模型能力,转移到了运行时架构、工具调用编排和上下文管理。换句话说,下一轮 AI 竞争的“护城河”,多半不在模型权重里,而在框架里。
二、“神秘模型”现身,智谱下一代旗舰或已现形
如果说调度层之争是“明线”,那 OpenRouter 上冒出来的一个匿名模型,就是当下的“暗线”。这款代号 stealth/ox-alpha 的模型被独立研究人员 Ben Davis 盯上了:它的视频编码器、分词器、输出风格等技术特征高度接近智谱的 GLM 系列,但在部分编程基准上却超过 GPT-5.6 和 Claude。Davis 自己说“99% 确定这来自智谱”,但截至目前智谱尚未官宣。
无独有偶,DeepSeek 的 V4-Flash-Vision-Exp 也把多模态推到了一个新的位置:图片最多折算 384 token,多模态 Agent 综合表现接近 Claude Opus-4.8,同时配上免费的 Files API,让开发者直接处理图文混合任务。字节 Seed 则被曝出新 Omni 模型参数传闻超 5T,并在预训练、强化学习与 Agent 研发间做了全面组织重构,为下一阶段铺路。再加上 Mistral 推出 Agentic Search、阿里开源 Qwen-UI-Agent 真机多模态 GUI 基座、商汤开源 8B 的 SenseNova U1.5Lite——本周的多模态战场几乎全员到齐。
更值得注意的是 OpenAI 把 GPT-5.6 Sol 的开发者 API 价格下调超过 20%。结合 DeepSeek-V4-Pro-0813 GA 上线、Tembench 2.1 打 87.9 分、DeepSWE 打 62.7 分——前排模型一边在升级,一边在降价;后排模型一边在追平,一边在试错。模型之间的差距越来越小,能决定胜负的,反而是谁能把这些模型高效地“调度”起来。
三、算力侧的动作,比模型更影响下一轮格局
战场之外,阿里平头哥自研芯片的商业化正在加速。最新一代 AI 处理器真武 M890 已经通过阿里云在自动驾驶、互联网、金融等 20 多个行业、超过 650 家外部客户中实现商业化应用,配套的超节点实例近期已经上线并开始规模化销售;阿里云表态“下半年持续放量”,并把大规模 AI 数据中心的交付周期压缩至 100 天。上一代平头哥芯片截至目前已经生产超过 50 万颗,最新一代 8 月已经部署在阿里云 AI 云平台。这意味着自研算力正从“内部降本”走向“对外创收”,对依赖外部算力的中小厂商来说,是一个被低估的变量。
围绕模型和算力的,是 Anthropic Claude Platform 把 Computer Use、Skills API 和 Files API 全部推到 GA,新版 Computer Use 允许在单次调用里执行多个连续操作并达到 HIPAA 合规;Browser Use 工具直接识别网页结构而不再依赖截图;Skills API 让企业把专有指令和脚本上传到 Claude 的代码执行沙箱;Files API 速率限制提升 5 倍、每组织 1TB 专用存储。能力开放,门槛却拉低了,开发者不再需要为“合规可用”做额外适配。
**结语:**如果只盯模型榜单,会觉得 8 月这几周平淡;但把视角拉高一点,会发现真正在分胜负的是调度层、工具链和算力底座。当模型本身逐渐变成“可替换电池”,谁来当“电池仓”、谁来当“充电桩”、谁来当“配电网络”,就成了下一轮 AI 故事的主线。