☰
哈基米又行了?Gemini 4 Argon 凭什么反超 GPT-6
2026/10/3 7:23:02 网站建设 项目流程

9 月 30 日,Google DeepMind 发布新前沿模型 Gemini 4 Argon。它最扎眼的不是名字,而是两件事:定价每百万输入 2 美元、输出 10 美元——和前一天 OpenAI 刚发的"五分之一价"GPT-6.1 Sol 完全对齐;同时在官方基准表里,Vals Index 以 68.9% 压过了 GPT-6 Astra(63.1%)和 Claude Opus 5.5(67.0%)。

我的判断:前沿模型的战争,正在从"谁更聪明"变成"同一个价格,谁把活儿干得更全"。Google 这次用和 OpenAI 平价小模型相同的价,卖一个基准上反超旗舰的模型——这不是巧合,是定价锚点被打穿后的贴身肉搏。

01 事件本末:先给网络防御者用,再慢慢开放

时间线很紧凑:9 月 30 日 Google DeepMind 官方博客发布 Gemini 4 Argon;它没有立刻全量开放,而是先通过 Fairwind Program 向一组"受信任的网络防御者"推出,后续才逐步走向开发者、企业和消费者。Google 同时明确,正在参与美国政府关于发布前模型访问的自愿流程,在护栏上持续迭代。

这是一个比 OpenAI 更谨慎的发布节奏:先在最敏感的网络防御场景小范围验证,再扩大访问。Argon 的定位是在复杂、长周期工作流里维持深度推理,主打真实世界软件工程、法律、金融等企业知识工作,以及网络安全防御。

02 数据拆解:价格、token、基准三笔账

第一笔是价格。官方口径:introductory price,每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入按输入价的 95% 折扣。把它和昨天 GPT-6.1 Sol 摆在一起——输入 2 美元、输出 10 美元、缓存折扣——数字几乎一模一样。这意味着两家已经在"中端旗舰"这个价位带上正面撞上。

第二笔是输出长度。Argon 把输出 token 上限从此前的 64K 一口气提到 1M,官方称之为业界领先。这直接关系到能不能在单次推理里生成几十万 token、一次性啃下长代码库或长文档。

第三笔是基准,要分清"哪些赢了"和"哪些没赢"。官方对比表里,Argon 在 Vals Index(68.9%)、AutomationBench(51.3%)、Vals Finance Agent v2(65.4%)、Harvey 法律 Agent(19.6%)、DeepSWE v1.1(77.9%)、长上下文 GraphWalks(128K 档 99.7%)上领先 GPT-6 Astra 和 Claude;但在 FrontierSWE v2(55.0% 对 Astra 65.5%)、OSWorld-2.0 桌面操作(69.2% 对 Astra 72.6%)上反而落后。换句话说,它赢在知识工作和软件 Agent,不是全面碾压。

03 多方观点:是真反超,还是挑了对自己有利的榜?

乐观方认为,Vals Index、金融和法律 Agent 这些更贴近真实企业工作流的指标被 Argon 拉开,说明 Google 在"把模型用进复杂业务"这件事上重新抢到了身位;1M 输出和数千名员工内部先行使用,也显示它不是纸面模型。

冷静方则提醒:基准表是官方自己挑的、自己测的,而且在更难的 FrontierSWE 和桌面操作上 GPT-6 Astra 仍领先;"先给网络防御者用"也意味着它还没经过大规模真实用户检验。两边都成立——Argon 赢下了它想赢的那部分战场,但离"全面最强"还有差距。

04 产业影响:价格锚点被打穿,开发者开始横向比价

对开发者:当 OpenAI 和 Google 的中端旗舰都落到输入 2 美元、输出 10 美元,选模型的依据就从"谁便宜"变成"在我的任务上谁强"——金融、法律、长代码场景可以试 Argon,难的系统级编码和桌面操作场景 GPT-6 Astra 仍占优。

对企业:1M 输出让"一次喂入整个代码库、整个合同集"成为可能,长上下文从卖点变成标配;但 Argon 目前只对受信任网络防御者开放,普通团队要等逐步放开。

对竞品:Anthropic 的 Claude 在 Vals Index 上 67.0% 居中,既没被拉开也没守住第一;前沿模型三强在同一价位上重新排队,价格战远没结束。

05 独立判断

三个判断:其一,$2 / $10 正在成为新的中端旗舰标准价——OpenAI 和 Google 不约而同,说明这个价位是当前推理成本和商业空间的平衡点;其二,Argon 真正的信号不是"全面第一",而是"长上下文 + 企业 Agent"这条线被拉到 1M token,未来半年各家都会被迫跟进;其三,官方基准永远挑自己赢的题,判断模型别只看一张表,要在自己的真实任务上跑一遍。

06 对读者的意义

对普通用户:不用急着追新模型,Argon 还要一段时间才面向消费者;对开发者:这两天连续两个同价模型发布,是时候把你的工作负载按"知识工作 / 系统编码 / 长文档"分类,分别测一遍哪家更划算;对行业观察者:前沿模型的竞争叙事正在从"参数和榜单"转向"在具体工作流里谁更便宜、更长、更稳"。

昨天 OpenAI 用五分之一价追旗舰,今天 Google 用同样的价反超旗舰。一个信号越来越清楚:前沿模型的高价时代正在结束,接下来是同一价位上的贴身肉搏。


极简速览:① OpenAI GPT-6.1 Sol 与 Ultrafast 高速档持续发酵,成本比 GPT-6 Sol 低约 30%;② OpenAI 常驻智能体 Dots 正式发布,面向 Pro/Business/Enterprise;③ Anthropic 推迟 IPO 至 11 月,招股书细节曝光;④ METR 发布前沿模型评估博客。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询