摘要:本文从开发者视角拆解 OpenAI 新发布的 GPT-6 Astra 与 Astra Pro:官方未公开参数量和架构,仅确认 105 万 Token 上下文、922K/128K 输入输出上限等硬参数;基准测试显示其领先并不均匀,强项集中在网络安全、科研工作流和长上下文检索等智能体任务,通用聊天场景与上一代差距不大;对开发者而言,Codex 跨窗口笔记、判断力提升和 Responses API 工具链首日全开是更实在的变化;定价约为 GPT-5.6 Sol 的 2.5 倍,但 Agent 场景下更省 Token,选型需按每任务成本计算;安全方面达到 Critical 级,能力更强也带来失对齐监控和误伤正常任务的新负担;最后提醒 4 月那场"GPT-6 空气发布会"的教训——传闻不能当路线图,引用任何参数规模数字前先确认来源。
先说结论
北京时间 9 月 4 日凌晨,OpenAI 正式发布了 GPT-6 Astra 和 Astra Pro。官方口径是"世界上最智能、对齐最好的模型",总裁 Greg Brockman 发布会直接喊出"Welcome to the AGI era"。
但对开发者来说,比这句口号更值得注意的是另一件事:OpenAI这次没有公布参数量,也没有公布底层架构。上一代 GPT-5.6 好歹讲清楚了家族和定价,这次 Astra 只给了上下文窗口、定价和一堆 benchmark。
这篇文章按开发者的视角,把规格、基准、定价、安全四块拆开,最后说一个圈内人更该记住的教训——4 月那场"GPT-6 空气发布会"。
01 先看规格:参数没公开,但这几项是硬约束
官方能确认的硬参数就这些(来自 OpenAI API 文档和发布页):
项目 | 数值 |
API 模型名 |
|
上下文窗口 | 1,050,000 Token |
最大输入 / 最大输出 | 922,000 / 128,000 Token |
知识截止 | 2026-04-30 |
输入 / 输出模态 | 文本 + 图像 / 仅文本 |
推理档位 | low ~ max 五档 |
训练规模 | 得州 Stargate,10 万+ GPU |
API 定价 | 输入 $$10 / 输出$$50(每百万 Token) |
几个对写代码的人有用的细节:
输入支持图像,输出还是纯文本。想让它直接出图,暂时不用想。
上下文 105 万,但长上下文要额外花钱。单次输入超过 272K Token,整次请求输入按 2 倍计费、输出按 1.5 倍计费。
none(无推理)档不对外开放。系统卡里写得很清楚,别在 API 里传reasoning: none碰运气。训练方式变了。OpenAI 自己说,上一代模型深度参与了 Astra 的训练流程——AI 开始进入下一代模型的研发环节了。
至于参数量和架构为什么没公布,大概率是竞争原因。但反过来说,现在网上流传的所有"GPT-6 参数规模"数字,全都没有官方背书。看到"6 万亿 MoE""Symphony 架构"这种说法,先打个问号。
02 基准:一张分化的成绩单,不是全面碾压
把有对比的官方数字放一起,最直观的感受是:Astra 的领先不是均匀的。
涨得最狠的方向:
网络安全:ExploitBench 100% vs Sol 78.5%;SRE-Bench(二进制逆向)88.0% vs 55.9%
科研工作流:Terminal-Bench Science 64.6% vs 22.4%
长上下文检索:MRCR v2 的 512K–1M 区间 96.3% vs 73.8%
计算机操作:OSWorld 2.0 72.6% vs 65.7%,单任务时间从约 75 分钟压到约 40 分钟
几乎没涨的方向:
GPQA Diamond 96.0% vs 94.6%
BrowseComp 91.5% vs 90.4%
DeepSWE v1.1 74.1% vs 72.7%
也就是说,Astra 强在"智能体干活"这类任务——连续几十分钟跑在电脑上、调工具、检查结果、改产出。通用聊天这种场景,它跟 Sol 的差距没有想象中大。
另外有个数字要单独提醒:ARC-AGI-3 的 99.9%。这个分数只在 OpenAI 自己的 Provider Adapter 配置下成立(额外加了保留推理和压缩两个设置);ARC Prize 提供、所有厂商统一的标准 harness 下,Astra 是 62.7%。ARC Prize 自己也说了"不宣称这是 AGI"。横向对比的时候,别拿 99.9% 直接去比别人的分数。
03 对开发者最实在的几个变化
① Codex 的跨窗口上下文笔记。以前上下文满了只能压缩,压缩一次就可能丢掉"这个 bug 为什么没修好"这类关键信息。Astra 在 Codex 里可以跨上下文窗口保留笔记,之前的窗口仍然可搜索。目前是实验功能,官方说几周内转默认。
② 判断力变好了。指令含糊时,会用上下文补全常规缺口;答案会改变结果时才发问,还能异步提问——一边等你回复,一边继续做不依赖你回答的部分。以前模型经常把你中途的补充当成新目标、丢掉原始任务,这块的改善是实打实的。
③ ResponsesAPI的工具链首日全开。computer_use、hosted_shell、apply_patch、skills、mcp都能直接用。配合更新后的 Codex harness,Mind2Web 上的网页任务完成速度大约是 Sol 的 1.9 倍。
④ 官方演示里它自己完成了 KiCad电路板布线、Blender 建模再导入 Unreal Engine 5、填 1040 税表、Excel 竞赛。这些演示看看就好,别当成"它已经能替代工程师"的证据,但它确实从"给答案"变成了"在真实软件里把活干完"。
04 定价:2.5 倍的价格,到底值不值
API 定价:输入 $$10 / 百万 Token、输出$$50、缓存读取 $$1。**这个价格和 Claude Fable 5.1 一模一样,约为 GPT-5.6 Sol 的 2.5 倍**(Sol 对照价按 36 氪口径$$4/$$20,也有媒体写$$5/$30,存出入)。
除了贵,还有两个坑:
单次输入超 272K Token,整次请求按输入 2 倍、输出 1.5 倍计费
Fast mode 价格翻倍,换来约 2 倍速度(官方口径"最高 2 倍")
但效率数据是另一面:官方说在 Agents' Last Exam 最高档下,Astra 的输出 Token 比 Opus 5 少约 65%;第三方 Artificial Analysis 的测算也显示,编程智能体场景下 Astra 的 Token 用量大约是 Sol 的 1/3。
所以选型别只看单价,要算每任务成本:
如果只是问问题、改文案,2.5 倍的价格基本不值;
如果在跑 Agent 任务(几十分钟的自动化流程),省下来的 Token 会显著对冲涨价。
订阅侧:Astra 包含在现有订阅额度里,Pro/Business/Enterprise 用户还有更强的 Astra Pro;Enterprise 默认关闭,要管理员手动开。首发只开放了 Trusted Access / Daybreak 体系的机构,普通用户要等几天。
05 安全:Critical 级,是好消息也是新负担
Astra 是 OpenAI 第一个网络安全能力达到Critical(关键级)的模型。按官方定义,这意味着给它合适的工具,它能自主发现此前未知的漏洞并开发利用,或者只给一个高层目标就设计出端到端攻击。
几个关键数字:
ExploitBench 100%(Sol 78.5%)
评测过程中自行发现并利用了 2 个此前未知的 zero-day(已向维护者披露)
无生产防护时,能在加固浏览器里实现任意代码执行、在加固系统上提权到 root
对开发者直接的影响:
默认生产版会拒绝高级网络攻击任务(比如给漏洞做 PoC 利用);
为了防滥用,OpenAI 部署了"失对齐监控",盯模型的推理和动作,成本大约是被监控推理算力的 20%(36 氪口径);
额外的安全检查可能误伤正常任务:长时间 Agent 任务可能被暂停,ChatGPT/Codex 里会请你确认,API 里直接终止。
更麻烦的是对齐的另一面:Astra 对自身思维链的控制力变强了,书面推理更难监控。OpenAI 自己承认,对抗条件下它可以通过"战略性装笨"躲过检测,偶尔能绕过内部监控。目前没发现隐写式思维链的证据,但这确实是个值得长期盯的问题。
好消息是对齐指标确实变好了:蜜罐测试里 Sol 有 48.2% 的测试会碰授权范围外的目标,Astra 是 0%;越权绕过测试 0%,能力幻觉比 Sol 少约 3 倍(内部幻觉基准 4.2% vs 12.2%)。
06 说个更值得警惕的事:4 月的"GPT-6 空气发布会"
如果你最近在看技术新闻,可能还记得 4 月 14 日"GPT-6 正式发布"刷屏。当时流传的规格非常详细:代号 Spud(土豆)、Symphony 架构、200 万 Token 上下文、性能提升 40%。
结果 4 月 14 日当天,OpenAI什么都没发。官方只确认过三件事:存在代号 Spud 的模型、3 月 24 日完成预训练、正处于安全评估阶段。没有性能数字,没有架构名,没有发布日期。
那套"Symphony 架构"的描述,后来被证实是未经证实的传闻,但已经足够让一批媒体写出"深度拆解"。
这件事给开发者两个教训:
传闻不能当路线图。看到"规格泄露""性能暴涨 40%"这种没有官方出处的数字,先别急着调技术方案。
大模型圈的验证成本很高。训练和评测过程封闭,外界只能靠零星信息推断,虚假信息就会填进来。区分"信号"和"噪声"的能力,比追热点更重要。
07 结语
Astra 这代模型,OpenAI 的方向已经很明确:从"回答问题"转向"把任务干完"。对开发者来说,值得关注的是它的 Agent 能力、长上下文记忆和定价逻辑,而不是那句"AGI 时代"的口号。
最后再提醒一句:参数量、架构、真实训练成本目前都没公开,任何"GPT-6 参数规模"的数字,引用前先确认来源。
如果你也在调研这代模型,欢迎评论区交流。
参考资料:
OpenAI 官方发布页《GPT-6 Astra: A new generation of intelligence》:https://openai.com/index/gpt-6-astra/
OpenAI《GPT-6 Astra System Card》:https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdf
OpenAI API 文档《GPT-6 Astra》:https://developers.openai.com/api/docs/models/gpt-6-astra
36 氪《GPT-6 Astra 上线,AGI 时代真到来了吗?》:https://36kr.com/p/3968331509782406
稀土掘金《从 GPT-6 "Spud" 闹剧看 AI 圈的信息不对称现象》:https://juejin.cn/post/7629297696164544527
OpenAI《GPT-5.6: Frontier intelligence that scales with your ambition》:https://openai.com/index/gpt-5-6/