GPT-6 Astra正式发布:能自己操作电脑的旗舰模型
2026/9/7 2:14:51 网站建设 项目流程

北京时间9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra,官方口径是"欢迎来到AGI时代"。据报道,这是OpenAI第一次用"AGI"而不是"更强的模型"来定义一次发布,训练据称动用了约10万块GPU。同一场发布里,既有接近满分的跑分,也有被网友当场抓包的演示失误,信息量很足。

这代模型到底变了什么

先说结论:GPT-6 Astra的变化不在"更会聊天",而在**“能自己干活”**。按官方演示和多家媒体报道,它可以操作电脑和浏览器,进入具体软件执行多步骤任务——填表、更新CRM、整理日程、做财务模型、分析科研数据、搭网站、装软件并测试,甚至进Unity、Blender这类工具里继续工作。规格上,据报道上下文窗口约105万token,知识截止到2026年4月底。

对写代码的人来说,编程能力是重头。OpenAI称Astra是其"最强的软件工程模型":据报道Terminal-Bench 4.0得分57.7%,上一代是37.3%;内部数据库迁移任务63.9%,上一代42.7%。高难数学基准FrontierMath上也拿了97.6%之类的接近满分成绩。

但同一天的另一条新闻是:官方演示用Astra填写美国报税表时,被社区发现用了非官方表格格式,且用边际税率公式替代了IRS税表,算下来少缴了约3.5美元。能力叙事和输出可靠性之间的落差,一次发布会全演完了。

另外据报道,OpenAI在发布时自己也提示:Astra虽是其"最智能"的模型,但监控难度可能更高,公司正在增设更多防御性工作流程来加强安全护栏。能力越强越难被看住,官方主动承认这一点,本身就说明新模型的容错空间并没有因为跑分变高而变大。

价格翻倍,账要先算清楚

按OpenAI公布的API价格,Astra是每百万输入token 10美元、输出50美元,模型名gpt-6-astra。据报道这大约是上一代GPT-5.6 Sol的2.5倍,和Anthropic的Claude Fable 5.1一个价位。

这个价格对普通开发者意味着什么?可以算一笔账:

  • 只塞几千token的短对话:几乎可以忽略
    • 把10万行代码库全塞进上下文做分析(输入约50万token):光输入就是50万÷100万×10美元 = 5美元,一次
    • 让它生成大段代码或长文档(输出2万token):2万÷100万×50美元 = 1美元
      所以"上下文大"和"输出贵"是一对矛盾:塞得越多,单次成本涨得越快。用在关键任务上值得,用在日常闲聊上纯属烧钱。CSDN和各大社区普遍的看法是:编程依然是各家旗舰模型的核心战场,但Astra目前的定位明显是"少而精"的高价值任务,不是走量的大路货。

对普通打工人的实际影响是:这种"能自己操作软件"的能力,第一批用上的肯定是买得起的企业客户,先被替代的往往也是流程里最标准化、最好校验的那部分执行工作。说白了,工具变强不直接等于人失业,但"会不会给AI的产出做校验"这项技能,会越来越值钱。

另外注意开放节奏:据报道,Astra先向接入其Daybreak网络安全平台的企业客户开放,Plus/Pro/Business/Enterprise订阅用户和API、Azure、AWS Bedrock用户要再等"未来数天"。这种分阶段发布引发了不少用户不满,CEO萨姆·奥尔特曼上线几小时后就公开致歉,说"发布过程比较混乱"。想尝鲜的话,现在大概率还轮不到,可以先把评估计划排上。

对普通开发者的三条建议

第一,别拿跑分当采购依据。Terminal-Bench分数翻倍是好事,但税表演示说明:benchmark测的是"平均水平",真实任务里"看着能干的模型"照样会在细节上出错。想迁移到Astra,先拿自己仓库里真实的bug、重构、迁移任务跑一轮,对比上一代模型,再决定值不值2.5倍的价格。

第二,用Agent任务必须加校验层。模型能操作软件之后,出错就不再是"文字不对",而是"动作不对"——可能改了不该改的文件、填了不该填的表。凡是涉及钱、合规、生产数据的任务,让它先给方案、再分步执行、最后人工复核结果。官方演示都能算错税,别指望自家业务里100%靠谱。

第三,试用代码很简单,但先确认有权限。等API开放后,标准OpenAI SDK就能调:

fromopenaiimportOpenAI client=OpenAI()# 读取环境变量 OPENAI_API_KEYresp=client.chat.completions.create(model="gpt-6-astra",messages=[{"role":"user","content":"请review这段Python代码,列出问题和修改建议"}],max_tokens=4000,)print(resp.choices[0].message.content)``` 没有访问权限时会直接报错,这正好提醒你:新模型再强,也得等它真正开放到你手上。## 最后说两句跑分接近满分、能自己操作电脑,和演示当场算错税、分阶段开放被骂,这些事发生在同一个模型身上,其实不矛盾——能力上限和可靠性从来是两回事。对普通用户来说,模型的"上限"是厂商宣传出来的,**"下限"才是自己试出来的**。 对我们打工人来说,真正要关心的不是"AGI来没来",而是:**当AI真的能自己干活了,哪些活需要人复核,复核的成本谁来出。**你怎么看,评论区聊聊。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询