Luna 砍 80% 到 0.20 美元、Sol 降完还是它 20 倍:OpenAI 的价格战打出两副面孔
同一个 GPT-5.6 家族、同一套 105 万 token 上下文窗口,输入价格却从 0.20 美元一路排到 4 美元,最贵与最便宜差整整 20 倍。更吊诡的是,这还是在 OpenAI 刚刚连续两轮降价之后的结果。8 月 21 日,OpenAI 把旗舰 Sol 的输入价从 5 美元降到 4 美元,降幅超过 20%;而就在三周前的 7 月 30 日,入门档 Luna 已经被一刀砍掉 80%,输入价从 1 美元直接砸到 0.20 美元。
一面是地板价,一面是塔尖价。OpenAI 用一个月两次降价,把价格战打出了两副面孔。
一、同一个家族,价格差 20 倍
先看这组数字。GPT-5.6 家族 7 月 9 日正式开放,Sol、Terra、Luna 三个档位共享 105 万 token 的超长上下文窗口,能力定位依次下探:Sol 是旗舰,负责复杂推理;Terra 是均衡档;Luna 主打低成本低延迟。到 8 月 21 日为止,三轮调价之后的现货价格是这样的:Luna 输入 0.20 美元、输出 1.20 美元(每百万 token);Terra 输入 2 美元、输出 12 美元;Sol 输入 4 美元、输出 20 美元。
把 Luna 和 Sol 摆在一起,差距立刻显现:输入价差 20 倍,输出价差约 16.7 倍。它们用的是同一套上下文窗口,理论上能处理的文档规模完全一样,差的只是推理能力和速度。对开发者来说,这意味着同一段代码、同一份长文档,放在不同档位跑,成本可以相差一个数量级。
二、两轮降价的时间线
降价不是一次性动作,而是一个月内的两次连续操作。
第一轮发生在 7 月 30 日,对象是入门和中档。Luna 输入价从 1 美元降到 0.20 美元,降幅 80%;输出价从 6 美元降到 1.20 美元。Terra 输入价从 2.50 美元降到 2 美元,输出价从 15 美元降到 12 美元,均降 20%。这一轮之后,Luna 的成本已经低到很多开发者会重新评估"哪些任务值得上大模型"。
第二轮发生在 8 月 21 日,对象换成了旗舰。Sol 输入价从 5 美元降到 4 美元,降幅 20%;输出价从 30 美元降到 20 美元,降幅约 33%。OpenAI 明确标注这是促销价,至少维持到 11 月 21 日,同时 ChatGPT Work 和企业 Credit 的折算价也同步下调。
注意一个细节:8 月 21 日这天,路透社报道 OpenAI 是在竞争压力之下发布 Sol 促销的,报道点名的压力来自 Anthropic 以及 DeepSeek、月之暗面等实验室。也就是说,这次旗舰降价不是技术发布会式的秀肌肉,而是一次直面竞争的商业防御,时机精准地卡在竞争对手新品和降价窗口附近。
三、为什么敢降:效率被 Sol 自己改写
价格砍到这份上,前提是成本端能撑住。OpenAI 这轮降价的技术底气,最戏剧化的一点是:Sol 自己的推理栈被它自己重写了。
7 月底的报道提到,OpenAI 公布 Luna 大幅降价时披露,Sol 已经自主重写了生产环境里的 GPU kernel 和投机解码路径。传统上,投机解码先让小模型草拟、再让大模型验证,用来压低每次生成的延迟;把这条链路优化到位,意味着同样的算力可以服务更多请求,单位成本随之下降。Sol 把底层算子重写一遍,相当于把旗舰模型的推理效率抬了一档,为整条产品线的价格下探腾出了空间。
另一方面是规模效应。GPT-5.6 家族 7 月 9 日才全面开放,一个月内就连续降价,说明 OpenAI 对调用量增长带来的边际成本下降相当有信心。推理成本里的固定开销,包括模型权重和服务集群,摊薄得越快,单次调用成本就越低,降价空间也就越大。Luna 敢一次砍 80%,本质上是在赌"价格降下去、调用量涨上来、单位成本再降"的正循环。
四、价格战地图:大家都在降
把镜头拉远,OpenAI 的降价不是孤例,而是 2026 年大模型价格战的一部分。Anthropic 在旗舰产品上同样在调整定价节奏,DeepSeek 和月之暗面等以低价著称的实验室持续用更激进的定价吸引开发者。OpenAI 选择在 8 月 21 日对 Sol 打折,时间点正对着竞争对手的新品发布窗口,防御意图明显。
价格战的直接受益者是开发者,但受益不等于"便宜"。Sol 即便降了 20%,输入价仍是 Luna 的 20 倍。厂商的分层定价让"选对档位"变成了开发者自己的责任:同样的应用,路由到 Luna 和路由到 Sol,成本差一个数量级。模型能力的军备竞赛,正在变成成本的精细化管理竞赛,谁的路由和缓存策略更聪明,谁的实际账单就更低。
价格战还有一个容易被忽略的下游效应:当推理价格持续走低,AI 应用的成本结构会被整体重构。过去按调用量精打细算的创业团队,可以把预算从省 token 转移到产品打磨上;而依赖高价模型做深度推理的应用,会开始重新计算是把任务留在云端还是搬到本地。这轮降价在 2026 年下半年的影响,可能要等到应用侧的成本迁移完成之后才能完全显现,但方向已经很清楚:模型调用会越来越像水电煤,按需取用、按量付费,价格不再是多数团队上车的门槛。
五、三档价格放一张表里
| 档位 | 定位 | 输入价(美元/百万token) | 输出价(美元/百万token) | 本轮降幅 |
|---|---|---|---|---|
| Luna | 低成本高速 | 0.20 | 1.20 | 7/30 降 80% |
| Terra | 均衡档 | 2.00 | 12.00 | 7/30 降 20% |
| Sol | 旗舰复杂推理 | 4.00 | 20.00 | 8/21 降 20%(输入)/33%(输出) |
(注:以上为 8 月 21 日后生效的现货价,Sol 为促销价,至少维持到 11 月 21 日)
六、开发者怎么接:选型逻辑与三个注意点
面对这套两副面孔的价格体系,开发者的选型逻辑可以收成三句话。
第一,按任务路由而不是按品牌选。简单查询、高频调用走 Luna,0.20 美元的输入价意味着即使调用量很大,账单也扛得住;涉及复杂推理、需要更强深度思考的任务再上 Sol。省钱的钥匙不在谈判,而在路由规则。
第二,留意超长输入的价格跃迁。GPT-5.6 家族虽然共享 105 万 token 上下文,但 Luna 超过 272K token 的输入会按 2 倍输入、1.5 倍输出计费。也就是说,超长文档任务的真实成本比基准价高得多,选型时要把这个隐藏档位算进去,别只看广告价。
第三,缓存要利用起来。读取缓存的价格是原价的 90% 折扣,对重复请求多的 Agent 和问答类应用,缓存命中率直接决定实际账单。价格表上的数字是起点,缓存、批处理这些工程手段才决定终点。
给一个直观的账。假设一个应用每月跑 1000 万输入 token、200 万输出 token。全部走 Luna,输入部分约 2 美元,输出部分约 2.4 美元,合计约 4.4 美元;同样的量全部走 Sol,输入约 40 美元,输出约 40 美元,合计约 80 美元。同一个应用,只因为路由不同,月度账单相差近 18 倍。价格战的大部分红利,最终属于那些愿意做路由优化和缓存命中的团队,而不是简单把默认模型切到最便宜的档位。
两轮降价让 GPT-5.6 家族的价格带铺得极宽,从 0.20 到 4 美元,覆盖了从玩具级到旗舰级的全部场景。价格战的深水区已经不只是谁更便宜,而是谁的分层更聪明。对开发者来说,这反而是最好的时代:算力从奢侈品变成日用品,剩下的问题只有一个,你会不会用。