Qwen3.8-Max-0902 登顶编程榜,模型价格卷到 5 美元
2026/9/4 1:36:05 网站建设 项目流程

9 月 2 日,阿里千问把旗舰模型 Qwen3.8-Max 升级到 0902 版本,在 Code Arena 的 WebDev 前端编程总榜上以 1691 分排到第一,比上一版涨了 22 分;官方给出的综合价格是每百万 Token 5 美元,按报道折算约 33.7 元人民币。同一天,据报道谷歌低调上线了 Gemini 3.8 Flash;前一天,Anthropic 刚发布 Claude Fable 5.1。编程模型这条赛道,更新的节奏肉眼可见地在加快。

这次升级的本质:不是新架构,是"针对性后训练"

0902 并不是从零训练的新模型。官方的说法是围绕编程(Coding)和专业办公(Cowork)两个方向,对 8 月初刚发布的 Qwen3.8-Max 做进一步后训练,让模型更适合企业真实复杂任务、科研、长周期任务(据报道)。底座规格据称是 2.4T 参数、1M 上下文,这是它能处理"把整个仓库代码喂进去改"这类活的前提。

把时间线拉出来看,这个版本离底座首发才一个月。头部厂商已经形成一种固定打法:同一个底座,隔几周针对某个场景做一轮后训练,就发一个新版本,榜单分数、价格、上下文长度跟着一起卷。

变了什么,没变什么

变了两件事。

一是名次。国内模型在"智能体式编程"这类偏工程的总榜上登顶了。Code Arena 的 WebDev 测的不是写个排序算法,而是多步推理、工具调用、端到端生成应用这类真实开发活,据报道这次比 Claude Opus 5 还高出 3 分。前端任务恰恰是工具调用最密集、最需要"改完自己验证"的场景,和 agent 写代码的真实形态最接近,所以各家厂商现在都盯着这类榜单。

二是价格。按 Code Arena 的帕累托前沿榜,性能排在后面两名的模型,综合价分别是 20 美元和 12 美元每百万 Token(据报道),0902 报的 5 美元确实把标杆往下拽了一截。

顺带一提,同一天谷歌上线的 Gemini 3.8 Flash,官方口径同样是增强软件工程和智能体知识工作流能力(据报道)。大家押注的是同一个方向:让模型直接干工程活,而不是停留在聊天窗口里。

没变的也有两件事。

一是跑分不等于你的场景。榜单任务和大多数人手头的活——内部管理系统、报表、接口联调——不是一回事,它能不能帮你把遗留代码改明白,还是得拿自己的项目说话。

二是模型再强也得配好工具链。IDE 插件、Agent 框架、CI 流程适配不到位,能力打折扣是常态。

对普通开发者意味着什么

最直接的变化是"用得起"了。编程模型的价格打到 5 美元这个档位,个人开发者自费接 API 写点自动化脚本、小工具,成本上是可以接受的。据报道,0902 已上线千问 AI 平台对外提供 API,并第一时间接入千问办公、Qoder、千问 App。

想体验的话,路径不复杂:

  • 开通 API,先用免费额度跑自己的真实需求,别拿官方示例当结论
    • 在编辑器里装官方插件(如 Qoder)直接试,比写脚本直观
    • 从"改 bug、补测试、写文档"这类小任务入手,别一上来就让它重构整个系统
      下面是接 OpenAI 兼容接口做最小验证的写法,地址和模型名以你账号后台实际开通值为准:
fromopenaiimportOpenAI# base_url / api_key / model 换成你控制台里的实际值;# 若平台不提供 OpenAI 兼容接口,以官方 SDK 为准client=OpenAI(base_url="https://你的服务商地址/v1",api_key="你的key",)resp=client.chat.completions.create(model="Qwen3.8-Max-0902",# 以后台实际开通的模型名为准messages=[{"role":"user","content":"给下面这个函数补上异常处理和类型注解,并说明改动点。",}],)print(resp.choices[0].message.content)``` 选型上给几个实在的提醒:-**别只看"综合平均价"**。输入、输出、缓存命中分开计费,实际账单按你的用量结构算;长上下文任务每次请求都拖着大段输入,单价再低也可能超预算--**长上下文是卖点也是成本点**。1M 上下文听着爽,费用和延迟会跟着上下文长度涨--**重点试工具调用和 Agent 能力**。现在的编程模型拼的是"能不能自己改完代码再跑测试把问题修掉"--**企业用户先过合规**。把代码片段发给第三方平台前,确认公司制度允许--**团队落地先划边界**。哪些活可以交给模型、哪些必须人审,这个边界要在引入前定好,尤其是涉及生产环境和数据的改动 坑也有:榜单价和到手价是两回事;"登顶"只代表评测集,不代表它改得动你那套跑了好几年的遗留代码;也别今天看这个榜换一个、明天看那个榜再换——工具链适配、提示词积累、团队习惯养成都有成本,跟风前先算算切换成本。对多数打工人来说,模型榜单是参考,真正有用的是"在你自己的代码库上跑通一个真实需求"## 结尾模型一个月一更、价格往下走,对写代码的人来说选择确实变多了,但"用在哪、怎么接、账怎么算"还是得自己过一遍。你怎么看,评论区聊聊。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询