8月26日晚,Hacker News首页同时出现了两款来自中国的轻量级大模型——智谱的GLM-5.3-Flash和阿里千问的Qwen3.8-Flash-Next,引发海外开发者社区的广泛讨论。两款模型均定位为“Flash”级,强调低成本和高效能,但各自的架构和侧重点有所不同。
与此同时,该赛道原有的代表性产品DeepSeek V4 Flash于8月17日调整了定价策略,引入峰谷计价模式。三款模型在同一个月内先后释放新信息,让开发者和企业用户在选型时有了更多维度的考量。
以下基于公开资料和第三方评测数据,分别介绍这三款模型的现状。
一、DeepSeek V4 Flash:定价策略调整,峰谷计价上线
DeepSeek V4 Flash自发布以来,以较低的API价格获得了不少中小团队和内容创作者的青睐。自2026年8月17日起,其定价模式调整为高峰/空闲时段差异化收费:
高峰时段(工作日 9:00-12:00, 14:00-18:00):输入(缓存未命中)3元/百万tokens,输出9元/百万tokens。
空闲时段:输入1.5元/百万tokens,输出4.5元/百万tokens。
调整后,若在空闲时段调用,价格仍处于可接受范围;但在高峰时段,调用成本较此前有明显上升。这一变化可能促使部分用户重新评估调用时机或考虑其他选项。
性能方面,根据独立评测机构Artificial Analysis的智能指数,DeepSeek V4 Flash得分为53分,在同级模型中仍具竞争力,但其输出速度较快(约120 token/秒),适合对响应时间敏感的任务。
二、GLM-5.3-Flash:开源且高智商,长上下文是亮点
GLM-5.3-Flash是智谱推出的轻量级MoE模型,总参数量320B,激活参数仅18B,上下文窗口达到1M tokens(约可处理1500页文本)。该模型于8月26日正式开源,采用MIT协议,允许商业使用。
定价:在官方ZAI平台上,输入价格为0.15美元/百万tokens,输出为0.50美元/百万tokens。部分第三方平台在促销期提供更低折扣。
性能:在Artificial Analysis智能指数中,GLM-5.3-Flash获得57分,与一些顶级闭源模型的得分持平。评测中该模型生成了约1.5亿个token,输出速度约为49 token/秒,相对偏慢,但官方表示其编程和Agent能力接近某些高价位旗舰模型。
部署特色:该模型的推理服务运行在国产芯片集群上,智谱自研的推理引擎实现了较高效率,这也在一定程度上证明了国产算力在大规模商业化场景下的可行性。
三、Qwen3.8-Flash-Next:架构前瞻,本地部署友好
Qwen3.8-Flash-Next是阿里千问基于下一代Qwen4架构打造的预览版模型,总参数为176B(含51B的N-gram嵌入模块),每token仅激活6B参数,支持高达1M的上下文窗口,并具备多模态输入能力。
定价:在千问AI官方平台,输入价格为1元/百万tokens,输出为3元/百万tokens;国际版QwenCloud定价为输入0.16美元、输出0.47美元。
性能:Artificial Analysis智能指数评分为56-58分区间,与GLM-5.3-Flash处于同一梯队。官方称其训练成本仅为Qwen3.7-Plus的九分之一,但性能反超。
部署优势:模型权重已上线Hugging Face和ModelScope,体积约73GB,有开发者反馈在128GB内存的Mac设备上可本地运行,这对于希望私有化部署或避免API调用的用户是一个值得关注的特性。
如何看待这三款模型?
从当前公开信息看,三款模型各有侧重:
DeepSeek V4 Flash在调整定价后,性价比更多取决于调用时段。若团队可以灵活安排非高峰时段调用,其成本仍可接受,且响应速度较快。
GLM-5.3-Flash的优势在于高智能得分、超长上下文以及开源商用授权,适合对模型能力要求较高、需要处理长文档或有私有化部署需求的场景。
Qwen3.8-Flash-Next则在极致定价和本地运行门槛上做出了平衡,尤其对个人开发者或小团队而言,较低的总拥有成本可能更具吸引力。
在实际使用中,不同模型对同一任务的表现可能存在差异——有的更简洁,有的更详尽;有的速度快,有的思考深。建议开发者根据自己的具体任务(如文案生成、摘要、编程辅助等)进行小规模实测,再决定长期选型。
三款模型基本情况对比
各模型简要说明
DeepSeek V4 Flash于2026年4月发布,自8月17日起调整为峰谷定价模式,高峰时段为工作日9:00-12:00和14:00-18:00,空闲时段价格为高峰时段的一半。
GLM-5.3-Flash于8月26日正式上线并开源,在Artificial Analysis智能指数中获得57分。模型采用MIT协议,允许商业使用。官方ZAI平台定价为输入$0.15/百万tokens、输出$0.50/百万tokens,上线前两周提供五折优惠。
Qwen3.8-Flash-Next同样于8月26日发布,是阿里基于Qwen4架构推出的预览版模型。模型权重已上线Hugging Face与ModelScope平台,生产版本Qwen3.8-Flash将通过QwenCloud提供API服务。
选型参考
不同模型在架构设计、定价策略和开源授权上各有侧重,用户可根据自身任务需求、调用频率、部署方式等因素综合评估:
若对响应速度和调用时段的灵活性有要求,可关注DeepSeek V4 Flash的峰谷定价机制,错峰调用成本相对更低。
若需要处理超长文档、追求较高智能水平,或希望获得开源商用授权,GLM-5.3-Flash的1M上下文窗口和MIT协议是值得关注的特性。
若希望本地部署或对成本较为敏感,Qwen3.8-Flash-Next的较低激活参数和开源权重为自托管提供了可能。
建议在实际选型前,用自身业务场景中的典型任务进行小规模测试,以获取更直接的体验对比。
未来关注点
随着GLM-5.3-Flash权重的开放和Qwen3.8-Flash-Next API的即将上线,市场上将有更多可直接对比的实测数据。届时,各模型在不同任务下的真实表现会更为清晰。对于从业者而言,保持关注、定期测试,或许是应对快速变化的大模型生态的务实方式。
模型本身只是工具,如何用好它们,依旧取决于使用者的业务理解和创造力。