2026 年夏天,国产大模型迎来了又一次重要升级。
短短几个月前,万亿(Trillion)参数仍然是行业讨论的焦点;如今,国产基础模型已经开始向2T+ 参数规模全面迈进。
月之暗面正式发布2.8T 参数的 Kimi K3,并宣布即将开源;阿里通义团队则上线2.4T 参数的 Qwen3.8-Max Preview,向开发者开放抢先体验。
相比单纯追求参数规模,这一代模型更值得关注的是另一件事——它们开始真正面向长周期 Agent、复杂工程任务以及科研工作流进行设计。
无论是 GPU 编译器开发、自主芯片设计,还是百万 Token 长上下文推理,都意味着国产大模型正在进入新的竞争阶段。
Kimi K3:目前规模最大的开源基础模型之一
月之暗面(Moonshot AI)此次发布的Kimi K3,总参数达到2.8 万亿(2.8T),也是目前公开发布的最大规模开源模型之一。
相比上一代模型,Kimi K3 更大的突破并不仅仅来自参数增长,而是在模型架构、训练方法以及 Agent 能力上的全面升级。
更高效的 2.8T 架构
超大模型最大的挑战并不是训练,而是如何在保持性能的同时控制通信成本与推理效率。
Kimi K3 主要采用了三项核心技术:
KDA(Kimi Delta Attention)+ AttnRes:优化超长上下文的信息流动,相比 Kimi K2,整体扩展效率提升约2.5 倍。
Stable LatentMoE 稀疏专家架构:模型包含896 个专家,每次推理仅激活16 个,兼顾模型容量与计算效率。
QAT(量化感知训练):从 SFT 阶段开始支持 MXFP4/MXFP8 量化,使模型能够更好适配主流 AI 推理硬件。
这些优化意味着,即便模型规模已经达到 2.8T,实际推理成本依然能够控制在商业部署可接受的范围内。
Agent 能力成为重点
相比聊天能力,Kimi K3 更强调复杂工程任务的自主执行能力。
官方展示了多个具有代表性的案例:
| 场景 | Kimi K3 能力 |
|---|---|
| GPU Kernel 优化 | 在长时间沙盒环境中持续优化 Attention Kernel,实现自动分析、修改与验证。 |
| GPU 编译器 | 从零构建 MiniTriton 编译器,并成功运行 nanoGPT。 |
| 芯片设计 | 基于开源 EDA 工具完成 SoC 设计、验证与部署。 |
| 科研编程 | 自动阅读二十余篇论文,完成计算天体物理复现并生成数千行代码。 |
| 3D 内容生成 | 使用 Three.js 与 WebGPU 自动完成游戏场景开发及素材剪辑。 |
这些案例说明,模型的目标已经不仅是"写代码",而是能够持续完成整个软件工程流程。
即将全面开源
根据官方计划:
完整模型权重将在 7 月 27 日前陆续开放。
API 基于 Mooncake 分离式推理架构,编码场景缓存命中率超过90%。
缓存命中输入价格低至0.30 美元/MTok。
对于开发者而言,这意味着超大模型开始具备更加实际的部署价值。
Qwen3.8:2.4T Preview 正式开放体验
另一边,阿里通义团队也带来了Qwen3.8-Max Preview。
官方公布的信息显示,该模型总参数约2.4T,目前 Preview 版本已经上线,可供开发者体验。
相比前代版本,Qwen3.8 更强调综合能力的提升,包括:
长上下文推理
Agent 工作流
编程能力
数学与科学推理
多轮复杂任务执行
目前开发者已经可以通过:
Token Plan(国内/国际站)
Qoder
Qoder Work
等平台调用最新 Preview 模型。
官方同时表示,模型完成最终收敛和对齐之后,将继续开源权重,延续 Qwen 系列长期坚持的开放生态策略。
国产大模型为何集体迈向 2T+?
如果把近两年的技术路线串联起来,会发现行业正在发生三个明显变化。
聊天机器人 ↓ 代码助手 ↓ Agent ↓ 软件工程 ↓ AI 基础设施1. AI 正在进入"工程执行"阶段
过去的大模型更多承担代码补全、文本生成等辅助角色。
而最新一代模型已经开始尝试完成:
GPU Kernel 优化
编译器开发
芯片设计
科研复现
大型项目开发
模型正在从"工具"逐渐演进为能够持续执行复杂任务的 Agent。
2. MoE 已成为超大模型主流路线
无论是 Kimi K3,还是 Qwen3.8,都采用了超大规模 MoE 架构。
这种设计能够在保持万亿级参数容量的同时,仅激活少量专家参与计算,大幅降低推理成本。
可以预见,未来几年MoE + 长上下文 + Agent将成为基础模型的重要发展方向。
3. 开源模型持续缩小与闭源模型的差距
过去几年,最强模型几乎都来自闭源阵营。
而如今,国产开源模型正在快速提升:
参数规模进入 2T+ 时代;
编程、Agent 与复杂推理能力持续增强;
API 成本不断下降;
开源生态持续扩大。
虽然顶尖闭源模型在部分能力上仍保持领先,但开源模型与闭源模型之间的差距正在进一步缩小。
写在最后
Kimi K3 与 Qwen3.8 的发布,意味着国产基础模型竞争已经从"参数规模"进入"工程能力"的新阶段。
对于多数开发团队而言,真正需要解决的不只是"选哪个模型",还有模型的持续接入与管理。相比自行维护多个模型接口,通过MaaS(Model as a Service)平台统一调用通常更加省心。例如魔芋 AI MaaS提供统一 API 接入多家主流模型,支持通过一个 API Key 灵活切换不同模型,在兼顾价格、响应速度、稳定性和安全性的同时,也降低了多模型协同和后续迁移的成本。通过链接注册可获百万token包福利。
魔芋AI大模型网关I全球大模型一站式调用及服务平台魔芋AI大模型聚合平台(大模型网关平台)专注于提供高效能、低成本的多品类 AI 模型服务,助力开发者和企业聚焦产品创新。https://www.moyu.info/register?aff=qBX9
未来值得关注的,不再只是模型有多大,而是它是否能够真正完成复杂的软件开发、科研分析、工程设计等长周期任务。
随着 Kimi K3 即将开源,以及 Qwen3.8 持续迭代,2026 年下半年国产大模型竞争或将进一步升温。与此同时,DeepSeek、GLM、Seed、MiMo、LongCat 等团队的新一代模型也值得期待。