GLM-5预训练数据揭秘:28.5T tokens背后的Scaling之路
【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5
GLM-5 是一款面向复杂系统工程与长程智能体任务的开源旗舰大模型。相比前代 GLM-4.5,它将预训练数据从 23T 扩展到 28.5T tokens,参数规模从 355B(激活 32B)扩展到 744B(激活 40B),并集成了 DeepSeek 稀疏注意力(DSA)大幅降低部署成本。这篇文章带你完整看懂 GLM-5 预训练 Scaling 的每一步。
一、参数与数据双升级:GLM-5 的 Scaling 清单 📈
Scaling(规模化扩展)依然是提升模型智能效率最可靠的途径之一。GLM-5 在这一代做了两件事:把模型做大、把数据喂足。
| 升级维度 | GLM-4.5 | GLM-5 | 提升幅度 |
|---|---|---|---|
| 总参数量 | 355B | 744B | +109% |
| MoE 激活参数 | 32B | 40B | +25% |
| 预训练数据量 | 23T tokens | 28.5T tokens | +24% |
| 稀疏注意力 | 无 | 集成 DSA | 部署成本大幅下降 |
💡 小知识:GLM-5 采用 MoE(混合专家)架构,744B 是"总专家规模",每次推理只激活 40B 参数——相当于"图书馆藏书 744 万册,每次只翻阅 40 万册",既保留了超大知识容量,又控制了计算开销。
更详细的升级说明见官方中文文档:README_zh.md。
二、为什么 28.5T tokens 的预训练数据如此重要?
对新手来说,"tokens 数"可以简单理解为模型"读完"了多少文字:
- 数据规模决定知识下限:28.5T tokens 意味着模型在预训练阶段"阅读"了远超任何人类穷尽一生的文本量,覆盖代码、论文、网页、对话等多领域语料;
- 数据质量决定智能上限:GLM-5 团队并不只是堆量,而是围绕复杂系统工程、长程任务等高价值场景优化数据配比,让 28.5T tokens 中的每一部分都"花在刀刃上";
- 数据与参数协同 Scaling:仅加数据不加参数(或反之)都会遇到瓶颈。GLM-5 把数据量提升 24% 的同时把参数量提升 109%,两者乘积效应显著拉开了与上一代的能力差距。
三、DSA 稀疏注意力:长上下文的"降本秘诀" 🔍
大上下文能力一直是部署大模型最烧钱的部分。GLM-5 集成了DeepSeek 稀疏注意力(DSA),其核心思想是:
- 不再对每个 token 与全部历史上下文做"全量计算",而是只关注真正相关的部分;
- 在保持长上下文能力的同时,大幅降低推理与部署成本。
对普通用户而言,这意味着:同样的硬件,能跑起更长的上下文;同样的服务价格,用户能获得更低的响应延迟。这也是开源旗舰模型走向"可落地"的关键一步。
四、后训练补位:异步 RL 基础设施让数据"长出"卓越能力
预训练决定"会不会",强化学习(RL)决定"有多强"。但大规模 RL 训练效率低一直是行业难题。GLM-5 团队自研了异步 RL 基础设施 slime,通过异步化设计大幅提升训练吞吐量与效率,使更细粒度的后训练迭代成为可能。预训练 + 后训练双管齐下,是 GLM-5 在推理、编程和智能体任务上全面超越 GLM-4.7 的根本原因。
五、基准测试:28.5T tokens 换来了多大的提升?
官方在 8 项主流基准上对 GLM-5 与前沿闭源模型进行了对比,覆盖智能体(Agentic)、推理与编码三大方向:
几个值得新手记住的关键数字:
- SWE-bench Verified(真实软件工程能力):73.8 →77.8,超越 Claude Opus 4.5 之外的多数对比项;
- Terminal-Bench 2.0(真实终端任务):41.0 →56.2,开源阵营领先;
- τ²-Bench(智能体任务):87.4 →89.7,追平闭源第一梯队;
- 8 项基准全部领先前代 GLM-4.7,验证了"数据 + 参数"双重 Scaling 路线的有效性。
六、真实世界场景:从编码到长周期经营 🚀
在内部评估套件 CC-Bench-V2 上,GLM-5 面向真实工程场景的表现同样亮眼:前端构建成功率 98.0%(+26%)、大仓库探索 65.6%、多步骤链式任务 52.3%,多项指标反超对比模型:
更具想象力的是长周期经营能力。在 Vending Bench 2(模拟运营一家自动售货机生意一整年)中,GLM-5 最终账户余额达$4,432,在开源模型中排名第一,展现出出色的长期规划与资源管理能力:
七、如何上手体验 GLM-5?🛠️
- 获取模型:GLM-5 提供 BF16 与 FP8 两种精度版本(744B-A40B),可通过主流模型社区下载,详见 README.md 中的模型下载说明;
- 本地部署:GLM-5 系列已适配 SGLang、vLLM、Transformers、KTransformers、Unsloth 等主流推理框架,昇腾 NPU 平台部署参考 example/ascend.md;
- 思考力度调节:通过
reasoning_effort参数可在max与high两档之间切换(默认max),也可用enable_thinking=false完全关闭思考,灵活平衡效果与速度; - 进阶微调:支持使用 slime、ms-swift 等框架进行 SFT / PPO / GRPO 微调,把 GLM-5 变成垂直领域的专属模型;
- 生态技能:项目内置的 skills/glm-master-skill/SKILL.md 汇总了 GLM 生态的官方技能目录与安装方法,适合想扩展 OCR、图像生成等能力的用户。
结语
GLM-5 的故事是 Scaling 路线的一次教科书式实践:28.5T tokens 的预训练数据打底、744B 参数规模承接、DSA 稀疏注意力降本、异步 RL 后训练封顶。正是这四层叠加,让这款开源模型在推理、编码与长程智能体任务上全面逼近闭源前沿——也为所有想理解"大模型是怎么变强的"的用户,提供了一条清晰可追溯的进阶之路。
【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考