slime 后训练框架:拆解 Megatron + SGLang 的 RL 数据闭环
2026/9/19 9:20:44 网站建设 项目流程

slime 后训练框架:拆解 Megatron + SGLang 的 RL 数据闭环

【免费下载链接】slimeslime is an LLM post-training framework for RL Scaling.项目地址: https://gitcode.com/GitHub_Trending/slime12/slime

做 RL 训练的人大多卡在 rollout(推理生成阶段):推理太慢、参数跟不上训练、数据链路对不齐。你需要的不是一个推理服务,而是把"训练出参数、推理出数据"放进同一个闭环的后训练框架。slime 后训练框架干的就是这件事。

🔧 数据流是怎么跑的

slime 的核心就三个模块,各管一段:

  • 训练模块(Megatron):从数据缓冲区读样本做训练,每步结束把新参数同步给推理端
  • Rollout 模块(SGLang + 路由器):拿最新参数生成新样本,含奖励模型、验证器输出,写回缓冲区
  • 数据缓冲区:中间的桥,管理提示词初始化、自定义数据与 rollout 生成方法

数据流转成一个圈:

Megatron 训练 → 参数同步 → SGLang 推理 → 样本+奖励 → 数据缓冲区 → 回到 Megatron

入口是train.py:先用 Ray 分配 GPU、创建 rollout 管理器,把初始权重推给 SGLang,再进主循环。每一轮先调generate()拿 rollout 数据,再提交async_train()训练,按间隔保存 checkpoint。想动手跑的话,先git clone https://gitcode.com/GitHub_Trending/slime12/slime,然后照着 Quick Start 指南 走。

📊 支持哪些场景和模型规模

  • 前沿模型 RL 后训练:GLM-4.5 到 GLM-5.3 系列的 RL 训练都由它承担。scripts/models/ 下覆盖 Qwen3-4B 到 GLM5.2-744B-A40B 各档规模的启动脚本。
  • Agentic 工作流:多智能体、搜索、编码 agent 都通过自定义生成函数接入同一个 rollout 循环,不 fork 训练内核。examples/ 里有 multi-agent、search-r1、coding-agent 现成案例。
  • 跨框架迁移tools/提供 HF 与 Megatrontorch_dist格式互转,模型在两个生态间来回搬。

🚀 几个值得留意的设计决定

  • 它直接透传 Megatron 和 SGLang 原生参数(推理参数加--sglang-前缀),所以上游引擎的新优化你能直接用上。
  • 它只选 SGLang 一个 rollout 后端,所以 PD 分离、会话亲和路由、增量权重同步这些能力可以完整使用,不做阉割。
  • 它提供 rollout-only 和 train-only 两条独立调试路径,所以 RL 里那些静默 bug 能一步步定位。
  • 它把容错、可复现、trace 当成一等公民写进 docs/,而不是事后补丁。

如果你正在做 LLM RL 后训练,且要同时管训练与推理两端的资源,值得花一个下午跑通一个小模型案例。如果只做 SFT 或纯推理服务,这个框架的收益就有限了。

【免费下载链接】slimeslime is an LLM post-training framework for RL Scaling.项目地址: https://gitcode.com/GitHub_Trending/slime12/slime

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询