☰
深度拆解「会自己找教练的马」:NeoHorse 的递归自我提升机制全解析
2026/10/10 22:25:21 网站建设 项目流程

深度拆解「会自己找教练的马」:NeoHorse 的递归自我提升机制全解析

【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B

2026 年 9 月,基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布 Agent-Native 模型 NeoHorse-1,包含 4B 与 9B 两个版本。技术社区很快给它起了一个形象的名字——"一匹会自己找教练的马"。这个比喻并非营销话术,它精确对应了论文标题中的关键词:Recursive Self-Improvement(递归自我提升,RSI)。本文结合 arXiv 技术报告、社区报道与本地仓库源码,拆解三个核心问题:这匹马是怎么"找教练"的?这套机制如何被装进一个 9B 模型?以及自我提升在小模型上的边界究竟在哪里。

一、RSI 的原理:把"执行轨迹"变成"下一轮训练数据"的闭环

递归自我提升(RSI)在概念上并不新鲜,真正的难点在于一个具体机制:AI 系统如何"观察"到自己的能力边界,并把这种观察转化为下一轮学习的信号。NeoHorse 给出的答案是——路由鞍具(Routing Harness)。

基元律动此前开源过 Routing Harness 系统 OpenSquilla,用于在 Agent 执行任务时选择和组织不同模型。NeoHorse 把这条技术路线从"推理期"延伸到了"训练期"。整个系统由一个异构模型池 + 智能路由构成:任务进入 harness 后,路由层会预测任务的能力需求、选择对应的服务层,然后记录下完整的交互过程。据澎湃新闻对技术报告的报道,这些执行轨迹"保留了能力需求预测、路由选择、模型响应、工具调用和环境反馈",经质量评估后用于后训练。

这意味着训练数据不再是人工撰写的问答对,而是真实 Agent 在真实工具环境中"跌打滚爬"出来的记录。要让这些杂乱轨迹成为合格训练样本,NeoHorse 设置了层层关卡:

  • 完整性检查:轨迹必须包含完整的推理、工具调用与结果;
  • 质量评估:按目标完成度、证据一致性、错误恢复能力等维度筛选;
  • 数据清洗:精确/近似去重、评测集去污染、结构验证、六维语义评估;
  • 子场景级标注:按 Scene / Goal / Outcome 打标签,让每段轨迹都能定位到具体能力点。

随后,路由信号把监督微调组织成三阶段课程式 SFT(routing-guided curriculum SFT),并进一步扩展到路由引导的 on-policy 蒸馏(routing-guided on-policy distillation):在相同的课程进度下,由教师模型监督学生模型自己生成的响应。最后一步是闭环的关键——能力引导分配(capability-guided allocation):把评估反馈重新折算成下一轮训练数据的混合配比,于是"系统学到什么"直接决定了"它接下来从什么中学",形成 evaluation–selection–update 三环节循环。

严格来说,这还不是完整的 RSI——README 中写得很克制:"extending this loop across successive iterations is the next step toward RSI"(跨代延伸这一循环是迈向 RSI 的下一步)。它目前是一个单轮循环的原型,但"自我观察能力 → 转化训练信号 → 更新模型回到 harness"的递归骨架已经跑通。

二、实现路径:9B 模型里装下"递归提升"的工程实装

本地仓库NeoHorse-1-9B就是这份技术报告开源的 9B 版本。先从模型卡片看定位:README.md明确写着它是从 Qwen3.5-9B 后训练的 9B 因果语言模型,面向文本 Agent harness、工具使用、编程与指令遵循,只含语言模型权重(视觉权重未包含),权重格式为 Safetensors / BF16,总大小约 17.9GB(见 model.safetensors.index.json)。

真正值得关注的是架构上的"混合注意力"设计。config.json 显示模型共 32 层,其中24 层为 linear_attention(线性注意力/SSM 风格层),8 层为 full_attention(全注意力层),每 4 层插入一个全注意力层(full_attention_interval: 4,全注意力位于第 3、7、11…31 层)。从权重索引可以验证这一设计:linear_attn 层拥有in_proj_qkv、in_proj_z、conv1d、dt_bias、A_log等典型状态空间模型参数,而 full_attention 层则是标准的q_proj/k_proj/v_proj/o_proj。这种"稀疏全注意力 + 线性注意力"的混合架构,正是为了在 262,144 个 token 的原生上下文长度(README 称可扩展至 1,010,000)下控制 KV 缓存开销——也是 9B 模型能在有限显存下跑长上下文 Agent 任务的底气。

递归提升的"工程落点"还体现在对话协议上。chat_template.jinja 与 tokenizer_config.json 定义了完整的 Agent 交互格式:

  • 工具调用使用<tool_call><function=...><parameter=...>的 XML 结构,要求函数调用必须嵌套在 tool_call 标签内,且参数以 key-value 形式显式声明;
  • 推理过程使用<think>...</think>标签包裹,支持 reasoning_content 与消息内容分离;
  • 多步工具调用通过<tool_response>...</tool_response>包裹工具结果,模板会从消息末尾反向检测最后一个真实用户提问,从而把"工具响应串"正确折叠为单轮对话。

换句话说,harness 里记录的"交错推理 + 工具调用 + 环境反馈"轨迹,在训练和推理两端用同一套模板语言还原——这让后训练学到的能力能够无损迁移回部署时的 Agent 链路。

部署侧同样为 Agent 场景做了针对性配置。README.md给出了两种官方路径:SGLang v0.5.17(技术报告所用版本)与 vLLM,启动参数均需指定--reasoning-parser qwen3与--tool-call-parser qwen3_coder,并配合--context-length 262144。也就是说,9B 模型的"Agent 原生性"不只是训练数据带来的,还依赖推理框架对思考标签与工具调用格式的原生解析。

三、效果与局限:+3.44 的宏观平均,以及小模型自我提升的边界

RSI 机制到底有没有用,最终要看数字。README.md 的评测表给出了十项基准、五个开源基线的完整对比,报告协议为 SGLang v0.5.17、temperature=1.0、presence_penalty=1.5、thinking mode 开启。核心结果:

  • 十项基准宏观平均 69.04,较基础模型 Qwen3.5-9B 的 65.60 提升 +3.44,同时超过 12B(Gemma-4-12B-it,63.51)与 30B(Muse-Glimmer-30B,67.86)级别的开源基线;
  • Agent 能力维度增益最显著:PinchBench +7.70(82.25)、VitaBench +11.00(42.25)、QwenClawBench +4.69(48.73)、tau2-Bench 90.82(+2.78)——这也符合直觉:训练数据全部来自真实 Agent 轨迹,收益自然集中在"会干活"的能力上。

arXiv 摘要还披露了一个更耐人寻味的现象:后训练把4B 版本的宏观平均从 58.94 拉升至 64.87(+5.93),涨幅明显大于 9B 版本的 +3.44,"substantially narrowing the aggregate gap between the post-trained 4B model and the 9B base model"——后训练后的 4B 模型与 9B 基础模型之间的整体差距被大幅收窄。这说明基于真实执行轨迹的后训练,对小模型的边际收益更大:小模型不缺参数,缺的是高质量的行为示范。

但效果表也诚实地暴露了边界。在 Coding 与指令遵循维度上,增益几乎为零甚至为负:LiveCodeBench v6 为 +0.00(65.14),IFBench +0.00(66.33),IFEval 甚至 -0.37(89.09)。HumanEval 的 +5.49 很大程度是低基线(92.68)下的追赶。换句话说:这套机制擅长把"会用的工具、会走的流程"教给模型,却难以凭空提升其基础指令遵循与代码生成能力——RSI 循环只能强化模型已经具备的能力谱系,无法创造训练分布之外的能力。这也解释了 README 中"Broad gains"措辞的审慎。

另一个不容忽视的边界是数据循环自身的风险。当前闭环是"评估反馈 → 训练混合"的单轮原型,尚未跨代迭代;一旦真正递归下去,由上一代模型生成的轨迹反复进入下一代训练,就必然面对自我蒸馏导致的多样性坍缩问题——这也是所有 RSI 路线的共同隐患。此外,本仓库只发布语言模型权重,不含视觉权重,多模态 Agent 能力不在当前讨论范围内。

结语

NeoHorse 的价值不在于宣称"模型自己训练自己",而在于给出了一个可复现、可审计的中间步骤:用路由 harness 把 Agent 的实战经验沉淀为训练信号,再用评估反馈决定下一轮学什么。对 9B 这个量级而言,+3.44 的宏观平均与 Agent 维度的大幅领先证明路径有效;而指令遵循维度的原地踏步与"跨代循环尚未跑通"的坦白,则划定了当前版本的真实边界。一匹会自己找教练的马,目前还处于"教练初上岗"的阶段——但训练场已经搭好了。

【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询