Agent-Native模型赛道开卷:基元律动之外还有谁在押注
【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B
2026 年 9 月,基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学、阿里巴巴发布技术报告,推出首个 Agent-Native 模型 NeoHorse-1(含 4B 与 9B 两个版本),把"让 Agent 用工具、收反馈、纠错误"这件事从前端框架推进到了模型训练层。同一时间,围绕"4B 小模型干翻 9B 通用模型"的社区讨论持续升温,CSDN 上与之相关的部署、微调、评测教程在两周内密集涌现。一个信号已经足够清晰:大模型竞赛的下半场,押注点正从"参数规模"转向"Agent 原生能力"。本文结合 NeoHorse-1-4B 开源仓库的源码级细节,拆解这条赛道的定义、玩家、技术路线与商业化逻辑。
什么是 Agent-Native:从"会聊天"到"会干活"
Agent-Native 与通用大模型的本质差异,社区里已有相当一致的经验性总结:通用模型优化的是"对话质量",Agent 模型优化的则是"输出约束性、确定性推理与格式稳定性"。基元律动在技术报告中的定义更直白——将 Agent 使用工具、接收反馈和修正错误的经验,转化为模型自身的参数能力。换句话说,通用模型把工具调用当作"事后拼接"的提示工程,Agent-Native 模型则把工具调用当作训练信号本身。
这一差异在仓库的 chat_template.jinja 中体现得十分具体。该模板内建了一套结构化的函数调用协议:系统提示注入<tools>JSON 工具清单,模型以<tool_call>包裹<function=...>与<parameter=...>的 XML 形式发起调用,工具结果以<tool_response>回传,多轮工具调用之间允许模型输出自然语言推理。配合<think>推理标签,模型被训练成"先想清楚、再决定调哪个工具、最后按格式落盘"的执行单元,而非自由发挥的聊天对象。部署侧同样印证了这一取向:README 给出的 SGLang/vLLM 启动参数中,--reasoning-parser qwen3与--tool-call-parser qwen3_coder是标配,也就是说推理框架层面就默认了工具调用与思维链的解析器绑定。
玩家图谱:谁在押注这条路线
押注 Agent-Native 的玩家大致可分为三类,而基元律动恰好卡在三者的交汇处。
第一类是"模型即 Agent"的先行者。NeoHorse-1-4B 的官方评测表中,同场竞技的是 Qwen3.5-4B、Gemma-4-E4B-it、Nanbeige-4.2-3B、Agents-A1-4B、Spark-X2.5-4B 五款开源模型,其中至少三款是 4B 量级、明确面向 Agent 场景的竞品——这本身就是一张赛道玩家的快照:头部厂商与创业公司都在 4B 这个"性价比甜点"上布局。
第二类是"框架转模型"的路线派。基元律动的特殊之处在于,其创始人王云鹤此前执掌过华为诺亚方舟实验室与盘古大模型,而公司在发布模型之前先开源了 Routing Harness 系统 OpenSquilla——一个在 Agent 执行任务时负责"选谁干活、怎么调度"的模型路由框架。NeoHorse 的意义在于把这条前端工具链延伸到了后训练阶段:路由系统产出的执行轨迹,反过来成为模型的学习语料。工具链、执行数据和模型训练第一次形成了自洽的闭环。
第三类是"决策专用"的细分生态。社区情报显示,围绕 NeoHorse 已生长出一批聚焦"决策模型"的衍生实践——对标 Jev 的 NeoHorse-Jev-4B 系列,主打多候选方案评分、工单分流、风控判断等结构化决策任务,采用 SFT + GRPO/DPO 两阶段训练与 JSON 强约束输出。这条支线说明,Agent-Native 赛道内部正在快速分化:一端是通用工具执行型,一端是专用决策评分型,而两者的评估语言(格式合规率、任务完成率而非对话榜单)已经和传统 LLM 评估分道扬镳。
技术路线:三种并行的押注方式
从仓库源码与官方文档出发,可以看到三条清晰的技术路线:
其一,Routing Harness 驱动的递归自我提升(RSI)。这是 NeoHorse 最独特的押注。README 完整描述了这条闭环:routing harness 将任务分配给异构模型池,记录工具交互与结果,估计能力需求,并以能力级反馈塑造下一轮训练数据混合;更新后的模型重新回到 harness 中服役,从而闭合一个"评估—选择—更新"的原型循环。配套的后训练框架是路由引导的课程式 SFT(routing-guided curriculum SFT)与路由引导的在线蒸馏(routing-guided on-policy distillation),把执行轨迹转化为训练信号,同时保留每条响应前后的执行与 harness 上下文。这不再是"造一个更强的模型",而是"造一个会自己变强的系统"——头条社区把它比喻为"一匹会自己找教练的马",颇为传神。
其二,数据管线层面的工程化。训练语料以 OpenSquilla 等 Routing Harness 产生的执行轨迹为核心,保留能力需求预测、路由选择、模型响应、工具调用与环境反馈五个环节,并经过完整性检查及目标完成、证据一致性、错误恢复等质量评估。仓库 README 列出的数据治理手段包括:精确与近似去重、评测数据去污、结构化校验、六维语义评估、以及场景级 Scene/Goal/Outcome 标注。Agent 训练数据的难点不在于"多",而在于"轨迹是否完整、失败是否被记录"——这套流水线给出了可复制的答案。
其三,混合注意力架构与超长上下文。打开 config.json 可以看到 NeoHorse-1-4B 的骨架:32 层中 28 层为 linear_attention(线性注意力),每 4 层插入一层 full_attention(全注意力),hidden_size 2560、intermediate_size 9216、head_dim 256。权重索引 model.safetensors.index.json 进一步证实:216 个 linear_attn 张量对 48 个 self_attn 张量,线性注意力占绝对主体——这是把 262,144 token 原生上下文(可扩展至 1,010,000)压进 4B 参数的硬件前提,也是"4B 在低显存上逼近更大模型"传闻的架构来源。权重量级为 Safetensors/BF16,总计约 8.4GB,两张分片即可装载。
工程落地:4B 尺寸的部署自由与协议约束
Agent 模型的价值必须落地到"可被 Agent 框架调用"。NeoHorse-1-4B 在这点上给出了教科书式的低门槛方案。README 提供两套启动路径:SGLang v0.5.17 的python3 -m sglang.launch_server --served-model-name neohorse-1-4b与 vLLM 的vllm serve,两者均暴露 OpenAI 兼容的/v1/chat/completions端点,并以--max-model-len 262144对齐上下文上限。结合社区实践,从 llama.cpp 的 GGUF 量化、Ollama 一键装载,到 vLLM 的 PagedAttention 与连续批处理,再到 guided decoding 强制 JSON 输出,4B 量级意味着消费级显卡与单卡 16GB 内网服务器都能完整走通"部署—推理—结构化输出"链路,也因此成为 Codex 等 Agent 工具链中低延迟决策节点的热门候选。
需要留意的是协议约束的另一面:模型虽然以 Apache-2.0 开源,但上游底座是 Qwen3.5-4B,其版权归属 Alibaba Cloud,许可证文件与模型卡中均保留了上游版权声明与 TokenRhythm 的修改声明(LICENSE 与 tokenizer_config.json 中的modification_notice字段可查)。也就是说,商用自由度建立在"尊重上游版权、保留声明"的前提之上——这为后来者提供了清晰的合规路径,也提示了 Agent-Native 赛道"基座依赖"的现实:多数押注者仍是在他人的地基上盖房子。
评测:Agent 能力的度量正在成型
Agent 模型的评测体系正在从"对话榜单"转向"任务完成"。NeoHorse-1-4B 的官方结果提供了可参照的度量方式:在 QwenClawBench 44.68、WorkBuddy Bench 34.41、PinchBench 77.33、tau2-Bench 88.46 四个 Agentic 基准上均位列参评模型第一(对比模型含 Qwen3.5-4B、Gemma-4-E4B-it、Nanbeige-4.2-3B、Agents-A1-4B、Spark-X2.5-4B);十个基准的 macro 平均 64.87,较基座 Qwen3.5-4B 的 58.94 提升 5.93。评测协议同样值得记录:SGLang v0.5.17、temperature=1.0、top_p=0.95、top_k=20、presence_penalty=1.5,且开启 thinking 模式并强制非空推理内容——Agent 基准的分数对采样参数极其敏感,脱离协议谈分数没有意义。
但数据也呈现了必要的诚实:VitaBench 上 NeoHorse-1-4B 的 32.00 落后于 Agents-A1-4B 的 39.25,LiveCodeBench v6 的 59.43 亦低于 Nanbeige-4.2-3B 的 72.50。这说明 Agent-Native 后训练带来的是"能力再分配"而非"全面碾压"——在需要多模态仿真与在线代码执行的部分场景,4B 量级仍有明显天花板。这恰恰是赛道健康度的证据:没有一家能在所有维度通吃,差异化空间依然充足。
未来 12 个月:三个观察点
基于现有情报与仓库状态,未来一年这条赛道的胜负手大概率集中在三处:
一是 RSI 闭环能否跑完第二圈。NeoHorse-1 目前只是"原型闭环":harness 记录轨迹、反馈塑造数据、更新模型回炉。真正的递归自我提升要求这个循环在多轮迭代中持续产生可测量的能力增益,而非一次性提升后收敛。谁先把"第二圈"的收益公开化,谁就定义了 Agent-Native 的上限叙事。
二是评估基准的标准化。QwenClawBench、WorkBuddy Bench、tau2-Bench 等基准的出现,说明"任务完成率 + 格式合规率 + 错误恢复率"正在取代困惑度与对话打分。接下来 12 个月,这些基准能否形成跨厂商公认的协议(包括采样参数、模拟器、裁判模型),将直接决定各家宣传口径的可比性。
三是决策专用与通用执行的生态分化。社区对 NeoHorse-Jev-4B 一类决策模型的热衷(LoRA 微调、GBNF/JSON Schema 约束、temperature=0.1 的工程信条)表明:企业级 Agent 落地更稀缺的是"稳定输出可审计结论"的决策引擎,而非"博学多才"的通才。基元律动手握 RSI 方法论与 OpenSquilla 调度层,能否将通用执行模型与专用决策模型统一进同一套数据反馈体系,是比单点模型发布更值得关注的战略问题。
Agent-Native 赛道的开卷信号已经足够响亮:当"路由—执行—反馈—再训练"成为模型的自我进化回路,当 4B 参数成为可私有化、可微调、可审计的默认尺寸,模型竞争就不再只是算力与参数的军备竞赛,而是一场关于"系统如何从执行中学习"的工程竞赛。基元律动押注的是整条闭环,而闭环一旦成立,模仿者将面临的不只是追赶一个模型,而是追赶一套会自我更新的方法论。
【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考