☰
开源 Agent 模型第二梯队浮出:Qwen3.5 血统军团崛起观察
2026/10/10 12:40:39 网站建设 项目流程

开源 Agent 模型第二梯队浮出:Qwen3.5 血统军团崛起观察

【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini

当大模型竞争的焦点从"谁能答对一道推理题"转向"谁能在真实环境里把一个长周期任务做完",Agent 模型的战场正在发生一次静默的格局重构。头部玩家依然牢牢把持着闭源生态的话语权——Claude、GPT 系列在 SWE-Bench 与 OSWorld 上不断刷新纪录;但在它们身后,一批以 Qwen3.5 系列为技术基座、以 Agent 工作流为唯一目标的开源模型军团正在快速集结。Nex-N2.5 便是这支军团中最具代表性的样本:它把"底座复用 + 定制框架 + 环境反馈训练"的路线跑通,并以 mini 尺寸把 Agent 能力压进了两张 H100 即可部署的区间。本文基于 Nex-N2.5-mini 仓库源码与公开基准数据,拆解这条技术路线的真实含量。

底座 + 定制框架:一条可复制的 Agent 化路径

翻开 Nex-N2.5-mini 的 config.json,技术路线的"血统"清晰可见:architectures字段为Qwen3_5MoeForConditionalGeneration,model_type为qwen3_5_moe——这是一个完整的 Qwen3.5 系 MoE 架构,而非从零训练的原创底座。40 层 Transformer 中每 4 层插入一个full_attention层,其余为线性注意力层;256 个专家、每个 token 激活 8 个专家;max_position_embeddings达到 262144。同时,config.json 中的vision_config区块(27 层视觉塔、patch_size 16、temporal_patch_size 2)与 processor_config.json 中的图像、视频处理器共同表明,mini 版本延续了 N2 系列的多模态基座——视觉不是附加能力,而是 Agent 感知环境、验证执行结果的接口。

但底座只是起点。真正定义 Nex 系列差异化的,是围绕推理与工具调用定制的一整套运行时。官方 README 直接给出了部署配方:使用定制版 SGLang(nexagi/sglang:v0.5.18-nex-patch镜像),启动时挂载 chat_template.jinja,并同时指定两个解析器——--reasoning-parser qwen3负责把思考痕迹与最终回答分离,--tool-call-parser qwen3_coder负责把模型输出的函数调用转换为结构化动作。这套组合意味着模型从权重到服务层是"为 Agent 而生"的,而不是通用聊天模型的外挂补丁。

chat_template.jinja 的细节进一步印证了这一点。模板定义了严格的<tool_call><function=...><parameter=...>XML 工具调用协议,要求函数调用必须嵌套在tool_call标签内、必需参数必须给出、工具返回结果以<tool_response>包裹回填对话;模板还能区分连续多轮工具调用(multi_step_tool检测),这直接服务于 Agent 与终端、浏览器、代码仓库反复交互的循环式任务形态。而reasoning_effort参数(none/medium/high)提供了三种思考模式——non-thinking、由模型自决的 adaptive thinking、强制 thinking——让开发者按任务时延与复杂度灵活调度推理预算。

错位竞争:不拼通用智力,拼 Agent 基准性价比

Nex-N2.5 与闭源头部巨头的关系,与其说是正面竞争,不如说是错位竞争。这在 README.md 的基准表中体现得十分直白:mini 版本在纯文本通用推理上没有试图与 Claude Opus 5、GPT-5.6 Sol 掰手腕,但在 Agent 与多模态操作类基准上表现出超出其体量的竞争力——Terminal-Bench 2.1 拿下 73.4,BrowseComp 83.4,Toolathlon Verified 54.6,OSWorld-Verified 71.2,OmniDoc 89.7。

值得注意的反差出现在 Pro/Max 与 mini 之间:SWE-Bench Pro 从 mini 的 43.8 一路抬升到 Pro 的 61.2、Max 的 65.7;Job Bench 从 28.5 到 53.6;OSWorld-2 从 30.5 到 56.4。这个梯度本身就是一个诚实的信号——Agent 能力仍然显著依赖模型规模,mini 的价值在于"以 2×H100 的成本获得可用的 Agent 能力",而不是"以小胜大"。

真正的竞争力藏在部署经济学里。README 给出了三个档位的资源清单:mini 只需单节点 2×H100,Pro 是单节点 8×H100,Max 则需要 2 节点 16×H200 并启用--moe-a2a-backend deepep、--moe-runner-backend deep_gemm、--attention-backend dsv4、fp8 KV cache 等一系列重型优化。对大量预算有限的团队而言,这是闭源 API 之外唯一能"把 Agent 放进自己机房"的路径——权重开源、Apache-2.0 许可、bfloat16 全精度,意味着数据不出内网、成本可预期、可微调可蒸馏。这恰恰是闭源巨头无法回应的市场空白。

中文社区生态:量化、端侧与教程的快速补位

一个开源模型是否具备生命力,看的不是发布那一刻的热度,而是它被社区"消化"的速度。从社区情报看,Nex-N2.5-mini 的中文生态已经形成三条清晰的落地线索。

第一条是 MLX 系量化。社区教程展示了基于mlx-optiq的静态混合 3/6 位量化方案:将 model.safetensors.index.json 记录的约 70.2GB(70214363872 字节)原始权重压缩至 17.8GB,压缩率约 74.6%,峰值内存仅 17.87GB,可在 Apple Silicon 上以约 50 tokens/s 推理。分层精度策略(嵌入层、in_proj_qkv 等 3 位,down_proj、lm_head 等 6 位)直接呼应了 config 中 MoE 与线性注意力层的结构差异——社区已经按架构语义在逐层调精度。

第二条是端侧 GGUF 落地。有实践文章完整对比了 Nex-N2.5-mini 与另一款模型的安卓端部署链路:GGUF 加载、MNN 框架适配、JNI 封装、Q4_K_M 量化验证,并触及 tokenizer 差异、KV cache 管理、ABI 兼容性与 APK 体积优化等工程细节。值得注意的是,tokenizer 层面 N2.5-mini 使用 Qwen3VL 系词表(tokenizer_config.json 中processor_class: Qwen3VLProcessor,词表 248320),这决定了端侧集成时必须同步处理其多模态特殊 token——社区教程明确点出了这一坑位。

第三条是服务化接入。OpenRouter 已上线nex-agi/nex-n2.5-mini,支持reasoning_effort、top_k等模型专属字段,配合 README 中的采样参数建议(temperature 0.7 / top_p 0.95 / top_k 40),开发者可以用标准 OpenAI 兼容接口直接驱动一个"带思考开关的 Agent"。从部署教程、量化攻略到 API 接入指南,这套生态补位速度正是"第二梯队"成型的标志。

第二梯队能撼动头部格局吗

结论需要克制。先看支撑"崛起"的事实:Qwen3.5 血统提供了一个成熟、可扩展、生态兼容的底座,Nex 系列在其上完成了 Agent 化改造与全链路开源;多尺寸梯队(mini/Pro/Max)覆盖了从 2×H100 到 16×H200 的完整算力光谱;社区在量化、端侧、教程侧的高速跟进说明开发者愿意为"可控的 Agent 模型"买单。这些都足以让 Nex 系列在开源 Agent 阵营中占据一个稳定的第二梯队身位。

但"撼动头部"的证据并不充分。README 的基准表本身给出了最冷静的注脚:在 AutomationBench、Job Bench、SWE-MM 等最能反映"真实长周期任务"的基准上,mini 与头部闭源模型的差距仍是倍数级的——SWE-Bench Pro 上 Claude Opus 5 的 79.2 对 mini 的 43.8,Job Bench 的 65.7 对 28.5。差距不仅存在于模型本体,更存在于闭源巨头那些不开源的部分:更庞大的环境反馈训练数据、更成熟的工具链闭环,以及数以千计的真实任务日志。

对行业而言,更有意义的判断不是"谁能赢",而是竞争维度的迁移:当 Agent 能力成为新的评分尺,开源阵营第一次获得了"在特定基准维度上正面比较"的入场券;当部署成本成为新的护城河,2×H100 的 mini 尺寸就成了一道闭源巨头难以跨越的价格边界。第二梯队未必能掀翻王座,但它正在把"Agent 能力的获得成本"压到前所未有的低位——而历史上,每一次成本曲线的下移,最终都会改写格局。

【免费下载链接】Nex-N2.5-mini项目地址: https://ai.gitcode.com/hf_mirrors/nex-agi/Nex-N2.5-mini

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询