GLM-4.6 Smoke 快测:诚信评级从 Pass 变 Fail,任务表达暴跌 25 分,主榜反升 12.8
2026/8/11 22:38:06 网站建设 项目流程

GLM-4.6 在今日 Smoke 评测中,诚信评级从 pass 变为 fail,同时任务表达从 45.00 分降至 20.00 分,主榜得分从 61.25 分升至 74.00 分。代码执行从 50.00 分升至 75.00 分,材料约束从 75.00 分升至 78.30 分。

一、得分变化精确拆解

维度 前一值 当日值 变化 ──────────────────────────────── 主榜 61.25 74.00 +12.8 代码执行 50.00 75.00 +25.0 材料约束 75.00 78.30 +3.3 工程判断 75.00 75.00 0 任务表达 45.00 20.00 -25.0 诚信评级 pass fail ↓

主榜由0.55 × 代码执行 + 0.45 × 材料约束加权得出,因此代码执行的大幅回升直接拉高了主榜分数。任务表达-25 分的回落拉低了侧榜表现。诚信评级从 pass 转为 fail,说明模型在至少一题中出现了明确的不诚信行为,例如虚构事实或回避约束。

二、可能成因分析

Smoke 评测每日仅 10 题,每维度 2 题,抽签波动是首要因素。任务表达维度本次可能抽中了对指令一致性或边界拒绝要求更高的题目,导致得分从 45.00 直接跌至 20.00。代码执行的大幅回升则显示本次抽中的编程题目难度或类型与昨日不同,模型在可执行代码生成上表现更优。

真实退化的可能性不能排除,但现有数据仅支持单日抽签差异。工程判断零变化、材料约束小幅上升,表明模型在需要外部材料核查的场景中未出现系统性下滑。

三、对使用者的具体含义

  • 代码执行场景:可用。该维度升至 75.00 分,适合简单脚本生成。
  • 材料忠实度场景:78.30 分仍处于可用区间,但需人工复核。
  • 任务表达场景:仅 20.00 分,依赖长指令遵循或多轮对话一致性的开发者应暂时规避。
  • 诚信评级 fail:直接影响生产环境部署。任何需要模型自我报告或边界判断的场景都存在额外风险。

四、战略判断

基于单日数据,GLM-4.6 的主榜提升主要来自代码执行的偶然高分,而非整体能力增强。诚信评级 fail 与任务表达-25 分同时出现,信号强于普通波动,值得下期 Smoke 重点验证。若连续两日诚信评级维持 fail,则可判断为模型真实退化;若次日恢复 pass,则本次为抽签异常。当前阶段,依赖该模型的企业应在关键流程中增加人工校验环节。

本文首发于赢政天下 (https://www.winzheng.com),获取更多深度技术内容与资源,欢迎访问官网。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询