OBLITERATUS Beyond-SOTA路线图解读:领先配置的11项指标与5大优化方向
2026/9/15 18:04:57 网站建设 项目流程

OBLITERATUS Beyond-SOTA路线图解读:领先配置的11项指标与5大优化方向

【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS

OBLITERATUS 是开源的 abliteration(拒答行为移除)工具包,其 Beyond-SOTA 路线图记录了当前领先模型配置的各项基准指标、"源锚定编辑缩放"(Source-Tethered Edit Scaling,STES)这一核心发现,以及从自动搜索到量化不变性的五阶段优化计划。本文带你快速读懂这份路线图的指标体系与下一步方向。

当前领先配置是谁?

路线图明确指认当前榜首:

outputs/qwen3.6-27b-aspa-n2-reg05-srcgamma090

即基于 Qwen3.6-27B、采用 ASPA 方法(n=2、regularization=0.5)、并以srcgamma=0.90做源锚定缩放的候选模型。它的完整指标向量如下:

维度结果
Full n120 发布评分(ship score)88.392
全量拒答率0.025
全量可用率0.9667
良性/风格通过率1.0 / 1.0
能力评分96.75
编码/创意通过率1.0 / 1.0
边界评分100.0
对抗边界评分99.165
社区审查总分99.5
社区代码/知识/数学/真实性1.0 / 1.0 / 1.0 / 1.0
首 token 平均 KL(相对源模型)0.549806
首 token top-1 一致率0.818

💡要点:这不是"拒答率降到 0 就算赢"的单一指标,而是发布、能力、边界、KL 保留度四位一体的帕累托评估。

核心发现:源锚定编辑缩放(STES)

路线图最重要的方法论发现是:

candidate_gamma = source + gamma * (edited_candidate - source)

即把"编辑后的候选"与"源模型"做线性插值,gamma控制靠近源模型的程度。对 Qwen3.6-27B,gamma=0.90相比原始 ASPA 是真正的帕累托改进:拒答更低、可用率更高、编码通过恢复,且边界行为依旧强劲。

细粒度 bracket 搜索进一步给出了一组对照数据:

Gamma状态
0.875能力挑战者:能力 96.80,KL 0.525216,全量分 87.250
0.900发布榜首:能力 96.75,KL 0.549806,全量分 88.392
0.925本轮被支配:能力 96.45,n30 分 88.167

结论很明确:全局标量 gamma 太"钝"。把 0.875 叠加到 48:64 层的 0.90 提升了能力却恶化了 n30 拒答;再收窄到晚期 MLPdown_proj、全注意力o_proj或线性注意力out_proj则保持能力却救不回 0.90 的拒答优势。因此下一步是学习式的按组件加权 STES:对保留敏感组件用小 gamma,对拒答关键组件用大 gamma。

我们还缺什么?——6 项能力差距

路线图用"What Others Still Have That We Need"一节列出了补齐清单:

  1. 自动搜索:Heretic 风格的 Optuna/TPE 循环,搜索编辑强度、层范围、正则化与保留指标;
  2. KL 一等公民化:KL 不再只是事后报告,而是候选选择中的约束或惩罚项;
  3. 量化原生验证:覆盖 MLX/GGUF/JANG 部署格式的"先编辑后量化"与"先量化后编辑"行为;
  4. MoE/路由器感知编辑:专家级局部编辑、路由漂移检查、每专家保留指标;
  5. 标准公开基准:本地社区门槛已覆盖紧凑版 HumanEval/MBPP/GSM8K/MMLU 探测,但仍需完整 harness 导出以便公开可比;
  6. 裁判/校准边界评分:用第二个校准的本地裁判同时捕获"错误拒答"与"不安全顺从"。

五阶段 Beyond-SOTA 计划

Phase 1:保留感知的自动搜索

把每个候选当作向量,优化目标为:

score = ship_gate + capability + boundary - KL_penalty - degeneration_penalty

实验网格覆盖 STES gamma(0.82~0.975 共 7 档)、组件加权 STES、二通道 n 方向、正则化(0.45~0.60)、层范围与组件掩码。晋级规则分层:n30 初筛 → KL 探测 → 仅帕累托候选跑 n120 → 仅发布候选跑边界探测,避免浪费昂贵的评测预算。

Phase 2:编辑场层析(Edit-Field Tomography)

逐层逐组件测量对拒答下降、良性 KL 漂移、编码悬崖、边界过度拒答、对抗鲁棒性的贡献,产出编辑场映射:

layer -> component -> {refusal_delta, KL_delta, capability_delta, boundary_delta}

这是从"通用消融"走向"因果定位"的关键一步:让优化器分清哪些子空间是拒答的,哪些只是相关伴随损伤

Phase 3:量化不变性

每个领先者必须"活过部署":BF16 指标 → MLX/GGUF 量化指标 → 量化漂移报告(ship/capability/boundary/KL 四项 delta)。目标是:编辑若不能在目标推理格式中存活,就不算数

Phase 4:MoE 与路由器感知

面向 MoE 模型增加专家级方向提取、路由 logit KL、每专家激活 KL、编辑前后专家负载熵,以及按专家分配的gamma_expert = optimizer(expert_load, refusal_signal, KL_sensitivity)

Phase 5:公开记分卡

发布捆绑包包含model_card_metrics.jsonpareto_frontier.jsonkl_report.jsonboundary_report.jsonquantization_report.jsonbenchmark_report.json,模型卡需展示源模型、编辑配方、拒答/过度拒答指标、能力基准、KL 保留、量化部署一致性与已知失败案例。

立即要跑的 7 个实验

路线图末尾给出了可执行的近期清单:MLX 评测通道降级兜底、对源模型/raw ASPA/srcgamma875跑社区门槛对照表、以晚期 MLP-down 与注意力-o 为种子搜索组件掩码系数、增加提前剪枝目标避免浪费 KL/n120 预算、对gamma=0.85/0.95补跑 KL、加入按四维排序的控制器目标,以及晋级标准——候选至少要在两条轴上超过gamma=0.90且不丢任何硬门槛

相关文档索引

资料说明
docs/beyond_sota_roadmap.md本文解读的 Beyond-SOTA 路线图原文
docs/QWEN38_27B_RESEARCH_ROADMAP.mdQwen3.8-27B 拒答手术研究路线图(含验收门槛)
docs/qwen38-experiment-matrix-v1.json842 对样本的实验矩阵 v1 协议
docs/complementary_blending.mdSVD+LEACE 权重插值混合方法
scripts/aspa_pareto_controller.pyASPA 帕累托控制器脚本
obliteratus/bayesian_optimizer.py贝叶斯优化器实现
obliteratus/analysis/15 个深层分析模块目录

结语

这份路线图的价值在于把"去掉拒答"从一个模糊口号,拆成了一条可量化的晋级流水线:从全局 gamma 到组件级 gamma、从事后报告 KL 到 KL 约束优化、从 BF16 实验室指标到量化部署一致性。对关注对齐研究与模型可控性的读者来说,它的"四层探测 + 多维指标 + 帕累托晋级"范式本身就是一份值得借鉴的评估工程范本。

【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询