OBLITERATUS Beyond-SOTA路线图解读:领先配置的11项指标与5大优化方向
【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS
OBLITERATUS 是开源的 abliteration(拒答行为移除)工具包,其 Beyond-SOTA 路线图记录了当前领先模型配置的各项基准指标、"源锚定编辑缩放"(Source-Tethered Edit Scaling,STES)这一核心发现,以及从自动搜索到量化不变性的五阶段优化计划。本文带你快速读懂这份路线图的指标体系与下一步方向。
当前领先配置是谁?
路线图明确指认当前榜首:
outputs/qwen3.6-27b-aspa-n2-reg05-srcgamma090即基于 Qwen3.6-27B、采用 ASPA 方法(n=2、regularization=0.5)、并以srcgamma=0.90做源锚定缩放的候选模型。它的完整指标向量如下:
| 维度 | 结果 |
|---|---|
| Full n120 发布评分(ship score) | 88.392 |
| 全量拒答率 | 0.025 |
| 全量可用率 | 0.9667 |
| 良性/风格通过率 | 1.0 / 1.0 |
| 能力评分 | 96.75 |
| 编码/创意通过率 | 1.0 / 1.0 |
| 边界评分 | 100.0 |
| 对抗边界评分 | 99.165 |
| 社区审查总分 | 99.5 |
| 社区代码/知识/数学/真实性 | 1.0 / 1.0 / 1.0 / 1.0 |
| 首 token 平均 KL(相对源模型) | 0.549806 |
| 首 token top-1 一致率 | 0.818 |
💡要点:这不是"拒答率降到 0 就算赢"的单一指标,而是发布、能力、边界、KL 保留度四位一体的帕累托评估。
核心发现:源锚定编辑缩放(STES)
路线图最重要的方法论发现是:
candidate_gamma = source + gamma * (edited_candidate - source)即把"编辑后的候选"与"源模型"做线性插值,gamma控制靠近源模型的程度。对 Qwen3.6-27B,gamma=0.90相比原始 ASPA 是真正的帕累托改进:拒答更低、可用率更高、编码通过恢复,且边界行为依旧强劲。
细粒度 bracket 搜索进一步给出了一组对照数据:
| Gamma | 状态 |
|---|---|
| 0.875 | 能力挑战者:能力 96.80,KL 0.525216,全量分 87.250 |
| 0.900 | 发布榜首:能力 96.75,KL 0.549806,全量分 88.392 |
| 0.925 | 本轮被支配:能力 96.45,n30 分 88.167 |
结论很明确:全局标量 gamma 太"钝"。把 0.875 叠加到 48:64 层的 0.90 提升了能力却恶化了 n30 拒答;再收窄到晚期 MLPdown_proj、全注意力o_proj或线性注意力out_proj则保持能力却救不回 0.90 的拒答优势。因此下一步是学习式的按组件加权 STES:对保留敏感组件用小 gamma,对拒答关键组件用大 gamma。
我们还缺什么?——6 项能力差距
路线图用"What Others Still Have That We Need"一节列出了补齐清单:
- 自动搜索:Heretic 风格的 Optuna/TPE 循环,搜索编辑强度、层范围、正则化与保留指标;
- KL 一等公民化:KL 不再只是事后报告,而是候选选择中的约束或惩罚项;
- 量化原生验证:覆盖 MLX/GGUF/JANG 部署格式的"先编辑后量化"与"先量化后编辑"行为;
- MoE/路由器感知编辑:专家级局部编辑、路由漂移检查、每专家保留指标;
- 标准公开基准:本地社区门槛已覆盖紧凑版 HumanEval/MBPP/GSM8K/MMLU 探测,但仍需完整 harness 导出以便公开可比;
- 裁判/校准边界评分:用第二个校准的本地裁判同时捕获"错误拒答"与"不安全顺从"。
五阶段 Beyond-SOTA 计划
Phase 1:保留感知的自动搜索
把每个候选当作向量,优化目标为:
score = ship_gate + capability + boundary - KL_penalty - degeneration_penalty实验网格覆盖 STES gamma(0.82~0.975 共 7 档)、组件加权 STES、二通道 n 方向、正则化(0.45~0.60)、层范围与组件掩码。晋级规则分层:n30 初筛 → KL 探测 → 仅帕累托候选跑 n120 → 仅发布候选跑边界探测,避免浪费昂贵的评测预算。
Phase 2:编辑场层析(Edit-Field Tomography)
逐层逐组件测量对拒答下降、良性 KL 漂移、编码悬崖、边界过度拒答、对抗鲁棒性的贡献,产出编辑场映射:
layer -> component -> {refusal_delta, KL_delta, capability_delta, boundary_delta}这是从"通用消融"走向"因果定位"的关键一步:让优化器分清哪些子空间是拒答的因,哪些只是相关伴随损伤。
Phase 3:量化不变性
每个领先者必须"活过部署":BF16 指标 → MLX/GGUF 量化指标 → 量化漂移报告(ship/capability/boundary/KL 四项 delta)。目标是:编辑若不能在目标推理格式中存活,就不算数。
Phase 4:MoE 与路由器感知
面向 MoE 模型增加专家级方向提取、路由 logit KL、每专家激活 KL、编辑前后专家负载熵,以及按专家分配的gamma_expert = optimizer(expert_load, refusal_signal, KL_sensitivity)。
Phase 5:公开记分卡
发布捆绑包包含model_card_metrics.json、pareto_frontier.json、kl_report.json、boundary_report.json、quantization_report.json、benchmark_report.json,模型卡需展示源模型、编辑配方、拒答/过度拒答指标、能力基准、KL 保留、量化部署一致性与已知失败案例。
立即要跑的 7 个实验
路线图末尾给出了可执行的近期清单:MLX 评测通道降级兜底、对源模型/raw ASPA/srcgamma875跑社区门槛对照表、以晚期 MLP-down 与注意力-o 为种子搜索组件掩码系数、增加提前剪枝目标避免浪费 KL/n120 预算、对gamma=0.85/0.95补跑 KL、加入按四维排序的控制器目标,以及晋级标准——候选至少要在两条轴上超过gamma=0.90且不丢任何硬门槛。
相关文档索引
| 资料 | 说明 |
|---|---|
| docs/beyond_sota_roadmap.md | 本文解读的 Beyond-SOTA 路线图原文 |
| docs/QWEN38_27B_RESEARCH_ROADMAP.md | Qwen3.8-27B 拒答手术研究路线图(含验收门槛) |
| docs/qwen38-experiment-matrix-v1.json | 842 对样本的实验矩阵 v1 协议 |
| docs/complementary_blending.md | SVD+LEACE 权重插值混合方法 |
| scripts/aspa_pareto_controller.py | ASPA 帕累托控制器脚本 |
| obliteratus/bayesian_optimizer.py | 贝叶斯优化器实现 |
| obliteratus/analysis/ | 15 个深层分析模块目录 |
结语
这份路线图的价值在于把"去掉拒答"从一个模糊口号,拆成了一条可量化的晋级流水线:从全局 gamma 到组件级 gamma、从事后报告 KL 到 KL 约束优化、从 BF16 实验室指标到量化部署一致性。对关注对齐研究与模型可控性的读者来说,它的"四层探测 + 多维指标 + 帕累托晋级"范式本身就是一份值得借鉴的评估工程范本。
【免费下载链接】OBLITERATUSOBLITERATE THE CHAINS THAT BIND YOU项目地址: https://gitcode.com/GitHub_Trending/ob/OBLITERATUS
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考