一、一个尴尬惊人的事实:大模型不会给自己写有用的技能
2026 年的大模型几乎什么都会写,但有一个例外:让它零样本、一次性地写出一个可泛化的技能(skill),仍然接近无效。
SkillsBench 把这个尴尬量化了。这个由社区构建的基准包含 86 个专家验证、真实数据、可验证的专业任务。结果:人类专家写的技能(curated skills)让模型平均提升16.2 个百分点——Claude Opus 4.5 从 22.0 分直接跳到 45.3 分;而模型自己一次性生成的技能,增益约等于零,在部分配置下甚至是负的。
SkillsBench:灰色为无技能基线,黄色为模型自生成技能,蓝色为人类专家技能。黄色柱与灰色柱几乎一样高——这就是 2026 年最大的浪费。
注意限定词:问题不是大模型不能参与写技能,而是不能一步到位。人类专家的技能好在哪里?不是因为文笔,而是因为它们沉淀了失败经验——"这个 API 有坑""这种文档要先用工具 X 解析"。这恰恰是 LLM 一次性生成给不了的东西。
于是问题自然变成:能不能像训练神经网络一样,迭代地"训练"一段文本?让模型在 rollout 里摔跤、反思、修改,用验证集防止过拟合——把"写技能"从一次性的提示工程,变成一个有梯度、有门控、有预算的优化问题。
2026 年 5 月以来,这个问题迎来了一波密集的回答。而这波回答的最新结论,相当反直觉。
二、序章:SkillOpt,第一次把文本当参数训
本文的"技能"是广义行为资产:可编辑、可分发、可外部验证的文本工件,包括技能文件、提示词、工具描述、控制流片段、wiki 条目与记忆策略。狭义的单文件技能只是其中一种形态。后文各处出现的"技能",都按此广义理解。
2026 年 5 月,Microsoft Research 放出 SkillOpt(arXiv 2605.23904)。它的划时代意义不在成绩单,而在于第一次让"优化一段技能文本"拥有了优化器的严谨形态。
形式化很漂亮:冻结 agent 的权重,把一个紧凑的自然语言技能文档 StS_t 当作唯一可训练的"参数"。训练数据来自 rollout 轨迹,"梯度"来自模型对自己轨迹的自我批评,更新是加/删/替换的原子编辑,编辑率相当于学习率——而每一步更新,必须通过一个held-out 验证集的门控才能被接受。测试集则被锁到最后,只为出报告。
SkillOpt 官方项目页的完整管线图:rollout → 分批优化器产生原子编辑 → 合并去冲突 → 编辑预算与学习率衰减 → 验证门控 → 接受或拒绝;下方是 epoch 级的慢更新与反思。
成绩也确实硬:在 7 个目标模型 × 6 个基准 × 多种执行环境的52 个评测单元里,SkillOpt 相对无技能基线全胜或打平;GPT-5.5 直聊平均提升 +23.5 分[1]。
SkillOpt 项目主页:52/52、7 个目标模型、6 个基准。注意这个数字的口径——它是相对"无技能基线"的全胜,后文还会用到这个口径。
工程化也做到了罕见的程度:MIT 协议开源,pip install skillopt即可使用;7 月 2 日的 v0.2.0 加入了 SkillOpt-Sleep 夜间离线自进化引擎,并集成了 Claude Code、Codex、Copilot、Devin、OpenClaw 等主流执行环境[2]。GitHub 收获约 1.67 万 star,生产案例开始出现:DAIR.AI 用 SkillOpt 优化多模态论文图表抽取技能,准确率从 0.73 提升到 0.93——+20 个百分点的生产环境实测[3]。
到这里,故事的常规走向应该是:给这套优化器加更多机制——更好的语言梯度、更聪明的门控、更精细的动量。几乎所有人都这么预期。
七周后,有人证明这条路错了。
错的不是验证,而是"自动验证"的方式。
三、主角登场:SkillOpt-Lite 与苦涩教训
7 月,EvolvingLMMs-Lab(Bo Li 组)放出 SkillOpt-Lite(arXiv 2607.03451)。标题里的副标题近乎挑衅:"One Line of Vibe"。它给出的核心结论可以概括为一句话:
复杂优化器机制,本质是为"模型自我批评不够准"设计的人类先验补偿。当模型足够强,这些补偿的边际收益递减,甚至变成噪声;而让 agent 自己演化整个 harness 的组件——提示、工具描述、控制流——这种通用机制对强弱模型都有效。
数字非常不给老师留面子。LiveMath 上,GPT-5.5 配置 +8.8 分,GPT-5.4-nano 配置+25.4分;Spreadsheet、DocVQA 等基准同样全面超出。训练曲线图里,蓝线(Lite)从第一批开始就压在红线(SkillOpt)上方,并且差距随批次数稳定存在,不是噪声[4]。
SkillOpt-Lite 论文的训练曲线:蓝色为 Lite,红色为原版 SkillOpt。四个子图(LiveMath-nano、LiveMath-5.5、Spreadsheet、DocVQA)中蓝线全程压制红线。
名场面发生在"廉价配置掀翻旗舰配置":GPT-5.4-nano 跑 HarnessOpt(0.7758),反超了 GPT-5.5 跑完整版 SkillOpt(0.7620)。
请注意这个结果的正确读法。它不是"弱模型不需要帮助"——恰恰相反,nano 的绝对提升(+25.4)远大于强模型(+8.8)。它说明的是:通用演化机制是模型无关的,而手工优化器先验只对"自我批评不准的模型"有价值。这正是机器学习史上反复上演的苦涩教训:手工特征让位于表示学习,手工结构先验让位于可微架构搜索,如今轮到手工优化器管线,让位于"把 agent 组件当普通代码文件演化"。
为什么复杂管线会失效?论文与后续讨论给出了三个互相加强的假说:
- 语言梯度的边际价值归零。自我批评信号的本质是"让模型给文本打方向"。强模型对自己的失败已经有足够准的诊断,包装成"梯度"只是徒增 token 成本和格式约束。
- 内部自动门控的信号在分布外是噪声。门控要判断"这次编辑会不会泛化",但它依据的仍是模型的自我评估——用同一个可能有偏的裁判,去校正同一个裁判的判决。
- 动量在长周期上放大早期错误。训练初期的一次幸运编辑会污染此后所有更新方向,而文本空间没有等价于"学习率 warmup 重置"的可靠机制。
Lite 把优化器做薄的同时,把演化对象做宽了——这就是 HarnessOpt:不只演化核心技能文件,连工具描述、提示模板、控制流片段一起进入演化池。结果"全组件演化优于仅演化核心循环",说明在 "Agent = Model + Harness + Artifact" 的坐标系里,harness 层的能力密度被严重低估了[5]。这个发现已经走出论文:Lite 的路线被接入了 VSCode Copilot。
诚实的文章要交代局限:Lite 仍依赖一个足够强的 critic 模型;多轮长程任务没有经过充分验证;整个演化过程没有理论保证,"为什么全组件演化更好"目前只有经验证据。
但方向已经变了。接下来值得看的,不再是"谁的优化器机制更精巧",而是同样的思想在四种不同世界观下的展开。
四、擂台:同一问题下的四种答法
先把丑话说在前面:以下四位考生的成绩单来自不同论文、不同模型、不同评测设置,用于路线定位,不构成统一考场的排名。
SkillOpt(序章) | SkillOpt-Lite(主角) | WikiSkill | SkillAdam | |
|---|---|---|---|---|
一句话定位 | 优化器范式奠基 | 精简管线 + 组件泛化 | 持久化 wiki 知识层 | 优化记忆 + 编辑预算 |
战绩口径 | 相对无技能基线 52/52 全胜 | 相对 SkillOpt 平均分反超(+8.8 / +25.4) | 5 个模型上超既有方法 3.3~12 分 | 5 个短任务基准 4 胜 1 平,长任务 DP-Avg +6.7 |
核心机制 | 语言梯度 + 编辑率 + held-out 门控 + 动量 | 把 harness 组件当代码文件演化 | 失败教训写入 wiki,追加式、检索式 | 跨周期优化记忆 + 波动驱动编辑预算 |
知识存放 | 单文件,回滚式 | harness 目录,回滚式 | wiki,不回滚、只沉淀 | 记忆 + 技能,长期保持 |
跨模型迁移 | 弱 | 中 | 强(主打卖点) | 未主打 |
token 成本 | 基准 | 更省 | 中 | 约 1/5 |
工程化 | 1.67 万 star,集成最全 | 已入 VSCode Copilot | 暂无可跑代码 | 学术向 |
4.1 WikiSkill:把"失败"存下来,而不是抹掉
8 月 27 日,Google Research 与 Virginia Tech 放出 WikiSkill(arXiv 2608.27454)。它和 Lite 的分歧是世界观级的:Lite 依然"回滚"——坏编辑被拒绝、丢弃;WikiSkill 则把每一次失败教训追加进一个持久 wiki,技能本身变成"知识检索 + 按需组装",而不是一份越改越大的单文件。在 5 个模型上,它的平均成绩超过 SkillOpt、EvoSkill、Trace2Skill 等所有既有方法 3.3~12 分[6]。
WikiSkill 论文首页(arXiv 2608.27454)与其 Figure 1:在 Qwen-3.5-4B/9B、Qwen-3.6-27B、Gemini 3.5 Flash 上,WikiSkill 曲线稳定高于 SkillOpt 与 EvoSkill。
它最漂亮的数字是跨模型迁移:小模型 Qwen-3.5-9B 配上从别处演化来的技能拿到 47.4%,反超大模型 Qwen-3.6-27B 裸跑的 39.4%。技能第一次展现出"可携带算力"的属性——这也是为什么它值得单独关注。
4.2 SkillAdam:把账算到 token 上
9 月 8 日的 SkillAdam 把问题换了个问法:演化过程自己,能不能更稳、更便宜?它的两个组件直指痛点——优化记忆(跨周期记住哪些编辑有效,而不是每轮从零反思)和波动驱动的编辑预算(成绩波动大时多改,平稳时少动)。结果是 5 个短任务基准上 4 胜 1 平、长任务 DP-Avg +6.7 分,而最扎眼的是成本:达到同等技能质量,只需要约五分之一的 token(4M 对 20M)[7]。
SkillAdam(arXiv 2609.08944)的演化路径示意图:初始技能经多轮"改多少、改哪里"的决策收敛到最优技能,编辑由预设规则与波动信号共同驱动。
当技能演化要从论文走向 7×24 小时的线上系统,token 账就是生死账。SkillAdam 未必是终局,但它指出的方向——把演化器自身的记忆与预算当作一等公民——大概率是对的。
4.3 小结:不是替代,是四个侧面
这四者拼起来才构成"行为资产优化"的完整版图:SkillOpt 回答怎么训,Lite 回答哪里值得训,WikiSkill 回答知识放哪,SkillAdam 回答怎么训得起。把它们放在同一张表里争论"谁第一"没有意义——它们的对手从来都不是彼此,而是第一部分那张图里灰色的"无技能基线"。
五、边界与邻居:同源、竞争与可融合的路线
把主角放进更大的坐标系——更新什么(权重 / 上下文 / 外部工件)×存多久(单任务 / 跨任务 / 持久)——技能进化只占其中一个格子。它的邻居们值得逐一划界,因为读者迟早会问:为什么不直接微调?为什么不走 RL?harness 演化又是什么?
5.1 对 微调/LoRA:冻结权重,换来四种自由
技能路线对微调的核心卖点:冻结权重、可 diff、可审计、跨模型复用。多数文本路线还支持回滚——WikiSkill 是例外,它追加式、不回滚,但失败教训同样可审计。这些属性在合规、多模型部署、快速迭代的场景里是微调给不了的。
SkillsBench 里还有一张图值得全文引用:带技能的 Haiku 4.5(27.7%,v1.0 论文口径;v1.1 榜单上该数字已更新为 30.1%)反超不带技能的 Opus 4.5(22.0%)——技能可以替代模型规模。对成本敏感的应用,"小模型 + 好技能"是比"换大模型"便宜得多的升级路径。
SkillsBench 的 "Skills Substitute for Model Scale":蓝线为带技能成绩,灰线为无技能成绩。Haiku+skills 反超裸跑 Opus 4.5。
技能承载的是真实能力,而非提示词噪音——有一个很聪明的判别实验:Skill-GRPO 把记忆库清空,成绩从 80.5 断崖跌到 60.2,证明学进去的东西确实存在于工件里,不是模型的错觉[5]。
但边界正在移动。2026 年出现的 SIA 这类元 Agent,已经让模型每轮自主决策:这一轮该改 harness,还是该打 LoRA 补丁——两个动作空间被放进同一个循环里[5]。更妙的反衬来自 PostTrainBench:让 agent 自主做后训练(自动改权重)目前并不可靠——最强的 agent 也只能达到官方微调模型的 23.2% 水平。注意这个例子的正确用法:不可靠的是"自主改权重",不是"改权重"本身;恰恰是官方权重的强大,反衬出"改外部工件"这条路在现实世界里的务实[8]。
5.2 对 RL 技能共进化:同一缺口的两条补给线
与文本空间平行的,是把技能库当作 RL 动态组件的一条线:SkillRL 让 agent 演化自己的技能目录,在 EvoAgentBench 上比静态技能库高 31%[9];SkillGraph 把技能图拓扑和下游策略联合训练,让技能关系随任务持续适应[10];Skill-R1 则干脆把技能优化解耦成 recurrent RL 问题——它的卖点恰恰是对闭源任务模型友好,与文本空间路线殊途同归。
两条线的分野清晰:RL 线信号更密、能直接进权重,但依赖可验证环境和大量交互样本;文本空间线样本效率高、对闭源模型友好、天然可审计。但它们的共同宿命在 SkillsBench 的灰色柱子上:都在补同一个缺口。也因此可以预测:两条线终将在"可验证性"这个瓶颈上汇合——谁能拿到更便宜、更防作弊的验证信号,谁就能定义下一代方法。
5.3 对 Harness 演化:不是邻居,是已经跨入的领地
最后这个"邻居"最特殊,因为 Lite 的 HarnessOpt 已经实质跨过了线——harness 演化不是赛道外的对照组,而是主角已经踏入的领地。真正需要划清的是问题层:优化对象是行为资产(skill 文件、工具描述),还是优化器本身(演化管线的代码)?
跨线之前,值得先看看 harness 自进化的前车之鉴:benchmark memorization(把测试集特征背下来)、随机噪声锁死胜者(单次幸运跑分决定演化方向)、复杂度膨胀( evolved harness 的 token 消耗翻倍)——这些病理正是 Lite 精简管线的隐性论据[11]。
这里需要做一个关键区分:Lite 精简的是 meta 层的优化器管线,并没有禁止 object 层的 harness 组件变多。在经验上,它靠小步编辑、预算约束和外部验证这三道闸,把 object 层的膨胀压在了可接受的范围内。
microsoft/skills 仓库的架构示意:领域技能、MCP 服务器、上下文注入正被组织成可分发的基础设施——"技能分发层"已经从设想变成仓库。
于是可以给出一个本文自己的判断:"技能"与"harness"的边界本质上是产品决策,而非技术本质——技能就是可分发、可版本化、可签名的 harness 切片。这个判断有现实的注脚:Microsoft 已经把 skills、MCP 服务器、Agents.md 组织进官方仓库,技能分发的基础设施正在成形。当分发层成熟,"技能作者"可能会像今天的 HuggingFace 模型作者一样成为一个职业。
六、升格:这不是 RSI,但这是离 RSI 最近的产品化形态
6.1 先校准概念
2026 年文献的共识是克制的:有界自精炼(bounded self-refinement)已经例行化,而开放式的 RSI(recursive self-improvement,递归自我改进)在公开文献中尚未被证明[12]。技能进化属于前者——它有明确的人类设定边界:任务分布、预算、验证集。
6.2 边界在哪:验证权归谁
那么边界画在哪?2026 年最有锋芒的一句话来自 Hugging Face 的 Philipp Schmid:agent 可以拥有自己的 prompt、skill、tool 和 harness code,但评测必须留在人类手里——"如果 agent 能修改评测器,分数就不再是证据"[13]。
回头看,这正是第二部分伏笔的回收。SkillOpt 系真正的遗产不是那套语言梯度加动量的管线(Lite 已经把它拆了),而是把泛化验证变成优化器的一等公民——held-out 验证门控,就是"评测权留在人类手里"这个原则最早的工程实现。Lite 去掉的是内部自动门控,保留的是验证权外置。整条演化谱系,从 SkillOpt 到 SkillAdam,变的是优化技巧,不变的是这条宪法。
所以技能进化不是 RSI,但它是目前距离 RSI 最近的产品化形态:它已经把"模型改自己"的闭环跑通,只是谨慎地把裁判席留给了人类。这个闭环往后每扩张一步——验证信号自动化、技能跨组织流转、演化目标从单任务走向开放世界——都会重新触碰这个问题。
6.3 三个前瞻
基于以上脉络,给出三个可检验的预测:
- 收敛预测:文本空间优化与 RL 权重空间将在一到两年内融合为"分层自进化"——权重内能力、权重外知识、外部验证门控各司其职,而 SIA 式的元 Agent 负责调度。单一赛道的方法会显得过时,分层的不会。
- 基础设施预测:技能仓库将成为新的分发层(类比 HuggingFace 之于权重)。随之而来的必然是签名、版本治理、供应链审计——microsoft/skills 仓库已经是这个方向的早期形态。
- 安全预测:技能注入与投毒会成为下一个安全热点。当技能可以跨模型、跨组织流转,一条被污染的技能就是一次跨系统的供应链攻击;届时"验证权外置"就不只是对齐原则,而是安全刚需。
七、实践指南:现在该选谁
你的处境 | 建议 |
|---|---|
要成熟生态、快速上手 | SkillOpt: |
用 VSCode Copilot,要泛化能力 | SkillOpt-Lite / HarnessOpt:全组件演化,已进产品 |
多模型共用技能资产 | 关注WikiSkill路线:跨模型迁移是目前最强卖点 |
长任务、成本敏感 | 关注SkillAdam:约 1/5 token 成本 + 长程稳定 |
有可靠的 verifier 环境 | 考虑SkillRL / Skill-R1的 RL 线,信号密度更高 |
需要合规审计 | 文本空间路线整体优于微调:可 diff、可回滚、可签名 |
结语
回到开头那张图:灰色的柱子是没有技能的大模型,蓝色的是有技能的。2026 年的技能进化浪潮,本质上是在给那根灰色柱子装上外部记忆与肌肉——不碰权重,却让同一个模型变成另一个物种。
而整场浪潮里最有分量的遗产,可能既不是 52/52,也不是 +25.4,而是一个朴素的原则:模型可以改自己的一切,除了裁判席。谁先想明白验证权该怎么安放,谁就能定义下一阶段的自进化基础设施。
参考(截至 2026-09-27):SkillOpt (arXiv 2605.23904)、SkillOpt-Lite (arXiv 2607.03451)、WikiSkill (arXiv 2608.27454)、SkillAdam (arXiv 2609.08944)、SkillsBench (skillsbench.ai)、microsoft/skills、EvoSkill、Trace2Skill、SkillRL、SkillGraph、Skill-R1、SIA、PostTrainBench。
引用来源
[1]: SkillOpt 论文(arXiv:2605.23904),52/52 评测单元结果:https://arxiv.org/abs/2605.23904
[2]: microsoft/SkillOpt GitHub,v0.2.0 Release(SkillOpt-Sleep 与多环境集成):https://github.com/microsoft/SkillOpt
[3]: DAIR.AI 创始人 Xavier Amatriain(@omarsar0)分享的 SkillOpt 生产实践(多模态图表抽取技能 0.73→0.93)
[4]: SkillOpt-Lite 论文(arXiv:2607.03451):https://arxiv.org/abs/2607.03451 ,代码:https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite
[5]: 2026 年自进化方法分类综述(Agent = Model + Harness + Artifact 框架;Skill-GRPO 记忆清空消融;SIA 元 Agent 工作)[6]: WikiSkill 论文(arXiv:2608.27454,Google Research & Virginia Tech):https://arxiv.org/abs/2608.27454[7]: SkillAdam 论文(arXiv:2609.08944):https://arxiv.org/abs/2609.08944[8]: PostTrainBench:agent 自主后训练 vs 官方微调模型的系统性对比(最佳 agent 23.2% vs 官方模型 51.1%)[9]: SkillRL:基于 EvoAgentBench 的技能目录共进化研究(较静态技能库 +31%)[10]: SkillGraph:技能图拓扑与下游策略联合 RL 训练的工作[11]: Agentic Harness Engineering 相关综述中列出的 harness 自进化病理清单(benchmark memorization、噪声锁死、复杂度膨胀等)[12]: RSI 综述《From Bounded Self-Refinement to Autonomous Research Loops》(有界自精炼已例行化,开放式 RSI 公开文献未证明)[13]: Philipp Schmid(Hugging Face)关于 self-evolving agents 边界条件的博客:agent 可拥有 prompt/skill/tool/harness,评测必须留在人类手里
创作不易,禁止抄袭,转载请附上原文标题及其链接