📖标题:Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?
🌐来源:arXiv, 2608.09629v1
🛎️文章简介
🔸研究问题:当使用前沿大模型作为优化器时,是否仍然需要框架预设特定的任务优化流程(如证据收集、修订、选择等步骤)?
🔸主要贡献:论文提出了开放式优化(OEO)框架,证明在固定外部契约下,足够强大的优化器可以在线自主组合改进过程,且性能优于或持平于预设流程方法。
📝重点思路
🔸提出开放式优化(OEO)概念,将外部治理的“优化契约”(目标、预算、数据边界等)与任务特定的“优化元策略”分离。OEO保留契约约束,但允许优化器在线决定如何收集证据、修订技能及何时停止,而非遵循预设流水线。
🔸选取两种互补的预设方法进行对比:SKILLOPT代表分阶段、有界编辑的训练流水线;GEPA代表基于反思的进化搜索。两者均固定了具体的改进程序,而OEO则将这一决策权交给优化器。
🔸设计多层次实验验证:首先在8个基准测试中将GPT-5.5驱动的OEO与SKILLOPT和GEPA进行头对头比较;其次通过零交互静态重写控制组,排除增益仅来自模型先验知识的可能性;最后通过能力阶梯实验,测试不同能力等级优化器在OEO接口下的表现。
🔸进行轨迹分析,对比OEO与SKILLOPT在优化路径上的差异,包括最大编辑幅度、部分广度及修订更替率,并评估最终选定技能在 item-level 的行为重叠度。
🔎分析总结
🔸在前沿模型(GPT-5.5)作为优化器时,OEO在14次对比中取得12胜1平1负,且仅使用了SKILLOPT配置预算中位数34.3%的目标交互token,证明其高效且具备竞争力。
🔸零交互控制实验显示,单次静态重写的性能显著低于OEO,尤其在LiveMath等复杂任务上出现倒退,证实OEO的增益来源于交互式反馈循环,而非单纯的模型先验知识。
🔸委托优化存在能力边界:中等能力优化器在预设流程(SKILLOPT)下表现优于OEO,弱优化器甚至无法在OEO接口下产生有效动作。这表明预设流程对于能力较弱的优化器是必要的脚手架。
🔸轨迹分析表明,预设流程主要改变优化的路径而非最终行为。OEO倾向于更大范围的编辑和更高的修订更替率,但最终选定的技能在多数情况下与预设方法解决相同的实例集合,路径差异不必然导致行为差异。
💡个人观点
论文重新定义了自进化代理中框架与模型的分工边界,它并未完全否定预设流程的价值,而是提出了一种“能力自适应”的责任分配原则:对于前沿模型,应赋予其在线组合优化策略的自由以追求效率和灵活性;而对于较弱模型,预设流程则是保障系统稳定运行的必要约束。