今天分享Frontis.AI与清华的最新自我改进(RSI)机器学习工程(MLE)。
开源了一个面向MLE中RSI研究的全栈系统OpenMLE,降一个35B的开源模型,在 MLE-Bench Lite 上把 Medal Average 从 39.39% 一路推到 71.21%——超过GPT-5.5 + Codex,逼近GPT-5.6 Sol和 2.8T 参数的Kimi K3。清华开源的另一个自学习Skill新框架,提速500倍
一、RSI 的可执行试验田
递归自我改进(Recursive Self-Improvement, RSI)是 AI 领域的终极叙事之一:系统改进产生下一代系统的过程,形成自我强化的循环。但 RSI 一直停留在哲学讨论层面,缺一个可测量、可执行、可复现的实验场。
机器学习工程(Machine Learning Engineering,MLE)天然就是 AI4AI 的一个具体实例——Agent 要为真实任务构建 ML 方案,并通过执行反馈反复迭代。
Figure 2 |左侧是 OpenMLE 全栈(环境层/学习层/搜索层)与 Frontis-MA1 的关系;右侧是从进化到 RSI 的机制阶梯
注意右侧的机制阶梯(Mechanism Hierarchy),这是理解全文野心的钥匙:
- Evolution(进化):变异 + 选择,AI 反复修改候选方案;
- Meta-Evolution(元进化):进化轨迹被回收用来训练”提出修改的模型”——改进者本身被训练了;
- Self-Evolution(自进化):经验回流;
- RSI(递归自我改进):极限目标,每个升级后的系统进一步改进产生后继者的过程。
二、35B 模型的超级进化
先看最刺激的图。MLE-Bench Lite(OpenAI 官方 22 任务划分),每任务 12 小时预算、单张 RTX 4090(12GB 显存封顶)——注意,这个沙盒算力预算比绝大多数已报告评测都要小:
Figure 1 | MLE-Bench Lite 总榜:左侧为全部模型×Harness 组合的 Medal avg@3;右侧 Pareto 面板展示模型参数量(对数轴)与分数的关系
右侧的”模型尺寸 × 分数”Pareto 图才是精髓:在一票百亿到万亿参数模型里,35B 的 Frontis-MA1 几乎单独撑起了小模型端的 Pareto 前沿。换句话说,后训练 + 领域化搜索栈,把大约 80 倍的参数差距压缩到了 1.5 个百分点的分数差距。
完整的受控对比数据:
同一 harness 下,后训练带来+21.22 个百分点(35B)和+18.18 个百分点(30B,跨基座复现);换一个更强的 harness(Evo-Max),再叠加约 +10 个点。训练收益和搜索收益是可组合的——这是全文最重要的定量结论。
三、OpenMLE-Gym:5758 个可执行任务的健身房
训 MLE Agent 的第一个瓶颈不是算法,是环境:你需要成千上万个带数据、带评测器、能沙盒执行的任务包,而现有基准最大的也就几百个(MLE-Bench 75 个、MLE-Smith 606 个)。
Figure 3 | 任务策展:左侧为三条数据源的质量-规模权衡;中间为竞赛任务的漏斗式过滤(11000 → 3972 → 2839 → 2240);右侧为统一的可执行任务包格式(public 输入 / private 答案 / 可执行 metric.py)
OpenMLE-Gym 的做法是三条任务源在”质量-规模”权衡上互补:
- Curated Anchors(156 个):人工精选,质量最高但没法上量;
- Kaggle Competitions(2240 个):人类撰写的题面 + 真实排行榜,质量与规模平衡,自动化管线从 Meta Kaggle 目录约 11000 个竞赛层层过滤,最终保留 20%;
- Kaggle Datasets(3362 个):基于 MLE-Smith 的 dataset-to-task 管线自动 induce 任务,规模最大但质量方差大。
Figure 4 | 规模与构成:5758 个任务对现有可执行任务资源形成数量级优势;模态上表格占 44%、图像 18%、时间序列 13%、多模态 11%;任务类型上分类+回归合计 87%
四、OpenMLE-ERL:把进化算子变成可训练目标
这是全文方法上最巧的一节。传统做法要么训完整轨迹(监督信号稀疏、和特定控制器耦合),要么只做推理时搜索(模型本身不变强)。OpenMLE 的选择是:把进化解耦成四个原子算子,让训练与推理共用同一套算子接口。
Figure 5 | OpenMLE 训练与推理总览:四个可训练原子算子(Draft 创建 / Improve 精炼 / Debug 修复 / Crossover 融合双亲)同时服务于推理时的解空间树扩展、SFT 热启动和 RL 在线优化
4.1 SFT 热启动:26,259 条执行验证过的样本
SFT 语料不是蒸馏来的文本轨迹,而是沙盒里真实跑过、按分数筛过的。
收集过程是预算自适应的:达到样本配额或耗尽执行预算就停——简单任务早停,把验证算力留给成功稀疏的难任务。
Figure 7 | 从已执行 rollout 中学习:左侧为 SFT 双路径语料构建;右侧为 RL 的父节点选择(奖励+子奖励方差+访问冷却)、Top-1/Top-K 自适应边界奖励归一化、以及放大上尾信号的熵优势
4.2 RL:三个针对 MLE 场景的专门设计
MLE 的 RL 和数学/代码 RLVR 很不一样:大量程序根本产不出可用奖励;成功程序的分数来自不同量纲的指标;反馈要等几分钟到几小时。OpenMLE-ERL 的三个应对:
① 自适应边界(Adaptive Bounds)。从每个任务的历史在策略分数前沿动态推导更紧的边界,把原始分数重映射到 [0,1] 的处理后奖励——边界随策略一起进化,在当前候选实际所在的区域保持分辨力。
② 熵优势(Entropic Advantage)。熵优势用 exp(β·r) 放大 rollout 组内靠近头部的奖励差距,替代 GRPO 风格的组归一化信号。效果很直观:
Figure 8 | 上尾奖励塑形的效果
③ 异步 Rollout。OpenMLE 让各生成-执行组独立启动、完成即入队消费,把策略更新和最慢任务解耦。
RL 训练曲线(验证奖励、验证奖牌数、rollout 奖励三线齐升):
Figure 6 | Frontis-MA1-35B 的 RL 训练曲线:Validation Base Reward 从 ~0.15 升至 ~0.40,Validation Medal Count(176 个验证任务)从 ~7 升至 ~25+
五、OpenMLE-Evo:经验驱动的长程搜索
训出来的算子要靠搜索框架组合。OpenMLE-Evo 基于 AIRA-Evo 风格的种群循环,但重新设计了循环使用执行证据的方式。作者把它总结为两个耦合的科学问题:下一个该扩展哪个节点(超越贪心分数最大化)?记忆该怎么构建,让被选中的算子拿到可行动的证据而不是不断膨胀的历史?
Figure 9 | OpenMLE-Evo 搜索 Harness
四个核心机制:结构化经验积累,三因子父节点选择,算子触发的记忆综合,算子条件化上下文。
六、实验:训练与搜索的收益可以叠加
6.1 Harness 本身就在创造价值
固定模型换 harness:OpenMLE-Evo 在四个前沿模型家族上一致性地优于 Claude Code / Codex 这类通用编程 Agent 脚手架;对 Frontis-MA1-35B,相比原始 AIRA-Evo 也从 53.03% 提到 60.61%。
Figure 10, 11 | Harness 对比
固定 harness 换模型(Figure 10):在统一的 OpenMLE-Evo 下,Frontis-MA1-35B(60.61%)压过 MiniMax M3、豆包 2.1 Pro、DeepSeek-V4 Pro 等一批大模型,仅次于 Kimi K2.6 和 GLM-5.2——而后两者参数量都在其十倍以上。
Figure 10 | 统一 OpenMLE-Evo harness 下的模型对比:实心柱为标准 Evo,网格帽为 Evo-Max 额外增益
6.2 长程自我改进:收益来自结构重组而非反复修一个程序
Figure 12
逐任务轨迹更能说明机制。leaf-classification 任务上:对比模型要么在很低的 Human Rank 上 plateau,要么有改进但够不到奖牌;Frontis-MA1 先用 Debug 建立可行的图像和表格分支,再用 Crossover 保留两支的互补证据,最后才用 Improve 升级融合模型。
Figure 13
mlsp-2013-birds(音频任务)上是同样的故事:对比轨迹停在第一个可行解附近,Frontis-MA1 把提交修复当起点,逐步构建专门的音频分支——记忆的作用体现在选择而非堆积。
Figure 14 | mlsp-2013-birds 轨迹:修复与重组产出银牌鸟类检测器
6.3 解的上限:不只是更多铜牌,而是更多金牌
Figure 15 | 金银铜牌分解:后训练和 Evo-Max 不只是把更多解推过铜牌线,而是把成功解系统性地推向金牌区;Frontis-MA1-35B + Evo-Max 的金牌率追平 Kimi K3,超过 Claude Opus 4.8 + Claude Code 和 Gemini 3.5 Flash + Gemini CLI
6.4 效率解剖:省 token 反而更高产
同 checkpoint、同种子、同 12 小时预算、每 harness 66 个任务-run 的对照实验里,OpenMLE-Evo 对原始 AIRA-Evo:
Figure 16 | 搜索效率对比
两个案例研究把机制讲透了:
Figure 17 | 案例 1nomad2018 透明导体
Figure 18 | 案例 2(露脊鲸检测)
案例 2 值得所有做进化搜索的人多看一眼:分数最高的分支和最有价值的分支经常不是同一个——B 分支保留的 Log-Mel + Delta/Delta-Delta 时域通道恰好是 A 分支没有的。纯分数 softmax 会让这种结构性互补在选中前就被饿死。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~