Frontis-MA1 / OpenMLE
能改进AI的AI,现在可在单张RTX 4090上运行
FrontisAI的OpenMLE技术栈和35B参数的Frontis-MA1智能体将递归自我改进变成了一个可复现的实验。在单张RTX 4090上,该模型在MLE-Bench Lite中得分71.21%,领先于GPT-5.5 + Codex,并接近大得多的前沿模型。

递归自我改进作为AI领域最具推测性的概念已存在数十年,它出现在末日论文章和科幻小说中。FrontisAI刚刚把它变成了一个GitHub仓库。该实验室于7月30日提交的论文描述了OpenMLE, , 一个用于改进AI自身构建方式的开放技术栈, , 以及Frontis-MA1,一个为运行该技术栈而训练的350亿参数模型。该项目的页面已在Hugging Face上获得161个赞。
让这项发布值得细看的,是硬件。Frontis-MA1的评估在显存限制为12 GB的单张RTX 4090上运行,每个任务有12小时的预算。在机器学习工程基准MLE-Bench Lite上,基础模型的奖牌平均分为39.39%。搭配搜索组件OpenMLE-Evo后,它跃升至60.61%。再加上增加了与基准无关的经验先验和异步搜索的OpenMLE-Evo-Max,它达到了71.21%。
这些数字击败了GPT-5.5 + Codex组合,并接近GPT-5.6 Sol和Kimi K3, , 后者是一个2.8万亿参数的模型,比Frontis-MA1大80倍。这些方案之间的算力差距才是真正的重点。
| MLE-Bench Lite上的配置 | 奖牌平均分 |
|---|---|
| 基础模型 | 39.39% |
| + OpenMLE-Evo | 60.61% |
| + OpenMLE-Evo-Max | 71.21% |
所有运行均在显存限制为12 GB的单张RTX 4090上使用每个任务12小时的预算。
四个算子,一个循环
该设计将构建模型视为一个进化过程,而非单次前向传播。FrontisAI定义了四个原子操作:Draft(起草)、Improve(改进)、Debug(调试)和Crossover(交叉)。Frontis-MA1经过后期训练,能够根据执行反馈执行这些操作,使用监督微调和强化学习,训练数据已针对评估基准做了去重。在推理时,相同的算子组合成长程搜索:系统提出候选、对它们进行变异、修复失败,并重组有效方案。论文将这一结果称为“在单一循环中将学习与进化耦合”。
这种架构依旧清晰可读,这一点很重要。“AI4AI”, , 即改进AI构建过程的系统, , 可能含糊到毫无用处。在这里,它被拆解为四个具名操作和一个任何人都能检查并复现的搜索循环。这才是真正的贡献,与任何单一分数无关。
迁移结果与细则
两个细节让这一结果不像是在基准上碰运气。在保留的NatureBench Lite上,两个组件各自都能泛化。固定框架不变,替换为训练后的模型可将Match-SOTA从50%提升到70%。固定模型不变,替换为OpenMLE-Evo可将其从20%提升到50%。保留数据意味着这一切都不在训练范围内,这是相信任何结论的最低条件。
注意事项同样具体。两个基准都是Lite版本,即更大型测试套件的精简版。每个数字都描述了一种受限配置:单张GPU,每个任务12小时的上限。与GPT-5.5 + Codex、GPT-5.6 Sol和Kimi K3的对比是论文自己的说法,摘要没有说明这些系统是如何配置或运行的。独立验证尚未进行。请将这些百分比视为实验室的报告,而非独立定论。
悬而未决的问题
对于一个旨在实现递归自我改进的系统,问题是这个循环能否产生复利效应。这些结果表明,一个训练后的模型利用进化来解决机器学习工程任务,表现优于其基础版本。但它们并未显示Frontis-MA1能产出一个超越自身的后继者, , 而这正是递归自我改进最终需要的东西。论文标题使用了“towards”(迈向)一词,这个词的分量很重。
这次发布改变的是谁有资格提出这个问题。模型权重和完整的OpenMLE技术栈都在GitHub上。RSI研究不再局限于前沿实验室和政策白皮书;它现在成了任何拥有一块像样GPU的人都能运行的实验,附带一个具名基准和一份写明的硬件配置。这个领域是否需要这一切,则是另一个问题。如今它成为可能,这件事本身就是新闻。
- 来源 : The AI that improves AI now runs on one RTX 4090 — 2026-07-30
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。