返回博客
AI4AI 与递归自我改进

从 AI4AI 到 RSI

大模型自进化的技术路径与行业图景

2026年8月25日 · 技术概览
2026 年 4 月开始系统调研,公开资料截于 2026 年 8 月 16 日。

AI 已经开始参与代码、数据、训练、评测和实验迭代。更关键的问题是:一次改进能否让系统更有效地完成下一轮改进?

当前公开进展主要集中在 Bounded RSI:任务、预算和可修改对象有明确边界,每轮改动都能验证和回滚。严格 RSI 还要求新版系统在相同预算下,比旧版系统更有效地产生下一代。公开结果尚未证明这种能力能够持续增强。

1. AI4AI、Auto Research 与 RSI

三个概念分别描述改进对象、工作方式和跨代能力:

概念核心问题范围
AI4AIAI 在改进什么?模型、数据、训练配方、Harness、评测器和 AI 基础设施
Auto Research研究怎样完成?Agent 自主完成检索、假设、实验、诊断和写作
RSI改进能否跨代增强?t+1 代需要比第 t 代更擅长改进后续系统

三个概念没有简单的包含关系。一个系统可以自动完成研究,但不改进 AI;也可以用 AI 改进模型或训练系统,却没有形成跨代反馈。一项覆盖 1,250 篇论文的 RSI 综述 也用“修改什么”和“谁关闭循环”两条轴整理相关工作,分别对应改进对象和研究流程;是否具备跨代增强能力,还需要单独检验。

Periodic Labs 展示了第一类边界:系统可以自主提出候选、安排实验并读取反馈,属于 Auto Research;它优化材料和物理系统,因此不属于本文讨论的 AI4AI。AlphaEvolve 展示了第二类边界:它改进过数据中心调度、芯片设计和 AI 训练内核,其中改进 AI 基础设施的任务属于 AI4AI;但公开结果衡量的是产出算法的质量,没有检验改动后的系统是否更擅长产生下一代,因此还不能据此判断 RSI 已经成立。

严格 RSI 的最低判据是:

在可控预算下,第 t+1 代系统能否比第 t 代更有效地改进下一代?

2. AI4AI 系统怎样运行

Coding Agent、ML engineering 和训练优化适合检验自改进机制。任务链路足够长,编译器、测试、训练日志和 benchmark 又能及时返回结果。

一个可运行的系统包含两个不同时间尺度的循环:

图 1|AI4AI 双循环:内环执行任务并纠错,外环根据运行轨迹修改研究系统,再用固定预算的 Dev 和 held-out 任务验收。

S_t 在内环中执行和纠错;外环汇总运行记录、修改研究系统,并用固定预算的 Dev 和 held-out 任务决定发布或回滚。

改动可以落在三个层面:

层面主要对象
模型层数据、架构、目标函数、优化器和训练配方,覆盖 pre-training、mid-training、post-training、蒸馏与持续学习等
Agent 系统层Harness、Context、Tool、Skill、Memory、路由、循环控制和失败恢复
计算系统层数据流水线、Kernel、Compiler、分布式训练、推理引擎和资源调度

三个层面共用同一验收层。如果验收层也纳入修改范围,需要在外部保留固定的回归测试和回滚规则,防止评分规则随系统一起漂移。

Harness 决定任务如何呈现、工具何时调用、反馈如何返回,以及经验能否跨轮保留和复用。同一策略在不同模型上可能产生相反效果,因此需要 model × harness 交叉实验。One Recipe, Many Harnesses 也显示,共享抽象可以迁移,语言相关组件仍需分别优化。

自动研究已经从 post-training 延伸到 pre-training。modded-nanogpt 提供可快速验证的训练环境;Karpathy autoresearch 让 Agent 持续修改训练代码、优化器和训练配方。8 月 16 日,Prime Intellect 公布了 18 个模型参与的 153 次多日运行。每次使用 8×H200,最长运行 8 天;最佳结果把达到目标损失所需的步数从 3290 降至 2726。

较强的 Agent 更会管理种子、实验噪声、消融和失败方案。最终保留的改动仍来自已有优化技巧,各模型的 Harness 和运行预算也不完全相同。这项实验说明 pre-training 配方可以进入长周期自动优化;它没有测试前沿规模迁移,也没有比较新旧 Research Agent 的改进能力。

计算系统层面也出现了类似工作。ArchAgent v2 自动演化三级数据预取器,在 DPC4 同规则下比此前人工冠军高 0.3% 几何平均 IPC。长时间仿真仍限制搜索规模,Agent 自身也没有进入改进对象。

双循环描述系统结构,RSI 分级进一步判断修改如何产生、选择,以及改进者能否跨代增强。

3. RSI分级

Gödel Machine、Darwin Gödel Machine、Huxley-Gödel Machine 和 Hyperagents 描述系统怎样产生和选择修改;Weco L0–L3 分别衡量闭环自治、研发生产率和递归动力学。L2 才开始检验跨代 improver 能力。

机制核心做法当前边界
Gödel Machine证明修改能够提高预期效用后,程序才重写自身真实但无法形式化证明的改进会被忽略
Darwin Gödel Machine用变异、benchmark 实测和多谱系选择改写 Coding Agent搜索仍受固定 benchmark 和外层选择规则约束
Huxley-Gödel Machine估计各 clade 的 metaproductivity(CMP),据此选择搜索树的扩展方向expansion 和 evaluation policy 固定,尚未比较新旧 improver
Hyperagents将任务 Agent 与产生改进的元程序放入同一可编辑系统任务分布、父代选择和最外层评估仍由外部固定

Weco 从研发生产率和跨代反馈划分四个阶段:

等级判断标准
L0:Autonomous Delegation研发闭环能够自主运行,但固定预算下仍弱于公平的人类基线
L1:Net-positive固定物理预算下超过公平的人类研发基线;收益形成多步趋势,并迁移到优化目标之外的任务或指标
L2:Ignition新版 improver 比旧版 improver 更有效地产生下一代
L3:Inflection正反馈超过研发难度增长,固定预算下的代际增益持续扩大

CMP 汇总一个 clade 的后代 benchmark 表现;HGM 估计 CMP,并据此选择搜索树的扩展方向。它把选择信号从当前性能推进到后代生产力,但没有让后代接管 improver 席位进行代际对照。Inflection 还要求新版 improver 反复接管,并使同预算下的代际增益持续扩大。现有 HGM 实验没有确认 Ignition 或 Inflection。

4. 怎样排除“假进步”

最终分数只说明一次运行的结果。额外预算、幸运种子、Harness 变化、数据泄漏和评分漏洞都可能制造涨分。Verifier 决定哪些改动会被保留,benchmark 决定系统朝哪个方向优化,因此两者也要接受检查。

本文选择代表性评测与诊断工作时,主要考虑与 AI / ML 研发的相关性、任务真实性、评分方式、预算控制、可复现性、污染风险和外部采用情况。

代表性工作主要用途与边界
RE-Bench用多档时间预算和人类专家对照,检查短时竞争力能否延伸到长期研究
MLE-bench让 scaffold、资源设置、尝试策略和污染控制成为显式评测条件
PaperBench用作者校验 rubric 和专家对照评估论文复现;不测原创研究能力
PostTrainBench直接运行 post-training,暴露目标错位、能力回退和 reward hacking
HarnessOpt-Bench固定调用预算并隔离搜索集和隐藏测试集,区分 Harness 优化与测试集拟合
Prime Intellect nanoGPT Speedrun展示多日实验为什么需要报告种子、停止规则、GPU 预算、方差和失败回访
Beyond Final Scores把总分拆成过程代理指标、经验复用、Harness 影响和方法新颖性

Beyond Final Scores:从总分到过程诊断

《Beyond Final Scores》评估了 7 个前沿模型、36 个长程 AI R&D 任务和 756 条轨迹。报告用三项规则代理指标定位过程瓶颈:C1 以高分首次出现的位置代理有效方向发现,C2 以可执行提交与构建失败代理交付能力,C3 以峰值保留和回退恢复代理反馈控制。这些指标并非对相应能力的完整定义。另一组对照实验观察任务内和跨任务的经验复用。

最终分数相近的模型,过程瓶颈可能完全不同。C2 整体较高,差异更多出现在方向选择、结果保持和失败恢复。经验有时改善后续决策,也可能让 Agent 固守错误结论或评分捷径。在 Opus、GPT 和 Kimi 的 Harness 对照中,汇总 avg@3 比 best@3 更敏感,模型总体排序没有改变;分任务结果仍有明显的 model × workload 交互。252 个最佳方案中,111 个被归为组合既有技术(composition-stacking),16 个利用了评测捷径。按报告的保守 rubric,经模型初筛和候选人工复核,只有 3 个保留“新方法”标签。

这组对照报告有无保留或注入经验时的分数变化,仍可能混入 rollout 随机性、提示效应和运行时漂移。它适合观察经验复用,不能直接视为跨代自改进,也不能用于确认 Ignition。

从涨分到 RSI

一次性 gain → held-out transfer → L1 Net-positive → L2 Ignition → L3 Inflection

“一次性 gain”和“held-out transfer”是本文增加的验证步骤;L1–L3 沿用 Weco 的动力学分级。前者需要排除额外预算和实现错误,后者要求收益可以重复,并迁移到未参与优化的任务。

一套可审计的实验至少要做到:

  • 固定任务、数据、Verifier 和工具版本。
  • 隔离开发集与 held-out。
  • 固定时间、计算量、尝试次数、工具权限和人工介入。
  • 预先说明种子选择、继续运行和停止规则,并报告方差与成本。
  • 检查污染、答案记忆、reward hacking、能力回退和违规行为。
  • 记录 Skill、Memory 和长期指令的来源、版本、审批与回滚历史。

Verifier 本身也会失效。OSReward 发现评审器会放过未完成的操作轨迹;Jagged Judges 显示正确判断可能在持续反驳下翻转;QuoteBench 将部分性能损失定位到执行解析层。评测需要分别检查 Agent、Verifier 和执行链路。

单次修改可标为四类:held-out 稳定增益且成本和风险可接受,记为 valid improvement;开发集收益没有迁移,记为 overfit;泄漏、绕过 Verifier 或修改评分规则带来的高分,记为 unsafe;覆盖不足或方差过大,记为 inconclusive

结论必须对应可回放日志、代码和数据版本、实验矩阵、成本及对照结果。多项组件同时变化时,无法完成可靠归因。

5. 行业进展:四条技术路线与重点团队

公开进展主要沿四条路线展开:

路线代表工作已有进展边界
算法与计算系统优化AlphaEvolveArchAgent v2在算法发现、训练内核和处理器预取器上取得了可验证增益优化对象主要是外部算法或系统,Research Agent 没有进入改进对象
训练配方搜索Prime Intellect nanoGPT SpeedrunAgent 已能管理多日实验中的种子、噪声、消融和失败方案回访前沿规模迁移和跨代改进尚未验证
Harness 优化Prime AgentHarnessOpt-BenchOEOAI4AI at Test-Time开始自动搜索提示词、工具、Skill、Memory 和运行流程,并测试能力迁移收益对模型、任务和评测设计敏感,尚无跨代 improver 对照
Agent 与元改进机制DGM、HGM、Hyperagents、Weco AIDE²Frontis OpenRSI已能修改 Agent、Harness,或运行包含环境反馈和训练的外层循环尚无同预算的新旧 improver 公开对照支持 Ignition

以下聚焦以 AI4AI 或 RSI 为核心定位的创业公司和独立研究团队,并按公开技术产出分组,不穷举所有参与相关工作的实验室。

已公开技术产出的团队

团队做什么公开了什么还缺什么
Sakana AI RSI Lab从 Agent-Native Models、AI Scientist 走向 RSIThe AI Scientist 与 DGM 的论文和代码同预算的新旧 improver 跨代对照
Weco AI在可量化的 ML engineering 任务上探索 Bounded RSIAIDE 的论文和代码;AIDE² 由外层 Agent 改写内层研究 Agent 并报告 held-out 增益,公司自评 L1AIDE² 完整代码、独立复现和 Ignition 检验
Frontis AI / 衔远科技构建面向 ML engineering 的 Bounded RSI 系统Frontis-MA1 权重,以及 OpenMLE-Gym、ERL、Evo 代码;OpenMLE Sandbox、NatureBench quickstart 和轨迹分析作者报告的 benchmark 结果仍待独立复现;尚无跨代 improver 检验
Intology用 Zochi / Locus 自动完成 AI R&D 与 post-trainingZochi 技术报告部分成果代码Locus 报告称标准 PostTrainBench 得分经 benchmark 作者核验完整 Research Agent 尚未开源。PostTrainBench+ 将七项任务总预算扩至 4,500 H100 小时且每项只运行一次,不能与原始十小时口径直接比较;尚无跨代 improver 检验
Inherent用论文复现任务训练 AI ScientistReplica / Faraday 将论文转成可执行任务和评分标准,再后训练 27B 模型;作者报告其在留出复现任务上超过 Claude Opus 4.8 和 GPT-5.5独立复现、开放式新假设评测和跨代 improver 检验

定位高度契合、公开产出较少的团队

团队做什么公开了什么还缺什么
Recursive Superintelligence研究 open-ended、AI-generating algorithms 和 AI scientists团队、使命和研究主题模型、代码和 benchmark
Mirendil将 pre-training、post-training、RL、eval、Harness 与基础设施整合为 self-accelerating AI R&D团队、岗位和工程蓝图运行结果和 held-out 验证
Discovery Loop先自动化 ML research / engineering,再以自身技术栈为优化对象团队与 AI-for-AI 外循环定位论文、模型、代码和 benchmark

6. RSI 的当前进展与待解问题

问题结论
AI 能否参与并改进 AI 研发?可以,已有论文、代码和多日运行结果
受约束、可验证的内外循环能否运行?可以,已有多个工程原型
固定预算下能否超过公平的人类研发基线?只有少量作者报告,完整 Artifact、预算可比性和独立复现仍不足
新系统能否成为更强的改进者?尚无同预算的新旧 improver 公开对照
固定预算下的代际增益能否持续扩大?尚无可信公开结果

仍需回答的问题包括:

  • 搜索与学习的归因:固定预算后,学习曲线、重复方差和新任务样本效率能否显示经验被真正利用?
  • 跨系统迁移:经验能否跨任务、模型和 Harness 生效?
  • 全局回归:局部 bad case 的修复是否引发遗忘、安全退化或其他能力回退?
  • Verifier 共适应:Agent、benchmark 和 Verifier 是否在共同寻找评分捷径?
  • 研究品味与新颖性:怎样区分已有技巧的重组与可迁移的新方法?
  • 长期审计:多代运行怎样记录 trace、成本、种子、停止规则和状态变更,并支持回放与回滚?
  • 因果归因:模型、Harness、数据和评测器同时变化时,哪项修改带来了收益?

截至 8 月 16 日,AI4AI 已进入可运行、可验证的工程阶段,公开结果主要支持受约束闭环,少量作者报告触及 L1。L2 Ignition 仍缺少同预算的新旧 improver 对照,L3 Inflection 尚无可信结果。下一步的关键实验,是检验 S_{t+1} 能否在多批 held-out 任务上稳定产生比 S_t 更多的有效改进。