从 AI4AI 到 RSI
大模型自进化的技术路径与行业图景
2026 年 4 月开始系统调研,公开资料截于 2026 年 8 月 16 日。
AI 已经开始参与代码、数据、训练、评测和实验迭代。更关键的问题是:一次改进能否让系统更有效地完成下一轮改进?
当前公开进展主要集中在 Bounded RSI:任务、预算和可修改对象有明确边界,每轮改动都能验证和回滚。严格 RSI 还要求新版系统在相同预算下,比旧版系统更有效地产生下一代。公开结果尚未证明这种能力能够持续增强。
1. AI4AI、Auto Research 与 RSI
三个概念分别描述改进对象、工作方式和跨代能力:
| 概念 | 核心问题 | 范围 |
|---|---|---|
| AI4AI | AI 在改进什么? | 模型、数据、训练配方、Harness、评测器和 AI 基础设施 |
| Auto Research | 研究怎样完成? | Agent 自主完成检索、假设、实验、诊断和写作 |
| RSI | 改进能否跨代增强? | 第 t+1 代需要比第 t 代更擅长改进后续系统 |
三个概念没有简单的包含关系。一个系统可以自动完成研究,但不改进 AI;也可以用 AI 改进模型或训练系统,却没有形成跨代反馈。一项覆盖 1,250 篇论文的 RSI 综述 也用“修改什么”和“谁关闭循环”两条轴整理相关工作,分别对应改进对象和研究流程;是否具备跨代增强能力,还需要单独检验。
Periodic Labs 展示了第一类边界:系统可以自主提出候选、安排实验并读取反馈,属于 Auto Research;它优化材料和物理系统,因此不属于本文讨论的 AI4AI。AlphaEvolve 展示了第二类边界:它改进过数据中心调度、芯片设计和 AI 训练内核,其中改进 AI 基础设施的任务属于 AI4AI;但公开结果衡量的是产出算法的质量,没有检验改动后的系统是否更擅长产生下一代,因此还不能据此判断 RSI 已经成立。
严格 RSI 的最低判据是:
在可控预算下,第t+1代系统能否比第t代更有效地改进下一代?
2. AI4AI 系统怎样运行
Coding Agent、ML engineering 和训练优化适合检验自改进机制。任务链路足够长,编译器、测试、训练日志和 benchmark 又能及时返回结果。
一个可运行的系统包含两个不同时间尺度的循环:
S_t 在内环中执行和纠错;外环汇总运行记录、修改研究系统,并用固定预算的 Dev 和 held-out 任务决定发布或回滚。
改动可以落在三个层面:
| 层面 | 主要对象 |
|---|---|
| 模型层 | 数据、架构、目标函数、优化器和训练配方,覆盖 pre-training、mid-training、post-training、蒸馏与持续学习等 |
| Agent 系统层 | Harness、Context、Tool、Skill、Memory、路由、循环控制和失败恢复 |
| 计算系统层 | 数据流水线、Kernel、Compiler、分布式训练、推理引擎和资源调度 |
三个层面共用同一验收层。如果验收层也纳入修改范围,需要在外部保留固定的回归测试和回滚规则,防止评分规则随系统一起漂移。
Harness 决定任务如何呈现、工具何时调用、反馈如何返回,以及经验能否跨轮保留和复用。同一策略在不同模型上可能产生相反效果,因此需要 model × harness 交叉实验。One Recipe, Many Harnesses 也显示,共享抽象可以迁移,语言相关组件仍需分别优化。
自动研究已经从 post-training 延伸到 pre-training。modded-nanogpt 提供可快速验证的训练环境;Karpathy autoresearch 让 Agent 持续修改训练代码、优化器和训练配方。8 月 16 日,Prime Intellect 公布了 18 个模型参与的 153 次多日运行。每次使用 8×H200,最长运行 8 天;最佳结果把达到目标损失所需的步数从 3290 降至 2726。
较强的 Agent 更会管理种子、实验噪声、消融和失败方案。最终保留的改动仍来自已有优化技巧,各模型的 Harness 和运行预算也不完全相同。这项实验说明 pre-training 配方可以进入长周期自动优化;它没有测试前沿规模迁移,也没有比较新旧 Research Agent 的改进能力。
计算系统层面也出现了类似工作。ArchAgent v2 自动演化三级数据预取器,在 DPC4 同规则下比此前人工冠军高 0.3% 几何平均 IPC。长时间仿真仍限制搜索规模,Agent 自身也没有进入改进对象。
双循环描述系统结构,RSI 分级进一步判断修改如何产生、选择,以及改进者能否跨代增强。
3. RSI分级
Gödel Machine、Darwin Gödel Machine、Huxley-Gödel Machine 和 Hyperagents 描述系统怎样产生和选择修改;Weco L0–L3 分别衡量闭环自治、研发生产率和递归动力学。L2 才开始检验跨代 improver 能力。
| 机制 | 核心做法 | 当前边界 |
|---|---|---|
| Gödel Machine | 证明修改能够提高预期效用后,程序才重写自身 | 真实但无法形式化证明的改进会被忽略 |
| Darwin Gödel Machine | 用变异、benchmark 实测和多谱系选择改写 Coding Agent | 搜索仍受固定 benchmark 和外层选择规则约束 |
| Huxley-Gödel Machine | 估计各 clade 的 metaproductivity(CMP),据此选择搜索树的扩展方向 | expansion 和 evaluation policy 固定,尚未比较新旧 improver |
| Hyperagents | 将任务 Agent 与产生改进的元程序放入同一可编辑系统 | 任务分布、父代选择和最外层评估仍由外部固定 |
Weco 从研发生产率和跨代反馈划分四个阶段:
| 等级 | 判断标准 |
|---|---|
| L0:Autonomous Delegation | 研发闭环能够自主运行,但固定预算下仍弱于公平的人类基线 |
| L1:Net-positive | 固定物理预算下超过公平的人类研发基线;收益形成多步趋势,并迁移到优化目标之外的任务或指标 |
| L2:Ignition | 新版 improver 比旧版 improver 更有效地产生下一代 |
| L3:Inflection | 正反馈超过研发难度增长,固定预算下的代际增益持续扩大 |
CMP 汇总一个 clade 的后代 benchmark 表现;HGM 估计 CMP,并据此选择搜索树的扩展方向。它把选择信号从当前性能推进到后代生产力,但没有让后代接管 improver 席位进行代际对照。Inflection 还要求新版 improver 反复接管,并使同预算下的代际增益持续扩大。现有 HGM 实验没有确认 Ignition 或 Inflection。
4. 怎样排除“假进步”
最终分数只说明一次运行的结果。额外预算、幸运种子、Harness 变化、数据泄漏和评分漏洞都可能制造涨分。Verifier 决定哪些改动会被保留,benchmark 决定系统朝哪个方向优化,因此两者也要接受检查。
本文选择代表性评测与诊断工作时,主要考虑与 AI / ML 研发的相关性、任务真实性、评分方式、预算控制、可复现性、污染风险和外部采用情况。
| 代表性工作 | 主要用途与边界 |
|---|---|
| RE-Bench | 用多档时间预算和人类专家对照,检查短时竞争力能否延伸到长期研究 |
| MLE-bench | 让 scaffold、资源设置、尝试策略和污染控制成为显式评测条件 |
| PaperBench | 用作者校验 rubric 和专家对照评估论文复现;不测原创研究能力 |
| PostTrainBench | 直接运行 post-training,暴露目标错位、能力回退和 reward hacking |
| HarnessOpt-Bench | 固定调用预算并隔离搜索集和隐藏测试集,区分 Harness 优化与测试集拟合 |
| Prime Intellect nanoGPT Speedrun | 展示多日实验为什么需要报告种子、停止规则、GPU 预算、方差和失败回访 |
| Beyond Final Scores | 把总分拆成过程代理指标、经验复用、Harness 影响和方法新颖性 |
Beyond Final Scores:从总分到过程诊断
《Beyond Final Scores》评估了 7 个前沿模型、36 个长程 AI R&D 任务和 756 条轨迹。报告用三项规则代理指标定位过程瓶颈:C1 以高分首次出现的位置代理有效方向发现,C2 以可执行提交与构建失败代理交付能力,C3 以峰值保留和回退恢复代理反馈控制。这些指标并非对相应能力的完整定义。另一组对照实验观察任务内和跨任务的经验复用。
最终分数相近的模型,过程瓶颈可能完全不同。C2 整体较高,差异更多出现在方向选择、结果保持和失败恢复。经验有时改善后续决策,也可能让 Agent 固守错误结论或评分捷径。在 Opus、GPT 和 Kimi 的 Harness 对照中,汇总 avg@3 比 best@3 更敏感,模型总体排序没有改变;分任务结果仍有明显的 model × workload 交互。252 个最佳方案中,111 个被归为组合既有技术(composition-stacking),16 个利用了评测捷径。按报告的保守 rubric,经模型初筛和候选人工复核,只有 3 个保留“新方法”标签。
这组对照报告有无保留或注入经验时的分数变化,仍可能混入 rollout 随机性、提示效应和运行时漂移。它适合观察经验复用,不能直接视为跨代自改进,也不能用于确认 Ignition。
从涨分到 RSI
一次性 gain → held-out transfer → L1 Net-positive → L2 Ignition → L3 Inflection
“一次性 gain”和“held-out transfer”是本文增加的验证步骤;L1–L3 沿用 Weco 的动力学分级。前者需要排除额外预算和实现错误,后者要求收益可以重复,并迁移到未参与优化的任务。
一套可审计的实验至少要做到:
- 固定任务、数据、Verifier 和工具版本。
- 隔离开发集与 held-out。
- 固定时间、计算量、尝试次数、工具权限和人工介入。
- 预先说明种子选择、继续运行和停止规则,并报告方差与成本。
- 检查污染、答案记忆、reward hacking、能力回退和违规行为。
- 记录 Skill、Memory 和长期指令的来源、版本、审批与回滚历史。
Verifier 本身也会失效。OSReward 发现评审器会放过未完成的操作轨迹;Jagged Judges 显示正确判断可能在持续反驳下翻转;QuoteBench 将部分性能损失定位到执行解析层。评测需要分别检查 Agent、Verifier 和执行链路。
单次修改可标为四类:held-out 稳定增益且成本和风险可接受,记为 valid improvement;开发集收益没有迁移,记为 overfit;泄漏、绕过 Verifier 或修改评分规则带来的高分,记为 unsafe;覆盖不足或方差过大,记为 inconclusive。
结论必须对应可回放日志、代码和数据版本、实验矩阵、成本及对照结果。多项组件同时变化时,无法完成可靠归因。
5. 行业进展:四条技术路线与重点团队
公开进展主要沿四条路线展开:
| 路线 | 代表工作 | 已有进展 | 边界 |
|---|---|---|---|
| 算法与计算系统优化 | AlphaEvolve、ArchAgent v2 | 在算法发现、训练内核和处理器预取器上取得了可验证增益 | 优化对象主要是外部算法或系统,Research Agent 没有进入改进对象 |
| 训练配方搜索 | Prime Intellect nanoGPT Speedrun | Agent 已能管理多日实验中的种子、噪声、消融和失败方案回访 | 前沿规模迁移和跨代改进尚未验证 |
| Harness 优化 | Prime Agent、HarnessOpt-Bench、OEO、AI4AI at Test-Time | 开始自动搜索提示词、工具、Skill、Memory 和运行流程,并测试能力迁移 | 收益对模型、任务和评测设计敏感,尚无跨代 improver 对照 |
| Agent 与元改进机制 | DGM、HGM、Hyperagents、Weco AIDE²、Frontis OpenRSI | 已能修改 Agent、Harness,或运行包含环境反馈和训练的外层循环 | 尚无同预算的新旧 improver 公开对照支持 Ignition |
以下聚焦以 AI4AI 或 RSI 为核心定位的创业公司和独立研究团队,并按公开技术产出分组,不穷举所有参与相关工作的实验室。
已公开技术产出的团队
| 团队 | 做什么 | 公开了什么 | 还缺什么 |
|---|---|---|---|
| Sakana AI RSI Lab | 从 Agent-Native Models、AI Scientist 走向 RSI | The AI Scientist 与 DGM 的论文和代码 | 同预算的新旧 improver 跨代对照 |
| Weco AI | 在可量化的 ML engineering 任务上探索 Bounded RSI | AIDE 的论文和代码;AIDE² 由外层 Agent 改写内层研究 Agent 并报告 held-out 增益,公司自评 L1 | AIDE² 完整代码、独立复现和 Ignition 检验 |
| Frontis AI / 衔远科技 | 构建面向 ML engineering 的 Bounded RSI 系统 | Frontis-MA1 权重,以及 OpenMLE-Gym、ERL、Evo 代码;OpenMLE Sandbox、NatureBench quickstart 和轨迹分析 | 作者报告的 benchmark 结果仍待独立复现;尚无跨代 improver 检验 |
| Intology | 用 Zochi / Locus 自动完成 AI R&D 与 post-training | Zochi 技术报告、部分成果代码;Locus 报告称标准 PostTrainBench 得分经 benchmark 作者核验 | 完整 Research Agent 尚未开源。PostTrainBench+ 将七项任务总预算扩至 4,500 H100 小时且每项只运行一次,不能与原始十小时口径直接比较;尚无跨代 improver 检验 |
| Inherent | 用论文复现任务训练 AI Scientist | Replica / Faraday 将论文转成可执行任务和评分标准,再后训练 27B 模型;作者报告其在留出复现任务上超过 Claude Opus 4.8 和 GPT-5.5 | 独立复现、开放式新假设评测和跨代 improver 检验 |
定位高度契合、公开产出较少的团队
| 团队 | 做什么 | 公开了什么 | 还缺什么 |
|---|---|---|---|
| Recursive Superintelligence | 研究 open-ended、AI-generating algorithms 和 AI scientists | 团队、使命和研究主题 | 模型、代码和 benchmark |
| Mirendil | 将 pre-training、post-training、RL、eval、Harness 与基础设施整合为 self-accelerating AI R&D | 团队、岗位和工程蓝图 | 运行结果和 held-out 验证 |
| Discovery Loop | 先自动化 ML research / engineering,再以自身技术栈为优化对象 | 团队与 AI-for-AI 外循环定位 | 论文、模型、代码和 benchmark |
6. RSI 的当前进展与待解问题
| 问题 | 结论 |
|---|---|
| AI 能否参与并改进 AI 研发? | 可以,已有论文、代码和多日运行结果 |
| 受约束、可验证的内外循环能否运行? | 可以,已有多个工程原型 |
| 固定预算下能否超过公平的人类研发基线? | 只有少量作者报告,完整 Artifact、预算可比性和独立复现仍不足 |
| 新系统能否成为更强的改进者? | 尚无同预算的新旧 improver 公开对照 |
| 固定预算下的代际增益能否持续扩大? | 尚无可信公开结果 |
仍需回答的问题包括:
- 搜索与学习的归因:固定预算后,学习曲线、重复方差和新任务样本效率能否显示经验被真正利用?
- 跨系统迁移:经验能否跨任务、模型和 Harness 生效?
- 全局回归:局部 bad case 的修复是否引发遗忘、安全退化或其他能力回退?
- Verifier 共适应:Agent、benchmark 和 Verifier 是否在共同寻找评分捷径?
- 研究品味与新颖性:怎样区分已有技巧的重组与可迁移的新方法?
- 长期审计:多代运行怎样记录 trace、成本、种子、停止规则和状态变更,并支持回放与回滚?
- 因果归因:模型、Harness、数据和评测器同时变化时,哪项修改带来了收益?
截至 8 月 16 日,AI4AI 已进入可运行、可验证的工程阶段,公开结果主要支持受约束闭环,少量作者报告触及 L1。L2 Ignition 仍缺少同预算的新旧 improver 对照,L3 Inflection 尚无可信结果。下一步的关键实验,是检验 S_{t+1} 能否在多批 held-out 任务上稳定产生比 S_t 更多的有效改进。