RSI 阅读指南

递归自我改进(RSI)阅读指南

24 份笔记:16 篇近半年的 RSI / 自演化 agent 论文,8 篇前沿实验室技术报告。不做综述式罗列,只回答三个问题——什么真的难,什么我们能做得更好,该押哪个方向

快照日期 2026-09-13 · 论文窗口 2026-06~09 · 报告窗口 2026-03~09

这是什么

这是一份为了做方向决策而做的阅读笔记,不是文献综述。每一篇都按同一套模板拆解,最后交叉阅读得出一页判断。它服务的问题很具体:如果要选一个难的、别人不容易做、且有根本性差异化的方向,该选哪个。

所以它刻意不做两件事:不给"该领域有 N 种流派"这类分类学;不复述摘要。它只关心三件事——这篇的护城河在哪(钱、数据、系统、还是想法)、它自己承认的弱点是什么、它对选方向意味着什么

筛选标准

从 500 余篇候选里收 24 篇,规则是事先定好的:

阅读的透镜

每篇笔记固定回答同样几个问题,这样 24 篇才能横向比较:

段落它在回答什么
一句话如果只能记住一件事,是哪件
机制拆解什么被修改、谁来评估、改进信号从哪来、循环怎么闭合
证据与评估数字、对照组、开放程度——以及哪些数字需要打折看
工程护城河 (仅报告)抄不走的到底是什么:钱、数据、系统,还是组织
真正难在哪门槛的类型。区分"要花钱"和"要想清楚"
我们的机会作者自认的弱点,逐条转成可做的切口
方向启示这篇对"选一个难方向"意味着什么

其中"真正难在哪"和"我们的机会"是这份笔记的重心。绝大多数论文会把自己的局限写在最后一节或附录里,那里往往是最有价值的信息——PaperGym 把自己的 Goodhart 事件写在附录 C.1HELIX 直说自己没跑完循环HackProbe 承认十次诚实迭代会被打断四次以上

建议的阅读顺序

  1. 方向判断 研究计划——先看结论。它给出护城河的五类分法、一张"可重做清单"、以及 5 个候选方向的排序、第一步和最大风险。其余三页都是它的证据。
  2. 报告综述(十六条判断)——八家实验室在做什么、谁的 playbook 对小团队最可学。读完就知道哪些墙是钱砌的、哪些是想法砌的。
  3. 论文综述(地形 / 红海 vs 无人区 / 三个瓶颈)——学术侧的分层,以及哪些方向已经挤满了人。
  4. 按需精读——从两页的索引表里挑。每条都有稳定锚点,方向判断页里的每个链接都直接跳到对应条目。

地形速览

学术侧:三条主线

第一条是分层。"改外部结构"和"改权重"已经分裂成两类几乎不相干的工作,却共用"自改进"这个词。前者(harness / skill / memory / 程序图)不训练、不要 GPU、几轮见效,Sakana、Google、HKU、Princeton+Prime Intellect 各出一篇,同期还有几十篇同类——彻底的红海,而且增益都在个位数百分点上见顶。后者才是真正动权重的闭环,它们共同证明:只要有确定性评分器和足够多的可执行环境,一个 30B 级别的开源模型能被推到接近闭源前沿MLE-Bench Lite 39.4% → 60.6%)。所以算法不再是瓶颈,环境供给才是——但 SPADE 同时划出了这条路的天花板:"invisible leash",自生成的环境永远不会超过生成者的认知边界。

第二条是评估器。0205061516 五篇从五个完全不同的方向出发,收敛到同一个结论:只要评估标准是静态的,自改进最终一定退化成对该标准的过拟合;而递归自评本身是有界的,界的位置取决于有没有一个循环碰不到的锚点。最实用的量级来自 05 号——10 条带真值的锚点就能撑起 88%–110% 的 held-out 收益;最刺眼的证据来自 02 号——最强的 baseline 评审器对 AI 生成论文的接受率是人类论文的 1.91 倍

第三条是冷水。AI4AI-Bench 直接去测 RSI 的定义本身(agent 能不能改进"造 AI 的过程"):平均 0.166 / 1.0263 次改了代码的提交里 141 次根本没碰学习算法另一篇拿两篇未发表的 NeurIPS 投稿当题目,agent 把工程全做完却被原作者判 Reject 和 Strong Reject,$3000 预算只用掉 38%–41%,在 15 轮自评审全部返回"拒"之后从未换过方法。两条独立证据链指向同一个诊断:agent 已经有研究的"手",还没有研究的"脑"——缺的是质量标准的内化、回溯、和资源感知。

工业侧:四家如何闭合循环

八篇报告收敛到的同一句话

Kimi 的整条链最终吊在 GRM 的 rubric 上而 rubric 是现场生成、无一致性保证;Anthropic 的天花板明确卡在冻结 benchmark 的完备性上(标题里就写着 "well-characterized");AgentWorld 的模拟保真度没有任何长程误差分析;而 DeepMind 之所以能产出真知识,恰恰因为它有 Lean——

闭环的质量 = 验证器的质量。

两位撰稿人分头读完各自的一半材料,独立得出了同一个结论。方向判断页把它当作起点,而不是终点。

怎么读这些数字

这份笔记的可信度依赖于把不确定的地方标出来,所以有几条必须先讲:

笔记原文

四个页面都是从 Markdown 笔记渲染的;原始笔记保留在仓库的 notes/ 目录下(notes/papers/ 16 篇 + 综述,notes/reports/ 8 篇 + 综述),内容与本站一致,方便用编辑器检索或做二次加工。