递归自我改进(RSI)阅读指南
24 份笔记:16 篇近半年的 RSI / 自演化 agent 论文,8 篇前沿实验室技术报告。不做综述式罗列,只回答三个问题——什么真的难,什么我们能做得更好,该押哪个方向。
快照日期 2026-09-13 · 论文窗口 2026-06~09 · 报告窗口 2026-03~09
这是什么
这是一份为了做方向决策而做的阅读笔记,不是文献综述。每一篇都按同一套模板拆解,最后交叉阅读得出一页判断。它服务的问题很具体:如果要选一个难的、别人不容易做、且有根本性差异化的方向,该选哪个。
所以它刻意不做两件事:不给"该领域有 N 种流派"这类分类学;不复述摘要。它只关心三件事——这篇的护城河在哪(钱、数据、系统、还是想法)、它自己承认的弱点是什么、它对选方向意味着什么。
筛选标准
从 500 余篇候选里收 24 篇,规则是事先定好的:
- 时效:论文以近半年为界,最好在三个月内。实际收录的 16 篇 arXiv v1 全部在 2026-06-13 之后,逐篇核对过。技术报告窗口放宽到六个月(2026-03-13 起),因为大厂报告的节奏更慢、信息密度更高。
- 机构:前沿实验室(OpenAI / Anthropic / Google DeepMind / Meta / DeepSeek / Moonshot / 阿里 Qwen / 字节 Seed 等);美国 top-30 高校;国内清北华五;港三新二。
- 公司技术报告权重高。理由很实际:它们写的是真正跑通的生产系统,护城河和取舍写得比论文诚实,而且常常附带可下载的权重。
- 两个记录在案的例外:论文 02(剑桥)和论文 05(AWS)——方向上不可替代,纳入理由写在各自条目顶部。
- 剔除规则同样公开:一篇 97 页的 survey 因主要单位不在白名单被放弃;AReaL2.0 机构合格但作者自承是 position paper、无任何 benchmark 数字,剔除。完整名单见论文页的收录说明。
阅读的透镜
每篇笔记固定回答同样几个问题,这样 24 篇才能横向比较:
| 段落 | 它在回答什么 |
|---|---|
| 一句话 | 如果只能记住一件事,是哪件 |
| 机制拆解 | 什么被修改、谁来评估、改进信号从哪来、循环怎么闭合 |
| 证据与评估 | 数字、对照组、开放程度——以及哪些数字需要打折看 |
| 工程护城河 (仅报告) | 抄不走的到底是什么:钱、数据、系统,还是组织 |
| 真正难在哪 | 门槛的类型。区分"要花钱"和"要想清楚" |
| 我们的机会 | 作者自认的弱点,逐条转成可做的切口 |
| 方向启示 | 这篇对"选一个难方向"意味着什么 |
其中"真正难在哪"和"我们的机会"是这份笔记的重心。绝大多数论文会把自己的局限写在最后一节或附录里,那里往往是最有价值的信息——PaperGym 把自己的 Goodhart 事件写在附录 C.1,HELIX 直说自己没跑完循环,HackProbe 承认十次诚实迭代会被打断四次以上。
建议的阅读顺序
- 方向判断 研究计划——先看结论。它给出护城河的五类分法、一张"可重做清单"、以及 5 个候选方向的排序、第一步和最大风险。其余三页都是它的证据。
- 报告综述(十六条判断)——八家实验室在做什么、谁的 playbook 对小团队最可学。读完就知道哪些墙是钱砌的、哪些是想法砌的。
- 论文综述(地形 / 红海 vs 无人区 / 三个瓶颈)——学术侧的分层,以及哪些方向已经挤满了人。
- 按需精读——从两页的索引表里挑。每条都有稳定锚点,方向判断页里的每个链接都直接跳到对应条目。
地形速览
学术侧:三条主线
第一条是分层。"改外部结构"和"改权重"已经分裂成两类几乎不相干的工作,却共用"自改进"这个词。前者(harness / skill / memory / 程序图)不训练、不要 GPU、几轮见效,Sakana、Google、HKU、Princeton+Prime Intellect 各出一篇,同期还有几十篇同类——彻底的红海,而且增益都在个位数百分点上见顶。后者才是真正动权重的闭环,它们共同证明:只要有确定性评分器和足够多的可执行环境,一个 30B 级别的开源模型能被推到接近闭源前沿(MLE-Bench Lite 39.4% → 60.6%)。所以算法不再是瓶颈,环境供给才是——但 SPADE 同时划出了这条路的天花板:"invisible leash",自生成的环境永远不会超过生成者的认知边界。
第二条是评估器。02、05、06、15、16 五篇从五个完全不同的方向出发,收敛到同一个结论:只要评估标准是静态的,自改进最终一定退化成对该标准的过拟合;而递归自评本身是有界的,界的位置取决于有没有一个循环碰不到的锚点。最实用的量级来自 05 号——10 条带真值的锚点就能撑起 88%–110% 的 held-out 收益;最刺眼的证据来自 02 号——最强的 baseline 评审器对 AI 生成论文的接受率是人类论文的 1.91 倍。
第三条是冷水。AI4AI-Bench 直接去测 RSI 的定义本身(agent 能不能改进"造 AI 的过程"):平均 0.166 / 1.0,263 次改了代码的提交里 141 次根本没碰学习算法。另一篇拿两篇未发表的 NeurIPS 投稿当题目,agent 把工程全做完却被原作者判 Reject 和 Strong Reject,$3000 预算只用掉 38%–41%,在 15 轮自评审全部返回"拒"之后从未换过方法。两条独立证据链指向同一个诊断:agent 已经有研究的"手",还没有研究的"脑"——缺的是质量标准的内化、回溯、和资源感知。
工业侧:四家如何闭合循环
- 后训练被拆成了两段。DeepSeek-V4 和 Kimi K3 互不相干却收敛到同一个答案——先按领域分头做小规模 RL 养出多个专家,再用"学生自采样 + 逐 token 反向 KL"的在线蒸馏压回一个统一模型。RL 负责产生能力,蒸馏负责整合能力。Moonshot 做得更彻底:把"思考预算"也当成一个维度,三领域 × 三档预算 = 九个专家,于是"想多久"从训练超参变成了推理时的开关。
- 阿里走数据侧。Qwen-UI-Agent 让 agent 自己做失败分析、映射成结构化原因、再照着缺口合成任务与环境,配 100+ 台真机;Qwen-AgentWorld 则不部署环境而是生成环境,一个语言世界模型同时模拟七个域,权重 Apache-2.0。值得注意的是这两篇没有接起来——"用生成环境跑诊断驱动飞轮"的通路空着,是外部团队现成的空隙。
- 字节 Seed 押在度量和桥接上。EdgeBench 用 3.8 万小时交互证明 agent 的环境学习服从 log-sigmoid 规律(R²=0.998),前 6.5 小时就能外推后 12 小时;经验蒸馏则解决了记忆与训练之间的断层——直接 SFT 只保住 3.8% 的收益,经验蒸馏保住 64.8%,环境样本少 9.6~57 倍。这两篇同出字节也没接起来,而"把经验蒸馏接进 EdgeBench 看 S_max 会不会被抬高"是个用开源任务就能做的实验。
- Anthropic 把循环推到元层。AAR 让 Claude 自己读文献、提训练方法、训模型、看分数、再迭代,一轮单卡 H200 三十分钟,在十类对齐失效上全部超过 28 位人类研究员的最好点子。它的方法论贡献比结果更重要:禁止从更强模型蒸馏、mini-paper 看到结果前冻结、几何平均、code monitor 事前审批——这套"不可作弊的实验协议"才是真正稀缺的东西,而且全部开源。
- DeepMind 走另一个极端。AlphaProof Nexus 完全不训练,纯推理时演化搜索,靠 Lean 这个不可能被骗的硬验证器 + Gemini Flash 给半成品打 Elo 的软评分器,解出 9 个开放的 Erdős 问题。最有信息量的数字是 "AlphaProof 单独 = 0/9"——价值在编排,不在那个被训练过的组件。
八篇报告收敛到的同一句话
Kimi 的整条链最终吊在 GRM 的 rubric 上而 rubric 是现场生成、无一致性保证;Anthropic 的天花板明确卡在冻结 benchmark 的完备性上(标题里就写着 "well-characterized");AgentWorld 的模拟保真度没有任何长程误差分析;而 DeepMind 之所以能产出真知识,恰恰因为它有 Lean——
闭环的质量 = 验证器的质量。
两位撰稿人分头读完各自的一半材料,独立得出了同一个结论。方向判断页把它当作起点,而不是终点。
怎么读这些数字
这份笔记的可信度依赖于把不确定的地方标出来,所以有几条必须先讲:
- 论文 02(Red Queen Gödel Machine)的摘要与数字是从 arXiv 摘要页逐字核对的,但 epoch 结构、anchor 替换流程等机制细节转引自第三方索引站,未从原文正文确认。
- 论文 02、05 是机构白名单的两个例外,已在各自条目顶部标注。
- 论文 04、06、09、14、16 正文中未给出代码仓库链接;其余 11 篇的链接已逐条验证可访问。
- 报告 04(DeepSeek-V4)的记载日期与所给 arXiv 编号前缀不一致,条目内已标注,引用发表日期前请自行核对。
- 部分亮眼数字有前提条件,笔记里都写明了——例如 Prime Agent 的 ARC-AGI-3 30%→95.5% 是特定 harness 评测设置(RHAE)下的 Best@1,不是标准榜单;EdgeBench 的"学习速度每三个月翻倍"基于 18 任务切片、单条模型线、两点外推,方向性可信但倍数要打折。
笔记原文
四个页面都是从 Markdown 笔记渲染的;原始笔记保留在仓库的 notes/ 目录下(notes/papers/ 16 篇 + 综述,notes/reports/ 8 篇 + 综述),内容与本站一致,方便用编辑器检索或做二次加工。