RSI 阅读指南

论文笔记:16 篇 RSI / 自演化 agent 研究

窗口 2026-06-13 至 2026-09-13,全部核对过 arXiv v1 日期与作者单位。按"对选方向的价值"排序,不是按引用或热度。

快照日期 2026-09-13 · 16 篇 · 每篇六段:一句话 / 机制拆解 / 证据与评估 / 真正难在哪 / 我们的机会 / 方向启示

综述:2026 年下半年的 RSI 研究地形

种子仓库 wkqdzkd/Awesome-Reliable-Self-Evolving-Agents 真实存在且内容扎实(549 篇,腾讯混元背景,按 L0 输出层 / L1 模型层 / L2 脚手架层 / L3 改进器层 / L4 准则层 五级分类),但它的收录截止在 2026 年 7 月底左右——2607 之后只有 12 篇、2608 只有 1 篇。因此本列表以该仓库为起点,另外通过 arXiv 全库检索补齐了 2026 年 6 月中至 9 月的 500 余篇候选,最终 16 篇全部逐一核对了 arXiv v1 日期与作者单位,v1 均在 2026-06-13 之后。

现在的地形

这半年最清晰的分层是:"改外部结构"和"改权重"已经分裂成两类几乎不相干的工作,却共用"自改进"这个词。前者(harness / skill / memory / 程序图)不训练、不要 GPU、几轮见效,Sakana、Google、HKU、Princeton+Prime Intellect 各出一篇(04091208),同期还有几十篇 "XXXHarness"、"XXXSkill"——这已经是彻底的红海,而且四篇的增益都在个位数百分点上见顶。后者(01 Frontis-MA103 SPADE07 Skill Self-Play)才是真正动权重的闭环,它们共同证明了一件事:只要有确定性评分器和足够多的可执行环境,一个 30B 级别的开源模型能被推到接近闭源前沿的水平(MLE-Bench Lite 39.4% → 60.6%,逼近 GPT-5.6 Sol)。所以算法不再是瓶颈,环境供给才是——SPADE 把这一点说得最直白,并同时指出了它的天花板:"invisible leash",自己生成的环境永远不会超过生成者的认知边界。

第二条正在成形的主线是评估器02(Red Queen Gödel Machine)05(Who Grades the Grader)06(RecurSE)15(PaperGym)16(HackProbe)五篇从五个完全不同的方向出发,收敛到同一个结论:只要评估标准是静态的,自改进最终一定退化成对该标准的过拟合;而递归自评本身是有界的,界的位置取决于有没有一个循环碰不到的锚点。05 号给出了最实用的量级——10 条带真值的锚点就能撑起 88%–110% 的 held-out 收益;02 号量化了最刺眼的证据——最强的 baseline 评审器对 AI 生成论文的接受率是人类论文的 1.91 倍

第三条线是冷水10(AI4AI-Bench)直接去测 RSI 的定义本身——agent 能不能改进"造 AI 的过程"——结论是平均 0.166/1.0,263 次改了代码的提交里 141 次根本没碰学习算法11(普林斯顿/斯坦福)给了两篇未发表 NeurIPS 投稿当题目,agent 把工程全做完了却被原作者判为 Reject 和 Strong Reject,$3000 预算只用掉 38%–41%,在 15 轮自评审全部返回"拒"之后从未换过方法。这两篇来自完全不同的证据链,指向同一个诊断:agent 已经有研究的"手",还没有研究的"脑"——具体缺的是质量标准的内化、回溯、和资源感知

红海 vs 无人区

红海:harness/prompt/skill-library 演化(同期几十篇,方法已经不缺,缺的是纪律);通用 self-play 出题(07 号自己的消融显示无结构的 self-play 只有 +0.3);各种垂直领域的 "Self-Evolving XXX Agent"(医疗、驾驶、推荐、遥感——种子库里占了一大半,创新在应用不在机制);agent memory 的第 N 种图结构。

无人区:(1) AI4AI——改进学习算法本身,有现成严格计分尺而几乎无人拿分;(2) 锚点经济学——"最小真值配额"横跨评估器、RL 训练、harness 演化三处被各自重复发明,没人统一(02/05/06/14 是同一母题的四个变体);(3) 持久状态的完整性与审计——08 号记录了 agent 把反作弊漏洞写进持久状态的真实事故,16 号的检测器 FPR 还高达 0.43;(4) 能力组合与路由——12 号无意中证明 harness 演化的收益主要来自"覆盖不同的题"(单点 52/100 vs 组合覆盖 79/100),但"不知道答案时怎么选"完全空白;(5) 开源的经验数据基础设施——Meta 的 Trellis 拿到 10× 加速和 60% 生产吞吐提升,但不开源。

三个最大的开放瓶颈

  1. 锚点从哪来、要多少、能放大多少倍。五篇独立工作撞到同一堵墙:演化能扩大覆盖,但造不出真值(05 号原话 "The anchor cannot be manufactured")。没有人给出"给定任务族,需要多少条真值锚、怎么分配、能放大几倍"的通用答案。这个研究不需要大算力,只需要好的实验设计。
  2. 不可验证域的信号。有确定性评分器的域已经被攻克得差不多了;没有的域里,目前最好的办法是从人类产物反向蒸馏 rubric(15 号),但代价是结构性的——rubric 是有限维的,优化它必然挤压它没覆盖的维度(新颖性 +16.8 / 严谨性 −9.9)。
  3. 长周期的回溯与放弃。所有自改进循环的真实上限:不会回溯的循环只会越来越确信自己的错误。11 号有完整的公开轨迹证据(15 轮负面反馈仍不掉头),10 号有配套证据(推理预算从低到高,触及算法层的比例 8%→64%,说明是短视而非能力不足)。这是一个可单独攻克、机器可测量的子能力,且没人在做。

收录说明与可核实性

两个机构例外(均已在各自条目顶部标注):02 Red Queen Gödel Machine(剑桥大学)——DGM 之后第一个把评估器正式纳入自改进循环并给出分域实验的工作,方向上不可替代;05 Who Grades the Grader(AWS Generative AI Innovation Center)——唯一一篇把"评估指标从哪来"用严格三分割协议和真实 Goodhart 事件做实证的工作。

无法核实的部分:02 号 Red Queen Gödel Machine 的 arXiv 无 HTML 版、ar5iv 转换失败、本机无 PDF 解析工具——其摘要与数字是从 arXiv 摘要页逐字核对的,但 epoch 结构、anchor 替换流程、selective erasure 等机制细节转引自第三方索引站(emergentmind),未能从原文正文直接确认;引用前建议自行打开 PDF 复核。

代码缺口:04、06、09、14、16 五篇论文正文中未给出代码仓库链接(其余 11 篇的代码/项目链接已逐条 HTTP 验证可访问)。

未收录一篇 survey:候选是 arXiv:2607.13104(Self-Improvements in Modern Agentic Systems,97 页,Schmidhuber 参与),但主要单位是 KAUST / 吉林大学,不在白名单内,且已有系统论文覆盖其结论。被剔除的高关注度候选arXiv:2607.01120(AReaL2.0,蚂蚁+HKUST+清华)机构合格但作者自承是 position paper、无任何 benchmark 数字;arXiv:2608.26582(J-Zero,KAIST)、arXiv:2608.07645(Mendel Gödel Machine,电子科大+LMU)、arXiv:2608.25776(EVOMAL,Queen's)、arXiv:2608.15546(ATLAS,RMIT)机构不合格。

索引表

#标题机构日期一句话链接
01Frontis-MA1 / OpenMLE(OpenRSI)清华 + Horizon + Frontis.AI2026-075758 个可执行 ML 任务,把 35B 开源模型推到接近闭源前沿arXiv · 代码
02The Red Queen Gödel Machine ⚠️剑桥大学2026-06让评估器和 agent 一起进化,用分 epoch 保住理论保证arXiv
03SPADEUW / Stanford / CMU / MIT 等2026-08出题人直接生成可执行环境,hint-based regret 卡住能力边界arXiv · 代码
04Recursive Harness Self-ImprovementSakana AI + UC Berkeley2026-07只重写 harness,便宜档模型打赢贵档且成本更低arXiv
05Who Grades the Grader? ⚠️AWS GenAI Innovation Center2026-0710 条真值锚点撑起 88%–110% 的 held-out 收益arXiv · 代码
06RecurSE浙江大学 + 美团 LongCat2026-08judge 自评自训,并诚实给出这种自举的上界arXiv
07Skill Self-Play阿里 Qwen + 港中文 + 人大等2026-07技能库当骨架;无引导 self-play 只有 +0.3arXiv · 代码
08Prime Agent普林斯顿 + Prime Intellect + MIT2026-08四层状态抽象,只让最外层 L3 持久态自我改写arXiv · 代码
09Procedural GraphsGoogle + Georgia Tech + 北大2026-09把做事方法沉淀成有向图,改动必须过 held-out 闸门arXiv
10AI4AI-Bench清华 + Navers Lab / Einsia.AI2026-08直接测"改进学习算法",最强系统平均只有 0.166/1.0arXiv · 主页
11Can AI agents conduct open-ended AI research?普林斯顿 + 斯坦福 + UK AISI 等2026-07两篇真实投稿,agent 工程全做完但被原作者拒稿arXiv · 材料
12HELIX香港大学 HKUDS2026-08harness 演化的收益是"覆盖不同的题"(52 vs 79/100)arXiv · 代码
13Experience Graphs(Trellis)Meta + 马里兰大学2026-06把经验当数据库,生产推理吞吐提升 60%+arXiv
14Scaling AutoResearch via World ModelsUIUC + Amazon2026-0890% rollout 交给世界模型打分,训练快 3.1–3.4×arXiv
15PaperGym浙江大学 ZJU-REAL + Apple2026-08从论文反向蒸馏 rubric;公开记录了自己的 Goodhart 事件arXiv · 代码
16HackProbe北大 + NTU + 京东 + 武大等2026-09黑盒监测"分数涨"与"真能力涨"的背离,限带宽防反噬arXiv

⚠️ = 机构白名单例外,纳入理由见该条目顶部。

01Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering(OpenMLE / OpenRSI)

清华大学 + Horizon Research + Frontis.AI · 2026-07 · arXiv:2607.28568 · 代码 · 权重

一句话

他们把"让 AI 做机器学习工程"这件事整套打通了:自己造了 5758 个可执行的 ML 任务环境,用执行结果训练出一个 35B 的"专门改模型训练代码"的模型,再让这个模型去驱动进化式搜索——这是目前公开工作里少数几个权重、数据、搜索算子三层都在同一个闭环里的 RSI 系统,而且权重和代码真开源了。

机制拆解

闭环分三段,首尾咬合:

  1. OpenMLE-Gym(造环境):从 Kaggle 数据集/比赛里自动构造 5758 个可执行任务,每个任务配一个确定性的 metric.py 评分脚本和 Docker 沙箱。这一步是把"ML 工程"变成可验证域的关键。
  2. OpenMLE-ERL(训算子):把 agent 的动作抽象成四个算子——Draft(写初版)、Improve(改进)、Debug(修错)、Crossover(把两个方案杂交)。每次算子调用产生的代码在沙箱里真跑,拿到执行状态 + 任务分数 + 日志作为结构化反馈,用来做 SFT + RL(按归一化 reward 加权),训出 Frontis-MA1-35B。
  3. OpenMLE-Evo(搜索):训好的模型本身成为进化搜索的"变异引擎",配合 experience card(记录每个节点的来源与表现)做 experience-guided parent selection,跑长周期搜索。

闭环怎么合上:论文的说法是 "verified evolutionary transitions supervise the same transformations that search later composes"——搜索过程中被验证有效的那些"父→子"代码变换,正好就是训练算子的监督信号;算子变强 → 搜索轨迹变好 → 产出更好的训练数据 → 下一轮后训练。改进信号全部来自沙箱真实执行,不依赖 LLM 裁判。

什么被修改:模型权重 θ、agent 的搜索脚手架、以及任务环境本身(环境是自动构造并过滤的)。

证据与评估

真正难在哪

我们的机会

方向启示

这篇证明了 RSI 在可验证域里已经不是概念——有确定性评分器 + 足够多环境 + 中等规模模型,就能把开源模型推到接近前沿闭源的水平。所以"做一个 RSI 系统"本身不再是差异化方向;差异化只能来自两处:(a) 你能造出别人造不出的环境(成本、许可、领域壁垒),(b) 你能在没有确定性评分器的域里造出可信信号。前者是工程战,后者是本文完全没碰的开放问题——也是真正难的那一半。

02The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators

剑桥大学 Machine Learning Systems Lab(Nicholas D. Lane 组)· 2026-06 · arXiv:2606.26294 · 代码:无(论文页未给仓库链接)

⚠️ 例外 #1:剑桥不在指定的机构白名单内。纳入理由:这是 Darwin Gödel Machine 之后第一个把"评估器本身"正式放进自改进循环并给出分域实验的工作,方向上不可替代。

⚠️ 可核实性警告:该 arXiv 无 HTML 版、ar5iv 转换失败、本机无 PDF 解析工具。下面的摘要与数字是从 arXiv 摘要页逐字核对的;但 epoch 结构、anchor 替换流程、selective erasure 等机制细节转引自第三方索引站(emergentmind),未能从原文正文直接确认。引用前请自行打开 PDF 复核。

一句话

以前所有自改进 agent 都假设"评分标准是固定的"——固定 verifier、固定 benchmark、固定标注集。这篇说:进化的本质是环境跟着物种一起变,所以让评估器和 agent 一起进化,并用"分 epoch"的办法保住理论保证:epoch 内评估标准冻结,只在 epoch 边界换评估器。

机制拆解

被修改的是两样东西:任务 agent 的源代码(写代码的、写论文的、写证明的),以及效用函数 / 评估器本身(code reviewer、paper reviewer、proof grader)。

  1. 把搜索切成 epoch。epoch 内评估标准完全冻结,于是这一段里的自改进保证可以从 Gödel machine 那一系(论文说继承自 HGM)直接继承过来——这是全文最关键的工程妥协:不追求"随时可变的效用",而是"分段平稳"。
  2. epoch 内搜索:候选 agent 用 Thompson sampling 在 "clade metaproductivity"(族系产出率)上做探索/利用权衡;打分用 Beta 后验的 ε-分位数做保守估计,只有证据足够强才动。
  3. epoch 边界换评估器:新评估器作为 challenger 训练出来,只有在一个固定的、与评估器无关的 ground-truth anchor 数据集上证明比在位者更准,才允许替换。
  4. 替换后做 selective erasure——只删掉那些依赖旧评估器的效用记录,避免跨标准混用证据,绕开"跨 epoch 分数不可比"这个致命问题。

改进信号从哪来:两层。内层是 epoch 内冻结评估器给出的分数(便宜、稠密);外层是 anchor 上的真值(贵、稀疏),只用来决定"要不要换评估器"。anchor 是整个系统的地基,也是它唯一不能自我生成的东西。

证据与评估

摘要中的数字(逐字核对过):

复现性:arXiv 页面未给代码仓库,HTML 版转换失败,只有 PDF。这是它最大的短板。

真正难在哪

我们的机会

方向启示

它给出了本领域最重要的一句判断:只要评估标准是静态的,自改进最终一定退化成对该标准的过拟合。因此"选一个难的、有根本差异化的方向"如果指向 RSI,那个方向大概率不是"让 agent 更会改自己",而是"让评估器能被可信地改进,并且能证明它改好了"。这篇给了第一个可用的工程框架(分段 + anchor + 选择性遗忘),但把最贵的部分(anchor 从哪来)留在原地。

03SPADE: Self-Play in Adaptive Synthetic Executable Environments

华盛顿大学、斯坦福、CMU、MIT、东北大学、NUS、首尔大学、芝加哥大学等(含 Luke Zettlemoyer、Yejin Choi、Natasha Jaques)· 2026-08 · arXiv:2608.19197 · 代码 · 项目页

一句话

自改进最大的瓶颈不是算法而是"题不够"。SPADE 让同一个模型既当出题人又当解题人:出题人直接生成可执行的 Python 环境(Gym 风格 reset/step),解题人在里面练,两边都用 RL 更新权重——等于把"环境供给"这件事自动化了。

机制拆解

被修改的:可执行环境代码 e、附带的"提示" h(privileged hint)、以及策略权重 θ(出题人和解题人共享参数)。

  1. Environment Designer 生成一个可执行环境 e(带 Gym 接口和内建 reward 函数)以及一条提示 h。
  2. 合法性验证:先查语法、能否执行,不合法直接丢;再加确定性 reset 检查,以及用 LLM 验证"成功条件确实可达"。这是防止出题人生成垃圾/不可解题目的第一道闸。
  3. Reasoning Agent 在 e 上跑两遍——一遍带提示 h,一遍不带。
  4. 核心信号:hint-based regret r_D(e) = 有提示的平均回报 − 无提示的平均回报。这个差值就是出题人的 reward。含义很直白:"给了提示就会做、不给提示就不会做"的题,正好卡在能力边界上,最值得练。再叠一个 difficulty anchor(把胜率拉进目标区间)。
  5. 两个角色都用 GRPO 更新,共享参数。
  6. 环境记忆:把跑过的环境连同 regret 分数存下来,已经掌握的题不再出;每轮从语料库重新采样新素材,防止出题模式坍缩。

改进信号从哪来:解题人这边是环境内建 reward 函数给的任务正确性(机器可验证);出题人这边是 regret(也是从真实 rollout 算出来的)。全程没有人类标注,也没有 LLM 打分当主信号——这是它比大多数 self-play 工作扎实的原因。

闭环怎么合上:解题人变强 → 同一批题的 regret 下降 → 出题人被迫生成更难的环境 → 新的训练数据 → 解题人再变强。语料采样和环境记忆是防坍缩的两个阀门。

证据与评估

真正难在哪

我们的机会

论文自己列的三个限制就是三个切口:

  1. "complexity bounded by the invisible leash":环境复杂度被模型自身能力和生成预算卡死——模型造不出它自己理解不了的题。破这个"看不见的绳索"是本领域的核心难题:能不能引入模型之外的复杂度来源(真实软件仓库、真实 API、真实用户日志)当作环境种子?
  2. "a human-designed optimizer":学习算法(GRPO)是人写死的,系统不改自己的学习规则。谁把"连优化器也进化"做出真实收益,谁就往前推了一格。
  3. "fixed-task evaluation":所有评测都是固定任务集,测不出开放式增长。缺一个能测"开放式能力增长"的评测协议——这本身就是一个值得做的独立方向。

小团队最现实的做法:不重做 30B 训练,而是在一个窄域(例如 shell/终端自动化、数据清洗)上复现 hint-based regret 的出题机制,用小模型验证"regret 出题 vs 难度出题 vs 随机出题"的差距——这个消融原论文没做透。

方向启示

SPADE 说明环境/数据供给才是 RSI 的真实瓶颈,而不是自改进算法。它也划出了这条路的天花板:"invisible leash"——自生成的环境永远不会超过生成者的认知边界。因此有根本差异化的方向不是"再做一个 self-play"(这已是红海),而是"如何把模型之外的世界持续接进环境生成回路":真实代码库、真实生产系统、真实失败日志。谁有独家的真实执行环境,谁就有别人复制不了的东西。

04Recursive Harness Self-Improvement(RHI)

Sakana AI + UC Berkeley(含 Matei Zaharia)· 2026-07 · arXiv:2607.15524 · 代码:论文中未给出仓库链接

一句话

不动模型权重,只让 LLM 反复重写自己的 harness(agent 的角色说明、通信约定、工作流),几轮之后一个"便宜档"模型就能打过同一家的"最贵档"模型——而且 token 用量不涨、缓存开销还降了 33–64%。

机制拆解

被修改的只有 harness:各 agent 的角色/指令、agent 之间的通信契约、workflow 的跳转结构。全是 prompt 级的文本,不碰权重。

  1. 用当前 harness H(i) 解任务,产出交付物。
  2. LLM evaluator 做成对比较:把这一轮的输出和上一轮的输出放一起,返回 y1≻y2 / y1∼y2 / y2≻y1 三选一。判断依据是六个维度:交付完整性、数值严谨性、可复现性、呈现质量、工程质量、任务对齐。
  3. 判断结果进历史 D(i)
  4. LLM harness optimizer 拿着 H(i) + 完整的偏好历史 D(i),写出 H(i+1)。注意:优化器看不到评估标准本身,只看到累积的偏好结果——作者管这叫 momentum-semantic signal,相当于没有梯度的梯度。
  5. 平均改进率低于阈值 ε 就停。

改进信号从哪来:纯粹来自 LLM evaluator 的成对偏好。没有真值、没有测试、没有执行结果。为了防止单一评委的偏见,用了两套不同模型族/不同推理档位的 evaluator 配置,各跑三个随机种子。偏好历史是唯一的跨轮记忆——这是一个非常轻的闭环,也正因为轻所以便宜。

证据与评估

真正难在哪

说实话,这篇的门槛最低——这正是它值得读的原因。它不需要 RL infra、不需要训练、不需要标注,只需要 API 额度和一个想清楚的评估协议。真正不容易的只有两件事:

我们的机会

作者自己承认的弱点非常具体,每一条都是切口:

方向启示

  1. "改 harness"是当前性价比最高的自改进层——不训练、不要 GPU、几轮就见效、还省钱。这也意味着它正在迅速变成红海(见 080912)。
  2. 它同时暴露了这条路的天花板:信号来自 LLM 自己的偏好,就等于用被优化对象当尺子。RHI 的收益真实,但它无法回答"再迭代 20 轮会不会变成对评委口味的过拟合"。想做有根本差异化的东西,不应该去卷第 N 个 harness 优化器,而应该去解决给 harness 演化提供可信、廉价、不被污染的反馈这个上游问题。

05Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

AWS Generative AI Innovation Center(+ HSBC Technology Center China)· 2026-07 · arXiv:2607.12790 · 代码

⚠️ 例外 #2:Amazon/AWS 不在白名单明确枚举的工业实验室里。纳入理由:这是唯一一篇把"评估指标从哪来"这个自改进的根本前提,用严格的三分割协议和真实的 Goodhart 案例做实证的工作。

一句话

所有自改进循环都偷偷假设"已经有一个可靠的评估指标"——现实里往往没有。这篇(Double Ratchet)证明指标本身可以被演化出来,并且给了一个关键的工程答案:只要有 10 条带标准答案的锚点,演化出的指标就能撑起 88%–110% 的 held-out 收益。

机制拆解

两个 ratchet(棘轮)交替推进:指标循环演化"怎么评分",技能循环演化"agent 会什么"。

指标循环(Algorithm 1)五步

  1. Sense:找出当前指标判错的 dev 条目,以及检测算子之间互相矛盾的训练输出。
  2. Grow:把失败聚类,合成新的类型化检测算子(deterministic ops,不是 LLM 打分)。新算子必须过闸:在自己那一簇上至少触发 50%,且在已知正确输出上保持沉默。
  3. Select:让 LLM 提出算子组合,用 S(e) = A_dev(e) · A_train(e)^w − λC(e) 选最优——dev 一致性 × 无标注共识 − 复杂度惩罚。
  4. Curate:leave-one-out 边际非正的算子退休;影子算子转正。
  5. Audit:对着锁死的 test 集汇报,循环永远读不到它。

三分割是全文最关键的设计dev(只有 10 条,"tiny and anchored")有标准答案,只用于选择目标,绝不用于训练合成算子train(大、无标注)暴露算子分歧,用无标注共识做正则;test(锁死)任何循环都不读,只用来报告指标的迁移能力(MBPP+ 用单元测试、Spider 2.0 用执行匹配、报告类用 rubric 分)。

改进信号从哪来:技能循环失败的尝试被聚成 "failure capsule",其错误文本喂给技能合成。哪些算失败由演化出的指标判定。而指标自己从不以任务表现为优化目标,只以"和 10 条锚点一致 + 无标注共识"为目标——这是防止指标为了让分数好看而自我腐化的关键切割。

两个循环怎么交替:固定课程表——早期指标阶段长,后期缩短。实际排布是 15/8/5/2 轮的指标阶段,插在四段 25 轮的技能阶段之间(技能总预算 100 轮)。技能循环的 held-out 评测始终钉在那个锁死的 test 集上,所以指标被污染只会拖慢学习,不会污染测量

证据与评估

真正难在哪

我们的机会

方向启示

这篇把"验证门控一切"变成了可操作的工程结论:自改进系统的安全性不在于循环本身有多聪明,而在于有没有一个循环永远碰不到的测量面。它同时给出了乐观的一面——锚点可以极小(10 条)。所以一个有差异化的方向是:做"最小锚点 + 可演化指标"的通用基础设施,让任何自改进循环都能便宜地拿到一个不会腐化的尺子。这比再做一个 agent 框架有价值得多。

06RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges

浙江大学 + 美团 LongCat 团队 · 2026-08 · arXiv:2608.24231 · 代码:论文中未给出仓库链接

一句话

让一个 judge 模型自己评自己:第一遍按 rubric 打分,第二遍用同步的副本审查自己的打分推理、给出过程奖励,然后用这个自产奖励做 RL——全程不用外部标注。更重要的是,它诚实地给出了这种自举的上界,并提供了一个能在崩溃前停下来的监控器。

机制拆解

被修改的:judge 策略参数 θ。用自产 reward 做 RL 更新,没有外部 gold label 进入训练。

防作弊的关键设计——接口解耦:judge 输出的是逐条 YES/NO,checker 输出的是独立的 5 档标量。两边的输出空间不重叠,切断了"直接抄 token 把奖励刷高"这条捷径。这是全文最值得抄的一个工程细节。

改进信号从哪来:完全来自模型自己(checker 的过程奖励)。人类验证只出现在验证/评测侧,从不进入训练 reward

闭环在哪停下——这是这篇真正的贡献:作者直说 "unanchored recursive learning is inherently bounded"——没有锚点的递归学习天然有界,自产奖励一旦饱和就再也不涨了,而且会开始损害分布外迁移。他们引入 PAV(Pairwise Advantage Validity):一个基于紧凑人工验证 holdout 集的无偏验证监控器,用来识别早停窗口,在 OOD 迁移退化之前把循环停掉。

证据与评估

真正难在哪

我们的机会

  1. "Scope of bounded RSI" 只适用于固定任务的递归,不适用于开放式自主修改——"开放式设定下界在哪"完全没人答。
  2. "Role of human verification in the holdout monitor" 需要前期标注成本——和 0205 撞到同一堵墙:锚点/holdout 的成本。
  3. 没有开源代码。
  4. 最实际的切口:把"有界"这件事量化成一条可预测的规律。RecurSE 给了一个点(+12.9 自身域 / +1.6~3.4 迁移),但没有给"迭代多少轮开始塌、塌的速度和什么相关"的曲线。谁做出"递归自评的衰减律"(类似 scaling law 的形式),谁就给整个领域提供了一个可以直接用来做决策的工具——而且这个实验用 7B~9B 模型就能做。

方向启示

这篇是三篇评估器论文(02/05/06)里立场最清醒的:递归自评有真实收益,但它是有界的,而且界的位置取决于你有没有一个循环碰不到的锚。三篇独立工作从三个方向收敛到同一个结论,这个信号很强。

对"选方向"的含义:"让 judge 自我改进"已经有可信方法了,不是空白。真正的空白在于 (a) 这个界的形状和可预测性,(b) 开放式/非 rubric 场景下怎么办,(c) 锚点成本怎么降。第三条是三篇共同的瓶颈,也就最值得攻。

07Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

阿里巴巴 Qwen 大模型应用团队 + 香港中文大学 + 中国人民大学 + 中山大学 + 北京大学 + ETH Zürich · 2026-07 · arXiv:2607.22529 · 代码

一句话

纯粹的 self-play 出题很容易退化成"出一堆相似的题"。这篇给出题人加了一个会进化的技能库当结构骨架:出题时按技能采样,出完题再根据结果精炼/淘汰/新增技能——结果在弱模型上带来了 +42.9 分的极端提升(把一个连 schema 都写不对的模型救回来了)。

机制拆解

三个角色:Proposer(出题)、Solver(解题)、Controller(管技能库 𝒮)。一轮(共 5 轮):

  1. 从技能库采一个技能,走两条流生成候选题:skill-routed(条件在该技能上)和 exploration(不条件)。
  2. 验证 + 算 reward:环境做三件事——schema 合规检查、技能自带的专用 validator(技能元组里的 ν)、以及 probe consistency(当前 solver 采 K 次 rollout,多数答案必须和参考答案一致)。最后一条是防止出题人生成"看起来有答案其实答案错了"的题。
  3. 按前沿难度排序,构造 50% skill-routed + 50% exploration 的混合课程。
  4. Proposer 用 GRPO 更新;Solver 在课程上更新。
  5. 技能库演化:精炼已有技能;低于 γ_prune 的淘汰;exploration 流里高于 γ_induce 的归纳出新技能

改进信号从哪来:Proposer 的 reward = 合法性二值闸 × 前沿难度 1 − 2|v_solve − 0.5|(solver 胜率越接近 50% 分越高)。这是个动态前沿——solver 变强,同一批题的 reward 自动下降。Solver 的 reward = 环境验证(精确正确性 + 格式合规),机器可验证,不靠 LLM 裁判

闭环怎么合上:生成失败的执行反馈触发技能精炼;合法的前沿题进课程;solver 提升改变难度地形,逼 proposer 出更难的;exploration 流不断归纳新技能扩张前沿。技能库就是那个"跨轮的记忆",也是它和普通 self-play 的唯一区别

证据与评估

真正难在哪

我们的机会

方向启示

Skill Self-Play 证明了一件重要的事:self-play 的收益不来自对抗,而来自"有结构的课程"(unguided SP 只有 +0.3 是铁证)。这意味着"技能库/记忆/经验"这类工作真正的价值不是"让 agent 记住东西",而是给自我生成的数据提供一个不会坍缩的组织结构

方向上:技能库本身已经是超级红海(同期至少二三十篇 "SkillXXX")。有差异化的问题是上游的那个——在没有 validator 的域里,前沿难度怎么估?因为一旦估不了难度,整个课程机制就没了。

08Prime Agent: A Self-Improving RLM Harness

普林斯顿大学 + Prime Intellect + MIT · 2026-08 · arXiv:2608.23552 · 代码

一句话

把 agent 的"状态"按四层分开(权重 L0 / 上下文 token L1 / 常驻 REPL L2 / 磁盘持久态 L3),只让最外层 L3 自我改写——prompts、记忆、skills、子 agent 规格。模型权重完全不动,靠这套状态工程在 ARC-AGI-3 上把 30% 打到 95.5%。

机制拆解

被修改的只有 L3 持久层:prompts、memories、skills、subagent specifications。权重冻结。四层状态是全文的核心抽象:

一轮:模型带着 L0–L3 的上下文被调用 → 选动作(执行代码、调工具、或递归创建子 agent)→ REPL 保留中间值 → Refinement:把轨迹证据转成带版本的 L3 状态更新,运行时在 turn 边界应用每条编辑并记录它的触发原因和预期效果 → Recovery:重启后能从保存的 artifact 重建 session。

改进信号从哪来:模型推理调用、工具输出、验证结果、以及 agent 显式请求的编辑。系统保存 append-only 事件历史 + 选定的 kernel 快照 + 带根的 session 树。评估靠任务自带的 end-condition 测试,加上人类通过 Agents View 界面巡检。

证据与评估

Benchmark基线方法模型
ARC-AGI-3 RHAE Best@130%95.5%Claude 系
OOLONG (Yahoo, 128k)0.420.70GLM-5.2
EmulatorBench0.000.208GLM-5.2
Factorio24/196 科技、71% 高级电路进度Sonnet 5

还在 nanoGPT speedrun 上跨 Kimi K3 / DeepSeek V4 Pro / GLM 5.3 做了对照。

ARC-AGI-3 那条 30%→95.5% 需要谨慎看待——它是 Best@1 在一个特定 harness 评测设置(RHAE)下的数字,不是标准 ARC-AGI 榜单。EmulatorBench 0.00→0.208 更能说明问题:从完全做不了变成能做一点。

代码完整开源,这是它相对同类工作的实质优势。

真正难在哪

我们的机会

方向启示

Prime Agent 说明"自改进"这个词在 2026 年下半年已经严重分层了:它和 01 号(真训权重)几乎不是同一类工作,但都叫 self-improving。对选方向的含义是——

  1. L3/harness 这一层已经被工业界的工程能力占领(Prime Intellect、Meta、Google 都在做),小团队在这里拼不过。
  2. 但它同时创造了一个新的、无人认领的问题:持久状态是会被污染的(漏洞、错误记忆、坏技能都会被写进去并长期存活)。持久态的完整性、审计、回滚这一块,有真实事故、有明确需求、没有成熟方案,而且不需要算力。这是小团队能拿下的位置。

09Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

Google(含 Sercan Ö. Arık)+ Georgia Tech + 北京大学 · 2026-09 · arXiv:2609.09153 · 代码:论文中未给出仓库链接

一句话

不让 agent 在不断变长的历史上自由生成动作,而是把"怎么做事"沉淀成一张有向属性图(程序性知识),然后离线迭代地增删图的节点和边——每次改动必须在 held-out 验证集上不掉分才被接受。在 24 个"模型 × benchmark"组合里 21 个排第一。

机制拆解

被修改的:Procedural Graph 本身(节点、边、属性)。模型和权重都不动。离线四步循环:

  1. Diagnostic Rollout:用当前 solver 在一批训练任务上跑,记录完整轨迹和分数。
  2. Feedback-Driven Mutation:一个 LLM refiner 对比失败轨迹和成功轨迹,提出图的拓扑和属性编辑(加/删节点、加/删边)。
  3. Validation Gating:候选图在 held-out 验证集上测;只有平均任务分不下降才被采纳。不合法候选在评测前就丢掉。
  4. Rejection Memory:把被拒的候选存下来,避免反复提同一个坏主意。

改进信号从哪来:执行反馈——成功/失败轨迹的对比。refiner 看到的是"哪条路走通了、哪条没走通",而不是一个标量分。连续若干轮没有被采纳的更新就停。

为什么这个设计值得注意:三个小设计各自堵一个坑——validation gate 堵"改动看起来好实际变差"(这是 harness 演化最常见的假阳性),rejection memory 堵"反复兜圈子",合法性预筛堵"浪费评测预算"。这三条加起来就是 04 号 RHI 缺的那一半(RHI 只有 LLM 成对偏好,没有 held-out 闸门)。

证据与评估

真正难在哪

我们的机会

方向启示

Procedural Graphs + RHI + HELIX + Prime Agent 四篇放在一起看,结论很清楚:"不改权重、只改外部结构"这条路在 2026 年已经被彻底验证有效,并且已经挤满了人。这是标准的红海。

它对"选难方向"的价值在于反向提示:这一层已经不缺方法,缺的是纪律。Procedural Graphs 的 validation gate 是这堆工作里唯一一个把"防止假阳性改进"做进机制的——而这恰恰指向下一个真问题:当演化预算大到一定程度,在 held-out 上做几百次选择本身就会过拟合 held-out。谁先把这个"演化的多重检验问题"用统计手段解决(而不是再加一个验证集),谁就有了别人绕不开的结果。

10AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

清华大学 + Navers Lab / Einsia.AI · 2026-08 · arXiv:2608.20318 · 代码/主页

一句话

RSI 的定义是"AI 改进造 AI 的过程"。这篇直接去测那件事:给 agent 一个真实的训练算法仓库和 4 小时 GPU,看它能不能把学习算法本身改好。答案是冷水——平均分 0.166(满分 1.0,原算法 = 0.1),263 次改了代码的提交里有 141 次根本没碰学习过程

机制拆解

这是 benchmark 而不是系统,但它的设计本身就是对 RSI 的一次机制拆解:

任务构造:10 个冻结的研究仓库,覆盖十个不同算法族——监督微调、多轮 agentic RL、on-policy 蒸馏、Bradley-Terry 奖励模型、偏好优化、扩散 RL、机器遗忘、离散图扩散、权重平均、one-shot 剪枝。故意选了彼此不相关的族,防止 agent 靠一个通用技巧通吃。

任务协议:agent 得到 4 小时 + 一张 B300 GPU,读代码、改代码,对着一个快速代理指标迭代。改完之后,代码从零重跑最多 12 小时,用固定的、agent 在开发期间接触不到的隐藏评估器打分。分数尺度统一:0.1 = 原算法,1.0 = 任务最优。基线就是"仓库自带的算法,给它和 agent 完全一样的条件"——这个对照设计很干净,排除了"改了什么都比没改好"的错觉。

为什么这套设计重要:绝大多数"自改进"论文测的是 agent 在任务上的表现。AI4AI-Bench 测的是 agent 能否改进产生能力的那个过程。这正是 RSI 定义里的递归那一层,也是几乎没人认真测过的一层。

证据与评估

真正难在哪

我们的机会

方向启示

这是整个列表里最重要的"降温剂",和 11 号互为印证:2026 年的 agent 在"可验证的工程任务"上已经很强(见 010307),但在"改进产生智能的那个过程"上几乎是零。0.166 / 1.0,且一半以上的尝试根本不敢碰学习算法。

对选方向的含义非常直接:"做一个自改进 agent" 是红海,"做一个能改进学习算法的 agent" 是空地。后者难在需要 GPU 和真实训练循环——这正是它还空着的原因,也正是它能构成根本差异化的原因。如果要选一个难的方向,AI4AI 比 harness 演化有高得多的天花板,而且已经有了现成的、严格的计分尺。

11Can AI agents conduct open-ended AI research? Early evidence from two case studies

普林斯顿大学(Arvind Narayanan)+ 斯坦福(Rishi Bommasani)+ UK AI Security Institute + Cornflower Labs + Georgetown CSET + UC Berkeley + 多伦多大学等 · 2026-07 · arXiv:2607.27191 · 材料

一句话

拿两篇未发表的 NeurIPS 2026 投稿当题目,给顶级 agent 6 天、$3000 API 额度、GPU 和整台 Linux 机器,让它从头做同一个研究。结果:两篇都被原作者明确拒稿(2/6 和 1/6 分)。工程全部自己完成了,判断力全线失守

机制拆解

这不是系统论文,是一次设计得很认真的对照实验,它的"机制"就是实验协议本身:

改进信号在哪失效了——这是最有价值的部分:agent 有自评审工具,在两篇上总共 15 轮修订里,自评审一直返回"拒",但 agent 从未真正换过方法。有反馈、有负面信号、就是不掉头。预算用不完:Personas 只用了 $3000 的 38%,TabPFN 41%。过早收敛:Personas 规划了 42 小时探索,5 小时后就锁定了方法;TabPFN 提前 40 小时就认定了主结论。

证据与评估

真正难在哪

我们的机会

方向启示

10 号 AI4AI-Bench 完全一致的信号,但来自另一条完全不同的证据链:agent 已经能做研究的"手",还做不了研究的"脑"。具体地,缺的不是知识、不是算力、不是工具,而是 (a) 质量标准的内化,(b) 回溯,(c) 资源感知

  1. "AI 自动做研究"作为一个整体目标现在还不成立——任何声称要做 AI Scientist 的方向要先回答这五条。
  2. 但这五条里,回溯与资源分配是可以被单独攻克的、机器可测量的能力(不像"创造力"那么虚)。做"让长周期 agent 学会放弃和重来",有明确的失败证据、现成的评测材料,且直接决定所有 RSI 循环的上限——因为不会回溯的自改进循环只会越来越确信自己的错误

12HELIX: Model-Harness Co-evolution for Recursive Self-Improvement

香港大学(HKUDS,Chao Huang 组)· 2026-08 · arXiv:2608.13951 · 代码

一句话

提出一个关键论点:harness 不是中性的包装,它同时决定"今天怎么执行"和"明天能拿到什么训练数据"——所以模型和 harness 应该 build→update→rebuild 地交替演化。但这篇自己没跑完这个循环,它只做到了"把训练数据物化出来"。

机制拆解

核心论点harness 塑造轨迹 (φ_t → τ_t)被验证的轨迹塑造下一个模型 (τ_t → θ_{t+1})更新后的能力画像决定新的 harness (θ_{t+1} → φ_{t+1})。三条有向依赖构成递归。

harness 被拆成八个维度:shell、session/hooks、config、prompt、tools、turn loop、acceptance、policy。组合成 typed ports / atoms / recipes / product shells,枚举出 4⁵=1024 个耦合配方(acceptance 独立选时是 4⁶=4096)。这个分解是全文最有复用价值的产出——它把"改 harness"从玄学变成了可枚举的组合空间。

三阶段Build(对固定模型,构造并评测多个可溯源的 harness 候选)→ Update(把 verified sibling trajectories——同一任务不同 harness 产生的兄弟轨迹——转成学习记录,微调模型)→ Rebuild(为更新后的模型重新演化 harness,因为新的能力画像可能偏好不同的运行时设计)。

谁来评估:一个 verifier V 观察 任务 / 轨迹 / 工作区 diff / 测试证据 / 策略证据,产出结果标签,区分 resolved、target-miss、regression、no-action、policy violation、patch-noise 六类。用 trace-strict 标准(必须观察到规范化的 bash 执行并有通过输出),交叉验证时用 SWE-bench Verified 官方评测器。六类标签比"过/不过"信息量大得多——这是它给学习信号加的最有用的一层结构

改进信号从哪来:同一批 rollout 一鱼两吃——执行信号用来选今天最好的固定 harness,学习信号(成功、回归、险些成功、替代解法)结构化成 SFT / critic / filter / preference 四类记录。作者原话:"The same harness interventions that change execution today structure the learning signal available tomorrow."

证据与评估

⚠️ 循环没闭合:作者明说 "This paper materializes model-update data but does not train an updated model"——只评测了单轮,多轮改进没有实验验证

真正难在哪

我们的机会

方向启示

HELIX 最有价值的不是它做成了什么,而是它无意中证明了一件事:harness 演化的收益主要是"覆盖不同的题",而不是"把同样的题做得更好"(52/100 vs 组合覆盖 79/100)。这把整个 harness 演化方向的叙事改了:如果收益来自多样性而非单点质量,那么

  1. 最优策略不是"演化出一个最好的 harness",而是"维护一个互补的 harness 组合 + 一个好的路由器"——这是完全不同的技术路线,目前没人在做。
  2. 这也解释了为什么 04/09 号那些"演化出单个更好 harness"的工作增益会见顶。

对选方向:"agent 能力的组合与路由"比"agent 的自我改进"更可能是下一个真问题,而且它和 quality-diversity(质量-多样性搜索)那一支天然接得上。

13Experience Graphs: The Data Foundation for Self-Improving Agents(Trellis)

Meta Platforms(含 Rob Fergus、Anirudh Goyal、Carole-Jean Wu)+ 马里兰大学(Daniel J. Abadi)· 2026-06 · arXiv:2606.29823 · 代码:无(Trellis 未开源;论文提到的 Axiom 优化器在 facebookincubator/axiom

一句话

所有自改进 agent 都在产生海量"经验"(轨迹、奖励、兄弟方案对比、因果血缘),但大家都把它当日志扔掉。Meta 说这是个数据库问题,做了 Trellis——把经验图当成持久、可查询的数据库状态,然后在生产的 kernel 优化任务上拿到了 10× 加速60%+ 的推理吞吐提升

机制拆解

这不是算法,是基础设施——这正是它在这份列表里的独特价值。

经验图里存什么:可执行 artifact、工具输出、客观奖励、兄弟节点对比可变的搜索统计量(访问计数、累计回报)、因果血缘。后三样是关键——普通的 trace 日志没有"兄弟对比"和"可变统计量",而这正是搜索算法需要的。

改进循环里什么被修改搜索统计量(visit counts 和 cumulative rewards 通过 backpropagation 更新,就是 MCTS 那一套,但持久化到数据库里);Skills 和 memory(分布式文件系统上的带版本 artifact);模型权重(通过物化的训练视图——SFT 轨迹、DPO 对、GRPO 分组)。"训练数据"在这里是一个数据库视图,不是一个手工导出的文件——这是整篇最聪明的抽象。

谁来评估:内层 agent session(Claude Code / Codex 这类)在隔离沙箱里生成并执行候选 artifact,客观指标自动算出来——正确性、延迟、吞吐。

三级飞轮怎么闭合:生产环境的探索填充 memory → memory 改进检索和前沿节点选择 → 产生的轨迹通过 SFT/DPO/GRPO 训练下一代模型 → 更强的模型产生更好的尝试,复利。

证据与评估

KernelEvolve 的生产部署数据(最硬的部分,因为是真实生产系统):

Trellis 本身未开源——这是它最大的实际限制。论文的价值在于设计论证和生产数据,不在于可复现的代码。

真正难在哪

这是整份列表里护城河最深的一篇,而且深得毫无技巧可言

我们的机会

方向启示

这篇的启示和其他所有论文都不同:RSI 的下一个瓶颈可能在数据基础设施,而不在算法。理由:010307 都证明了"有可验证信号 + 足够多尝试 = 能力提升"。那么一旦尝试的数量级从千级涨到亿级,问题就自动变成"怎么存、怎么查、怎么把它变成训练视图"——这正是数据库问题。

对选方向:经验数据基础设施是一个被严重低估的位置——它不性感、不发 ICML、但所有人都需要,而且目前唯一的实现锁在 Meta 内部。同时要清醒:它的价值只有在有真实、持续、大规模的 agent 流量时才兑现。没有流量就没有飞轮。这决定了它适合"已经有产品在跑"的团队,不适合纯研究团队。

14Scaling Automatic Research Agents via World Models(WMRL)

伊利诺伊大学厄巴纳-香槟分校(UIUC)+ Amazon · 2026-08 · arXiv:2608.12564 · 代码:论文中未给出仓库链接

一句话

训练 AutoResearch agent 最贵的不是 GPU 而是执行 reward——每个 rollout 都要真跑一遍 ML 实验。这篇用一个 world model(同一个 backbone)去预测执行结果代替真跑,只留 ~10% 的样本真执行当"锚",做在线去偏和方差融合,训练快 3.1–3.4×,分数还更高

机制拆解

world model 是什么:就是"一个通用语言模型去模拟环境(可能有误差)",和 agent 用同一个 backbone,从任务上下文和方案预测执行结果分数。三个部件:

  1. 锚组(anchor groups):每轮里约 10% 的 rollout 组送进真实环境执行,拿到真分数。剩下 90% 由 world model 打分。
  2. 在线去偏(Online Debiasing):在不断累积的"(world model 分, 真分)"配对上,用等张回归(isotonic regression)拟合一个单调重校准函数 f̂,持续刷新。只假设偏差是单调畸变(论文的 Assumption 6),不假设无偏。
  3. 逆方差去噪(Inverse-Variance Denoising):把锚组的梯度流和 world-model 梯度流按各自方差的倒数加权融合——方差大的那一路权重自动降下来。

改进信号从哪来根源仍然是真实环境执行,只是被稀释到 10% 并通过校准放大到其余 90%。这是它和"用 LLM 打分代替执行"的本质区别——锚永远在,只是变少了

证据与评估

真正难在哪

我们的机会

方向启示

这篇代表了 RSI 领域一个正在成形但还没被命名的方向:"便宜的 reward 代理 + 少量真锚"。它和 05(10 条锚点撑起演化指标)06(PAV holdout 监控)02(ground-truth anchor 决定评估器换代)是同一个母题的四个变体:自改进循环的关键资源不是算力,而是"真信号的最小配额",以及怎么把这点配额放大

四篇独立工作从四个方向收敛到同一个抽象,这个信号非常强。对选方向的含义:"最小真值配额的理论与工程"本身就是一个值得押的方向——它横跨评估器、RL 训练、harness 演化三个子领域,目前每个子领域都在各自重复发明,没有人把它统一起来。谁做出"给定任务族,需要多少真值锚、怎么分配、能放大多少倍"的通用答案,谁就给整个领域提供了一个所有人都要用的工具。而这个研究不需要大算力,只需要好的实验设计——对小团队极其友好。

15PaperGym: Rubric-Centered Evolution for Research-Plan Generation

浙江大学(ZJU-REAL)+ Apple · 2026-08 · arXiv:2608.31119 · 代码 · 项目页

一句话

"写研究方案"没有标准答案,所以用不了 RLVR。这篇的做法是从论文本身拆出 rubric:用论文的"目标+背景"当问题,用"方法+实验设计"当答案来源,生成十条二值判据——一个 8B 模型训完在 ResearchQA 上拿到 73.48,超过大得多的 Kimi K2.6(73.19)。

机制拆解

数据怎么造(全文最关键的设计):把论文拆成四段——Research Goal、Background、Research Method、Experimental Design。问题只从"目标/背景"生成,判据只从"方法/实验设计"生成。两者来自论文的不相交段落,所以判据不可能从问题里直接推出来。这个 "disjoint sections" 约束是防止判据泄漏的机制性保证,不是靠后处理过滤。

rubric 长什么样:十条原子二值判据,同时考察方法创新性和实验设计。分两类——specialized(实例特定,问题条件 + 答案锚定)和 general(通用,考察完整性、具体性、合理性)。

训练两阶段:1) Rubric-Conditioned OPSD(on-policy self-distillation):一个被 rubric 条件化的 teacher 指导 student,用 KL 散度做 token 级监督,作用是"把输出分布拓宽";2) GRPO with Rubric-as-Rewards冻结的基座模型对着二值判据自评分(1.7B 训练时用 4B 模型评),判定聚合成标量 reward 做 RL,作用是"把分布收窄到高 reward 区"。作者称之为 widen-then-narrow 的熵课程——这个两阶段顺序本身是有信息量的结论。

改进信号从哪来:十条二值判据的自评。评分者是冻结的基座模型,不参与训练——这一点很重要,它避免了"评分者和被评者一起漂移"。

rubric 质量怎么验证:用 LLM judge 问"这条判据能不能只看问题就推出来"做判据泄漏检测。PaperGym 泄漏率 3.7–5.0%,对照现有数据集是 11.9–34.1%。另外用五次重跑的自一致性和跨模型一致性测评分器可靠性。

证据与评估

Qwen3-8B(OPSD+GRPO vs 未训练):

Benchmark基线方法增益
RubricHub Science46.0749.41+3.34
ResearchPlan-GenML20.2823.53+3.25
ResearchQA66.6573.48+6.83
PaperGym-Innov18.6924.47+5.78
PaperGym-Design17.0321.88+4.85
五项均值33.7438.55+4.81
最诚实也最有价值的一条(在附录 C.1):GRPO 的增益集中在"新颖洞见"(+16.8)和"目标对齐"(+5.1),但在"科学严谨性"上掉了 9.9、"执行质量"掉 5.6、"预期影响"掉 1.9。作者自己把原因归为 reward hacking——模型写更长的回答去匹配更多判据项,复杂度上去了,其他维度的分掉下来。这是一个在自己论文里公开记录的 Goodhart 事件。

真正难在哪

我们的机会

方向启示

PaperGym 回答了一个重要问题:不可验证域并非无法做 RL——可以从"已有的人类产物"里反向蒸馏出判据。论文、代码 review、法律意见书、设计文档,都可以用同样的"不相交段落"技巧生成不泄漏的 rubric。这是一个可以大规模复用的配方。

但它也暴露了这条路的代价:rubric 是有限维的,优化它一定会挤压 rubric 没覆盖的维度(+16.8 / −9.9)。这不是实现 bug,是 rubric 作为奖励的结构性后果。

对选方向:"从人类产物反向导出奖励"是一条被验证可行、成本可控、尚未拥挤的路。而它的核心难题——怎么让 rubric 的覆盖面跟上策略的优化速度——正好和 02 号 RQGM05 号是同一个问题的三种解法。这三篇的交集,就是本领域目前最值得押的那个位置。

16Harness-agnostic detection and immunization of reward hacking in self-evolving language models(HackProbe)

北京大学 + 南洋理工大学(NTU)+ Fullive-AI + 京东供应链技术团队 + 武汉大学 · 2026-09 · arXiv:2609.04665 · 代码:论文中未给出仓库链接

一句话

自演化系统跑久了,可见分数会和真实能力脱钩(reward hacking)。这篇不做"更好的评估器",而是做一个黑盒监测器:拿一批秘密的、分布固定的探针题,实时算"分数涨幅"和"真能力涨幅"的背离,并且用限制反馈带宽的办法防止监测器自己变成第二个被 hack 的目标。

机制拆解

监测什么:只看两个黑盒接口——可见分数,以及模型在保密探针上的输出。不需要知道 harness 长什么样(所以叫 harness-agnostic)。

核心统计量D_t = ΔM_t − λΔĈ_t,其中 ΔM_t 是可见评估器分数的变化,ΔĈ_t 是从秘密、分布固定的比较核(comparison core)估出的真实能力变化(对测试集漂移免疫)。两者背离就是 hacking 的信号。四个互补统计量融合成一个校准风险分:水平差、带变点检测的背离、停滞、条件置信度,用 Šidák 校正做多重检验控制。

"免疫"是什么意思——这是全文最有意思的设计:不只是报警,而是用秘密核 + "gaming footprint"(作弊足迹的结构度量)重新从候选池里选。关键在于:反馈被限制在每代 log₂Π 比特。原因很直白——如果监测器给出的反馈太详细,那个反馈本身就变成了新的优化目标,系统会转而去 hack 监测器。限带宽是防止监测器被反噬的机制性保证,不是启发式

谁来评估:比较核 Ĉ(θ) 估真实能力;另有一个 held-out 黄金审计集 A_eval,在整个演化结束后只用一次。数学题用严格的最终答案判分——行为膨胀在这里是真会丢分的。

证据与评估

要诚实看待这些数字:AUROC 0.763 和 FPR 0.434 都不算好。作者自己说 "A false-positive rate of 0.434 interrupts more than four honest generations in ten"——十次诚实的迭代会被打断四次以上,这离能用还很远

真正难在哪

我们的机会

作者列的限制异常坦率,几乎每条都是可做的题:

方向启示

这篇和 02050614 一起构成本领域的第二条主线:当自改进跑得足够久,问题不再是"能不能改进",而是"我们怎么知道它真的改进了"

它独有的贡献是那个限带宽原则:监督信号一旦足够详细就会成为新的被优化目标。这个洞察超出了 reward hacking 本身——它适用于任何"用 A 监督 B、而 B 在优化"的设置,包括所有 LLM-as-judge 的场景。

对选方向的含义:"自改进的可观测性"(observability)是一个正在成形、还很粗糙、但注定必须存在的方向。现在的最好结果只有 AUROC 0.76 / FPR 0.43,说明这里离成熟非常远。它的优点是不需要大算力,只需要好的统计设计和一套探针工程;缺点是它是"守门员"角色,不容易讲出增长故事。适合作为主方向的配套能力,或者作为一个卖给别人的基础设施——因为每一个跑自改进循环的团队都会撞上这个问题,而没有人愿意自己造这个工具