RSI 阅读指南

技术报告笔记:八家实验室如何闭合自改进循环

窗口 2026-03-13 至 2026-09-13。DeepSeek / Moonshot / 阿里 Qwen / 字节 Seed / Anthropic / Google DeepMind。八篇均已核实发表日期与链接可访问。

快照日期 2026-09-13 · 8 篇 · 每篇七段:一句话 / 机制拆解 / 证据与评估 / 工程护城河 / 真正难在哪 / 我们的机会 / 方向启示

索引表

#报告机构日期闭环的关键动作开放度链接
01Kimi K3Moonshot AI2026-07九专家 RL → 多教师在线蒸馏(MOPD)权重开放(自有协议)arXiv · 权重
02Automated Alignment ResearchersAnthropic2026-08AI 提出并验证训练方法本身harness + benchmark 全开源arXiv · 代码
03Qwen-UI-Agent阿里 Qwen / MAI-UI2026-07失败分析驱动的任务/环境合成飞轮闭源arXiv
04DeepSeek-V4DeepSeek-AI2026-04领域专家 RL → 反向 KL 在线蒸馏合并权重 MITarXiv · 权重
05Qwen-AgentWorld阿里 Qwen2026-06用世界模型生成环境供 RL 采样权重 Apache-2.0arXiv · 代码
06Experience DistillationByteDance Seed + Monash2026-07上下文经验 → 权重(自蒸馏)无代码arXiv
07EdgeBenchByteDance Seed2026-07测量环境学习的 log-sigmoid 规律51/134 任务 + harness 开源arXiv · 代码
08AlphaProof NexusGoogle DeepMind2026-05硬验证器 + 软评分器的演化搜索仅结果开源arXiv · 结果

综述:十六条判断

  1. 这一轮最显著的共识是后训练被拆成了两段DeepSeek-V4Kimi K3 互不相干却收敛到同一个答案——先按领域分头做小规模 RL 养出多个专家,再用"学生自采样 + 逐 token 反向 KL"的在线蒸馏把它们压回一个统一模型,RL 负责产生能力,蒸馏负责整合能力
  2. Moonshot 的做法最彻底:把"思考预算"也当成一个维度,三个领域 × 三档预算交叉出九个专家,再用 MOPD 同时蒸回一个 2.8T 模型,于是"想多久"从训练超参变成了推理时的开关。
  3. DeepSeek 的版本更朴素(四个领域、SFT+GRPO、反向 KL 合并),但它把权重按 MIT 协议全放出来了,是唯一一家让外部团队能直接拿到合并前后模型做实验的。
  4. 阿里走的是数据侧的路线:Qwen-UI-Agent 让 agent 自己做失败分析、把失败映射成结构化原因、再照着缺口合成任务与环境,配 100+ 台真机和上万并发 rollout,把"题目从哪来"这个问题交给了机器自己。
  5. 阿里的另一半答案是 Qwen-AgentWorld——不去部署环境而是生成环境,一个语言世界模型同时模拟终端、浏览器、安卓等七个域,把 agentic RL 的环境成本从"部署几千个容器"降成"一次前向推理",而且权重 Apache-2.0 开放。
  6. 值得注意的是阿里内部这两篇没有接起来:真机农场造轨迹、世界模型造环境,中间那条"用生成环境跑诊断驱动飞轮"的通路是空着的,这是外部团队现成的空隙
  7. 字节 Seed 这一轮没有押在训练管线上,而是押在度量和桥接上:EdgeBench 用 3.8 万小时交互证明 agent 的环境学习服从 log-sigmoid 规律(R²=0.998),且只用前 6.5 小时就能外推后 12 小时,第一次把"自改进的速率"变成可预测的工程量。
  8. Seed 的另一篇(经验蒸馏)解决了一个被长期忽略的断层:agent 试错攒下的经验直接 SFT 只保住 3.8% 的收益,而让"无经验的学生"去拟合"有经验的教师"的单步决策能保住 64.8%,环境样本比 PPO/GRPO 少 9.6~57 倍——这是"记忆系统"通向"能力成长"目前唯一便宜的桥。
  9. 有趣的是这两篇同出字节却也没接起来:EdgeBench 全程不更新权重,经验蒸馏恰好就是更新权重的方法,"把经验蒸馏接进 EdgeBench 看 S_max 会不会被抬高"是一个用开源任务就能做、字节自己没做的实验
  10. Anthropic 是唯一一家把循环推到元层的:AAR 让 Claude 自己读文献、提训练方法、训模型、看分数、再迭代,一轮只要单卡 H200 跑 30 分钟,在十类对齐失效上全部超过 28 位人类研究员的最好点子,用约 2,400 条样本就接近了生产级 Opus 4.8 的安全分。
  11. Anthropic 的方法论贡献比结果更重要:禁止从更强模型蒸馏(涨分必须来自方法本身)、mini-paper 在看到结果前冻结、几何平均逼你每个 benchmark 都涨、code monitor 事前审批——这套"不可作弊的实验协议"才是真正稀缺的东西。
  12. Google DeepMind 走的是另一个极端:AlphaProof Nexus 完全不训练,纯推理时的演化搜索,靠 Lean 编译器这个不可能被骗的硬验证器 + Gemini Flash 给半成品草稿打 Elo 的软评分器,解出了 9 个开放的 Erdős 问题和 44 个 OEIS 猜想。
  13. 那篇里最有信息量的数字是 "AlphaProof 单独 = 0/9"——一个经过大规模 RL 训练的专用证明器单独完全解不出,塞进通用 LLM 的演化编排里就能解出九道,说明价值在编排而不在那个被训练过的组件
  14. 八篇从四个完全不同的方向收敛到同一个瓶颈:Kimi 的整条链最终吊在 GRM 的 rubric 上而 rubric 是现场生成、无一致性保证;Anthropic 的天花板明确卡在冻结 benchmark 的完备性上(标题里就写着 "well-characterized");AgentWorld 的模拟保真度没有任何长程误差分析;而 DeepMind 之所以能产出真知识,恰恰因为它有 Lean——闭环的质量等于验证器的质量
  15. 对小团队最可学的 playbook 排序很清楚:Anthropic 第一(harness、10 套 benchmark、通用模板全开源,一张卡就能端到端跑完整个递归循环,是唯一能完整复现的),字节 Seed 第二(经验蒸馏方法极轻、无需任何 RL 基础设施、一周内可验证核心对照;EdgeBench 提供了现成的高质量长程考场和 S_max/t_mid/β 这套共同语言),阿里第三(真机农场抄不走,但 AgentWorld 权重可直接下载用,飞轮的认知部分——诊断驱动合成、步级判分、环境失败单列——全是零硬件门槛的 prompt 与流程设计),DeepSeek/Moonshot 最后(在线蒸馏这个原语值得复现,但九专家、可恢复 microVM 沙箱、partial rollout 调度都是资本与系统工程的门槛)。
  16. 因此若要选一个难的、有根本差异化、门槛在思想不在算力的方向:做"更难被骗的评判者"——把可靠验证从数学扩展到更广领域,让"发现新的失效模式"本身也进入闭环,而不是靠人先写好 benchmark;这是上面每一家的天花板所在,也是唯一一个无论谁做成了、所有人都得依赖它的位置。

01Kimi K3: Open Frontier Intelligence

Moonshot AI(Kimi Team)· 2026-07 · arXiv:2607.24653 · 权重(Kimi K3 License,开放权重)

一句话

把"训练九个专家 → 再蒸回一个模型"做成了工业流水线:K3 先按"三个领域 × 三档思考预算"分别用强化学习练出九个专家模型,再用多教师在线蒸馏(MOPD)把它们压回一个 2.8T 参数的统一模型;配套的百万 token 级 agentic RL 基础设施(可恢复沙箱 + 部分 rollout)是目前公开资料里最完整的一套"闭环生产线"。

机制拆解

什么被修改——模型权重。但不是一次性改一个模型,而是分头改九个。三个领域是:通用任务(视觉、推理、知识、检索)、通用 agent(长程助理、深度研究、写作)、代码 agent(软件工程、算子内核、网页开发)。每个领域再配 low / high / max 三档"思考预算",3×3 = 九个专家。

谁来评估——分两类:

改进信号从哪来——除了任务奖励,还有两个"防作弊"的负向信号,这是最值得抄的部分:

循环怎么闭合——MOPD(Multi-Teacher On-Policy Distillation)。统一模型 π_θ 在自己采样的轨迹上跑,逐 token 拿教师和自己的对数概率比当稠密奖励:

r = clip(sg(log π_teacher^(d,e)(y_t|x,y_<t) / π_θ(y_t|e,x,y_<t)), −R_max, R_max)

按领域 d 和预算档 e 选对应的教师。九个专家的能力就这样同时压进一个模型,而且"思考预算"变成了可控开关而不是训练时的固定超参。

任务从哪来也是闭环的一部分:一张自演化的分层知识图谱,agent 通过网页探索不断递归扩展(DAG,从种子节点长出去)。合成任务时按不同粒度采样节点(单个或组合),把节点关键词 + 祖先上下文拼成 web query,检索回来的材料交给合成 agent 产出各类训练任务。任务供给本身不靠人

证据与评估

工程护城河

真正难在哪

  1. 九倍 RL 算力。这不是"想清楚就能做"的事,是纯粹的资本门槛。
  2. 可恢复沙箱的工程量。冻结/恢复一个跑到一半的 Docker + 数据库 + 浏览器状态,且要在成千上万条并发轨迹上稳定工作——这是分布式系统的活儿,不是 ML 的活儿。
  3. 知识图谱驱动的任务合成质量无从复现。论文给了机制,没给图谱、没给种子节点、没给过滤规则。
  4. 论文对 cluster 规模、预训练总 token 数一概不提,成本无法反推。

我们的机会

方向启示

K3 说明"闭环"已经不是算法问题而是系统问题:算法(GRPO 类 + 蒸馏)人人都有,差距在沙箱能不能暂停恢复、rollout 能不能不被长尾拖死、任务能不能自动长出来。小团队不该去比模型规模,应该去比闭环的某一节做到极致——尤其是"可恢复的长程环境"这一层,它是所有人的瓶颈,且是纯软件工程,不需要万卡。

如果要选一个有根本差异化的方向:不要复制 K3 的九专家,去做它没做的"评估器自身的可靠性"。K3 的整条链路最终吊在 GRM 的判断上,而它的 rubric 生成没有任何稳定性保证。谁能让"自动评估器"变得可审计、可复现、可证伪,谁就握住了所有 RSI 系统的地基。

02Automated Researchers Can Mitigate Well-characterized Alignment Failures

Anthropic(+ UC Berkeley)· 2026-08 · arXiv:2608.28945 · 代码(harness + 10 套 benchmark,CC BY 4.0)

一句话

让 Claude 自己当"对齐研究员":读文献 → 提方法 → 训模型 → 看分数 → 再迭代,在十类对齐失效上全部跑赢了 28 位人类研究员的最好点子,而且每轮训练只要一张 H200 跑 30 分钟。这是目前最干净、最便宜、最可复现的一个真实递归自改进闭环。

机制拆解

这篇是本批报告里唯一一个"AI 改进 AI 的训练方法"而不是"AI 改进自己的答案"的,值得逐环拆:

什么被修改——不是模型权重,是训练方法本身。AAR(Automated Alignment Researcher)产出的是一段训练代码 + 一批合成训练数据,用它去 post-train 一个目标模型。改的是"怎么训"这一层。

谁来评估——一个独立的 evaluator,在冻结的 benchmark 套件上跑训练后的权重,算各安全 benchmark"缺口闭合比例"的几何平均。用几何平均是关键设计:算术平均可以靠刷爆一个指标拉高,几何平均逼你每个都得涨。

改进信号从哪来——就是这个几何平均分。外加一道硬约束:方法不允许从 AAR 自己或更强的模型蒸馏行为,所以涨分必须来自方法本身,而不是"把答案抄给学生"。这一条把"自改进"和"用更强老师作弊"切开了,是整篇论文最重要的方法论贡献。

循环怎么闭合——五个 AAR 并行跑,共享一个论坛(finding forum)和一个排行榜。每轮:1) 读文献综述 + 论坛里前人的结果;2) 提出方法,写成一篇 mini-paper;3) 等 code monitor 审批(防作弊闸门);4) 单卡 H200 训 ~30 分钟;5) 拿到分数;6) 把结论发回论坛;7) 开一个全新 session 重来(每轮上下文清零,靠论坛做长期记忆)。单次 run 最长 48 小时 wall-clock。平均 6.4 小时的 hill-climbing 就超过人类最好方案。

防作弊是设计的一部分,不是事后补丁:mini-paper 必须在看到结果之前冻结(防止事后编故事);code monitor 训练前审方法(防止用被禁的技术);操作系统级隔离 held-out 数据;能力检查(方法若拉低 MMLU / GSM8K / IFEval 直接否决);事后用 Claude Opus 4.8 的层级式 scaffold 做轨迹审计。

证据与评估

工程护城河

说实话——几乎没有。这正是它最值得读的地方。

真正难在哪

  1. benchmark 的质量就是天花板。整个闭环的信号来自一套冻结的评测;评测不覆盖的失效模式,AAR 永远发现不了,甚至可能被优化掉。论文自己承认作用域是 "well-characterized"(已被刻画的)失效——标题里就写着
  2. "禁止从更强模型蒸馏"这条规则的执行靠 code monitor 判断,不是形式化保证。规则一松,结论就退化成"用更强模型洗数据"。
  3. 上下文清零 + 论坛做记忆的设计很聪明,但论坛内容的增长/污染没有长期实验(最长 48 小时)。
  4. 每轮 30 分钟的训练意味着方法必须是"轻量 post-training"级别的,重方法(改架构、改预训练)进不了这个循环。

我们的机会

这是八篇里唯一一篇小团队可以端到端完整复现的

方向启示

它证明了一件事:递归自改进的瓶颈不是模型能力,是评估的完备性。AAR 用极少的算力和极小的数据就超过了人类专家,因为搜索空间被一个好评测收窄了;而它的天花板也正好卡在那个评测上。

对选方向的启示很直接:不要去做"更聪明的 agent",去做"能自动扩张的评测/验证层"。谁能把"发现新的失效模式"也变成闭环的一部分(而不是靠人先写好 benchmark),谁就把这套机器从"已知问题的自动求解器"升级成真正的自改进系统。这是一个根本性差异化、门槛在思想不在算力的方向。

03Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

阿里巴巴 MAI-UI Team / Alibaba Token Hub · 2026-07 · arXiv:2607.28227 · 代码/权重:无(仅项目页 tongyi-mai.github.io/Qwen-UI-Agent,环境与权重未开放)

一句话

把"失败分析 → 造任务 → 造环境 → 收轨迹 → 再训"这条数据飞轮完全交给 agent 自己跑,配上 100+ 台真机、150+ App、一万条并发 rollout,训出一个在真机上 92.2% 成功率的 GUI agent。这是本批里数据飞轮写得最具体的一篇。

机制拆解

什么被修改——模型权重(SFT 语料 + 在线 RL)。但真正在迭代的是训练语料本身

阶段一 · 能力冷启动:用强基座模型分析 mobile / desktop / web 三端的领域需求,agent 生成初始任务池和对应环境上下文,跑多轮 rejection sampling,把被接受的轨迹汇成统一 SFT 语料。

阶段二 · 迭代精炼(这才是飞轮):1) Agent 驱动的失败分析——把模型当前的失败映射到结构化的原因类别:缺少应用知识、违反约束、状态跟踪错误……;2) 按能力缺口合成任务与环境——不是随机造题,是照着上一步诊断出的短板造;3) 收轨迹 → 判分 → 接受的轨迹进语料 → 重训 → 回到第 1 步。

四根支柱让飞轮转得动

谁来评估 / 改进信号从哪来——在线 RL 阶段用 GRPO 变体:验证器给二值结果奖励 r_i = v_x(s_final(i)) ∈ {0,1},组内归一化成优势 (r_i − r̄_x)/Std(...) + ε。注意奖励是看最终环境状态,不看 agent 自己说完成没完成。

另外有一层 VLM judge 专门做三分类:任务成功 / 模型失败 / 环境失败。把环境故障从模型失败里摘出去——真机环境下这一步不做,奖励信号就是噪声。

课程机制:活跃任务池优先放成功率处于中间区间的任务(太简单太难都没梯度),难任务扔进监控池并削减预算,等模型变强再捞回来。

证据与评估

Benchmark分数备注
MobileWorld-Real(真机)92.2%超 Gemini 3.1 Pro +6.0pp、Opus 4.8 +7.5pp、GPT-5.6 Sol +6.8pp
AndroidDaily(真机高频任务)97.5%
MobileWorld(沙箱)82.1%超 Opus 4.8 +14.6pp
OSWorld-Verified79.5%第二名
OSWorld-v2(部分进度)40.0%每任务步数比基线少 58.4% / 21.7%
WebArena73.6%超 Opus 4.8 +1.7pp
ScreenSpot-Pro81.5%GUI grounding(zoom-in 设定)

另外在 13 个通用 benchmark(MMLU-Pro、MMMU-Pro 等)上验证了后训练没有损伤通用能力。开放度:——无权重、无代码、无环境,只能读机制。

工程护城河

真正难在哪

  1. 真机农场的资本与运维。设备、SIM 卡、账号、网络代理、封号对抗——每一项都是持续成本。
  2. 账号与支付的合规/风控。User Agent 处理支付确认这件事本身就踩在灰色地带,外部团队很难合规复现。
  3. 一万条并发 rollout 的调度,配上"环境失败 vs 模型失败"的判别,是一整套生产级基础设施。
  4. 论文什么都不放,复现只能从零重建。

我们的机会

真机农场抄不走,但飞轮的认知部分几乎全部可以:

方向启示

它给出的最强信号是:决定 agent 上限的不是算法,是"题目从哪来"。Qwen 用真机农场解决了"环境真实性",用 agent 飞轮解决了"题目供给"。小团队没有真机农场,但"题目供给"这一侧完全开放。

配合 第 05 篇(Qwen-AgentWorld,用世界模型造环境),一个自然的差异化方向浮现出来:把"诊断驱动的任务合成"和"模型生成的环境"接在一起,做一条不依赖物理设备的飞轮。这条路阿里自己都还没接通(两篇论文各做一半),是真实存在的空隙。

04DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence

DeepSeek-AI · 2026-04(笔记记为 arXiv v1 2026-04-26;官方模型卡 2026-04-27,模型 4 月 24 日发布)· arXiv:2606.19348 · 权重(MIT) · MegaMoE kernel

⚠️ 元数据不一致:笔记记载的日期是 2026-04,但所给 arXiv 编号前缀 2606 对应 2026-06。两者必有一处需以原页面为准——引用发表日期前请打开链接核对。

一句话

DeepSeek 明确把后训练拆成两段:先各领域独立养专家(SFT + GRPO),再用在线蒸馏把这些专家合并成一个统一模型——用"分头 RL + 蒸馏合并"取代了"在一个模型上做所有 RL"。这是本轮最重要的后训练范式转变,而且权重是 MIT 协议全开放。

机制拆解

什么被修改——两层:先是各个领域专家的权重,再是统一模型的权重。

第一阶段 · 独立培养领域专家:四个领域——数学、代码、agent、指令遵循。每个领域先在该领域高质量数据上做 SFT 建立基础能力,再用 GRPO 做强化学习,由"针对该领域成功标准定制的奖励模型"引导。

第二阶段 · 统一模型合并:统一模型作为学生,对多个教师优化反向 KL 损失,在自己采样的分布上做 on-policy distillation。关键点:这是在线蒸馏(学生自己采样、教师打分),不是离线拿教师输出做 SFT——所以学生不会去学自己根本到不了的分布,训练信号始终落在学生的实际状态上。

谁来评估 / 改进信号从哪来——第一阶段是各领域定制奖励模型 + 可验证信号;第二阶段就是教师的逐 token 对数概率。这里有个重要的结构性含义:第二阶段不需要任何外部奖励,所有"外界的判断"都已经被固化在教师权重里了。

配套的几个专家训练组件(论文列出但展开有限):Reasoning Efforts(可变计算预算,对应产品侧 Non-think / Think High / Think Max 三档)、Generative Reward Model、Tool-Call Schema and Special Token(工具调用用专用 special token 表达,而不是塞进自然语言里)、Interleaved Thinking(思考与工具调用交织)、Quick Instruction。

循环怎么闭合——统一模型发布后又成为下一代的基座。DeepSeek 的迭代周期本身就是那个大循环。

证据与评估

工程护城河

真正难在哪

  1. 论文对后训练写得很省。数据量、训练成本、各领域样本规模、奖励模型怎么训——全部缺失。上面列的 Generative Reward Model / Interleaved Thinking 等组件只有名字,没有展开。
  2. 四路并行的领域 RL,算力是单路的四倍。
  3. mHC(双随机矩阵流形约束)和 CSA/HCA 混合注意力的稳定训练,需要大规模才能验证,小规模复现结论可能不迁移。
  4. "十个教师合成一个"这类外部解读在正文里找不到明确对应——以论文原文的四领域说法为准,不要引用二手数字

我们的机会

方向启示

DeepSeek 在这一代给出的判断是:RL 负责"产生能力",蒸馏负责"整合能力"——两件事被明确分开了。这与"一个大 RL 管线包打天下"的旧范式是决裂的。

对选方向的启示:如果要做自演化系统,"能力整合层"是一个被严重低估、且不需要巨额算力的位置。目前公开的做法(反向 KL 在线蒸馏)非常朴素:无冲突仲裁、无遗忘度量、无教师可信度加权。谁把"如何把 N 个专家安全地合并成一个而不丢能力"做成一门可靠的技术,谁就拿到了所有分布式自改进系统的必经环节。这是一个门槛在算法、不在算力的根本性差异化方向。

05Qwen-AgentWorld: Language World Models for General Agents

阿里巴巴 Qwen Team · 2026-06 · arXiv:2606.24597 · 代码 · 权重 35B-A3B 与 397B-A17B(Apache-2.0)

一句话

不造环境,生成环境:训一个模型专门预测"agent 做了这个动作后,终端/浏览器/安卓屏幕会返回什么",一个模型同时模拟七类环境,让 agentic RL 不再被真实环境的数量卡住。权重 Apache-2.0 全开放——这是本批里对小团队最直接可用的一件武器。

机制拆解

它是什么——一个"语言世界模型"(Language World Model, LWM)。输入当前观察 + agent 的动作,输出下一个观察。agent 点了个按钮、敲了条 shell 命令、调了个 API、发了个搜索——模型预测环境会返回什么。

七个域,一个模型:文本类(MCP、Search、Terminal、SWE)+ GUI 类(Web、OS、Android)。论文的一个核心发现是知识在这些域之间互相迁移——同一个模型学 Terminal 的状态转移,对理解 SWE 也有帮助。

它自己怎么被训出来(三阶段):1) CPT:注入状态转移动态 + 世界知识,基于 1000 万+ 条跨七域的交互轨迹;2) SFT:激活 "next-state prediction" 的思维模式——让模型学会用长 CoT 去推演"接下来环境会怎样",而不是直接猜;3) RL:用混合 rubric + 规则奖励锐化模拟保真度。规则奖励管可判定的部分(返回值格式、退出码),rubric 管"这个页面看起来合不合理"这类软判断。

它在闭环里的两个位置(本篇最聪明的地方):

循环怎么闭合——agent 在世界模型里采样 → 拿奖励 → 更新策略;世界模型也可以拿真实环境的数据继续校准。真实环境从"每条轨迹都必须跑"降级成"只用来校准模拟器",环境样本消耗断崖式下降。

证据与评估

工程护城河

真正难在哪

  1. 保真度即天花板,而论文没有给出"模拟器误差如何传导到策略性能"的定量分析。世界模型幻觉出一个不存在的 API 返回值,agent 就学会了一个在真实世界不成立的策略。这是经典的 model-based RL 风险,论文用 rubric+规则 RL 缓解,但没有量化残余误差。
  2. 长程漂移。单步预测准不代表 50 步后的模拟状态还可信。论文的评测偏向单步/短程 next-state prediction,长程复合误差是明显的缺口。
  3. 七域覆盖不等于你的域被覆盖。做垂直领域的话要自己续训。
  4. 397B 版本的推理成本本身不低——用世界模型省下的环境成本,一部分又付给了推理。

我们的机会

这是八篇里投入产出比最高的一件工具。

方向启示

它宣告了一件事:"环境"正在从基础设施变成模型能力。过去 agentic RL 的护城河是"你有没有几千个真实环境",现在变成"你的世界模型准不准"。对没有真机农场、没有万卡的团队,这是一次门槛的重新洗牌——而且洗到了对小团队有利的一侧。

选方向的启示:去做世界模型的"可信度"而不是"覆盖面"。覆盖面靠数据量,那是大厂的游戏;可信度(长程一致性、不确定度校准、误差传导)靠方法,那是小团队能赢的游戏。而且这个能力是所有 model-based 自演化系统的共同前提——做成了就是所有人的依赖项。

06Sample-Efficient Learning from Agent Experience(经验蒸馏 / EPD)

ByteDance Seed + Monash University · 2026-07 · arXiv:2607.21051 · 代码/权重:无(论文未给出明确的开源仓库)

一句话

agent 反复试错攒下的"经验",直接拿去 SFT 只能保住 3.8% 的收益,而用经验蒸馏能保住 64.8%——而且比 PPO/GRPO 少用 9.6~57 倍的环境交互。这篇把"上下文里的经验"变成"权重里的能力"这条路打通了,是记忆系统与训练系统之间那座缺失的桥。

机制拆解

问题的起点很具体:agent 在一个任务上反复尝试,把之前的失败历史塞进上下文,表现会显著变好(in-context learning)。但这个收益是一次性的——换个任务、清空上下文,就没了。怎么把它固化进权重?

什么被修改——学生模型的权重。

经验怎么收集——agent 对同一任务反复尝试,每次尝试都以前几次的历史为条件。文字冒险游戏:每轮游戏状态重置,但历史保留。软件工程任务:历史和代码状态都保留、持续演化。

为什么直接 SFT 会失败(只保住 3.8%)——这是全文最重要的洞察。直接在收集到的轨迹上做 SFT,模型只是在复制观察到的动作,学到的是表面模式;而那些好动作之所以好,是因为教师看着经验做了上下文推理。动作被复制了,产生动作的推理过程丢了。

经验蒸馏(EPD)怎么做(保住 64.8%)——核心损失(论文式 2):

L_EPD(θ; τ^exp) = −Σ_{t=0}^{T−1} E_{a'_t ~ π_θ₀(·|h_t^exp, τ^exp)} [ log π_θ(a'_t | h_t^exp) ]

读法:教师 π_θ₀有经验 τ^exp 的条件下采样动作;学生 π_θ没有经验的条件下去拟合这些动作;只做单步 rollout(从已记录的历史点出发走一步),不是重新生成整条轨迹。一句话:让学生在没有经验的情况下,做出有经验的教师才会做的决策。教师和学生是同一个模型,区别只在于上下文里有没有经验——所以这是严格意义上的自蒸馏,不引入外部更强模型。

三个让它真能跑起来的工程组件:1) 经验预处理——把原始历史抽象/摘要化,保留任务相关信息(原始经验上下文 60~600 轮、8 万+ token,不处理根本塞不下);2) 增强教师推理——给教师加深度审议的 prompt 指令;3) 分支打包——把连续多个教师决策堆进单条训练序列,4,096 条独立样本压成 128 条打包序列,训练时间降低 10 倍以上

循环怎么闭合——agent 跑任务 → 攒经验 → 经验通过 ICL 提升当前表现 → EPD 把这个提升固化进权重 → 更强的 agent 去跑下一批任务。环境交互只在第一步消耗。

证据与评估

定义 G_ICL = (S_m − S_ZS)/(S_ICL − S_ZS) × 100%,即把方法归一化到 zero-shot(0%) 与 ICL 上界(100%) 之间。

指标数值
SFT 保住的 ICL 收益3.8%
EPD 保住(SWE 任务)64.8%
EPD 保住(TaleSuite 文字游戏)93.4%
SWE: ICL+EPD vs PPO51.4% pass@1 vs 17.7%,环境样本少 9.6×
TaleSuite: ICL+EPD vs GRPO43.8 vs 29.9 归一化分,环境样本少 57.2×
OOD 泛化(494 个未见任务)pass@1 4.62% → 8.84%
多任务经验数据总量6,170 万 experience tokens
分支打包加速>10×

设定:749 个精选软件工程任务(agent 拿到 issue 和仓库,可读代码、改文件、跑命令、看 commit 反馈)+ 6 个文字冒险游戏(TaleSuite,七任务池:Acorncourt / Balances / Detective / Enter / Inhumane / Library / Reverb)。注意"一个环境样本 = 一次完整的 agent 尝试",不是一步交互。开放度:——无代码、无数据集链接,但机制完整到可以独立实现。

工程护城河

几乎没有护城河,这正是它的价值。

真正难在哪

  1. 上界就是 ICL 的上界。EPD 最多把 ICL 的收益搬进权重,搬不出更多。如果任务本身 ICL 提升不大,这个方法没有用武之地。
  2. 依赖长上下文教师。8 万+ token 的经验上下文意味着教师必须有很强的长上下文能力,且教师推理成本高(虽然总成本仍远低于 RL 的环境交互)。
  3. 经验预处理(摘要化)是个没有被充分消融的黑盒。摘要丢掉了什么、丢掉的东西是否正是关键——论文没有深入。
  4. 64.8% 意味着仍有 35% 的收益漏掉了,论文没有解释漏在哪。
  5. 无代码,需要自己实现(但实现量不大)。

我们的机会

这是八篇里最适合作为第一个动手项目的。

方向启示

它把一个常被混淆的问题讲清楚了:"经验"和"数据"不是一回事。轨迹是数据,直接学它只学到模仿;经验是"有历史条件下的判断力",要学的是判断力而不是动作。

这对做自演化 agent 的方向选择意义很大:目前业界的 memory 系统绝大多数停在"把历史存起来、检索出来塞进上下文"——是外挂,不是成长。EPD 指出了从外挂到成长的那一步怎么走,而且便宜到小团队做得起。

如果要选一个难的、有根本差异化的方向:做"经验 → 权重"这条通路的完整版——包括多轮迭代的稳定性、遗忘控制、哪些经验值得固化哪些该丢。这是 RSI 的核心机械,目前公开工作只走了一小步,且不需要万卡。

07EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

ByteDance Seed · 2026-07 · arXiv:2607.05155 · 代码(51/134 任务 CC BY 4.0,SForge 评测框架 Apache-2.0)

一句话

把 5 个前沿模型扔进 134 个真实任务里各跑 12 小时以上、烧掉约 3.8 万小时交互,发现"agent 从环境中学习"的性能曲线服从一条极其干净的 log-sigmoid 规律(R² = 0.998);并且模型代际之间的"学习速度"大约每三个月翻一倍。这是第一次有人把自改进循环的速率变成可测量、可外推的量。

机制拆解

这篇不是训练方法,是测量层——但对选方向的价值极高,因为它定义了"改进"该怎么被量化。

任务怎么造——134 个真实任务,六大领域:科研/ML(39)、软件工程(36)、组合优化(19)、专业知识工作(19)、形式化数学(13)、交互游戏(8)。人类专家构建每个任务的平均投入 57.2 小时,最高到 320 小时。这个数字本身就是本篇最硬的资产说明。

双层反馈(这是设计精髓)内环 · agent 自控——agent 在工作区里操作、跑测试、看报错,想看多少次看多少次,自己掌握节奏;外环 · judge 中介——提交产物后,由隐藏测试或评判标准打分,返回校准过的分数或诊断,次数受限、权威。这正好映射真实工作流:开发者本地随便迭代,但只有部署/评审才给出权威校准。把"廉价的自我检查"和"昂贵的权威反馈"分开,是所有自改进系统都该有的结构。

agent 怎么"学"——纯上下文内学习,全程不更新权重。学习完全发生在前向传播里,靠对任务历史的条件化。所以这篇量的是"模型利用反馈的能力",不是"训练算法的能力"。证据:200k 对比 1M 上下文的 Claude Opus 4.8,2 小时时领先 +5.8 分,到 12 小时仍有 +4.4 分——上下文长度带来的是持续性优势,不是一次性优势。

改进信号从哪来——就是外环 judge 的校准分数。关键对照实验:累积经验 vs 独立重启。同一个 Opus 4.8、17 个任务,12 小时后累积经验 43.0 分 vs 独立重启 36.1 分(+6.9)。进步来自复用反馈,不是来自反复采样——这一句话就否定了"多试几次就行"的朴素路线。

规律本身

S(t) = S_max / (1 + (t_mid / t)^β)

S_max 可达性能上限;t_mid 达到半数性能所需的交互时间;β 转变陡峭程度。

证据与评估

工程护城河

真正难在哪

  1. 成本。想自己重跑一遍完整评测,光 API 就是巨额开销,何况 12 小时/任务 × 134 × 3 次 × 5 模型。
  2. 83 个任务不公开,榜单无法完整复现,只能在 51 个任务的子集上做。
  3. "每三个月翻倍"的证据基础较窄:18 个任务的切片、只看 OpenAI 一条模型线、两个时间点做 log-linear 外推。方向性可信,具体倍数要打折
  4. 结论只适用于不更新权重的 in-context 学习。它没有回答"权重更新的自改进"是否遵循同样的规律——这是一个明确的、重要的、尚未回答的问题。

我们的机会

方向启示

这篇给出的两个战略判断,比任何单个算法都重要:

  1. "从环境中学习"是可预测的,不是玄学。6.5 小时就能外推 12 小时(R²≥0.997),说明这套动力学有结构。既然可预测,就可以被优化、被对比、被当作工程指标管理。
  2. 学习速度每三个月翻倍——如果这个趋势哪怕只对一半,那么"agent 在部署后自己变强"的速率增长会快于"模型本身变强"的速率。方向选择上这意味着:押注"改进循环的效率"比押注"模型的绝对能力"更有杠杆,因为前者的增长曲线更陡,而且是小团队能参与的。

具体到选一个难的方向:去补 EdgeBench 明确留下的那个洞——权重更新的自改进是否遵循同一条规律。这个问题有清晰的定义、有开源的考场、有已知的对照基线(纯 in-context 曲线),成本可控,而且答案无论正负都是领域级的贡献。

08Advancing Mathematics Research with AI-Driven Formal Proof Search(AlphaProof Nexus)

Google DeepMind(+ Aarhus University)· 2026-05 · arXiv:2605.22763 · 结果仓库(Lean 证明 Apache-2.0 / CC BY 4.0;系统本身未开源)

一句话

在 Lean 形式化验证器的地基上搭了一套演化式的多 agent 证明搜索,自主解决了 353 个未解 Erdős 问题中的 9 个(其中两个开放了 56 年)和 492 个 OEIS 猜想中的 44 个——而且全程不做任何训练,纯推理时搜索。它证明了一件事:当验证器是绝对可靠的,闭环可以完全不碰权重就产出新知识。

机制拆解

什么被修改——不是权重,是证明草稿(proof sketch)的种群。改进发生在一个不断演化的候选池里。

四级架构,逐级加码(这个消融设计本身就很值得学):

谁来评估——两个评估器,分工明确,这是全篇最关键的设计

  1. Lean 编译器(硬评估,绝对可靠):每次 LLM 改完代码就类型检查,报错原文喂回去。完成的证明必须是 sorry-free,并由 SafeVerify 检查没有引入被禁公理(含 sorryAx)。这一层不可能被骗。
  2. Rating agent(软评估,Gemini 3.0 Flash):给未完成草稿的"看起来靠不靠谱、清不清楚"打分,用 Plackett-Luce 模型把两两比较转成 Elo。

改进信号从哪来——这正是本篇要解决的核心难题:形式化证明的原生信号是二值的(证出来/没证出来),而且绝大多数时候是 0,稀疏到没法搜索。解法是用软评估器给"半成品"打分,把二值信号插值成连续的适应度,让演化算法有梯度可循。硬评估器保正确性,软评估器保可搜索性——两者各司其职,软评估器判错了也只是浪费算力,绝不会产出错误定理。

循环怎么闭合:完成的证明 → 成功信号,终止;编译错误 → 原文喂回 LLM;未完成草稿 → 进种群数据库,被打 Elo → 作为下一代父本;全局 goal 缓存:子目标做哈希,之前解过就直接取回 tactic 序列——跨问题、跨 agent 的共享记忆,是这套系统里唯一持久化的"学到的东西";AlphaProof 对剩余目标给出证明/反证/超时,结果进入下一轮 prompt 构造。

证据与评估

结果数值
Erdős 问题9 / 353(#12(i)、#12(ii)、#125、#138、#152、#741(i)、#741(ii)、#846、#26)
OEIS 猜想44 / 492(从 2,649 个候选自动形式化而来)
开放代数几何问题2 / 4(含一个开放 15 年的 Hilbert 函数问题)
最久的 Erdős 问题开放 56 年(#12)
单题推理成本每个 Erdős 问题数百美元(按难度有 2~5× 波动)
AlphaProof 单独(纯树搜索)0 / 9
基础 Agent A 事后重试那 9 题9 / 9(但最难的几题成本显著更高)

另有图论、优化(含一个发现了新参数的收敛率证明)、加性组合(Ben Green #57 的实值变体)、量子光学(N=d∈{4,6,10} 的多个构造)上的结果。模型:Gemini 3.1 Pro 做 prover,Gemini 3.0 Flash 做 rater。

最有信息量的一个数字是 "AlphaProof 单独 = 0/9":一个经过大规模 RL 训练的专用定理证明器,单独用完全解不出这些题;而把它作为工具塞进一个通用 LLM 的演化搜索循环里,就能解出 9 道。价值在编排,不在那个被训练过的组件。

开放度:中等偏低。所有 Lean 证明和部分自然语言证明开放(含第三方溯源到 OEIS / Erdős Problems),结果已登记到陶哲轩关于 AI 贡献 Erdős 问题的 wiki。但系统本身、harness、演化调度代码都没有开源

工程护城河

真正难在哪

  1. 只在有形式化验证器的领域成立。Lean 给了一个不可能被欺骗的 oracle,这是 99% 的现实任务都没有的奢侈品。这既是本文成功的原因,也是它可迁移性的边界。
  2. 自动形式化是隐藏的瓶颈:2,649 个候选只转化出 492 个可用命题(约 18.6%)。形式化本身就是一道窄门。
  3. 成功率本身不高(Erdős 2.5%、OEIS 8.9%),意味着这是一台"高成本低命中"的机器——依赖的是"错了不要紧,对了就是新定理"的非对称收益结构。
  4. 系统未开源,复现要从架构描述重建。

我们的机会

方向启示

这篇给出的判断最锋利:闭环的质量 = 验证器的质量。有 Lean 的地方,纯推理时搜索就能产出人类未知的新定理,完全不需要训练;没有可靠验证器的地方,再大的模型和再多的 RL 也只是在优化一个会被欺骗的代理指标。

对"选一个难的、有根本差异化的方向",这指向一个非常具体的位置:把"可靠验证"从数学扩展到更广的领域。不是造更强的 agent,是造更难被骗的评判者——形式化的、可执行的、可审计的验证层。这件事与 第 02 篇(Anthropic 的天花板卡在 benchmark 完备性)第 01 篇(Kimi 的整条链吊在 GRM 上)第 05 篇(世界模型的保真度无保证)指向的是同一个瓶颈。八篇报告从四个完全不同的角度收敛到同一个结论,这本身就是最强的方向信号。