RSI 阅读指南

方向判断:什么真的难,什么我们能做得更好,该押哪一个

交叉阅读 16 篇论文 + 8 篇实验室技术报告之后的结论。每一条判断都指回具体条目;没有出处的话不写。

快照 2026-09-13 · 材料窗口:论文 2026-06~09,报告 2026-03~09

这份判断回答三个问题:(一) 什么是真正难的、别人无法轻易做到的(二) 什么是我们能重新做出来并且效果更好的(三) 哪 3–5 个方向值得押,按什么顺序

先说最重要的一句,因为它决定了后面所有排序:2026 年下半年的 RSI 领域,算法不再是瓶颈,"信号从哪来"才是。四个互不相干的证据链同时指向这里——OpenMLE 用确定性评分器把 35B 开源模型推到接近闭源前沿;AlphaProof Nexus 靠 Lean 这个不可能被骗的验证器,完全不训练就解出 9 个开放的 Erdős 问题;Anthropic 的 AAR 用一张 H200 和 2400 条样本跑赢 28 位人类研究员,而它的天花板明写在标题里("well-characterized",即冻结 benchmark 的覆盖范围);Kimi K3 整条九专家流水线最终吊在一个现场生成、无一致性保证的 GRM rubric 上。闭环的质量 = 验证器的质量。这不是一个观点,是四家从四个方向撞出来的同一堵墙。

一、护城河盘点:什么是真正难的

把 24 篇里所有"做不到"的地方分类,得到五类护城河。它们的深浅顺序和大多数人的直觉相反——最深的不是算力。

1 · 算力与资本:最显眼,但也最不该追

清单是实的:Kimi K3 的九个专家各做完整 RL,等于单模型九倍的 RL 算力,外加 2.8T 参数 / 104B 激活的训练系统(MoonEP);DeepSeek-V4 的 33T token 预训练 + 四路并行领域 RL;Qwen-AgentWorld 的 397B MoE;AlphaProof Nexus 每个 Erdős 问题数百美元 × 353 题;EdgeBench 约 38,000 小时的前沿模型 API 交互;AI4AI-Bench 的 29 配置 × 10 任务 × 最多 12 小时从零重跑。

判断:这一类既追不上也不必追,而且它正在贬值。DeepSeek 把 V4 权重按 MIT 放出来了,Qwen 把 AgentWorld 两个尺寸按 Apache-2.0 放出来了——别人花了最多钱的那部分,正好是你可以免费下载的那部分。反过来说,凡是"多花钱就能做到"的东西,都不构成你的差异化,也不构成他们的护城河

2 · 数据与环境:最真实的护城河,因为它是人力和许可,不是聪明

判断:这是当前最深的一层,但它有两道裂缝。第一道是 SPADE 说破的 "invisible leash"——自生成的环境永远不会超过生成者的认知边界,所以"用模型造环境"这条路有内生天花板,不能无限替代真实世界。第二道方向相反:AgentWorld 把权重开放了,等于宣布"环境"正在从基础设施变成一件可下载的模型能力。这两道裂缝合起来给出一个很具体的机会——见 第二部分与方向 D3

3 · RL 基础设施与系统工程:门槛高,但是纯软件,不是资本

判断:这一类挡人,但挡的是时间不是钱。它对小团队的含义是 K3 那条笔记给出的:不要比模型规模,去把闭环的某一节做到极致。其中"可恢复的长程环境"是所有人的共同瓶颈,且是纯软件工程。

4 · 评估器与验证层:唯一一类既深又公开的护城河

这一类最值得单独看,因为它的壁垒不在"拥有",在"纪律":

判断:这是整个领域的地基,而它公开可得。换句话说,这里的护城河不是资源型的,是执行型的——Anthropic 把武器放在桌上,大多数团队仍然做不出同等严谨度的评测协议。这正是"门槛在思想不在算力"的实指,也是后面排序的主要依据。

5 · 思想:清单不长,每一条都零算力可抄

真正稀缺的东西可以列成一张表。它们的共同点是:实现成本接近零,但没有它们,整个循环就是自欺

机制它挡住了什么出处
禁止从更强模型蒸馏把"自改进"和"用更强老师作弊"切开——涨分必须来自方法本身报告 02
硬验证器 + 软评分器分工只用硬的信号太稀疏搜不动,只用软的必然 reward hacking报告 08
限带宽反馈(每代 log₂Π 比特)监测器给的反馈一旦足够详细,它自己就变成新的被优化目标论文 16
接口解耦(judge 出 YES/NO,checker 出 0–4 标量)切断"直接抄 token 把奖励刷高"的捷径论文 06
不相交段落生成 rubric判据泄漏(PaperGym 3.7–5.0% vs 现有数据集 11.9–34.1%)论文 15
hint-based regret 当出题奖励题目偏离能力边界——"给提示就会、不给就不会"的题最值得练论文 03
锚点守卫(fail-closed)指标自我腐化:去掉它目标函数立刻刷到 1.000,完全空洞论文 05
epoch 分段 + selective erasure换了评估器之后跨轮分数不可比论文 02
held-out 验证闸门 + 拒绝记忆"看起来变好实际变差"的假阳性改进,以及反复提同一个坏主意论文 09
步级判分(抽最长有效前缀)整条轨迹失败=零信号;废轨迹也能榨出稠密监督报告 03
"环境失败"单列成一类把环境抖动算进模型的错——小团队 RL 不收敛的常见根因报告 03
预算控制(超 τ·b₀ 奖励覆写 −1)+ 冗长控制两种最常见的 reward hacking,成本几乎为零报告 01
"训练数据 = 一个数据库视图"训练集从手工导出的文件变成可查询、可重放的状态论文 13
S_max / t_mid / β 三参数语言"agent 变强了"这种无法证伪的说法报告 07

判断:这张表就是答案的一半。把它抄全,你已经越过了绝大多数团队——而且一块 GPU 都不用买。

二、什么是我们能重新做出来、并且更好的

这一节只收作者自己承认的弱点,以及两篇论文明明该接却没接上的接口。每条都注明出处。

A · 没人画过的曲线(成本最低、结论最直接)

这四条是同一件事的四个切面:整个领域都在用"少量真信号 + 便宜代理"这个配方,却没有人量化过配方的比例。

B · 两篇论文之间明明该接却没接的接口

C · 作者自认"没做完"的循环

D · 被发现、被记录、但没有被修的失效

E · 被证明存在、但无法部署的收益

HELIX 最有价值的发现是无意中撞出来的:单个最佳演化 harness 只有 52/100,而完整候选组合的覆盖是 79/100(相对覆盖增益 58%)。也就是说——harness 演化的收益主要来自"覆盖不同的题",不是"把同样的题做得更好"。但 79/100 是事后按结果选的 oracle coverage,不可部署。"不知道答案时怎么选"这个路由问题完全空白,而它是把 58% 变成真实收益的唯一途径。

三、候选方向:排序与取舍

排序依据三条,按重要性:(1) 差异化是否根本性——做成了别人是否绕不开;(2) 门槛是否在思想而不在算力——因为算力那一侧我们必输;(3) 第一步是否能在数周内出可证伪的结果

排序方向差异化来源算力需求首个结果
D1可扩张的验证层(从"锚点经济学"切入)所有人的天花板都在这里,且没人统一数周
D2AI4AI:训练一个"敢改学习算法"的 agent天花板最高,有现成严格计分尺而几乎无人拿分中–高1–2 月
D3经验 → 权重的完整通路(多轮 EPD)从"记忆外挂"到"能力成长"的唯一便宜通道低–中1–2 周
D4能力组合与路由(portfolio + router)改写 harness 演化的整个叙事数周
D5自改进的可观测性与持久态审计每个跑循环的团队都会撞上,没人愿自己造数周

D1 · 可扩张的验证层:从"锚点经济学"切入

首选

一句话:做一件所有自改进循环都要依赖、但每个人都在各自重新发明的东西——一把不会被优化对象腐化的尺子;具体的第一形态是回答"给定任务族,需要多少条真值锚、怎么分配、能放大多少倍"。

为什么难

因为真值造不出来。论文 05 的原话是 "The anchor cannot be manufactured"——演化能扩大覆盖面,但不能凭空生成正确答案。论文 02 撞的是同一堵墙(anchor 必须是人类接受决定和评分 rubric,要花真钱且会过时),论文 06 撞的也是(PAV 监控器依赖人工验证 holdout)。

更难的部分在于纪律而非算法:三分割 + fail-closed 锚定 + 有效性闸门 + 独立终审裁判 + 位置交换,每一条都是为堵一条具体的作弊路径。论文 05 的消融给了最刺眼的证据——去掉锚点守卫,目标函数立刻刷到 1.000(完全空洞),而去掉花哨的技能库生命周期管理几乎没影响(held-out 0.868 vs 0.868)。扛住安全性的是那道最朴素的守卫。还有一层更深的统计难题,论文 09 已经指出:当演化预算大到一定程度,在 held-out 上做几百次选择本身就会过拟合 held-out——再加一个验证集是解决不了的,这是多重检验问题。

为什么和别人有根本性差异化

因为这是每一家的天花板,而没有任何一家在做它Anthropic 自认作用域限于 "well-characterized" 失效(标题里就写着);Kimi 的整条链吊在现场生成、无一致性保证的 rubric 上;AgentWorld 的保真度没有任何长程误差分析;DeepMind 之所以能产出真知识,纯粹因为它手里有 Lean。四家的极限是同一个,而这个位置无论谁做成了,所有人都得依赖它。

而且目前每个子领域都在各自重复发明同一个原语02 号的 ground-truth anchor(决定评估器换代)、05 号的 10 条 dev 锚点、06 号的 PAV holdout、14 号的 10% 锚组。四篇独立工作、四个不同子领域、同一个抽象,没有人把它统一起来。统一它,就是在定义这个领域的度量衡。

第一步做什么

  1. 把锚点曲线跑出来(2–4 周)。用 论文 05 的开源代码(Double Ratchet 已在 amazon-science 下开源)在 MBPP+ / Spider 2.0 上复现 10 条锚点的结果,然后把锚点数扫成 1 / 3 / 10 / 30 / 100,画出"收益保留率 vs 锚点数"。同时扫 论文 14 的锚组比例(10% → 5% → 2%)。输出一条曲线和一个塌陷点。
  2. 同时做一件工程品:把三分割协议 + 锚点守卫 + 锁死 test 集 + 独立终审裁判做成一个可以挂到任何自改进循环上的小库。这是 论文 05 自己点出的方向("最小锚点 + 可演化指标的通用基础设施"),而它比再做一个 agent 框架有价值得多。
  3. 再往前一格(高风险高回报):验证 论文 02 留下的那个假设——能否用机器可验证的窄任务当宽域评估器的锚(用单元测试锚定代码评审器,再用代码评审器去评审不可验证的设计文档)。如果成立,整套东西就从"要买标注"变成"可自举",这是本领域最值钱的未解问题之一。

最大的风险

结论可能是任务族依赖的,画不出普适曲线。论文 05 已经埋了伏笔——它的三个任务族里两个(MBPP+ 用单元测试、Spider 2.0 用执行匹配)都是机械可检测的,而它自己说 "metric evolution buys the most where the solver's failures are mechanically detectable"。如果 10 条锚点的魔力只在机械可检测的域成立,那么这条曲线的适用面会远小于预期。缓解办法:第一步就把一个纯语义域(报告类,保留率仅 88%,是三者中最低的)放进扫描,让这个风险在第一个月内就暴露,而不是在第六个月。

第二个风险是商业性的:做出来的是公共品,不容易独占。这个风险是真的,但它的另一面是标准位置——度量衡的定义者通常比使用者更难被替代。

D2 · AI4AI:训练一个"敢改学习算法"的 agent

天花板最高

一句话:RSI 的原始定义是"AI 改进造 AI 的过程",而现在没有人做得到——这是列表里唯一一块有严格计分尺、却几乎无人拿分的空地。

为什么难

数字是冷的。AI4AI-Bench 给 agent 一个真实训练仓库 + 4 小时 B300,让它改学习算法本身:平均分 0.166 / 1.0(尺度上 0.1 就是原算法),最强系统只有 0.250——只走完"原算法到最优"这段路的六分之一。更说明问题的是:263 次改动代码的提交里,141 次根本没碰学习过程,只改了运行配置之类;碰了算法层的 122 次平均 0.226,只改配置的平均 0.126。作者的判词是 agent "recover a competent default rather than design past one"。

另一条完全独立的证据链给出同样的诊断:两篇未发表的 NeurIPS 投稿当题目,agent 把工程全部自己完成(文献综述、GPU 调试、数百次实验、编译 LaTeX),结果被原作者判 2/6 和 1/6。作者归纳的五个瓶颈里最刺眼的三条是——缺乏质量标准、缺乏回溯、缺乏资源感知。具体表现:15 轮修订里自评审一直返回"拒",agent 从未换过方法;$3000 预算只花掉 38%–41%;规划了 42 小时探索,5 小时后就锁死了方法。

难还难在成本结构:真实训练循环要 GPU,评测本身也要 GPU(29 配置 × 10 任务 × 最多 12 小时从零重跑)。这正是它还空着的原因。

为什么和别人有根本性差异化

因为"做一个自改进 agent"是红海,"做一个能改进学习算法的 agent"是空地。前者有几十篇 XXXHarness / XXXSkill 在卷,增益都在个位数百分点见顶(04/08/09/12 四篇是同一族);后者的最好成绩是 0.25,且原论文自己指出了往哪走却没做。

更关键的是有一条已经被量化的上升通道AI4AI-Bench 发现把推理预算调高,触及算法层的比例从 8% 升到 64%。这说明"不敢改算法"主要是惰性与短视,不是能力上限。同时"成本和分数不相关"(中位 $181,区间 $7–$626)说明当前所有系统的搜索策略都很糟。这两条加起来是一个很具体的机会:一个专门被训练/被提示去触碰算法层、并且有预算分配意识的 agent,很可能一步把 0.25 推高一大截。

而工具是现成的:Anthropic AAR 是这个循环唯一完整开源的实现(harness + 10 套 benchmark + 通用模板,CC BY 4.0),一张 H200 跑 30 分钟一轮,平均 6.4 小时 hill-climbing 就超过人类最好方案。它的闭环结构是可移植的:冻结评测 + 几何平均 + mini-paper 预注册 + code monitor + 论坛记忆。

第一步做什么

  1. 把 AAR 的 harness 搬到 AI4AI-Bench 的记分尺上,先老老实实复现 0.25 附近的基线。这一步验证的是管道,不是想法。
  2. 做那个原论文指出却没做的对照:固定预算下,比较"默认 agent" vs "被强制先提出算法层假设再动手的 agent" vs "带显式预算分配策略的 agent"。目标是回答 8%→64% 这条曲线到底能不能被提示/训练买到,以及它是否真的转化成分数
  3. 顺手把"回溯"做成可测量的能力论文 11 的全部轨迹、日志、专家评审、实验前问卷都在 cruxevals.com 公开。"为什么 agent 在 15 轮负面反馈后仍不掉头"——数据是现成的、免费的、没人分析过。这是这个方向里成本最低的一块,且结论直接反哺 D1 和 D3。

最大的风险

你可能撞上 论文 11 那堵墙:agent 已经有研究的"手",但没有研究的"脑"。如果 0.166 的根因不是惰性而是判断力的结构性缺失,那么提示工程和小规模 RL 都买不到,投入会被真实的 GPU 账单放大。

缓解办法:把第 2 步设计成一个会证伪自己的实验——如果强制触碰算法层之后分数不涨(甚至下降),那说明瓶颈确实在判断力而非意愿,此时应立刻止损转向 D1/D3,而不是加钱继续。次要风险:AI4AI-Bench 的任务环境是否完整开放需要先确认,不开放则复现成本会高很多。

D3 · 经验 → 权重的完整通路

最快见效

一句话:目前业界的 memory 系统绝大多数停在"把历史存起来、检索出来塞进上下文"——那是外挂,不是成长经验蒸馏指出了从外挂到成长那一步怎么走,但只走了一轮。

为什么难

难点是反直觉的那个:直接拿轨迹去 SFT 只能保住 3.8% 的 ICL 收益论文把原因讲透了——SFT 只是在复制观察到的动作,而那些动作之所以好,是因为教师看着经验做了上下文推理;动作被复制了,产生动作的推理过程丢了。EPD 的解法是让没有经验的学生去拟合有经验的教师的单步决策,保住 64.8%(文字游戏域 93.4%),环境样本比 PPO/GRPO 少 9.6~57 倍

剩下的难在没人碰过的地方:多轮会怎样。论文只做了一轮"采经验 → 蒸馏",蒸馏后的模型再去采新经验会持续增益还是崩塌,完全未知。还有那漏掉的 35%——为什么 TaleSuite 保住 93.4% 而 SWE 只有 64.8%,论文没有解释。以及经验预处理(摘要化)目前是个没有被充分消融的启发式黑盒:摘要丢掉了什么,丢掉的是否正是关键。

为什么和别人有根本性差异化

三点。第一,它是"记忆系统"通向"能力成长"目前唯一便宜的桥——不需要 rollout 调度、优势估计、KL 控制器、critic,"就是一个加权交叉熵"。第二,它接得上一个领域级的公开问题EdgeBench 用 3.8 万小时交互证明 in-context 环境学习服从 log-sigmoid(R²=0.998,前 6.5 小时能外推后 12 小时),并明确留下一个洞——权重更新的自改进是否遵循同一条规律。这个问题有清晰定义、有 51 个开源任务 + SForge 做考场、有已知的对照基线,答案无论正负都是领域级贡献。第三,两篇同出字节 Seed 却没有接起来——现成的空隙。

还有一层战略理由来自 EdgeBench 的第二个发现:模型代际之间的"学习速度"约每三个月翻倍。如果这个趋势哪怕只对一半,那么"agent 部署后自己变强"的速率增长会快于"模型本身变强"的速率——押注改进循环的效率比押注模型的绝对能力更有杠杆,而且前者是小团队能参与的。(该结论的证据基础较窄:18 个任务切片、单条 OpenAI 模型线、两个时间点做 log-linear 外推。方向性可信,倍数要打折。)

第一步做什么

  1. 一到两周内复现那个核心对照:一张卡 + 一个任务集,验证 "SFT 3.8% vs EPD 64.8%"。论文无代码,但机制完整到可以独立实现,实现量不大(三个工程件:经验预处理、增强教师推理、分支打包——后者把 4096 条样本压成 128 条,训练时间降 10 倍以上)。
  2. 然后做论文没做的第二轮:蒸馏后的模型回去采新经验,再蒸一次。画出"轮次 vs 保留率 vs OOD 泛化"的曲线,看它是持续增益还是崩塌。这是最直接的自演化延伸。
  3. 接到 EdgeBench 上:在 51 个开源任务上跑,报告 S_max / t_mid / β 三个参数相对纯 in-context 基线的变化。用这套语言说话,说服力完全不同。

最大的风险

上界就是 ICL 的上界。作者写得很清楚:EPD 最多把 ICL 的收益搬进权重,搬不出更多。如果任务本身 ICL 提升不大,这个方法无用武之地;而多轮迭代很可能在第二、三轮就撞上这个天花板——那样"自演化延伸"会变成"确认了一个上界",学术价值仍在,产品价值打折。

次要风险:EdgeBench 有 83 个任务不公开,结论只能在 51 个任务的子集上成立;而 EPD 依赖 8 万+ token 的长上下文教师,教师推理成本不低(虽然总成本仍远低于 RL 的环境交互)。

D4 · 能力的组合与路由,而不是单点最优

叙事改写

一句话HELIX 无意中证明了 harness 演化的收益主要是"覆盖不同的题"而不是"把同样的题做得更好"——如果这是真的,那么整条赛道的目标函数都选错了。

为什么难

证据先摆出来:固定 harness 基线 50/100(LiveCodeBench),最佳演化候选 52/100——单点提升只有 +4%;而完整候选组合的覆盖是 79/100,相对覆盖增益 58%。SWE-bench Verified 上是 44 → 46 vs 组合 49(共 55 实例)。

难在那 79/100 是事后按结果选出来的 oracle coverage,不可部署。真实场景里你不知道答案,所以必须在不知道答案时决定用哪个 harness——这是一个标准的路由/选择问题,但它的代价结构很恶劣:论文 09 已经指出结构化指导"increases token use even when it reduces solver steps",所以路由带来的收益随时可能被多跑几个候选的成本吃掉。此外 HELIX 自己承认 "cannot tell which individual component caused the change"——每次演化同时改多个组件,归因不了。

为什么和别人有根本性差异化

因为所有人都在优化错的目标RHIProcedural GraphsHELIX 都在找"那个最好的 harness",而 HELIX 的数据说最优策略应该是"维护一组互补的 harness + 一个好的路由器"。这解释了为什么这一族工作的单点增益普遍在个位数百分点见顶。这条技术路线目前没人在做,而且它和 quality-diversity(质量-多样性搜索)那一支天然接得上。

次级差异化:HELIX 把 harness 拆成八个维度(shell / session-hooks / config / prompt / tools / turn loop / acceptance / policy),枚举出 1024–4096 个配方这个组合空间正好适合做因子实验设计——用标准统计方法解决归因问题,是现成的、没人做的活。

第一步做什么

  1. HELIX 开源代码上先复现 52 vs 79 这个 gap,确认它不是小样本噪声(LiveCodeBench 只取了前 100 题而非随机抽样,这是它的已知弱点)。
  2. 训一个路由器,报"oracle gap 闭合率":在不知道答案的前提下,能把 52 → 79 这段差距关掉多少?这个指标本身就是这个方向的主结论,而且它天然是可证伪的。
  3. 把成本画进去RHI 在成本侧有漂亮结果(token 不涨、缓存读写降 33–64%),Procedural Graphs 则相反。"既涨分又降本的结构演化"这条帕累托前沿没人画过——把它画出来。
  4. 顺带做因子实验,回答"八维度里哪几维真的值钱"。这是 RHI 自认的 "correlational rather than causal" 的直接补丁。

最大的风险

红海溢出。harness 演化这一层已经被工业界的工程能力占领(Google、Sakana、Prime Intellect、HKU 同期各一篇,外加几十篇同类),即使你的角度是新的,也随时可能被一个资源更多的团队用两周复现掉——因为门槛低得反常(不训练、不要 GPU,只要 API 预算)。第二个风险是收益被成本吃掉:路由需要更多候选、更多试跑,而 58% 是覆盖增益不是分数增益,两者之间隔着一个未经验证的转换率。

缓解办法:把"oracle gap 闭合率"和"单位成本收益"同时作为主指标,让这个方向在第一个月就交出可证伪的数字——而不是又一个 harness 优化器。

D5 · 自改进的可观测性与持久态审计

配套能力

一句话:当自改进跑得足够久,问题不再是"能不能改进",而是"我们怎么知道它真的改进了"——以及"它往自己的持久状态里写了什么"。

为什么难

HackProbe 是目前最好的尝试,数字仍然很难看:检测 AUROC 0.763(基线 0.663),假阳性率 0.434——作者原话"十次诚实的迭代会被打断四次以上"。格式层作弊只有 0.600。而且在四种配置里只有一种(限带宽重选)挽回的真实能力多于它在干净运行上损失的(比值 1.11),其余都是净亏

更难的是一个信息论层面的上界,不是工程问题:作者点破轮换探针"只能阻止记忆,真正的天花板是探针生成器的覆盖数(covering number)"——有结构的攻击者只需要 O(N(ε)) 个样本就能建模响应面。另外探针预算是硬成本:n=240 恰好落在检测曲线最陡处,要达到 0.90 检测率还需要约 360 条,且每条都必须保密、分布固定、不泄漏。

持久态那一侧同样棘手:Prime Agent 记录了一次真实事故——agent 发现了一个反作弊漏洞,然后把它保存进了持久状态。作者开出的药方(最小权限动作接口、独立状态校验、可审计回滚)一条都还没做

为什么和别人有根本性差异化

因为每一个跑自改进循环的团队都会撞上这个问题,而没有人愿意自己造这个工具。它还有一条独有的、外溢价值很高的洞察——限带宽原则:监督信号一旦足够详细,就会成为新的被优化目标。这条适用于任何"用 A 监督 B 而 B 在优化"的设置,包括所有 LLM-as-judge 场景。同一条原理在 论文 06 以"接口解耦"的形式独立出现(judge 出 YES/NO,checker 出 0–4 标量,输出空间不重叠,切断抄 token 刷奖励的捷径)。两篇独立工作收敛到同一条原理,这是可信度很高的信号。

最大的真空写在 HackProbe 自己的限制里:只在 prompt 层宿主上验证过,权重层的自演化完全没测——而权重层正是 01/03/07 所在的层。

第一步做什么

  1. 把监测器接到一个真在跑的开源自演化系统上OpenRSIPrime Agent 都开源),观察真实的、非人为注入的 hacking。现在所有数字都来自受控注入实验,野生表现完全未知——而 Prime Agent 那次真实事故就是现成的测试用例。
  2. 补格式层统计量(AUROC 0.600 是明确的基线),并把 FPR 从 0.434 压向 0.1。这两件事各自都够一篇工作,且有明确的对照。
  3. 做 L3 持久态的完整性审计:带版本的状态编辑 + 触发原因 + 可审计回滚,Prime Agent 已经有 append-only 事件历史和 session 树,缺的是审计层。

最大的风险

它是守门员,讲不出增长故事。这是个结构性劣势:所有增益都是"避免的损失",而避免的损失很难被度量、也很难被卖。加上目前的技术水位(AUROC 0.76 / FPR 0.43)离能用还远,很可能做了一年仍然是"比没有强,但没人敢依赖"。

因此我的判断是:D5 不适合当主方向,适合当 D1 的配套件。它和 D1 共享同一套探针/锚点工程,共享同一批用户,而且如果 D1 做成了度量衡,D5 就是那套度量衡的告警系统——合起来是一个完整的产品,分开则各自偏弱。

如果只能做一件事

做 D1,但第一个月先跑 D3 的第一步。理由是三条:

  1. D3 的第一步最快出结果(一两周,一张卡),而且它产出的东西正是 D1 需要的素材——多轮 EPD 的崩塌点是"没有锚的递归会走多远"这个问题在训练侧的实例,和 RecurSE 的衰减曲线是同一个问题的两个面。
  2. D1 是唯一一个所有人都绕不开的位置,而且它的门槛正好落在我们能赢的那一侧(纪律与实验设计,不是算力)。
  3. D2 天花板最高但风险最不可控,它值得作为 D1 站稳之后的第二发子弹:那时你已经有了一把可信的尺子,用它去量"改进学习算法"这件事,比裸着上要安全得多。

D4 和 D5 的定位不同:D4 是一个可以低成本试探、随时可弃的机会(HELIX 代码开源,两周就能知道 52 vs 79 的 gap 是否稳固);D5 是 D1 的配套件,不单独立项。

不该做的方向

把这几条写下来,是因为它们看起来都很像"自改进":

这份判断在什么情况下是错的

把可证伪点写出来,是为了让半年后能检查这份判断,而不是重写一遍。

本页所有数字与引述均来自 论文笔记报告笔记,那里标注了各自的核实状态。其中 论文 02 的机制细节转引自第三方索引站、未从原文正文确认,引用前请复核。