RSI 阅读指南

先写下答案,再做东西

一个不需要人、难度自己会长的改进循环。这页说清楚它的原理、为什么别的地方也能用,以及我们接下来具体做什么。

2026-09-15 · 承接 方向判断 与 notes/directions/01

一、普通做法为什么是死路

做完一个东西再问"好不好",这个问题没有机器能回答的答案——只能找人。找人就慢,慢就没有迭代,没有迭代就没有进化。

普通做法 做出一个东西 ──→ 问 "好不好?" ──→ 没有答案,只能找人 这个做法 —— 把顺序反过来 ① 先写意图 ② 做出来 ③ 受限条件下读回来 ┌──────────────┐ ┌────────┐ ┌──────────────┐ │ 先读大标题 │ │ │ │ 只能看 3 眼 │ │ 再读价格 │ ─────→ │ 版面 │ ──────→ │ 1/4 分辨率 │ ──→ ④ 对比 │ 最后看按钮 │ │ │ │ 有干扰 │ │ └──────────────┘ └────────┘ └──────────────┘ │ │ │ └────────── 答案在这里,是你自己写的 ───────────────┘

④ 是纯机械对比:读回来的顺序 == 你写的顺序吗?机器自己就能判。

关键在于:真值不是采集来的,是先写下的

你本来就是带着目的去做东西的,那个目的就是答案。把它先写下来,检验就变成可机器判定的对比。这一步不需要任何人、任何标注、任何偏好数据。

二、"受限"是关键,没有它整件事就是废的

读者没有限制 意图 → 实现A → [看多久都行] → 对 ✓ 意图 → 实现B → [看多久都行] → 对 ✓ 意图 → 实现C → [看多久都行] → 对 ✓ ↑ 全都满分 = 学不到任何东西
读者被限制(3 眼 / 低分辨率 / 有干扰) 意图 → 实现A → [3 眼] → 对了 ✓ 意图 → 实现B → [3 眼] → 错了 ✗ ← 信息在这里 意图 → 实现C → [3 眼] → 对一半 ~ ↑ 差别显出来了
限制 = 区分度的来源。不设限,所有东西都一样好;设了限,差别才显出来。

而且"A 能过 3 眼、B 过不了"这件事,做之前谁也不知道——必须真的做出来、真的跑一遍受限阅读才知道。这和代码一样:不跑你不知道它会不会崩。这就是它能提供新信息、而不是复述已知的原因。

三、难度为什么自己会长

第 1 轮 读者能看 3 眼 └→ 设计者学会:重要的东西放显眼处 └→ 结果:大家都过关了 │ "都过关了" = 太简单了 ──────┐ ↓ 第 2 轮 读者被压到 2 眼 └→ 设计者被迫学更强的:层级更陡、对比更狠 └→ 结果:又都过关了 │ ──────────────────┐ ↓ 第 3 轮 2 眼 + 干扰 + 更低分辨率 └→ ...

没有人排课表。门槛上升的唯一依据是"上一代都过关了"。

能力 / 难度 │ ╱ 设计者 │ ╱ │ ╱ 两条线互相追,谁也停不下来 │ ╱ │ ╱ 读者(难度) │ ╱ │──────╱ └──────────────────────────────────→ 时间 对比 —— autoresearch 那类系统 │ │ ╭──────────────────── 设计者撞顶后就平了 │ ╱ │──╱ │───────────────────────────── 难度线永远是平的(5 分钟预算 + 固定验证集) └──────────────────────────────────→ 时间

四、为什么别的地方也能用

把上面抽象出来,只剩一个共同点:你能不能先写下答案

① 先写下"它该做什么"② 做出来③ 在什么限制下④ 对比什么
海报阅读顺序版面3 眼 / 低分辨率 / 干扰顺序对不对
代码函数该干嘛程序有限测试次数 / 算力行为对不对
agent该完成什么调控拓扑有限步数 / 上下文完成没有
策略该达到什么policy有限交互次数达到没有

于是同一件事有了一个通用的说法:

d(A, B) = 在预算 B 之内,能把 A 和 B 区分开的概率。

叫做资源受限下的可观察等价性。它不是设计专有的,对任何有"行为"的产物都成立。而它同时补上了四格里最难的两格:

要求为什么满足
无人测试由机器生成,预算只是一个数字
信息超出先验"这个测试能不能分开它们"是执行的经验事实,不跑不知道
难度内生系统变好 → 提高预算 → 对手用更多预算去找能区分的测试
形状是度量可区分性在构造上就是一个距离,不是分数

复利从哪来

度量的分辨率是算力的函数,而算力是系统可以多花的东西。

预算越高 → 区分越细 → 空间越锐利 → 选择越精准 → 值得再加预算。"改进者改进自己"在这里有了具体所指:不是让验证器更聪明,而是让它看得更细,而看得更细只需要花更多算力。

五、尺子的单位从哪来(校准)

不问"几分",只问"这两个能不能分开"。然后在一个点周围朝各个方向推一点点,看推多远才刚好能被区分:

↑ 这个方向要推 0.3 才看得出差别(迟钝) │ │ ←─────────────●─────────────→ 推 0.1 就 A 推 0.1 就 看得出 看得出(敏感) │ │ ↓ 0.3 连起来 = ╭───────────╮ │ A │ ← 一个椭圆 ╰───────────╯ 椭圆的形状,就是这一点上的"尺子"。

这正是颜色科学一百年前做的事:用"人眼刚好能看出差别"当颜色空间的刻度单位(MacAdam 椭圆 → CIELAB 的 ΔE)。区别只在于——这里的观察者是一个会因为资源不够而混淆的算法,不是人。

六、我们要做的研究

研究问题一句话:

把验证器从"打分函数"换成"资源受限下的可区分性度量",并让预算自己上升,能不能得到一个不会撞顶的改进循环?
1

先读三篇,决定要不要继续

其中一篇可能直接否掉主线:Survive or Collapse(arXiv 2605.22217)的受控实验结论是"约束自改进稳定性的是任务准入,不是奖励的标定"。如果它对,换度量解决不了问题,我们在调一个不绑定的变量。必须先读,不能绕。

另两篇:Who grades the grader(2607.12790,锚一去掉度量就坍缩成"永远放行")、Does Capability Transfer to Subjective Behavior(2605.27914,已经做过无真值验证验证器)。

2

把度量按 MacAdam 的方式重建

现有实现的匹配判断已被证伪(两个随机产物几乎从不"读成一样",匹配率 0.01–0.05)。正确构造是:在一个产物周围做微扰,找受限读者刚好能分辨的阈值,得到局部 JND 椭球,那就是局部度量张量。

3

测那个唯一重要的问题:前沿会不会一直涨

四个臂对照:度量+预算上升 / 标量+预算上升 / 度量+预算固定 / 标量+预算固定

成功判据:只有"度量+预算上升"那一臂的前沿持续上移而不平台化,并且它产出的东西在训练中从未出现过的预算档位上依然成立(否则只是过拟合前沿,不是发现)。

失败判据(必须事先写死):如果四臂都平台化,或者预算固定的臂同样能涨,则"难度内生"不是关键变量,整条线作废。

4

先在有真值的域做,再谈没真值的域

代码/算法是第一个落点——那里有独立的真值可以核对我们的度量有没有骗自己。设计/海报是目标域,但不是第一个实验域:在没有独立核对手段的地方先做,等于自证。

七、诚实的账:已经被别人做掉的,和真正的风险

主张状态依据
标量有方向可被刷已有人做Transitivity Meets Cyclicity(2605.17342, ICML 2026)已把偏好拆成 transitive 标量 + cyclic 向量
无真值验证验证器已有人做2605.27914 的三张证书,且指出人类评分者自身相关只有 ρ≈0.45,人本身不构成锚
几何自洽能替代锚已被推翻我们自己的合成实验(检验相关仅 0.13–0.38,六项里两项恒等空转)+ Double Ratchet 的锚消融(度量坍缩成"永远放行",而下游分数照样好看,所以发现不了)
换度量能解决 Goodhart很可能错Survive or Collapse:绑定约束是任务准入而非奖励标定
标量无法表示异质人群仍成立但不新
受限恢复当改进信号零命中549 篇里没有;recovery 只出现在审计字段,从未当作改进信号
验证器本身是带距离的空间零命中metric space / embedding / behavior descriptor 全部 0;L4 的 30 篇都在演化 rubric 或权重,没有一篇在演化几何
最大的单点风险:如果 Survive or Collapse 是对的,那么这一整页的主线是在调一个不绑定的变量。第 1 步不是形式,是真的可能让我们收工的一步。

八、现在的状态

东西状态说明
notes/directions/01已写,已修正原文保留,第九节记录了哪几句被自己的实验推翻
experiments/01跑通纯 numpy,三个世界(含两个假设失效的);C1 成立,C2 推翻,C3 未建立
experiments/02半成品意图→实现→受限恢复→保真度 这半边跑通且只要 3 毫秒;度量那半边的匹配构造已证伪,待按 MacAdam 重写