先写下答案,再做东西
一个不需要人、难度自己会长的改进循环。这页说清楚它的原理、为什么别的地方也能用,以及我们接下来具体做什么。
2026-09-15 · 承接 方向判断 与 notes/directions/01
一、普通做法为什么是死路
做完一个东西再问"好不好",这个问题没有机器能回答的答案——只能找人。找人就慢,慢就没有迭代,没有迭代就没有进化。
④ 是纯机械对比:读回来的顺序 == 你写的顺序吗?机器自己就能判。
关键在于:真值不是采集来的,是先写下的
你本来就是带着目的去做东西的,那个目的就是答案。把它先写下来,检验就变成可机器判定的对比。这一步不需要任何人、任何标注、任何偏好数据。
二、"受限"是关键,没有它整件事就是废的
限制 = 区分度的来源。不设限,所有东西都一样好;设了限,差别才显出来。
而且"A 能过 3 眼、B 过不了"这件事,做之前谁也不知道——必须真的做出来、真的跑一遍受限阅读才知道。这和代码一样:不跑你不知道它会不会崩。这就是它能提供新信息、而不是复述已知的原因。
三、难度为什么自己会长
没有人排课表。门槛上升的唯一依据是"上一代都过关了"。
四、为什么别的地方也能用
把上面抽象出来,只剩一个共同点:你能不能先写下答案。
| 域 | ① 先写下"它该做什么" | ② 做出来 | ③ 在什么限制下 | ④ 对比什么 |
|---|---|---|---|---|
| 海报 | 阅读顺序 | 版面 | 3 眼 / 低分辨率 / 干扰 | 顺序对不对 |
| 代码 | 函数该干嘛 | 程序 | 有限测试次数 / 算力 | 行为对不对 |
| agent | 该完成什么 | 调控拓扑 | 有限步数 / 上下文 | 完成没有 |
| 策略 | 该达到什么 | policy | 有限交互次数 | 达到没有 |
于是同一件事有了一个通用的说法:
d(A, B) = 在预算 B 之内,能把 A 和 B 区分开的概率。
叫做资源受限下的可观察等价性。它不是设计专有的,对任何有"行为"的产物都成立。而它同时补上了四格里最难的两格:
| 要求 | 为什么满足 |
|---|---|
| 无人 | 测试由机器生成,预算只是一个数字 |
| 信息超出先验 | "这个测试能不能分开它们"是执行的经验事实,不跑不知道 |
| 难度内生 | 系统变好 → 提高预算 → 对手用更多预算去找能区分的测试 |
| 形状是度量 | 可区分性在构造上就是一个距离,不是分数 |
复利从哪来
度量的分辨率是算力的函数,而算力是系统可以多花的东西。
预算越高 → 区分越细 → 空间越锐利 → 选择越精准 → 值得再加预算。"改进者改进自己"在这里有了具体所指:不是让验证器更聪明,而是让它看得更细,而看得更细只需要花更多算力。
五、尺子的单位从哪来(校准)
不问"几分",只问"这两个能不能分开"。然后在一个点周围朝各个方向推一点点,看推多远才刚好能被区分:
这正是颜色科学一百年前做的事:用"人眼刚好能看出差别"当颜色空间的刻度单位(MacAdam 椭圆 → CIELAB 的 ΔE)。区别只在于——这里的观察者是一个会因为资源不够而混淆的算法,不是人。
六、我们要做的研究
研究问题一句话:
把验证器从"打分函数"换成"资源受限下的可区分性度量",并让预算自己上升,能不能得到一个不会撞顶的改进循环?
先读三篇,决定要不要继续
其中一篇可能直接否掉主线:Survive or Collapse(arXiv 2605.22217)的受控实验结论是"约束自改进稳定性的是任务准入,不是奖励的标定"。如果它对,换度量解决不了问题,我们在调一个不绑定的变量。必须先读,不能绕。
另两篇:Who grades the grader(2607.12790,锚一去掉度量就坍缩成"永远放行")、Does Capability Transfer to Subjective Behavior(2605.27914,已经做过无真值验证验证器)。
把度量按 MacAdam 的方式重建
现有实现的匹配判断已被证伪(两个随机产物几乎从不"读成一样",匹配率 0.01–0.05)。正确构造是:在一个产物周围做微扰,找受限读者刚好能分辨的阈值,得到局部 JND 椭球,那就是局部度量张量。
测那个唯一重要的问题:前沿会不会一直涨
四个臂对照:度量+预算上升 / 标量+预算上升 / 度量+预算固定 / 标量+预算固定。
成功判据:只有"度量+预算上升"那一臂的前沿持续上移而不平台化,并且它产出的东西在训练中从未出现过的预算档位上依然成立(否则只是过拟合前沿,不是发现)。
失败判据(必须事先写死):如果四臂都平台化,或者预算固定的臂同样能涨,则"难度内生"不是关键变量,整条线作废。
先在有真值的域做,再谈没真值的域
代码/算法是第一个落点——那里有独立的真值可以核对我们的度量有没有骗自己。设计/海报是目标域,但不是第一个实验域:在没有独立核对手段的地方先做,等于自证。
七、诚实的账:已经被别人做掉的,和真正的风险
| 主张 | 状态 | 依据 |
|---|---|---|
| 标量有方向可被刷 | 已有人做 | Transitivity Meets Cyclicity(2605.17342, ICML 2026)已把偏好拆成 transitive 标量 + cyclic 向量 |
| 无真值验证验证器 | 已有人做 | 2605.27914 的三张证书,且指出人类评分者自身相关只有 ρ≈0.45,人本身不构成锚 |
| 几何自洽能替代锚 | 已被推翻 | 我们自己的合成实验(检验相关仅 0.13–0.38,六项里两项恒等空转)+ Double Ratchet 的锚消融(度量坍缩成"永远放行",而下游分数照样好看,所以发现不了) |
| 换度量能解决 Goodhart | 很可能错 | Survive or Collapse:绑定约束是任务准入而非奖励标定 |
| 标量无法表示异质人群 | 仍成立 | 但不新 |
| 受限恢复当改进信号 | 零命中 | 549 篇里没有;recovery 只出现在审计字段,从未当作改进信号 |
| 验证器本身是带距离的空间 | 零命中 | metric space / embedding / behavior descriptor 全部 0;L4 的 30 篇都在演化 rubric 或权重,没有一篇在演化几何 |
八、现在的状态
| 东西 | 状态 | 说明 |
|---|---|---|
notes/directions/01 | 已写,已修正 | 原文保留,第九节记录了哪几句被自己的实验推翻 |
experiments/01 | 跑通 | 纯 numpy,三个世界(含两个假设失效的);C1 成立,C2 推翻,C3 未建立 |
experiments/02 | 半成品 | 意图→实现→受限恢复→保真度 这半边跑通且只要 3 毫秒;度量那半边的匹配构造已证伪,待按 MacAdam 重写 |