二十四、 一个重要的更正:训练日志里那个"100%"是假的

★★★ 1.2k 字 · 源文件 进度.md 第 1028 行起 · goal ruler ground selfcorrect

#★ 我做了什么

用同一个策略,换了 4 个不同的评估种子,各测一次:

评估种子上左右下
11100%0%100%0%
22100%0%100%0%
33100%0%100%0%
44100%0%100%0%

★ 四次完全一样。

#★ 这说明什么

换种子不动 -> 不是"抽样运气",而是【她真的只会两条指令】 (上/右 会,左/下 完全不会)。

#★★★ 而这就判定了一件事

训练日志里那句 训练到位率 亮=100% 不亮=100% 【不能】当能力读数。

原因:两把尺子不一样。

尺子它量的东西
训练侧(我这次加的那行)★ "这一回合里【任意一刻】擦到过目标附近"
评估侧★ "在这个指令下真的到位"

★ 旁证:评估侧同一时刻的平均格距 = 0.50 格 (0.5 格 ≈ 没停在目标上),而训练侧仍报 100%。 -> 训练侧那个 100% 与"真的停在目标上"不是同一件事。

#★ 这解释了本项目一个长期困惑

"训练日志一直漂亮,一评估就一半" —— 因为两把尺子量的是不同的东西。

★ 而"β 归零就崩"那个发现仍然成立(两组同时崩,是 β 的效应), 但它保住的是【松尺子】下的读数 —— 严格尺子下 --beta-end 0.4 是否也有效,还需要重测。

#★ 对话里的"她学会了"要不要撤回?

不撤回,但要标注。

AL_s1 那条"目标完全不可见下 100%"的证据走的是【评估路径】(严格尺子), 所以它仍然成立。 只是当时没有逐指令核对平均格距。

#★ 下一步

#做什么
1★★★ 把训练侧的尺子收紧(要求到位后停留几刻,或用最终位置)
2★★★ 用严格尺子重测 --beta-end 0.4
3★★ 用严格尺子复核 AL_s1 的"命令→目标"证据

#★ 一句话

不是她学会了又忘了,而是我一直在用一把【太松的尺子】读训练日志。 换种子不动的那个 2/4,说明她其实只会两半。


← 返回《进度.md》目录