二十四、 一个重要的更正:训练日志里那个"100%"是假的
★★★
1.2k 字 ·
源文件 进度.md 第 1028 行起 ·
goal ruler ground selfcorrect
#★ 我做了什么
用同一个策略,换了 4 个不同的评估种子,各测一次:
| 评估种子 | 上 | 左 | 右 | 下 |
|---|---|---|---|---|
| 11 | 100% | 0% | 100% | 0% |
| 22 | 100% | 0% | 100% | 0% |
| 33 | 100% | 0% | 100% | 0% |
| 44 | 100% | 0% | 100% | 0% |
★ 四次完全一样。
#★ 这说明什么
换种子不动 -> 不是"抽样运气",而是【她真的只会两条指令】 (
上/右会,左/下完全不会)。
#★★★ 而这就判定了一件事
训练日志里那句 训练到位率 亮=100% 不亮=100% 【不能】当能力读数。
原因:两把尺子不一样。
| 尺子 | 它量的东西 |
|---|---|
| 训练侧(我这次加的那行) | ★ "这一回合里【任意一刻】擦到过目标附近" |
| 评估侧 | ★ "在这个指令下真的到位" |
★ 旁证:评估侧同一时刻的平均格距 = 0.50 格 (0.5 格 ≈ 没停在目标上),而训练侧仍报 100%。 -> 训练侧那个 100% 与"真的停在目标上"不是同一件事。
#★ 这解释了本项目一个长期困惑
"训练日志一直漂亮,一评估就一半" —— 因为两把尺子量的是不同的东西。
★ 而"β 归零就崩"那个发现仍然成立(两组同时崩,是 β 的效应), 但它保住的是【松尺子】下的读数 —— 严格尺子下
--beta-end 0.4是否也有效,还需要重测。
#★ 对话里的"她学会了"要不要撤回?
不撤回,但要标注。
AL_s1 那条"目标完全不可见下 100%"的证据走的是【评估路径】(严格尺子),
所以它仍然成立。 只是当时没有逐指令核对平均格距。
#★ 下一步
| # | 做什么 |
|---|---|
| 1 | ★★★ 把训练侧的尺子收紧(要求到位后停留几刻,或用最终位置) |
| 2 | ★★★ 用严格尺子重测 --beta-end 0.4 |
| 3 | ★★ 用严格尺子复核 AL_s1 的"命令→目标"证据 |
#★ 一句话
不是她学会了又忘了,而是我一直在用一把【太松的尺子】读训练日志。 换种子不动的那个 2/4,说明她其实只会两半。