三十六、 四条判据全部收口(本目标结束)
★★★★★★★
1.6k 字 ·
源文件 进度.md 第 1867 行起 ·
goal discipline ruler ground read
#★ 判据 (ii):规律搬不走 —— 本目标最干净的一个结果
做法:只教她两个字(上、左),然后考她四个字。
| 指令 | 格距 | 到位率 | |
|---|---|---|---|
| 上 | 1.02 格 | 31.2% | ★ 教过 |
| 左 | 0.47 格 | 0.0% | ★ 教过(很近,但没停住) |
| ★ 右 | ★ 4.75 格 | 0.0% | ★ 没教过 |
| ★ 下 | ★ 5.21 格 | 0.0% | ★ 没教过 |
| — | — | — | ★ 站着不动 = 3.00 格 |
★★★★★★★ 对没教过的两个字,她把方块推得【比站着不动还远】。
★★★ -> 她不是"不知道往哪走",而是【主动朝错的角走】。 所以她学的是"这个字对应这个角"这个【绑定】, 而不是"这个字指向那边"这个【关系】。
★ 这与本会话另一条结论方向一致:固定布局训练 → 随机布局只有 34.9%。 ★★ 两条合起来说同一件事:她的泛化能力一直很弱,而之前那些"100%"的读数掩盖了它。
#★★★★★ 判据 (iii) 的机制收口:我那个"撤掉进度条"根本没生效
进度条 = 每刻的 Φ(s') − Φ(s),其中 Φ = −0.25 × 曼哈顿距离(到位封顶为 0)
关掉进度条时,回合末给 arrive_bonus = 1.0算一下量级(起点离目标 3 格):
| 一个回合她拿到什么 | |
|---|---|
| ★ 进度条开 | ★ Φ 从 −0.75 走到 0 → 累计 +0.75 |
| ★ 进度条关 | ★ 回合末一次给 1.0 |
★★★★★★★ 0.75 对 1.0 —— 几乎一样大。
★★★ -> "撤掉进度条"没有把奖励变稀疏, 它只是把一个【连续的 0.75】换成了一个【一次性的 1.0】。 总奖励量级相同,信息仍在 —— 所以它天然测不出任何东西。
★ 而它甚至解释了为什么 C(撤进度条)的最早点反而最高(68.8%):
一次性 1.0 比连续 0.75 更"要么全拿、要么没有",所以更强烈地要求"真的到位"。
#★★★ 所以本目标的最终答案
★★ "她能不能从后果里学习?"
★★ 能 ——
D(两根支架都撤)到过 35.4%/27.1%,B最早点 35.9%,C最早点 68.8%,而三个盲策略地板是 0.0–0.8%。★★★ 但她留不住 —— 三条撤支架的线在末点全部回到地板, 唯一守住 38.0% 的那条【什么都没撤】。
★★ 而"她是否依赖那个连续进度信号",本目标【没有】回答 —— 因为我那个干预在数值上几乎什么都没改。
#★★★ 我这一轮学会的最重要的一件事
★★★★★ "撤掉某个输入"之前,必须先算一下【它原本贡献了多少】。
★ 否则你会撤掉一个几乎没贡献的东西,然后把它读成"她不需要它"。
★★ 这和"撤掉的东西本来就没进来"是同一族的两端 —— 一个是它没参与,一个是它没分量。两者都会给你一个假的零结果。
★★★ 可复用的做法:任何"撤掉 X"的实验,跑之前写下 【X 在正常条件下的数值贡献】,并与【撤掉后替代它的东西】比较。