三十六、 四条判据全部收口(本目标结束)

★★★★★★★ 1.6k 字 · 源文件 进度.md 第 1867 行起 · goal discipline ruler ground read

#★ 判据 (ii):规律搬不走 —— 本目标最干净的一个结果

做法:只教她两个字(上、左),然后考她四个字。

指令格距到位率
上1.02 格31.2%★ 教过
左0.47 格0.0%★ 教过(很近,但没停住)
★ 右★ 4.75 格0.0%★ 没教过
★ 下★ 5.21 格0.0%★ 没教过
———★ 站着不动 = 3.00 格

★★★★★★★ 对没教过的两个字,她把方块推得【比站着不动还远】。

★★★ -> 她不是"不知道往哪走",而是【主动朝错的角走】。 所以她学的是"这个字对应这个角"这个【绑定】, 而不是"这个字指向那边"这个【关系】。

★ 这与本会话另一条结论方向一致:固定布局训练 → 随机布局只有 34.9%。 ★★ 两条合起来说同一件事:她的泛化能力一直很弱,而之前那些"100%"的读数掩盖了它。

#★★★★★ 判据 (iii) 的机制收口:我那个"撤掉进度条"根本没生效

text
进度条 = 每刻的 Φ(s') − Φ(s),其中 Φ = −0.25 × 曼哈顿距离(到位封顶为 0)
关掉进度条时,回合末给 arrive_bonus = 1.0

算一下量级(起点离目标 3 格):

一个回合她拿到什么
★ 进度条开★ Φ 从 −0.75 走到 0 → 累计 +0.75
★ 进度条关★ 回合末一次给 1.0

★★★★★★★ 0.75 对 1.0 —— 几乎一样大。

★★★ -> "撤掉进度条"没有把奖励变稀疏, 它只是把一个【连续的 0.75】换成了一个【一次性的 1.0】。 总奖励量级相同,信息仍在 —— 所以它天然测不出任何东西。

★ 而它甚至解释了为什么 C(撤进度条)的最早点反而最高(68.8%): 一次性 1.0 比连续 0.75 更"要么全拿、要么没有",所以更强烈地要求"真的到位"。

#★★★ 所以本目标的最终答案

★★ "她能不能从后果里学习?"

★★ 能 —— D(两根支架都撤)到过 35.4%/27.1%, B 最早点 35.9%,C 最早点 68.8%,而三个盲策略地板是 0.0–0.8%。

★★★ 但她留不住 —— 三条撤支架的线在末点全部回到地板, 唯一守住 38.0% 的那条【什么都没撤】。

★★ 而"她是否依赖那个连续进度信号",本目标【没有】回答 —— 因为我那个干预在数值上几乎什么都没改。

#★★★ 我这一轮学会的最重要的一件事

★★★★★ "撤掉某个输入"之前,必须先算一下【它原本贡献了多少】。

★ 否则你会撤掉一个几乎没贡献的东西,然后把它读成"她不需要它"。

★★ 这和"撤掉的东西本来就没进来"是同一族的两端 —— 一个是它没参与,一个是它没分量。两者都会给你一个假的零结果。

★★★ 可复用的做法:任何"撤掉 X"的实验,跑之前写下 【X 在正常条件下的数值贡献】,并与【撤掉后替代它的东西】比较。


← 返回《进度.md》目录