#★★★ 一句话
把"追亮格"这条捷径堵掉之后,那个中文字真的拿到了梯度:
在【目标完全不可见】的条件下,她能靠它把方块开到对应的角,
到位率 93.8% ~ 100%(瞎猜是 25%)。
#★ 决定性读数
text
AL_s1.pt(对齐目标 + 一半回合目标格不亮 训练出来)在【目标完全不可见】下:
评估点 上 左 右 下 到位率
1 0.0% 0.0% 0.0% 100.0% 25.0% <- 瞎猜水平(检查点原本不会)
100 100.0% 75.0% 100.0% 100.0% 93.8%
200 100.0% 100.0% 100.0% 100.0% ★ 100.0%
300 100.0% 75.0% 100.0% 100.0% 93.8%
★ 目标格一次都没有被画出来 —— 唯一的线索就是屏幕上那个中文字。
#★ 为什么这次能成:两个可修的原因
| 之前的失败 | 真正的原因 |
|---|
| 旧任务上 100%,但把指令涂黑读数不变 | ★ 目标格总是亮着 → 追亮格就够了 → 那个字拿不到梯度 |
| 改成随机目标后还是不行 | ★ 那时命令与目标脱钩了(随机目标把命令覆盖掉)→ 根本没要求她学 |
| 对齐后训练末点还是差 | ★ 末点 β=0 的已知崩溃 |
★★★ → 所以"她学不会"这句话之前一直是错的。
真相是:【从来没有一个配置真正要求过她学那件事】。
#★ 我们改了什么
| 项 | 旧 | 新 |
|---|
ARRIVE_PX | 11.0 px(格宽 46%) | 4.0 px |
START_RC | (3,1)(让四目标恰好等距 37.5px) | (4,1) |
| 目标格 | ★ 永远亮着 | ★ 一半回合不亮(新增开关,默认关=旧行为) |
| 命令与目标 | ★ 训练时被随机化(脱钩) | ★ 对齐(目标 = 命令对应的角) |
#★ 数字
| 量 | 值 |
|---|
| 瞎猜(4 选 1) | 25.0% |
| 她做到 | 93.8% ~ 100.0% |
| 效应 | ★ +68.8 ~ +75.0 个百分点 |
| 种子噪声 | 25 pp(远小于效应) |
#★ 诚实的限定
- 评估期间仍在训练 300 步 → 所以 100% 是那 300 步之后测的。
★ 但那 300 步也是在"目标不可见"下进行的,所以它证明的是
"这个能力可学",而不是"那个检查点已经会了"。
- 只有 2 个种子(
AL_s2 还在跑)→ MDE 是用两个种子估的。
★ 而效应比噪声大近三倍,重算不会改变方向。
#★ 下一步该做什么
| # | 做什么 | 为什么 |
|---|
| 1 | ★★★ 解决末点崩溃(β=0 时策略塌掉) | ★ 现在"能力可学"已经确认,<br>剩下的问题是"训完之后还能不能保持" |
| 2 | ★★ 用这个方法重做一遍旧的接地线结论 | 那些结论是在"目标永远亮着"的旧设计下取得的 |
| 3 | ★ 认字任务(exp31)那条线不受影响 | 它的判据是"整个汉字打对",没有这类捷径 |
← 返回《进度.md》目录