十九、10-02 深夜:工作记忆第一次测 —— 而我先测错了,然后自己抓出来

1.4k 字 · 源文件 进度.md 第 727 行起 · goal ruler optim ground read memory selfcorrect

#★★★ 先说怎么做错的

我用 --hide-after 0 vs 8 各跑 3 个种子,结果两臂每一个读数都逐位相同:

text
       到位率    到达刻   教师一致      loss
步200  100.0%   4.0/24   +0.208     +0.003
步400   50.0%   nan/24   +0.276     -0.288
步600   50.0%   nan/24   +0.272     -0.233
        ↑ hide_after=0 和 =8 【完全一样】

我当时写下的结论是:"hide_after 在评估里完全没起作用"。

#★★★★★ 而我错了 —— 真正的原因写在项目自己的代码里

text
--highlight-after 的默认值 = 0    ← 目标格【从第 0 刻就亮着】

项目 exp41:1229 自己的话:

"目标格一直亮着的话,策略有一条【完全不用认字】的捷径 —— · 真读懂了 -> 能在高亮出现之前到位(读数 pre_hl)"

-> 目标格一直亮着,策略就直接朝亮格开,根本不需要指令。 -> 所以隐藏【文字指令】对它【不可能】有影响。

-> 我上一轮说"没生效"是错的。它生效了,只是被这条捷径完全掩盖。

#★★ 我的错在哪(这是第三次同型错误)

#我的错该怎么做
1把 stop_on_correct=not a.play 读成"与默认等价"求值,不要读
2用 --readout-hidden 前没查它存不存在先跑 check_args.py
3★ 看到"零效应"就下结论,没先看判别器读数 pre_hl★★ 看到"零效应"时,先问"这个实验有没有可能测不到"

★★★ 共同形态:我把【结果】当成了【关于她的结论】, 而没有先问【这个测量有没有可能被绕过】。 而项目自己为这个问题设计了判别器 —— 我没用它,所以又犯了一次。

#★ 更正后的状态

问题答案
hide_after 生效吗★★ 生效(环境逻辑正确,评估也传了它)
那为什么两臂一样★★ highlight_after=0 让目标格一直可见 -> 策略无需指令
"她能拿住指令吗"★★ 仍然未被测量(结论不变,理由不同)

#★★ 下一步(确切)

#做什么
1把 pre_hl(判别器读数,exp41 已算好)打进训练日志
2★★★ 用 --highlight-after 12(晚于 hide_after=8)重跑条件 (5)
3判据 = pre_hl(高亮出现【之前】到位的比例)—— 那才需要真的记住指令
4顺便查"步200 到 100% 后掉到 50%"这个退化现象(两臂一致,是独立问题)

← 返回《进度.md》目录