十九、10-02 深夜:工作记忆第一次测 —— 而我先测错了,然后自己抓出来
1.4k 字 ·
源文件 进度.md 第 727 行起 ·
goal ruler optim ground read memory selfcorrect
#★★★ 先说怎么做错的
我用 --hide-after 0 vs 8 各跑 3 个种子,结果两臂每一个读数都逐位相同:
到位率 到达刻 教师一致 loss
步200 100.0% 4.0/24 +0.208 +0.003
步400 50.0% nan/24 +0.276 -0.288
步600 50.0% nan/24 +0.272 -0.233
↑ hide_after=0 和 =8 【完全一样】我当时写下的结论是:"hide_after 在评估里完全没起作用"。
#★★★★★ 而我错了 —— 真正的原因写在项目自己的代码里
--highlight-after 的默认值 = 0 ← 目标格【从第 0 刻就亮着】项目 exp41:1229 自己的话:
"目标格一直亮着的话,策略有一条【完全不用认字】的捷径 —— · 真读懂了 -> 能在高亮出现之前到位(读数
pre_hl)"
-> 目标格一直亮着,策略就直接朝亮格开,根本不需要指令。 -> 所以隐藏【文字指令】对它【不可能】有影响。
-> 我上一轮说"没生效"是错的。它生效了,只是被这条捷径完全掩盖。
#★★ 我的错在哪(这是第三次同型错误)
| # | 我的错 | 该怎么做 |
|---|---|---|
| 1 | 把 stop_on_correct=not a.play 读成"与默认等价" | 求值,不要读 |
| 2 | 用 --readout-hidden 前没查它存不存在 | 先跑 check_args.py |
| 3 | ★ 看到"零效应"就下结论,没先看判别器读数 pre_hl | ★★ 看到"零效应"时,先问"这个实验有没有可能测不到" |
★★★ 共同形态:我把【结果】当成了【关于她的结论】, 而没有先问【这个测量有没有可能被绕过】。 而项目自己为这个问题设计了判别器 —— 我没用它,所以又犯了一次。
#★ 更正后的状态
| 问题 | 答案 |
|---|---|
hide_after 生效吗 | ★★ 生效(环境逻辑正确,评估也传了它) |
| 那为什么两臂一样 | ★★ highlight_after=0 让目标格一直可见 -> 策略无需指令 |
| "她能拿住指令吗" | ★★ 仍然未被测量(结论不变,理由不同) |
#★★ 下一步(确切)
| # | 做什么 |
|---|---|
| 1 | 把 pre_hl(判别器读数,exp41 已算好)打进训练日志 |
| 2 | ★★★ 用 --highlight-after 12(晚于 hide_after=8)重跑条件 (5) |
| 3 | 判据 = pre_hl(高亮出现【之前】到位的比例)—— 那才需要真的记住指令 |
| 4 | 顺便查"步200 到 100% 后掉到 50%"这个退化现象(两臂一致,是独立问题) |