二十三、 崩潢修好了:一行参数

★ 1.3k 字 · 源文件 进度.md 第 964 行起 · arch optim

#★ 问题是什么

训练到后半段,她会突然"忘掉"已经学会的东西。 (此前几个种子末点从 100% 掉到 0%/25%,我一直把它归因于"捷径"或"她学不会"。)

#★ 真正的原因:β 一旦归零,就崩

text
步   | 训练亮  | 训练不亮 | beta
 900 | 100.0% |   100.0% | 0.17
1000 | 100.0% |   100.0% | 0.03
1100 | 100.0% |    88.9% | 0.00   <- β 归零
1200 |  22.2% |     0.0% | 0.00   <- 两组同时崩
1500 |  54.5% |    60.0% | 0.00   <- 之后一直摇摆

★ 在 β>0 的整个区间(步 1–1100),训练侧两组【都是 100%】。 β=0 之后的第一个评估点,两组【同时】崩。

#★ 修法:别让 β 归零

powershell
--beta-end 0.4
臂不亮组最小不亮组末点β末
基线(β 到 0)0.0%60.0%0.00
--beta-end 0.4(3 个种子)100% / 100% / 85.7%★ 全部 100%0.40
--beta-floor 0.3100%★ 100%0.30

★ 效应 +40 个百分点,而点间噪声只有 14 个百分点 → 效应远大于噪声。

#★ 为什么"留一点 β"就够了

β 是"照着老师做"的权重。老师知道目标在哪(它直接读目标位置)。 一旦 β=0,那条信号就没了,而她自己看到的东西里【没有目标信息】 —— 于是她只能漂移。

★ 留一个小的 β,等于留一个"目标在哪"的微弱锚点, 足以让已经学会的东西不被丢掉。

#★ 为什么这个发现重要

项影响
★★★ 以前所有用默认 β(到 0)的接地线跑次末点读数不可信;峰值点还能用,但必须标注
★★ "β 钉在 0.5"会锁死学习(此前记录)本次确认 0.4 不锁死 → 安全的范围在 0.3 ~ 0.4
★ 认字任务(exp31)★ 不受影响(它用的是恒定 β=1.0,不退火)

#★ 仍未解释的一件事

训练侧两组都 100%,而评估侧只有 50%(正好两条指令 100%、两条 0%)。 ★ 这不影响上面的结论,但它意味着"评估侧末点均值"这个判据的口径还需要查清。

#★ 一句话

她不是学不会,是"学完之后被 β 归零弄丢了"。 把 β 停在一个小值上,东西就留住了。


← 返回《进度.md》目录