§28 2026-10-04 凌晨:四个干预跑完后的判定 —— 一条记账修正、一条不成立、一条被削弱

· ★★★★★★ 2.8k 字 · 源文件 PROJECT.md 第 5171 行起 · discipline ruler arch ground selfcorrect

★ 本节把 §26.5 里那四个干预的结果收口,并更正两处早先的结论。 ★★★ 所有读数用权威口径 eval_f2_all_checkpoints.py(固定种子 + 24 题/指令 + 贪心)。 ★ 主读数按铁律 = 末点相对最好点(三个数一起报)。

#28.1 ★★★★★★★ 判定表(四个干预)

干预★ 判据(跑前写死)★ 结果★ 判定
★★ W2 --rl-scale 0(移除 π)最好点提高★ +29.5pp(p = 0.0000,3 种子)<br>★ 串行组内 +12.0pp(p = 0.0106)★★★ 成立
★★ V1 --freeze-trunk末点 ≥1 条在 ≥2 种子★ FT_s4 末点 100%<br>★★★ FT_s6 末点 21.9%(且最好点 60.4% < 起点 75.0%)★★★ 不成立(1/2)
★★ T5 --restore-best-at-end末点 == 最好点在 ≥2 种子★ FRZ_s1:38.5% → 38.5%(参数差 0),而未干预的末点 = 0.0%<br>★★★ FRZB_s6 vs FT_s6:9 个快照逐位相同,末点 21.9% → 60.4%★★★ 成立(2/2)
IMO(移除 π+v+ent)验"v 是否被 π 抬高"★ 未跑完(RLO 跑次没开 --gn-split ⇒ 无法离线替代)★ 记账

#28.2 ★★★★★★★ 而 T5 的判定比"成立"更强

★★★ FRZB_s6 与 FT_s6 的【全部 9 个快照逐位相同】(44.8/40.6/25.0/25.0/41.7/40.6/21.9%), 只有末点不同(21.9% → 60.4%),且 FRZB_s6.pt 与 FRZB_s6_best.pt 的参数差 = 0。

★★★★★ -> 所以 --restore-best-at-end 是一个【纯记账修正】: 它不改变训练的任何一步,收益完全来自"你原本会把一个好检查点丢掉"。 ★★★ 收益 = 原本的损失量(本例 +38.5pp),而不是"它产生了新能力"。

#28.3 ★★★★★★ 两处更正

#★ 早先的说法★ 更正
①★★ "末段参数更新是最大的一段 ⇒ 它导致丢失"★★★ 不成立:FT_s4(变好)与 FT_s6(变差)的末段移动速度几乎相同(0.000575 vs 0.000588 / 100 步,差 2%);而中段速度差 2–8 倍。★ 且 FT_s4 自己的形状是 U 形(首段最快 0.000944)
②★★ "冻主干是累积器,而全参是替换器"★★★ 只在 FT_s4 上成立;FT_s6 是"早峰后衰退"(最好点在步 1)⇒ 降级为单种子的机制假设

#28.4 ★★★★★★ 现在可以无条件引用的(A 类,节选)

#★ 结论★ 证据
A1★★★ 移除 π 显著提高最好点+29.5pp,Fisher p = 0.0000
A2★★★ --restore-best-at-end 保住最好点(纯记账)9 个快照逐位相同;参数差 0
A3★★★ --freeze-trunk 确实生效主干 13,767,061 参数逐位差 0
A4★★★ 并行协议不改变训练轨迹790 步逐步损失曲线差 = 0.0000e+00
A5★★★ 摇杆的 tanh 把输出压缩 2.2 倍最优缩放 a* = 2.20
A6★★★ 一个新的线性读出在到位前窗口几乎完美RMSE 0.0026–0.1097
A7★★★ 原训练读出的形状差 6 倍RMSE 0.85–1.12
A8★★★ 冻主干把"读出方向被转走"从根上消除冻结时旋转角 0.00°(四个)vs 全参 7°–85°
A9★★★ 解会"升-峰-降"六条非冻主干跑次里五条

#28.5 ★★★★★★ 而不可引用的(C 类,节选)

★ "上限在【同时】上" · "读出竞争是上限来源" · "价值头在拖 trunk" · "移除 π 改善了保持" · "每个最好点都是 3 条好 + 1 条全死" · "v 是末段大更新的驱动项" · "绑定存在然后崩塌" · "偏离在指令方向上" · "末段大更新导致丢失"(本轮新增)· "冻主干是累积器"(本轮降级)。

#28.6 ★★ 下一步(按优先级)

#★ 干预★ 它测什么
1★★ LRD --lr-end 0(在跑)★★ 末段步长是否是元凶(★ 决定性判别:--lr-decay-frac 0.5 只影响后半段)
2★★ FT2_s6(FT_s6_best 再训一次)★ 那个 60.4% 的点是否可改进
3★★★ 组合干预:--rl-scale 0 + --restore-best-at-end★★★ 今晚两条最强修法叠加
4★ GN2P把"并行不改变轨迹"从 790 步扩到 1400 步

★ 全部判据在 journal/CRITERION_*.md 里、且在跑前写死。

← 返回《PROJECT.md》目录