§28 2026-10-04 凌晨:四个干预跑完后的判定 —— 一条记账修正、一条不成立、一条被削弱
·
★★★★★★
2.8k 字 ·
源文件 PROJECT.md 第 5171 行起 ·
discipline ruler arch ground selfcorrect
★ 本节把
§26.5里那四个干预的结果收口,并更正两处早先的结论。 ★★★ 所有读数用权威口径eval_f2_all_checkpoints.py(固定种子 + 24 题/指令 + 贪心)。 ★ 主读数按铁律 = 末点相对最好点(三个数一起报)。
#28.1 ★★★★★★★ 判定表(四个干预)
| 干预 | ★ 判据(跑前写死) | ★ 结果 | ★ 判定 |
|---|---|---|---|
★★ W2 --rl-scale 0(移除 π) | 最好点提高 | ★ +29.5pp(p = 0.0000,3 种子)<br>★ 串行组内 +12.0pp(p = 0.0106) | ★★★ 成立 |
★★ V1 --freeze-trunk | 末点 ≥1 条在 ≥2 种子 | ★ FT_s4 末点 100%<br>★★★ FT_s6 末点 21.9%(且最好点 60.4% < 起点 75.0%) | ★★★ 不成立(1/2) |
★★ T5 --restore-best-at-end | 末点 == 最好点在 ≥2 种子 | ★ FRZ_s1:38.5% → 38.5%(参数差 0),而未干预的末点 = 0.0%<br>★★★ FRZB_s6 vs FT_s6:9 个快照逐位相同,末点 21.9% → 60.4% | ★★★ 成立(2/2) |
IMO(移除 π+v+ent) | 验"v 是否被 π 抬高" | ★ 未跑完(RLO 跑次没开 --gn-split ⇒ 无法离线替代) | ★ 记账 |
#28.2 ★★★★★★★ 而 T5 的判定比"成立"更强
★★★ FRZB_s6 与 FT_s6 的【全部 9 个快照逐位相同】(44.8/40.6/25.0/25.0/41.7/40.6/21.9%),
只有末点不同(21.9% → 60.4%),且 FRZB_s6.pt 与 FRZB_s6_best.pt 的参数差 = 0。
★★★★★ -> 所以
--restore-best-at-end是一个【纯记账修正】: 它不改变训练的任何一步,收益完全来自"你原本会把一个好检查点丢掉"。 ★★★ 收益 = 原本的损失量(本例 +38.5pp),而不是"它产生了新能力"。
#28.3 ★★★★★★ 两处更正
| # | ★ 早先的说法 | ★ 更正 |
|---|---|---|
| ① | ★★ "末段参数更新是最大的一段 ⇒ 它导致丢失" | ★★★ 不成立:FT_s4(变好)与 FT_s6(变差)的末段移动速度几乎相同(0.000575 vs 0.000588 / 100 步,差 2%);而中段速度差 2–8 倍。★ 且 FT_s4 自己的形状是 U 形(首段最快 0.000944) |
| ② | ★★ "冻主干是累积器,而全参是替换器" | ★★★ 只在 FT_s4 上成立;FT_s6 是"早峰后衰退"(最好点在步 1)⇒ 降级为单种子的机制假设 |
#28.4 ★★★★★★ 现在可以无条件引用的(A 类,节选)
| # | ★ 结论 | ★ 证据 |
|---|---|---|
| A1 | ★★★ 移除 π 显著提高最好点 | +29.5pp,Fisher p = 0.0000 |
| A2 | ★★★ --restore-best-at-end 保住最好点(纯记账) | 9 个快照逐位相同;参数差 0 |
| A3 | ★★★ --freeze-trunk 确实生效 | 主干 13,767,061 参数逐位差 0 |
| A4 | ★★★ 并行协议不改变训练轨迹 | 790 步逐步损失曲线差 = 0.0000e+00 |
| A5 | ★★★ 摇杆的 tanh 把输出压缩 2.2 倍 | 最优缩放 a* = 2.20 |
| A6 | ★★★ 一个新的线性读出在到位前窗口几乎完美 | RMSE 0.0026–0.1097 |
| A7 | ★★★ 原训练读出的形状差 6 倍 | RMSE 0.85–1.12 |
| A8 | ★★★ 冻主干把"读出方向被转走"从根上消除 | 冻结时旋转角 0.00°(四个)vs 全参 7°–85° |
| A9 | ★★★ 解会"升-峰-降" | 六条非冻主干跑次里五条 |
#28.5 ★★★★★★ 而不可引用的(C 类,节选)
★ "上限在【同时】上" · "读出竞争是上限来源" · "价值头在拖 trunk" ·
"移除 π 改善了保持" · "每个最好点都是 3 条好 + 1 条全死" ·
"v 是末段大更新的驱动项" · "绑定存在然后崩塌" · "偏离在指令方向上" ·
"末段大更新导致丢失"(本轮新增)· "冻主干是累积器"(本轮降级)。
#28.6 ★★ 下一步(按优先级)
| # | ★ 干预 | ★ 它测什么 |
|---|---|---|
| 1 | ★★ LRD --lr-end 0(在跑) | ★★ 末段步长是否是元凶(★ 决定性判别:--lr-decay-frac 0.5 只影响后半段) |
| 2 | ★★ FT2_s6(FT_s6_best 再训一次) | ★ 那个 60.4% 的点是否可改进 |
| 3 | ★★★ 组合干预:--rl-scale 0 + --restore-best-at-end | ★★★ 今晚两条最强修法叠加 |
| 4 | ★ GN2P | 把"并行不改变轨迹"从 790 步扩到 1400 步 |
★ 全部判据在 journal/CRITERION_*.md 里、且在跑前写死。