§45 2026-10-04 凌晨 00:15:填掉了契约里的"未测出"—— 末段大更新由 v(价值项)驱动
·
★★★★★★★
1.1k 字 ·
源文件 进度.md 第 2444 行起 ·
goal ruler optim selfcorrect
★ 目标契约原本写着:"未测出:末段大更新由哪一项驱动 ——
pi/v/sup的梯度范数没落盘"。 现在已测出。 数据:GN_s5(--gn-split,1270 点,KL_COEF = 0⇒ 四路分解完整)。 ★ 读法跑前写死(tools/supervisor/read_gn_split.py)。 → 完整:journal/RESULT_GN_LATE_UPDATES_DRIVEN_BY_VALUE_TERM.md
#一、★★★★★★★ 读数
| 项 | ★ 相对变化(末段 vs p10) | ★ 中位梯度范数 |
|---|---|---|
★ v(价值项) | ★★ 6.52x(最大) | 0.031 |
pi | 3.18x | 0.384 |
ent | 2.00x | 0.001 |
sup | ★ 0.36x(下降) | ★ 4.614(最大) |
最大/第二 = 2.05 ⇒ 判据成立 ⇒ 驱动项是 v。
#二、★★★★★★ 三条更正
| # | ★ 更正 |
|---|---|
| 1 | ★★ "谁最大"与"谁在末段增长"是两个不同的问题 —— sup 绝对量级最大(sup/pi = 12.02x)但在末段下降 |
| 2 | ★★★ 证伪审计 F5("三项尺度差一个数量级"):实测最大/最小 = 5724x(3.4 个数量级) |
| 3 | ★★★ 纠正隐含假设:末段参数更新最大(37–50%)而 sup 的梯度范数在下降 —— 不矛盾,因为 Adam 的步长 ≈ lr·m̂/√v̂ 与梯度【大小】近似无关 ⇒ "参数更新最大" ≠ "梯度最大" |
#三、★★★ 可零成本检验的预测
★★ 若
v是驱动项,那么--v-coef 0.0应减小末段漂移。 ⇒ 队列里的IMO(--rl-scale 0 --v-coef 0 --ent-coef 0)正好能检验它 —— 与W2(只移pi)的末段漂移对比即可。
#四、★ 教训 221
★★★★★ 对 Adam 来说,"梯度大"与"参数动得多"是【两件事】—— 把后者当成前者的证据,会得出相反的结论。