4.2 崩溃的根因链(每一步都被数据否证过一次)
0.5k 字 ·
源文件 评审综述.md 第 152 行起 ·
goal discipline ruler arch optim ground read selfcorrect external
| # | 假设 | 实测 | 结论 |
|---|---|---|---|
| 1 | RL 太强 | 关掉 adv-norm 照样崩 | ❌ |
| 2 | KL 锚拉住策略 | 3 种子复现 1/4 | ❌ 是运气 |
| 3 | 到达目标格后优势无方差 | 直接测:测不了(分组没有对照组) | ⚠️ 未检验 |
| 4 | "冻住策略" | RL_SCALE=0 时参数哈希显示 11/12 步在变 | ❌ 只关了一项损失 |
| 5 | 门控是解药 | 熵修正 + 门控关也能过(A9_N0) | ❌ |
| 6 | 熵修正就够 | 门控 6/6 vs 门控关 1/6 | ❌ 门控是稳定性来源 |
| 7 | 破坏源是 v(价值)而非 pi(策略) | 只关 pi 崩;只关 v 3/4 不崩 | ✅ |
★ 熵的定义原来写错了:mix 模式把 log_std 当成熵,
使它在损失里出现两次、符号相反 -> 探索幅度被反向拉扯 -> 逐刻漂移 -> 崩。