§47 2026-10-04 凌晨 03:10:"留住"有解了 —— 两个零架构改动的修法
·
★★★★★★★
2.0k 字 ·
源文件 进度.md 第 2539 行起 ·
ruler arch optim memory
★ 这是 §46 之后的收口。★ 全部读数用权威口径
eval_f2。 → 完整:PROJECT.md §29、journal/RESULT_T5_FINAL_FOUR_INDEPENDENT_EVIDENCES.md、journal/RESULT_LRD_DECISIVE_LATE_STEP_SIZE_IS_THE_CAUSE.md
#一、★★★★★★★ 两个修法(都不改架构)
| # | ★ 修法 | ★ 它做什么 | ★ 证据 | ★ 成本 |
|---|---|---|---|---|
| ① | ★★★ --restore-best-at-end | ★★ 把末点换成最好点(纯报告层) | ★★★★ 4 个跑次 | ★ 零 |
| ② | ★★★ --lr-end 0 | ★★★ 让末点不丢,甚至超过最好点 | ★★ 1 个跑次 | ★★ 要重训 |
#二、★★★★★★★ 修法 ① 的四个证据(收益一致在 +38~40pp)
| # | ★ 跑次 | ★ 最好点在步 | ★ 最好点 | ★ 干预后末点 | ★ 未干预末点 | ★ 收益 |
|---|---|---|---|---|---|---|
| 1 | FRZ_s1 | 1100 | 38.5% / 1.63 | 38.5% | ★ 0.0% | +38.5pp |
| 2 | FRZB_s6 vs FT_s6 | 1 | 60.4% / 0.74 | 60.4% | ★ 21.9% | +38.5pp |
| 3 | ★★ FRZ_s3 | 800 | ★ 39.6% / 1.00 | 39.6% | ★ 0.0% | +39.6pp |
| 4 | ⚠️ FRZ_s2 | 1 | 25.0% / 3.55(假阳性) | 25.0% | 25.0% | ★ 0 |
★ 参数逐位差全部 0.000000e+00 ⇒ 判据 T5 成立且超出要求(3/3 个可测种子)。
#三、★★★★★★★ 修法 ② 的决定性证据
| 步 | ★ REL_s4 | ★ LRD_s4 | ★ lr_eff |
|---|---|---|---|
| 400 | 0.001070 / 0.0% | ★ 0.001070 / 0.0% | 0.001000 |
| 600 | 0.005230 / 60.4% | ★ 0.005230 / 60.4% | 0.001000 |
| 1200 | 0.003639 / 21.9% | 0.001505 / ★★ 89.6% | 0.000286 |
| ★★ 1400 | ★ 0.008194 / 0.0% | ★ 0.000411 / 89.6% | ★ 0 |
★★★★★★★ -> 前 600 步【逐位相同】⇒ 干净的单变量判别。 末段慢 20 倍,而末点从 0.0% 变成 89.6%(超过它的最好点 60.4%)。 ⇒ 判决:后半段的【大步长】就是丢失的原因。
#四、★★★★★★ 今晚修改了项目最早结论的一条
★ "任何单次最多同时活 3 条"只对 REL 成立(RLO_s4/RLO_s8 都活了 4 条)
★ REL 0/3 vs RLO 2/3,Fisher p = 0.4000(不显著)
⇒ 它只能支持"那条上限句需要附条件"。
#五、★★★★★ 一个待修的实现缺陷
★ --save-best 只看到位率,而 eval_f2 用"到位率 且 格距"
⇒ 已选出过 3 个假阳性。
★★★ 正确的顺序:先修 --save-best 的规则,再用 --restore-best-at-end 保住它。
#六、★ 今晚的三条元教训
| # | ★ |
|---|---|
| 251 | ★★★★★ 一个"保护机制"如果不记录它为什么开火,它就会把故障伪装成"随机崩溃"。 |
| 252 | ★★★★★ 一个"决定性判别实验"之所以决定性,是因为它的前半段是同一件事 —— 而那必须被验证。 |
| 253 | ★★★★★ 一个"救回末点"的干预,它的收益是可预测的量:"最好点 − 末点"。 |