四十一、 夜班(1):并集分析 + 我自己的一次重要更正
★★★★★★★
2.0k 字 ·
源文件 进度.md 第 2206 行起 ·
ground selfcorrect
★ 完整版见
journal/RESULT_THE_LIMIT_IS_SIMULTANEITY_NOT_LEARNABILITY.md与journal/CORRECTION_MAX_3_IS_NOT_A_LIMIT_AND_READOUT_WAS_AN_INFERENCE.md。
#★★★★★ 一、并集分析(5 个完全同配置的跑次)
| 跑次 | 上 | 左 | 右 | 下 | ★ 活着 |
|---|---|---|---|---|---|
REL_s4 | 100% | 79% | 62% | 0% | 3 |
REL_s5 | 0% | 100% | 0% | 0% | 1 |
REL_s6 | 100% | 100% | 0% | 100% | 3 |
REL_s7 | 0% | 62% | 0% | 25% | 2 |
REL_s8 | 100% | 0% | 0% | 0% | 1 |
★ 并集覆盖 4/4 · 从未被学会的指令:无 · 单次最多活着 3 条 · 同时全会 4 条:0 ★ 各指令两两 Fisher 全部 p ≥ 0.206 ⇒ 难度无显著差异
#⚠️⚠️ 二、而我紧接着更正了自己一句写错的话
我写过:"这不是'某条学不会',也不是'容量不够',而是【同一个读出上能同时维持的绑定数有上限】。"
两处错:
| # | 错 | 对 |
|---|---|---|
| 1 | 把"5 个跑次里最多活 3 条"说成"上限" | ★ 那是 n=5 的观测最大值,不是有界性的证据 |
| 2 | 把"读出竞争"当成结论 | ★★ 它只是未经检验的推断,且与"2 指令 0/6 vs 4 指令 5/5"方向相反 |
★ 收窄后可辩护的说法:一次训练通常只建出【部分解】(1–3 条), 而末段的大更新把已经建出的部分解再走掉一部分。
★ 第 173 条教训:把"样本里的最大值"说成"上限",会把一个观测变成一条定律。
要声称一个上限,必须有一个"超过它就被阻止"的机制, 或者一个"把资源加倍而它不变"的实验 —— 否则只能说"观测到的最大值是 X"。 ★ 而这条与教训 170("我没见过" ≠ "不存在")是同一枚硬币的两面: 一个把缺席当不存在,一个把出现当有界。
#★★★★★ 三、所以下一步换成一个不动架构的判别实验
★ 我发现"改读出"超出我的授权(目标义务清单里有"不换循环核",而读出头属于循环核模块) ⇒ 必须先走"改架构五项说明"。
★★★ 而有一个更便宜、完全不动架构的判别实验:FREEZE-TRUNK(判据 V1)
做法:从 REL_s4_best.pt / REL_s6_best.pt 出发,续训 200 步(β=0),
冻住整个 LNN 主干,只训读出。对照:GN2-PROBE 同起点、同步数、同种子,主干不冻。
| 观察 | ★ 结论 |
|---|---|
| ★★ 冻住后漂移停止而没冻时漂移 | ★★ 病因是主干在移动 ⇒ 修法在优化器/主干,不动读出 |
| ★★ 两者都漂 | ★★ 病因在读出本身 ⇒ 那时才值得走改架构流程 |
★★ 而验证 --freeze-trunk 我用了【参数差】而不是看代码(项目里有过
RL_SCALE=0 只关一项而 v/sup 仍改共享层的现场):
主干(lnn.*)逐项最大变化 = 0.000e+00 ← 严格为 0
读出(其余) 逐项最大变化 = 1.712e-02 ← 在学#★★ 四、今夜已入队的五个链(全部有独占槽闸门)
| 链 | 判据 | 它回答什么 |
|---|---|---|
SUB_s0..s3 | T4 | 训练 4 条只看上/下 —— "辅助信号"还是"更多机会" |
FRZ_s0..s3 | T5 | 冻在最好点能不能留住 |
GN_s4/5/6/8 | 梯度范数 | β→0 之后谁顶上来 |
GN2P_s4/s6 | "交接" | 从会崩的最好点续训,谁在推参数 |
FT_s4/s6 | V1 | 主干移动 vs 读出撑不住 |