四十一、 夜班(1):并集分析 + 我自己的一次重要更正

★★★★★★★ 2.0k 字 · 源文件 进度.md 第 2206 行起 · ground selfcorrect

★ 完整版见 journal/RESULT_THE_LIMIT_IS_SIMULTANEITY_NOT_LEARNABILITY.md 与 journal/CORRECTION_MAX_3_IS_NOT_A_LIMIT_AND_READOUT_WAS_AN_INFERENCE.md。

#★★★★★ 一、并集分析(5 个完全同配置的跑次)

跑次上左右下★ 活着
REL_s4100%79%62%0%3
REL_s50%100%0%0%1
REL_s6100%100%0%100%3
REL_s70%62%0%25%2
REL_s8100%0%0%0%1

★ 并集覆盖 4/4 · 从未被学会的指令:无 · 单次最多活着 3 条 · 同时全会 4 条:0 ★ 各指令两两 Fisher 全部 p ≥ 0.206 ⇒ 难度无显著差异

#⚠️⚠️ 二、而我紧接着更正了自己一句写错的话

我写过:"这不是'某条学不会',也不是'容量不够',而是【同一个读出上能同时维持的绑定数有上限】。"

两处错:

#错对
1把"5 个跑次里最多活 3 条"说成"上限"★ 那是 n=5 的观测最大值,不是有界性的证据
2把"读出竞争"当成结论★★ 它只是未经检验的推断,且与"2 指令 0/6 vs 4 指令 5/5"方向相反

★ 收窄后可辩护的说法:一次训练通常只建出【部分解】(1–3 条), 而末段的大更新把已经建出的部分解再走掉一部分。

★ 第 173 条教训:把"样本里的最大值"说成"上限",会把一个观测变成一条定律。

要声称一个上限,必须有一个"超过它就被阻止"的机制, 或者一个"把资源加倍而它不变"的实验 —— 否则只能说"观测到的最大值是 X"。 ★ 而这条与教训 170("我没见过" ≠ "不存在")是同一枚硬币的两面: 一个把缺席当不存在,一个把出现当有界。

#★★★★★ 三、所以下一步换成一个不动架构的判别实验

★ 我发现"改读出"超出我的授权(目标义务清单里有"不换循环核",而读出头属于循环核模块) ⇒ 必须先走"改架构五项说明"。

★★★ 而有一个更便宜、完全不动架构的判别实验:FREEZE-TRUNK(判据 V1)

做法:从 REL_s4_best.pt / REL_s6_best.pt 出发,续训 200 步(β=0), 冻住整个 LNN 主干,只训读出。对照:GN2-PROBE 同起点、同步数、同种子,主干不冻。

观察★ 结论
★★ 冻住后漂移停止而没冻时漂移★★ 病因是主干在移动 ⇒ 修法在优化器/主干,不动读出
★★ 两者都漂★★ 病因在读出本身 ⇒ 那时才值得走改架构流程

★★ 而验证 --freeze-trunk 我用了【参数差】而不是看代码(项目里有过 RL_SCALE=0 只关一项而 v/sup 仍改共享层的现场):

text
主干(lnn.*)逐项最大变化 = 0.000e+00   ← 严格为 0
读出(其余) 逐项最大变化 = 1.712e-02   ← 在学

#★★ 四、今夜已入队的五个链(全部有独占槽闸门)

链判据它回答什么
SUB_s0..s3T4训练 4 条只看上/下 —— "辅助信号"还是"更多机会"
FRZ_s0..s3T5冻在最好点能不能留住
GN_s4/5/6/8梯度范数β→0 之后谁顶上来
GN2P_s4/s6"交接"从会崩的最好点续训,谁在推参数
FT_s4/s6V1主干移动 vs 读出撑不住

#★ 五、而这一轮修好的一个会在午夜静默失败的真缺陷


← 返回《进度.md》目录