§26 2026-10-03 夜:病因锁定在【优化动力学】,而且是用"一个数"证明的

· ★★★★★★★ 2.7k 字 · 源文件 PROJECT.md 第 5094 行起 · ruler arch optim ground selfcorrect

★ 本节的结论取代 §23–§25 里所有关于"为什么会丢"的说法。 ★★ 而这一夜我改了九次结论、撤回了三篇 RESULT —— 每一次的现场都在 journal/。 读本节之前先读 journal/GOAL_NAVIGATION.md(结论导航)与 journal/CRITERIA_LEDGER.md(判据台账)。

#26.1 ★★★★★★★ 核心读数(三个数,两个判据)

量★ REL_s4★ REL_s6★ 含义
训练出的读出 R²(留出轨迹)0.45620.4714她做到的
最小二乘最优解 R²(同一批数据)1.00001.0000★★ 能做到的
★ R² 差距0.54380.5286★★ 她差多少
★ 参数距离(与最优读出)1.0015★ 2.1692★★★ 更灵敏的崩塌读数
最优解的 diag(指令可分度)1.32531.3254★★ 最优解是高度条件化的

工具:tools/supervisor/measure_r2_gap.py(四个干预从此判这两个数)

#26.2 ★★★★★★★ 排除表(每条都有独立可测的证据)

解释★ 状态证据
容量不够★★ 排除参数 3.6 倍无用
表示不够(哪条指令)★★ 排除线性探针 1.000 × 9 个跑次、每个时间点
★★ 表示不够(该怎么推)★★★ 排除教师每刻的摇杆目标能被线性读出以 R² = 1.000 复现
任务不可解★★ 排除教师对每条指令都正确(余弦 0.96–0.97)
示范不可靠★★ 排除四条指令的教师摇杆长度完全相同(3.249)
难度不对称★★ 排除两两 Fisher 全 p ≥ 0.206
探索不足★★ 排除失败指令的 \stick\与学会的相当(0.34–0.47)
★★ "只是分布不同"★★ 排除同分布差距 0.5288、跨分布 0.5267(策略驾驶下 0.2009)
★★ "泛化问题"★★ 排除训练集差距 0.5289 vs 留出集 0.5286 —— 几乎相同
★★★★★ 优化动力学★★★★★ 唯一剩下的,且已被直接测出★★★ 上面那张表

#26.3 ★★★★★★ 机制的一行陈述

pi 与 v 都作用在【同一个读出向量】上。 于是训练读出的最优解是 "教师项 + 策略梯度项 + 价值项"的折中点,而不是最小二乘解。 ⇒ 它必然欠拟合教师(实测 0.47 vs 1.00), 而且被折中得越远(参数距离越大),行为崩得越厉害 (REL_s4 距离 1.00 → diag 0.287;REL_s6 距离 2.17 → diag 0.175)。

★ 而"崩塌"的本质因此被改写: 不是"她学了又忘",而是"读出从来没有收敛到那个它本可以一次到达的位置"。 ★ 证据:REL_s6 在步 1200 的 diag(1.293)与闭式最优解的 diag(1.3254)几乎相同 —— 两个完全独立的路径给出同一个数。

#26.4 ★★★ 一个我必须记下的方法论事实

这一夜我最大的收获不是某个结论,而是"怎样才不会被自己的读数骗":

教训★ 一句话
192"信息存在"与"信息可用"是两个量;不要用均值距离判断存在性(用可恢复性)
195一个"构造上应 ≤1"的比值算出 >1 ⇒ 那是公式错了,不是发现
196一个问题没有干净闭式答案时 ⇒ 换检验方式,而不是再换代理量
197工具的读数有效性必须在该工具内部证明,且要覆盖整条链
198"修了三次而读数一次没变"是读数与模型无关的指纹 ⇒ 停止修复,打印中间量
199一个对照本该成功却失败 ⇒ 它诊断的是你的评估链,不是被研究的对象
200让对照与主体走完全相同的代码路径,是对照能起作用的前提
201"训练失败是优化问题"可以被一个数证明,不需要排除法

★★ 而这一夜我失败了两条测量线(共 7 个版本的实现), 两次都写成了失败记录而不是悄悄删掉:journal/FAILED_MEASUREMENTS_READOUT_UTILIZATION.md 与 journal/FAILED_MEASUREMENT_TEACHER_LINEAR_READABILITY.md。

#26.5 ★ 下一步(四个已排队、判据已写死的干预)

干预★ 它测哪个候选★ 判据(两个数)
W1 --lr-end步长R² 差距与参数距离应缩小
W2 --rl-scale 0梯度被 pi 扰动参数距离应部分缩小
IMO β 恒 1.0与奖励通路的交互参数距离应从 ~2.2 显著降下来
V1 --freeze-trunk主干移动两者都应缩小
T5 --stop-at-best只是停住末点条数 ≥1 在 ≥2 种子

★★★ -> 这些不再是"探索",而是【对同一对数(R² 差距、参数距离)的五个检验】。

← 返回《PROJECT.md》目录