§26 2026-10-03 夜:病因锁定在【优化动力学】,而且是用"一个数"证明的
·
★★★★★★★
2.7k 字 ·
源文件 PROJECT.md 第 5094 行起 ·
ruler arch optim ground selfcorrect
★ 本节的结论取代 §23–§25 里所有关于"为什么会丢"的说法。 ★★ 而这一夜我改了九次结论、撤回了三篇 RESULT —— 每一次的现场都在
journal/。 读本节之前先读journal/GOAL_NAVIGATION.md(结论导航)与journal/CRITERIA_LEDGER.md(判据台账)。
#26.1 ★★★★★★★ 核心读数(三个数,两个判据)
| 量 | ★ REL_s4 | ★ REL_s6 | ★ 含义 |
|---|---|---|---|
| 训练出的读出 R²(留出轨迹) | 0.4562 | 0.4714 | 她做到的 |
| 最小二乘最优解 R²(同一批数据) | 1.0000 | 1.0000 | ★★ 能做到的 |
| ★ R² 差距 | 0.5438 | 0.5286 | ★★ 她差多少 |
| ★ 参数距离(与最优读出) | 1.0015 | ★ 2.1692 | ★★★ 更灵敏的崩塌读数 |
最优解的 diag(指令可分度) | 1.3253 | 1.3254 | ★★ 最优解是高度条件化的 |
工具:tools/supervisor/measure_r2_gap.py(四个干预从此判这两个数)
#26.2 ★★★★★★★ 排除表(每条都有独立可测的证据)
| 解释 | ★ 状态 | 证据 | ||
|---|---|---|---|---|
| 容量不够 | ★★ 排除 | 参数 3.6 倍无用 | ||
| 表示不够(哪条指令) | ★★ 排除 | 线性探针 1.000 × 9 个跑次、每个时间点 | ||
| ★★ 表示不够(该怎么推) | ★★★ 排除 | 教师每刻的摇杆目标能被线性读出以 R² = 1.000 复现 | ||
| 任务不可解 | ★★ 排除 | 教师对每条指令都正确(余弦 0.96–0.97) | ||
| 示范不可靠 | ★★ 排除 | 四条指令的教师摇杆长度完全相同(3.249) | ||
| 难度不对称 | ★★ 排除 | 两两 Fisher 全 p ≥ 0.206 | ||
| 探索不足 | ★★ 排除 | 失败指令的 \ | stick\ | 与学会的相当(0.34–0.47) |
| ★★ "只是分布不同" | ★★ 排除 | 同分布差距 0.5288、跨分布 0.5267(策略驾驶下 0.2009) | ||
| ★★ "泛化问题" | ★★ 排除 | 训练集差距 0.5289 vs 留出集 0.5286 —— 几乎相同 | ||
| ★★★★★ 优化动力学 | ★★★★★ 唯一剩下的,且已被直接测出 | ★★★ 上面那张表 |
#26.3 ★★★★★★ 机制的一行陈述
pi与v都作用在【同一个读出向量】上。 于是训练读出的最优解是 "教师项 + 策略梯度项 + 价值项"的折中点,而不是最小二乘解。 ⇒ 它必然欠拟合教师(实测 0.47 vs 1.00), 而且被折中得越远(参数距离越大),行为崩得越厉害 (REL_s4距离 1.00 →diag0.287;REL_s6距离 2.17 →diag0.175)。
★ 而"崩塌"的本质因此被改写:
不是"她学了又忘",而是"读出从来没有收敛到那个它本可以一次到达的位置"。
★ 证据:REL_s6 在步 1200 的 diag(1.293)与闭式最优解的 diag(1.3254)几乎相同
—— 两个完全独立的路径给出同一个数。
#26.4 ★★★ 一个我必须记下的方法论事实
这一夜我最大的收获不是某个结论,而是"怎样才不会被自己的读数骗":
| 教训 | ★ 一句话 |
|---|---|
| 192 | "信息存在"与"信息可用"是两个量;不要用均值距离判断存在性(用可恢复性) |
| 195 | 一个"构造上应 ≤1"的比值算出 >1 ⇒ 那是公式错了,不是发现 |
| 196 | 一个问题没有干净闭式答案时 ⇒ 换检验方式,而不是再换代理量 |
| 197 | 工具的读数有效性必须在该工具内部证明,且要覆盖整条链 |
| 198 | "修了三次而读数一次没变"是读数与模型无关的指纹 ⇒ 停止修复,打印中间量 |
| 199 | 一个对照本该成功却失败 ⇒ 它诊断的是你的评估链,不是被研究的对象 |
| 200 | 让对照与主体走完全相同的代码路径,是对照能起作用的前提 |
| 201 | "训练失败是优化问题"可以被一个数证明,不需要排除法 |
★★ 而这一夜我失败了两条测量线(共 7 个版本的实现),
两次都写成了失败记录而不是悄悄删掉:journal/FAILED_MEASUREMENTS_READOUT_UTILIZATION.md
与 journal/FAILED_MEASUREMENT_TEACHER_LINEAR_READABILITY.md。
#26.5 ★ 下一步(四个已排队、判据已写死的干预)
| 干预 | ★ 它测哪个候选 | ★ 判据(两个数) |
|---|---|---|
W1 --lr-end | 步长 | R² 差距与参数距离应缩小 |
W2 --rl-scale 0 | 梯度被 pi 扰动 | 参数距离应部分缩小 |
IMO β 恒 1.0 | 与奖励通路的交互 | 参数距离应从 ~2.2 显著降下来 |
V1 --freeze-trunk | 主干移动 | 两者都应缩小 |
T5 --stop-at-best | 只是停住 | 末点条数 ≥1 在 ≥2 种子 |
★★★ -> 这些不再是"探索",而是【对同一对数(R² 差距、参数距离)的五个检验】。