十六、 单变量确认:真凶找到了(echo_drop)

★ 1.5k 字 · 源文件 进度.md 第 552 行起 · read

text
检查点           有回显    无回显   "抄"的贡献   留出无    认字
var_s0.pt       1.0000   1.0000    0.0000   0.4583  1.0000
REPRO_var_s0    0.3750   0.3438    0.0312   0.2396  1.0000   ← echo_drop=0.5
SV_nopred       0.3229   0.2708    0.0521   0.1562  1.0000   ← +pred_coef=0(被排除)
SV_noecho       0.4688   0.0208  ★ 0.4479   0.0104  1.0000   ← ★ 只改 echo_drop->0.0
P0v2old         0.5208   0.0104  ★ 0.5104   0.0000  1.0000

#★★★ 单变量链

比较唯一变量结果
REPRO vs SV_noecho★ echo_drop 0.5 → 0.00.0312 → 0.4479 ✅ 决定性
REPRO vs SV_nopredpred_coef 1.0 → 0.00.0312 → 0.0521 ❌ 噪声

★★★ 改一个参数(echo_drop)就把"她会写"变成"她只会抄"。 而 SV_noecho 复现了 P0v2old 的行为(0.4479 vs 0.5104)—— 二者只差这一个参数。

#⚠️ 但机制层我不理解,我不编解释

配置有回显的回合无回显的回合
echo_drop 0.5(会写)★ 有(50%)有(50%)
echo_drop 0.0(只会抄)无有(100%)

"多给她看回显"反而让她更不依赖回显 —— 与直觉相反。 ★ 而且无回显时屏幕上根本没有前缀可抄,她却恰好只在有回显时才会写。 → 机制层是一个还没被理解的东西。我只报因果,不编故事。

#★ 这意味着:今天全部结论作废重做

结论处置
units 加 4 倍没用★ 作废(用的是 echo_drop=0 的退化配方)
线性 vs 非线性读出无差★ 作废
pi-init-std 无效应★ 作废
"整字 43~62%"★ 退化配方的读数(真配方 REPRO 是 0.3438,var_s0 是 1.0)

#★ 下一步(先建基准,再重做)

#做什么为什么这个顺序
1★★ "好配方"的 ≥3 种子基线★ 没有方差就没有可比的基准(var_s0 1.0 vs REPRO 0.34 就是教训)
2在好配方上重做 units 扫描干净条件下容量是不是瓶颈
3在好配方上重做读出实验同上
4机制层:为什么 echo_drop 会翻转结论需要一个专门诊断

← 返回《进度.md》目录