三十九、 收口:五臂 + 八跑次跑完了 —— 而判据的形状错了

★★★★★★★ 2.6k 字 · 源文件 进度.md 第 2049 行起 · goal ruler optim ground memory selfcorrect

★ 这一节替掉第三十八节末尾那句"她这次守住了"(那是 1–2 个种子的读法)。 ★ 完整版见 journal/RESULT_GOAL_8358_FINAL_CLOSURE.md。

#★ 最终答案(一句话)

★★★★★ 两个缺陷都修好了。而动机里那句"她的读数可能来自尺子"是【错的】—— 容差放大 3 倍,她的峰值读数【一字不差】(47.9% vs 47.9%); 尺子抬高的是【瞎撞的地板】(1.4% → 5.6%),不是她。

★★★★★ 而"她留不住"这个结论要改写成: 它【不是二分的】—— 无老师条件下,八跑次里【有的守住、有的崩到地板】。 正确的说法是一个【比例】:进度条一直开着 → 守住 4/5;进度条被关掉或从未开 → 守住 0/3。

★★★★ 而所有跑次共享一个上限:她【从来没有一次】学到 3 条以上的指令。

#★★★★★ 八个跑次的末点(每臂逐条件,两个量都报)

跑次进度条老师末点到位率末点格距★ 末点指令数
F2_A s0全程β→0.431.2%1.692
F2_A s3全程β→0.439.6%2.112
F2_B s0全程无44.8%1.902
F2_B s1全程无★ 0.0%2.690
F2_B s2全程无25.0%2.691
F2_C步600关β→0.49.4%2.101
F2_D步600关无★ 0.0%2.690
F2_E★ 从未开无0.0%2.670

★ 瞎撞地板 5.6%;不动 = 3.00 格

★★★★★ 两条读数:进度条一直开的臂 4/5 守住;被关掉/从未开的 0/3 守住。 而指令数【从来没有 3 条以上】——这是三个种子都一致的唯一上限。

⚠️⚠️⚠️ 更正(同日,收口自检抓出来的):最后那句是【错的】。 ★★★ 她【学到过 3 条和 4 条】 —— 上一轮旧条件四臂的最好点: C_SC_nobar_best = 上 100% / 左 62% / 右 79% / 下 100%(85.4% / 0.96 格)= 4 条; 另三个臂各 3 条。 ★★ 我的错在于:用一个"末点"读数去回答一个"能力"问题。 → 见 journal/CORRECTION_SHE_LEARNED_THREE_AND_FOUR_COMMANDS.md 与 PROJECT.md §24。 ★★★ 所以正确的表述是:她能学到 4 条,而她的问题是【把能力保持到末点】。

#★ 三个判据

判据判定
T1 修容差后地板上升★ 成立(靠 tol 4/8/12/16 的单调趋势;⚠️ 单点差在噪声边缘,我自己标出来的)
T2 撤奖励干预生效★★ 成立(D 末点 0.0% 且零噪声 vs A 31.2–39.6%)
★★ T3 留不住 vs 守住★★★ 判据形状错了 → 已改写成比例(4/5 vs 0/3)

#★★★★ 本目标最重要的机制发现

#发现证据
1★★★★ "她需要密集信号才能学"是错的F2_E 在零密集信号下把格距从 3.00 降到 1.99(★ 但短暂,末点退回 2.67)
2★★★★★ "到位率"会假阳性 → 门槛必须两个条件同时到位率 25% 可以【什么都不学】就有(一条指令蒙对),而它的格距是 3.55 = 比不动还远
3★★★★★ "能不能学会"至少是【趋势】与【事件】两个问题F2_E:趋势 ✅(3.00→1.99)、事件 ❌(到位率 0%)

#★★ 我这一轮犯的错(五条,都留了现场)

#错教训
1★★★ 三次用"中途点"下结论(其中两次是朝成功方向)提前宣布成功更危险 —— 没人会去复核好消息(138、150)
2★★ 检测器匹配了自己(用 *F2_* 查命令行,而它自己就含 F2_*)自我匹配:测量工具出现在它自己的测量里
3★★ "工具坏了但输出像在指控被测对象"又出现(本会话第 7 例)读数工具硬编码了臂名 → 报"没日志"而日志存在
4★ 把中文注释写进 .ps1已写脚本自动剥离
5★★★ 宣布"两条臂都守住"时只有一个种子补种子后 F2_B 的 seed 1 崩了 — 而那正是我答应的那条

#★ 下一步(已启动)

★★★ 「可靠性实验」:F2_B 配置 × 5 个种子 × 主读数 = 学到的指令条数(约 3 小时)

结果含义
条数在 1–3 之间【随机跳动】★★ 稳定性问题 → 继续在这个世界里修
条数【总是 1–2】★★★ 容量/干扰问题 → 先改机制再谈语言
有种子到 4 条★★★ 旧结论大幅改写

← 返回《进度.md》目录