24. 收口自检推翻了我自己的结论:她学到过 3 条和 4 条
★★★★★★★
1.6k 字 ·
源文件 PROJECT.md 第 4815 行起 ·
ruler ground selfcorrect
日期:2026-10-03。这一节是"收口那一刻最危险"的现场记录。 ★ 触发:
tools/preclosure_selfcheck.py(它问"每条结论有几个独立来源、有没有矛盾读数")。
#24.1 ★★★ 被推翻的结论
★ 我在 §23.5 与导航块里写过:
"她学到的永远是【两条】指令,不是四条" / "从来没有一次学到 3 条以上"
#24.2 ★★★★★ 而实测(上一轮旧条件四臂的【最好点】)
| 检查点 | 到位率 | 格距 | ★ 逐指令 | ★ 条数 |
|---|---|---|---|---|
★ C_SC_nobar_best.pt | 85.4% | 0.96 | 上=100% 左=62% 右=79% 下=100% | ★★★ 4 |
D_SC_none_best.pt | 60.4% | 1.87 | 上=79% 左=100% 右=0% 下=62% | ★★ 3 |
A_SC_ctrl_best.pt | 60.4% | 1.87 | 上=42% 左=38% 右=0% 下=100% | ★★ 3 |
B_SC_nodemo_best.pt | 55.2% | 1.94 | 上=0% 左=79% 右=42% 下=100% | ★★ 3 |
★★★★★★★ -> 四个臂的最好点【全部】达到 3 条,其中一个达到 4 条(85.4% / 0.96 格)。
#24.3 ★★★★ 我为什么错了(比结论本身更重要)
| 我做了什么 | 错在哪 |
|---|---|
★★ 统计"条数"只用了 F2 系列的八个末点 | ★ 末点是"最后剩下什么",不是"能做到什么" |
| ★★★ 把两个问题混成一个 | ★★★ "能学到几条"与"末点还剩几条"是两个问题 |
| ★ 上一个目标的四臂只看过聚合到位率 | ★ 我从没看过它们的逐指令读数 |
★★★ -> 这是本目标自己那条教训(149:趋势 vs 事件要分开)的另一个实例: 这里是【能力 vs 末点保持】要分开。 而我犯的方式是:用一个"末点"读数去回答一个"能力"问题。
#24.4 ★★★★★ 更正后的结论
| 问题 | ★ 答案 |
|---|---|
| ★★ 她能学到几条指令? | ★★★ 至少 4 条(最好点四条全非零:100/62/79/100%) |
| ★★★ 末点还剩几条? | ★★ 0–2 条;"守住"是比例(进度条开 4/5、关 0/3) |
| ★ "只学两条"的来源 | ★ 只对末点成立,对能力完全不成立 |
★★★★★ -> 本目标核心结论第 4 次改口: 【她的能力上限不是两条 —— 她的问题是把能力保持到末点。】
#24.5 ★★★ 第 154 条教训
| # | 教训 |
|---|---|
| ★ 154 | ★★★★★ "所有条件都 done"最危险的那一刻就是它 —— <br>因为此时最容易把一条没被独立检验的结论当成已建立。<br> |
★ 本例:三条判据都 done,而收口自检问了一句"有没有矛盾的读数",<br> 它立刻翻出一个:她其实做到过 4 条。<br> ★★ 可复用的做法:把"有没有与结论矛盾的读数"做成【必跑的脚本】, 并且要【跨目标/跨数据集】去找矛盾,不只看当前目标的数据 ——<br> 这次矛盾的读数就在【上一个目标】的数据里。 |