二十一、接地线这条线的定案:"她读指令"是一个误会
1.6k 字 ·
源文件 进度.md 第 831 行起 ·
goal ruler ground selfcorrect
#★★★ 结论(一句话)
旧接地线任务上那个 100%(包括"门控 6/6 过线"), 不是"她读懂了指令",而是【任务允许的一个固定解】。 而在真的需要知道目标的任务上,她【学不会】。
#★ 四条独立证据(全部同向)
| # | 证据 | 数字 |
|---|---|---|
| 1 | 改 hide_after(指令字何时消失)三次 | 读数逐位相同 |
| 2 | --control blank(指令区整块涂黑) | 18 个评估点与"字可见"时逐点相同 |
| 3 | ★ 在真的需要知道目标的设计上训练(随机目标) | 峰值 41.7%(1/4 机率),末段 0% |
| 4 | ★ 观测实测:四个指令下的 screen 与 props | ★ 哈希相同、差异像素/分量 = 0 |
#★★★ 任务设计已修(可撤回)
| 项 | 旧 | 新 | 为什么 |
|---|---|---|---|
ARRIVE_PX | 11.0 px | 4.0 px | 11px 是格宽的 46%、格高的 76% —— 路过就算到 |
START_RC | (3,1) | (4,1) | 旧起点让四个目标恰好等距 37.5px 且成 [2×2] 对角 |
RANDOM_GOAL_TRAIN | 不存在 | ★ 新增(默认关) | ★ 固定布局让"一个固定动作"也能命中 |
★ 修好与否由【盲策略对照】判定(这是本目标新增的前置判据):
固定目标布局: 最好的盲策略 25% -> 判据【未命中】
训练时随机目标: 六个盲策略全部 0% -> 判据【命中】★ 规则已固化进脚本:接地线任何改动都必须先跑
python tools/blind_sweep_control.py --random-goal,
而"改动可接受"的标准是【最好的盲策略保持 0%】。
#★★★ "门控 6/6 过线"已重新表述
| 内容 | |
|---|---|
| 原 | 她按指令把方块开到了对应的格子 |
| 改为 | ★ "在固定目标布局下,6/6 个配置都收敛到了一条满足该布局到位判据的轨迹" |
| 并附 | 该判据在旧设计下不要求知道目标,所以 6/6 不能读作"读指令"的能力 |
#★ 受影响的 / 不受影响的
| 项 | 状态 |
|---|---|
★★★ 所有旧设计接地线跑次(A8_*/A9_*/I16_*/RE_*) | 到位读数不要求知道目标 -> 与"能力"的关系被高估 |
★ 认字任务(exp31) | ★ 完全不受影响(判据是"整个汉字打对",不存在这类松弛) |
★ peak_vs_end 的"门控过线不受 β 崩溃影响" | 结论不变(那是稳定性),但含义要按上面重读 |
#⏳ 还在跑
RG_blank 已完成 18/31(与 RG_text 逐点相同)
RG_text_long 排队(6000 步,排除"训练预算"这条替代解释)
RG_visible 排队(训练时目标【可见】+ 随机目标)★ RG_visible 是关键:如果目标看得见时她能学会,
那就证明差距是信息性的 —— 她需要看得见目标,
而"用那个中文字判断目标"这件事她做不到。那会给出一个正面的、可执行的结论。