三十二、 数数这件事:她真的在数数量(三个对照都过了)
#★ 先说最要紧的一句
★★★★★ 她不是在数"屏幕上墨点多不多"。 她是在数"有几个东西"。
这两件事听起来一样,其实完全不同 —— 而下面的两个对照就是用来分开它们的。
#★ 三个对照,三种"作弊路",全部堵住
| 她想走的路 | 我们怎么试 | 结果 |
|---|---|---|
| ★ 背图案("这个画面 → 3") | ★ 用固定布局训练她,然后拿随机布局考她 | ★ 四类全 100% → ★ 她根本不依赖布局 |
| ★ 量墨量("墨多就是多") | ★ 训练时物体半径 3–5,考试时换成 5–7 | ★ 9 个考点全程高位,3 个考点四类全 ≥90% |
| ★ 猜一个常数 | ★ 机率线 25%、盲策略 25% | ★ 她 85%–100% |
#★ 第二个对照为什么最关键
"数个数"和"量总面积"这两件事,在这个任务里是【同源】的 —— 因为"数量"就是"总面积 ÷ 单个物体有多大"。 所以任何真要数东西的做法,都必须先估出"单个物体多大"。
-> 一个"背下墨量阈值"的解,它的阈值是按训练尺度定的。 一旦考试用的物体变大,它就该【从头到尾全错】。而她没有。
★★★ 她重新估了"一个物体多大",然后数出了个数。
#★ 诚实地说一个弱点
N=3 是四类里最弱的一档:在尺度迁移下最低到 72.7%,
而 N=1/2/4 全程 ≥85%(多为 100%)。
★ 这与"没学会"有本质差别 —— 那是全 0%,这是最弱的一档。 原因也说得通:它既要估准单物体大小,又要数到 3,中间那一档最吃尺度估计的误差。
#★ 一个我自己写错的判据(值得记下来)
我原本在设计里写死:"最好的盲策略必须显著低于机率线(≤35%)。"
而这个判据在这个任务上【数学上不可能成立】:
| 盲策略 | 实测 | 它是什么 |
|---|---|---|
| ★ 永远说 k | 25.0% | ★ 真盲(不看屏幕)—— 要求它低,它确实等于机率线 |
| ★ 面积 ÷ 单物体面积 | 50.2% | ★ 一个算法版的计数器 —— 不要求它低 |
| ★ 按精确墨量查表 | 100% | ★ 不是策略,是该族的上界(定义上必然 100%) |
★★★ -> 我把判据改成了【分布迁移】:换一个尺度分布再测。 背阈值的会崩,真正在数的不会。而那之后读数就干净了。
★★ 这是我这条判据本身错了,不是任务错了(第 97 条教训)。
#★ 现在她会的三件事
| 能力 | 水平 | 条件 |
|---|---|---|
| ★ 认字 | 0.944 | 认得 247 个常用字 |
| ★ 单个命令 → 走到那个角 | 93.8%–100% | 目标完全不可见(机率线 25%) |
| ★★ 数一数有几个东西,敲出数字 | ★★ 四类 85%–100% | ★ 位置/大小/形状全随机,且换尺度也成立 |
★ 她第一次会了一件"输入可以长得完全不一样、而答案是同一个"的事。 这是抽象的开始,也是"判断"最原始的样子。