3. 数学任务线:结论与证据
#3.1 结论
在 1 位数的"读入-延迟-写出"任务上,模型无法稳定学会。 根因不是编码器、不是学习率、不是容量。
#3.2 决定性证据(全在 experiments/)
| 实验 | 内容 | 结论 |
|---|---|---|
exp25_encoder_verdict.py | 卷积编码器 vs 扁平 MLP | 卷积能到 100%,MLP 只有 14.5% —— 编码器没问题 |
diag_why_not_learning.py | 同进程对比 extra_dim | extra_dim=0 → 92.2%;extra_dim=2 → 10.2% |
diag_extradim_isolation.py | 3 种子 × 7 配置 | 种子 2 在任何配置下都学不会(全 14.5%) |
exp27_write_2x2.py | 逐笔×监督密度×后果错位,3 种子 | 只有"只监督末刻"稳定有效 |
diag_tick_counting.py | 换延迟测试 | 模型塌缩成只输出 0(覆盖 1/10 类) |
diag_hold_minimal.py | one-hot 保持任务 | LSTM 和 CfC 都能跨 12 刻保持 100% —— 循环核没问题 |
#3.3 exp27 的最终判读(重要)
因子 平均收敛数(满 3)
只监督末刻 1.00 / 1.50 ← 强、一致
每刻都监督 0.00 / 0.50 ← 最差
逐笔 vs 瞬间 1.00 vs 0.50 ← 弱且不稳定
后果错位1刻 0.50 ← **有害**核心发现:稀疏的结果信号 优于 稠密的正确答案。 这条直接支持了用户提出的奖励机制方向。
#3.4 我犯过的错(需记住)
- 曾据单种子结果宣称"逐笔写字 13%→91%,有效" —— 3 种子下不成立
- 曾宣称"extra_dim=0 就能到 92%" —— 依赖种子
- 延迟阶梯实验的 10.9% 结论可能受 exp24 抢 GPU 影响(未复验)