3. 数学任务线:结论与证据

1.0k 字 · 源文件 SESSION_STATE.md 第 58 行起 · arch optim memory

#3.1 结论

在 1 位数的"读入-延迟-写出"任务上,模型无法稳定学会。 根因不是编码器、不是学习率、不是容量。

#3.2 决定性证据(全在 experiments/)

实验内容结论
exp25_encoder_verdict.py卷积编码器 vs 扁平 MLP卷积能到 100%,MLP 只有 14.5% —— 编码器没问题
diag_why_not_learning.py同进程对比 extra_dimextra_dim=0 → 92.2%;extra_dim=2 → 10.2%
diag_extradim_isolation.py3 种子 × 7 配置种子 2 在任何配置下都学不会(全 14.5%)
exp27_write_2x2.py逐笔×监督密度×后果错位,3 种子只有"只监督末刻"稳定有效
diag_tick_counting.py换延迟测试模型塌缩成只输出 0(覆盖 1/10 类)
diag_hold_minimal.pyone-hot 保持任务LSTM 和 CfC 都能跨 12 刻保持 100% —— 循环核没问题

#3.3 exp27 的最终判读(重要)

text
因子              平均收敛数(满 3)
只监督末刻        1.00 / 1.50     ← 强、一致
每刻都监督        0.00 / 0.50     ← 最差
逐笔 vs 瞬间      1.00 vs 0.50    ← 弱且不稳定
后果错位1刻       0.50            ← **有害**

核心发现:稀疏的结果信号 优于 稠密的正确答案。 这条直接支持了用户提出的奖励机制方向。

#3.4 我犯过的错(需记住)

  • 曾据单种子结果宣称"逐笔写字 13%→91%,有效" —— 3 种子下不成立
  • 曾宣称"extra_dim=0 就能到 92%" —— 依赖种子
  • 延迟阶梯实验的 10.9% 结论可能受 exp24 抢 GPU 影响(未复验)

← 返回《SESSION_STATE.md》目录