7. 当前未解的问题(按优先级)
2.7k 字 ·
源文件 PROJECT.md 第 1453 行起 ·
goal ruler arch optim ground selfcorrect external
#7.1 ★★★ 多延迟训练能否学会(阻塞一切外推实验)
单延迟能学会(100%),多延迟 8000 迭代仍 50%。但结论未定(lr 锁死缺陷)。
要做的:加 lr 下限重跑,并观察"何时开始学"。
#7.2 ★ 自主动力学 —— 已改写:两个被混为一谈的问题必须分开
本条于第 0 阶段清债时被大幅修正。原文依据 §6.6(未训练网络 + 假零输入 + 对照静默崩溃)—— 那条证据链已作废(见 §6.6、§5 第 22/23/24 条)。
原文(已作废):
零输入下状态冻结(§6.6)。这直接阻塞两个终极目标。 要做的:引入内生动力学源
g(h):现在: h_new = f(0, h)→目标: h_new = f(g(h), h)判据:零输入下有效秩 ≥ 4/16、末段每步变化 > 1e-3,且任务准确率下降 < 10pp。
★ 修正后的事实(exp13_linear_probe,任务相关线性探针,lr=1e-3,3 种子):
| 时刻 | 指令可读出 | 探针可读出 |
|---|---|---|
| 指令期 | 100.0% | 48.4% |
| 延迟期初 | 100.0% | 48.4% |
| 延迟期中 | 100.0% | 48.4% |
| 延迟期末 | 100.0% | 48.4% |
| 探针期初 | 92.4% | 97.7% |
| 最后一步 | 63.4% | 98.2% |
(随机基线 11.1%;三个种子在延迟期全部拿到 100%)
任务的延迟期就是真零输入(match.py:129:x = np.zeros(...),延迟期不写任何东西),
cell 收到的是 enc(0) = b_enc。
#★ 结论:两个问题被彻底分开
(1) 「空闲时状态里有没有内容」→ 已达成,100%。 状态在整个延迟期完整携带指令,跨三个种子满分。 "空闲时状态没有内容"这个说法是错的。
(2) 「能不能同时用上两项」→ 真问题。 探针一出现,指令可读出性 100% → 63.4%。这是 §6.13 的同时容量, 与"有没有自主动力学"是两件不同的事。
★ 一个必须保留的区分:「保持」≠「演化」
第 (1) 条证明的是状态稳定保持内容,而不是自行演化。 §7.2 原本想要的"空闲时的过程"仍然没有被证明 —— 但它也没有被证伪, 因为从来没有人正确地测过它。
★ 为什么不再急着上 activity_loss
rotor 的结构半已实现(含谱范数约束、零初始化 gain、精确退化验证),
缺的只是 activity_loss。但现在有了一个具体的新风险:
延迟期末的内容保持率已经是 100%,而这个保持依赖状态的稳定。
activity_loss 的作用正是推动状态去动 —— 两者是张力关系。
强行加它,很可能把 100% 的保持打坏。
(§6.13 自己的探针就说明了这个张力:状态"动"起来之后,指令的可读出性反而掉了。)
★ 现在的正确做法(按顺序)
- 先固定"保持"这个已达成的东西 —— 把它写成判据:延迟期内容保持率 ≥ 90%。 实测 100% 已达标,不要动它。
- 分开测"演化" —— 若要,必须用一个不破坏保持的形式:
显式的外生变量(
a(t),见 §7.4),而不是改动循环核的动力学。 理由:a(t)加在状态外面,保持通路不受影响。 activity_loss降级为条件性选项 —— 只有在"显式变量也做不到"时才考虑, 且判据必须含 内容保持率不得下降(不只是"准确率下降 <10pp")。
★ 判据(改写后,事先写死)
| 判据 | 阈值 | 现状 |
|---|---|---|
| 延迟期指令可读出率 | ≥ 90% | 100% ✔ 已达成 |
| 末刻指令可读出率 | ≥ 80% | 63.4% ✘ ← 这才是待解决的 |
| 若加内生项:延迟期保持率 | 不得下降 | — |
#7.3 ★★ 缺少顺序输出(阻塞 L3 与算术任务)
现在只有 head(h[:, -1, :]) —— 读最后一步给一个类别。要打字/逐位输出,需要递归解码(每步把上一步输出喂回去)。
这也是 L3"承诺后改写"的前置条件。
#7.4 ★★ 缺少情感状态与记忆
§4 的解耦方案里"内心"部分的核心(情感向量 a(t)、情节记忆、内驱力)完全没有。
设计要点(已定,未实现):
a(t)缓慢变化、有衰减、被事件驱动 → 天然满足"不只是输入的函数"- 情感作为门控调制记忆检索与表达(有脑科学依据:神经调质)
g(a)就是 §7.2 需要的内生输入源,同时提供"主动发起"
#7.5 ★ 能力验证尚未系统化
| 能力 | 状态 |
|---|---|
| 输入可变(L1) | 实现正确、修复后尚未重跑验证 |
| 约束累加(L2) | 未设计 |
| 承诺改写(L3) | 未设计(依赖 §7.3) |
| 翻页动作(3 类离散输出) | 未做。比打字容易(就是三分类) |
| 屏幕环境 | 未做 |
#7.6 其他
- "更小更好"这个结论的边界在哪:units=16 成功,48/128 失败。是容量太大反而难训,还是 lr 需要随容量调整?(16 个配置里 units 与 lr 未交叉穷举)
- 约 12% 种子完全失败:原因未知(初始化?)值得查,因为可能是"训练不稳定"的信号
- 扰动强度校准:需要一个通用的"字内/字间距离比"检查,作为图像类任务的标配门禁