7. 当前未解的问题(按优先级)

2.7k 字 · 源文件 PROJECT.md 第 1453 行起 · goal ruler arch optim ground selfcorrect external

#7.1 ★★★ 多延迟训练能否学会(阻塞一切外推实验)

单延迟能学会(100%),多延迟 8000 迭代仍 50%。但结论未定(lr 锁死缺陷)。

要做的:加 lr 下限重跑,并观察"何时开始学"。

#7.2 ★ 自主动力学 —— 已改写:两个被混为一谈的问题必须分开

本条于第 0 阶段清债时被大幅修正。原文依据 §6.6(未训练网络 + 假零输入 + 对照静默崩溃)—— 那条证据链已作废(见 §6.6、§5 第 22/23/24 条)。

原文(已作废):

零输入下状态冻结(§6.6)。这直接阻塞两个终极目标。 要做的:引入内生动力学源 g(h): 现在: h_new = f(0, h) → 目标: h_new = f(g(h), h) 判据:零输入下有效秩 ≥ 4/16、末段每步变化 > 1e-3,且任务准确率下降 < 10pp。


★ 修正后的事实(exp13_linear_probe,任务相关线性探针,lr=1e-3,3 种子):

时刻指令可读出探针可读出
指令期100.0%48.4%
延迟期初100.0%48.4%
延迟期中100.0%48.4%
延迟期末100.0%48.4%
探针期初92.4%97.7%
最后一步63.4%98.2%

(随机基线 11.1%;三个种子在延迟期全部拿到 100%)

任务的延迟期就是真零输入(match.py:129:x = np.zeros(...),延迟期不写任何东西), cell 收到的是 enc(0) = b_enc。

#★ 结论:两个问题被彻底分开

(1) 「空闲时状态里有没有内容」→ 已达成,100%。 状态在整个延迟期完整携带指令,跨三个种子满分。 "空闲时状态没有内容"这个说法是错的。

(2) 「能不能同时用上两项」→ 真问题。 探针一出现,指令可读出性 100% → 63.4%。这是 §6.13 的同时容量, 与"有没有自主动力学"是两件不同的事。

★ 一个必须保留的区分:「保持」≠「演化」

第 (1) 条证明的是状态稳定保持内容,而不是自行演化。 §7.2 原本想要的"空闲时的过程"仍然没有被证明 —— 但它也没有被证伪, 因为从来没有人正确地测过它。

★ 为什么不再急着上 activity_loss

rotor 的结构半已实现(含谱范数约束、零初始化 gain、精确退化验证), 缺的只是 activity_loss。但现在有了一个具体的新风险: 延迟期末的内容保持率已经是 100%,而这个保持依赖状态的稳定。 activity_loss 的作用正是推动状态去动 —— 两者是张力关系。 强行加它,很可能把 100% 的保持打坏。

(§6.13 自己的探针就说明了这个张力:状态"动"起来之后,指令的可读出性反而掉了。)

★ 现在的正确做法(按顺序)

  1. 先固定"保持"这个已达成的东西 —— 把它写成判据:延迟期内容保持率 ≥ 90%。 实测 100% 已达标,不要动它。

  2. 分开测"演化" —— 若要,必须用一个不破坏保持的形式: 显式的外生变量(a(t),见 §7.4),而不是改动循环核的动力学。 理由:a(t) 加在状态外面,保持通路不受影响。

  3. activity_loss 降级为条件性选项 —— 只有在"显式变量也做不到"时才考虑, 且判据必须含 内容保持率不得下降(不只是"准确率下降 <10pp")。

★ 判据(改写后,事先写死)

判据阈值现状
延迟期指令可读出率≥ 90%100% ✔ 已达成
末刻指令可读出率≥ 80%63.4% ✘ ← 这才是待解决的
若加内生项:延迟期保持率不得下降—

#7.3 ★★ 缺少顺序输出(阻塞 L3 与算术任务)

现在只有 head(h[:, -1, :]) —— 读最后一步给一个类别。要打字/逐位输出,需要递归解码(每步把上一步输出喂回去)。

这也是 L3"承诺后改写"的前置条件。

#7.4 ★★ 缺少情感状态与记忆

§4 的解耦方案里"内心"部分的核心(情感向量 a(t)、情节记忆、内驱力)完全没有。

设计要点(已定,未实现):

  • a(t) 缓慢变化、有衰减、被事件驱动 → 天然满足"不只是输入的函数"
  • 情感作为门控调制记忆检索与表达(有脑科学依据:神经调质)
  • g(a) 就是 §7.2 需要的内生输入源,同时提供"主动发起"

#7.5 ★ 能力验证尚未系统化

能力状态
输入可变(L1)实现正确、修复后尚未重跑验证
约束累加(L2)未设计
承诺改写(L3)未设计(依赖 §7.3)
翻页动作(3 类离散输出)未做。比打字容易(就是三分类)
屏幕环境未做

#7.6 其他

  • "更小更好"这个结论的边界在哪:units=16 成功,48/128 失败。是容量太大反而难训,还是 lr 需要随容量调整?(16 个配置里 units 与 lr 未交叉穷举)
  • 约 12% 种子完全失败:原因未知(初始化?)值得查,因为可能是"训练不稳定"的信号
  • 扰动强度校准:需要一个通用的"字内/字间距离比"检查,作为图像类任务的标配门禁

← 返回《PROJECT.md》目录