22. 现在的瓶颈与下一步(含对其他 AI 路线的评估)

★★★★★ 1.6k 字 · 源文件 PROJECT.md 第 4658 行起 · ruler optim external

#22.1 ★★★ 瓶颈判断

★★★ 不是"缺信息",而是【缺一个把学到的东西保存下来的机制】。

★ 支持的证据:三条线里两条在最好点达到地板的 40–80 倍,然后回到地板; 唯一守住的那条(A)没有撤任何支架,而且它的监督项【持续存在】。

#22.2 ★★ 对"三阶段:内心 → 驱动 → 翻译成语言"路线的评估

★ 方向同意(先内心、后语言;T/F 判据尤其 F 是关键;LLM 不能当评价者)。 ★ 三处修正(详见 journal/REVIEW_OF_THREE_STAGE_ROADMAP.md):

#修正
一 ★★★★ 它建议先建"多时间尺度状态 + 经验回放",但没提"奖励项在更新里占多少"这个尚未测的量。<br>回放改变的是【采样分布】,而当前更新量是否由奖励项决定【还没测】。<br>★ 正确第一步:先用 --gn-split 测出各损失项的梯度范数份额。
二 ★★★ ts 不是"不需要调到 50",而是真实权衡(见 §21.2)。<br>★ -> 所以"三块不同时间尺度"这个想法恰好是对的,而且现在有了它的动机。
三 ★★★★ "慢"不等于"记忆":三块独立 CfC 各自只看到自己的输入时,<br>得到的是【滤波器组】,不是【记忆】。<br>★ 要得到记忆必须有【写入门】(h_fast 能把具体内容写进 h_mid,且有选择地写)——<br>这才是"记忆没有自己的地方"那个结构问题的解法。

#22.3 ★★ 下一个实验(按成本排序,全部跑前写死判据)

#做什么判据成本
1★★★ 用 --gn-split 测三个 β 下各损失项的梯度范数份额★ 得到"谁在主导训练"的数字;<br>若 share_pi 在 β=0.4 时极小 → 回放的前提不成立约 20 分钟(tools/measure_gn_share.py 已就绪)
2★★ 把 B 的最好点【冻住】并继续训★ 若不再退化 → "缺锚"成立,而锚可以来自【参数冻结】而不是经验回放约 15 分钟
3★★★ 三块状态 + 【写入门】★ 三块各自达标;h_slow 不为常数;三块互不挤中等
4★ 回放缓冲(仅当第 2 步指向"缺数据")★ B 臂末点不塌回 0%中等
5★ 表达驱动 + 自发输出★ 与外部奖励的相关性不显著;<br>关掉驱动后自发动作消失中等
6★ 符号到符号翻译 → 接 LLM★ T 过、F 不过(F 是关键)大

#22.4 ★ 第 129 条教训(本会话最值得留的一条)

★★★★★ "撤掉某个输入后结果没变"有两种完全不同的原因: 那个输入【不重要】,或者那个输入【本来就没进来】。

★★ 可复用的做法:做"撤掉 X"的实验之前,先核对【X 在正常情况下的贡献量级】; 而在用自己的推理替代项目已有工具之前,先搜一遍项目里有没有为这个问题写好的东西。

★ 错不在测量方法,而在【没有先看项目已经怎么解决过它】。


← 返回《PROJECT.md》目录