导航:如果你只读一段,读这一段(截至 2026-10-03)

· ★★★ 5.8k 字 · 源文件 PROJECT.md 第 27 行起 · ground memory

★★ 本文件是【逆序历史文档】(最新的节在最后,第 21/22 节)。 下面这一段是"现在该信什么"的摘要;细节与逐次现场在末尾的 §21/§22。

#A. 现在能下的结论

#结论证据强度
1★★★ 她的记忆时间常数是 2.0 刻★★ time_constants() 实测 10.0 ms = 2.00 刻;<br>一个回合 48 刻 → 覆盖 4.2%
2★★★ 她能学到 4 条指令;而她末点通常只剩 0–2 条★★★ C_SC_nobar_best 四条全非零:上=100% 左=62% 右=79% 下=100%(85.4% / 0.96 格);<br>另有三个臂的最好点各 3 条<br>⇒ ★ 必须把【能力】与【末点保持】分开问
3★★★ 她在【没有老师】的条件下有时能守住 —— 但不是必然★★★ 三种子:seed 0 守住 44.8%、seed 2 守住 25.0%、<br>seed 1 崩到 0.0% ⇒ "守住"是一个【2/3 的概率】,不是一个是/否的事实<br>(随机地板 5.6%;详见 journal/RESULT_T3_MULTISEED_FINAL_2_OF_3_HELD.md)

#B. ⚠️ 被修正或推翻的旧结论(请以本段为准)

旧结论在哪旧说法★ 现在
★ 上面的 A-1(本文件早先版本)★★★ "她学得会,但留不住"★★★ 已【部分更正】:修好两个测量缺陷后,<br>无老师条件下三种子里两种守住(44.8% / 25.0%)、一种崩到 0.0%<br>⇒ "她留不住"应改为"她【有时】留得住,而那个概率此前从未被测"<br>⚠️ 但"是尺子还是奖励幅度救了它"仍分不开(两处同时改了)
★ §21 里的"两副顺序:第二步永远 0%"★ 推翻★★ 三个 ts 臂都非零;ts=50 条件率 48.4%(机率线 25%)
★★ §21.5 的"完美朝目标策略 200 回合到位 0 次"★★★ 推翻(是我的控制器有缺陷)★★★ 修正后是 100.0%:它把"命令摇杆 0"当成"停下",<br>而方块会停在离目标 21.44 px 处
§19 / §20★ "到达率 0% ⇒ 没学会"★★ 修正:末点 0% 与"学不会"是两件事
本会话中途★ "RL 项比监督项小两个数量级"(依据:损失值)★★ 依据不成立:该看梯度范数。<br>实测:β=0.4 时奖励项占 50.2%、监督项占 49.8% → 方向相反
早期章节★ "容量不足"作为瓶颈候选★★ 已排除

#C. ★★★ 现在的瓶颈判断(第 3 次改口,以本段为准)

★★★ 瓶颈不是"缺一个保存机制",也不是"她只能学到两条指令" —— 而是【把能力保持到末点】:她【能学到 4 条】(最好点四臂都到 3 条、一个到 4 条), 而末点通常只剩 0–2 条。

★★★ 证据(F2_B 三种子,完全同配置):

种子末点到位率末点格距末点学到的指令数
044.8%1.902(左 100% / 下 79%)
1★ 0.0%2.690
225.0%2.691(左 100%)

★★★ -> 末点的"条数"是【会变的】(2/0/1)—— 而"能力上限是两条"这个说法【是错的】:上一个目标四个臂的【最好点】全部到 3 条, 其中一个到 4 条(C_SC_nobar_best:上 100% 左 62% 右 79% 下 100%)。 详见 journal/CORRECTION_SHE_LEARNED_THREE_AND_FOUR_COMMANDS.md。

★★★ 而"记忆太短"(2.0 刻)是真实的,但它在【这个任务】上不是约束: 接地任务是"看到字 → 开到那个角",中间没有延迟期。

★ 触发条件写在 journal/DECISION_ON_MEMORY_ARCHITECTURE.md: 在【一个明确有延迟期的任务】上测到她保持率明显偏低之前,不动记忆架构。

★★★ 而这一段的教训是:我在本目标里【连续三次】改了瓶颈判断 ("留不住" → "缺保存机制" → "只学两条" → "稳定性"), 每一次的依据都比上一次多一个种子。所以"瓶颈判断"本身是需要样本量才敢下的结论。

#C2. ★★★★★ 第 4 次改口(以本段为准):"她在解之间漂移",而"干扰假设"被反向否证

★★★ 失败模式不是"崩掉"而是【在解之间漂移】(RESULT_ENDGAME_DIAGNOSIS_DRIFT_BETWEEN_SOLUTIONS.md): REL_s8 步 1100–1200 是「左=100%」,步 1400 变成「左=50%」; REL_s6 从「下=67%」换成「左=50% 下=25%」。 而 ent 全程稳定 −0.24 ⇒ 不是策略崩溃,是行为在指令间重新分配。 回退起点全在 β ≤ 0.4(老师基本退出之后)。

★★★★★ 而"四条指令互相干扰"这个直觉假设【被反向否证】:

组最好点条数nFisher「至少 1 条」
4 指令3,1,3,1,155/5
2 指令0,0,0,0,0,06★★ 0/6,p = 0.002

★★★ -> 把指令从 4 条减到 2 条让她【明显更难学到任何东西】—— 而干扰假设预测的是相反方向。 详见 journal/RESULT_INTERFERENCE_HYPOTHESIS_REFUTED_IN_REVERSE.md。

★★ 两个候选机制:(a)指令数是辅助信号而非干扰源(2 条时示范分布多样性减半); (b)她需要更多机会碰到一个"能学会的角落"(与"逐指令会在解之间换"吻合)。 区分它们只需一个实验:训练 4 条但评估只看那 2 条。


★★★★★ 2026-10-03 夜追加(并集分析)—— 并更正一句我写错过的话:

跑次上左右下★ 活着
REL_s4100%79%62%0%3
REL_s50%100%0%0%1
REL_s6100%100%0%100%3
REL_s70%62%0%25%2
REL_s8100%0%0%0%1

★ 并集覆盖 4/4 · 从未被学会的指令:无 · 单次最多活着 3 条 · 同时全会 4 条:0 ★ 各指令两两 Fisher 全部 p ≥ 0.206(难度无显著差异)

⚠️ 而我说过"上限在【同时】上" —— 这句话【已更正】: 最多活 3 条 是 n=5 的【观测最大值】,不是有界性的证据; 而"读出竞争"只是【未经检验的推断】,且与"2 指令 0/6 vs 4 指令 5/5"方向相反。 → journal/CORRECTION_MAX_3_IS_NOT_A_LIMIT_AND_READOUT_WAS_AN_INFERENCE.md(教训 173)

★★★ 收窄后可辩护的说法:一次训练通常只建出【部分解】(1–3 条), 而末段的大更新把已经建出的部分解再走掉一部分。 ★★★ 而"两条硬证据"里的第一条【已被我自己更正】—— 以下是更正后的版本: ① 末段参数更新是【最大】的一段 → ★★ 末段是【较大】的一段(1200→1400 相对变化 37–50%), 但不是唯一最大:REL_s8 的 400→600 是 56.8,比它的 1200→1400(47.5)更大。 → journal/CORRECTION_NEVER_LEARNED_DOMINATES_AND_LATE_IS_NOT_THE_MAX.md(教训 175) ② ★★★ 新的、更强的证据:沿快照追踪 diag = 1 − mean(四条指令下平均摇杆向量的两两余弦) (0 = 四条指令同一个动作)发现它【会升上去再崩掉】: REL_s7 步 1200 = 1.301(完全条件化)→ 步 1400 = 0.002; REL_s8 步 1000 = 1.229 → 步 1400 = 0.079。 ⇒ 绑定会建立,然后在最后 200–400 步崩塌。 → journal/RETRACTION_BINDING_DOES_FORM_THEN_COLLAPSES.md(教训 183–184)

★★★ 判据 V1(分辨"主干移动"与"读出撑不住"):FREEZE-TRUNK —— 冻住整个 LNN 主干只训读出;对照 GN2-PROBE(同起点同步数,主干不冻)。 冻住后漂移停止 ⇒ 病因在主干;两者都漂 ⇒ 病因在读出。 ★ 用它而不是直接改读出,因为改读出属于循环核模块而 NOT_DOING 里有"换循环核"。

#C3. ★★★★★★ 一个必须记住的测量陷阱(付过代价,两次)

★★★★★ "到达"有两把【不同的尺子】,而它们的差值会伪装成"数据矛盾":

尺子定义6.12px 时
★ 到达判定欧氏 dist_px <= arrive_px(12.0)到达
★★ 环境自报 _dist_cells()曼哈顿"格"距离(CELL_H = 14.4px)★ 0 格("在目标格里")

★★★ -> 所以"她在目标格里"与"她到达了"不是同一件事。 我在 journal/RETRACTION_ARRIVAL_GAP_WAS_MY_OWN_BUG.md 里因为这两把尺子 自造过一次"数据矛盾",并差点把它解释成一个机制。

★★★ 复评工具现在会打印【它实际使用的判定条件】(arrive_px/arrive_bonus/ts/train_cmds), 并把两把尺子并排显示(mean-dist 欧氏 vs cell-dist 曼哈顿)。

#D. ★★★★ 一个必须记住的设计缺口(付过代价)

★★★ "中途撤掉 X"与"从来没有 X"是两个不同的实验。

★ 四臂的进度条都是"第 600 步才关",所以每一臂都先享受了 600 步的密集信号 → "撤掉密集信号后能不能学会"这个问题,四臂里一条也没测到, 而报告里却把它叫做"支架撤除实验"。

★★ F2_E(--shaping-off-at 0 + β→0.0)就是补这个缺口的那一条。

#D. 三条最有价值的可复用做法(都付过现场代价)

规矩现场代价
★★★ 日志给曲线,检查点给结论★ 同一跑次最好点 35.9% / 末点 0.0%
★★★ 不用末点(也不用中途点)下能力结论★ 我曾在步 700 判断"B 更差",300 步后反转
★★ 多臂对比必须用【固定种子】复评★ 每个跑次在自己的随机流上评估,日志不能直接比

★ 完整的 129 条教训在 journal/(每份都有现场与出处)。

架构名 Darlin —— 它描述的是立场,不是机制:它对着你说话, 并且在你不在的时候仍然在场。(不带撇号:撇号在包名、路径、shell 引用里会到处咬人,而口语里掉的那个 g 是发音的事,不是拼写的事。)

角色相关的同人内容放在 characters/,与架构分离 —— 见 NOTICE 与 characters/README.md。


← 返回《PROJECT.md》目录