导航:如果你只读一段,读这一段(截至 2026-10-03)
★★ 本文件是【逆序历史文档】(最新的节在最后,第 21/22 节)。 下面这一段是"现在该信什么"的摘要;细节与逐次现场在末尾的 §21/§22。
#A. 现在能下的结论
| # | 结论 | 证据强度 |
|---|---|---|
| 1 | ★★★ 她的记忆时间常数是 2.0 刻 | ★★ time_constants() 实测 10.0 ms = 2.00 刻;<br>一个回合 48 刻 → 覆盖 4.2% |
| 2 | ★★★ 她能学到 4 条指令;而她末点通常只剩 0–2 条 | ★★★ C_SC_nobar_best 四条全非零:上=100% 左=62% 右=79% 下=100%(85.4% / 0.96 格);<br>另有三个臂的最好点各 3 条<br>⇒ ★ 必须把【能力】与【末点保持】分开问 |
| 3 | ★★★ 她在【没有老师】的条件下有时能守住 —— 但不是必然 | ★★★ 三种子:seed 0 守住 44.8%、seed 2 守住 25.0%、<br>seed 1 崩到 0.0% ⇒ "守住"是一个【2/3 的概率】,不是一个是/否的事实<br>(随机地板 5.6%;详见 journal/RESULT_T3_MULTISEED_FINAL_2_OF_3_HELD.md) |
#B. ⚠️ 被修正或推翻的旧结论(请以本段为准)
| 旧结论在哪 | 旧说法 | ★ 现在 |
|---|---|---|
| ★ 上面的 A-1(本文件早先版本) | ★★★ "她学得会,但留不住" | ★★★ 已【部分更正】:修好两个测量缺陷后,<br>无老师条件下三种子里两种守住(44.8% / 25.0%)、一种崩到 0.0%<br>⇒ "她留不住"应改为"她【有时】留得住,而那个概率此前从未被测"<br>⚠️ 但"是尺子还是奖励幅度救了它"仍分不开(两处同时改了) |
★ §21 里的"两副顺序:第二步永远 0%" | ★ 推翻 | ★★ 三个 ts 臂都非零;ts=50 条件率 48.4%(机率线 25%) |
★★ §21.5 的"完美朝目标策略 200 回合到位 0 次" | ★★★ 推翻(是我的控制器有缺陷) | ★★★ 修正后是 100.0%:它把"命令摇杆 0"当成"停下",<br>而方块会停在离目标 21.44 px 处 |
| §19 / §20 | ★ "到达率 0% ⇒ 没学会" | ★★ 修正:末点 0% 与"学不会"是两件事 |
| 本会话中途 | ★ "RL 项比监督项小两个数量级"(依据:损失值) | ★★ 依据不成立:该看梯度范数。<br>实测:β=0.4 时奖励项占 50.2%、监督项占 49.8% → 方向相反 |
| 早期章节 | ★ "容量不足"作为瓶颈候选 | ★★ 已排除 |
#C. ★★★ 现在的瓶颈判断(第 3 次改口,以本段为准)
★★★ 瓶颈不是"缺一个保存机制",也不是"她只能学到两条指令" —— 而是【把能力保持到末点】:她【能学到 4 条】(最好点四臂都到 3 条、一个到 4 条), 而末点通常只剩 0–2 条。
★★★ 证据(
F2_B三种子,完全同配置):
种子 末点到位率 末点格距 末点学到的指令数 0 44.8% 1.90 2(左 100% / 下 79%) 1 ★ 0.0% 2.69 0 2 25.0% 2.69 1(左 100%) ★★★ -> 末点的"条数"是【会变的】(2/0/1)—— 而"能力上限是两条"这个说法【是错的】:上一个目标四个臂的【最好点】全部到 3 条, 其中一个到 4 条(
C_SC_nobar_best:上 100% 左 62% 右 79% 下 100%)。 详见journal/CORRECTION_SHE_LEARNED_THREE_AND_FOUR_COMMANDS.md。★★★ 而"记忆太短"(2.0 刻)是真实的,但它在【这个任务】上不是约束: 接地任务是"看到字 → 开到那个角",中间没有延迟期。
★ 触发条件写在
journal/DECISION_ON_MEMORY_ARCHITECTURE.md: 在【一个明确有延迟期的任务】上测到她保持率明显偏低之前,不动记忆架构。★★★ 而这一段的教训是:我在本目标里【连续三次】改了瓶颈判断 ("留不住" → "缺保存机制" → "只学两条" → "稳定性"), 每一次的依据都比上一次多一个种子。所以"瓶颈判断"本身是需要样本量才敢下的结论。
#C2. ★★★★★ 第 4 次改口(以本段为准):"她在解之间漂移",而"干扰假设"被反向否证
★★★ 失败模式不是"崩掉"而是【在解之间漂移】(
RESULT_ENDGAME_DIAGNOSIS_DRIFT_BETWEEN_SOLUTIONS.md):REL_s8步 1100–1200 是「左=100%」,步 1400 变成「左=50%」;REL_s6从「下=67%」换成「左=50% 下=25%」。 而ent全程稳定 −0.24 ⇒ 不是策略崩溃,是行为在指令间重新分配。 回退起点全在β ≤ 0.4(老师基本退出之后)。★★★★★ 而"四条指令互相干扰"这个直觉假设【被反向否证】:
组 最好点条数 n Fisher「至少 1 条」 4 指令 3,1,3,1,1 5 5/5 2 指令 0,0,0,0,0,0 6 ★★ 0/6,p = 0.002 ★★★ -> 把指令从 4 条减到 2 条让她【明显更难学到任何东西】—— 而干扰假设预测的是相反方向。 详见
journal/RESULT_INTERFERENCE_HYPOTHESIS_REFUTED_IN_REVERSE.md。★★ 两个候选机制:(a)指令数是辅助信号而非干扰源(2 条时示范分布多样性减半); (b)她需要更多机会碰到一个"能学会的角落"(与"逐指令会在解之间换"吻合)。 区分它们只需一个实验:训练 4 条但评估只看那 2 条。
★★★★★ 2026-10-03 夜追加(并集分析)—— 并更正一句我写错过的话:
跑次 上 左 右 下 ★ 活着 REL_s4100% 79% 62% 0% 3 REL_s50% 100% 0% 0% 1 REL_s6100% 100% 0% 100% 3 REL_s70% 62% 0% 25% 2 REL_s8100% 0% 0% 0% 1 ★ 并集覆盖 4/4 · 从未被学会的指令:无 · 单次最多活着 3 条 · 同时全会 4 条:0 ★ 各指令两两 Fisher 全部 p ≥ 0.206(难度无显著差异)
⚠️ 而我说过"上限在【同时】上" —— 这句话【已更正】:
最多活 3 条是 n=5 的【观测最大值】,不是有界性的证据; 而"读出竞争"只是【未经检验的推断】,且与"2 指令 0/6 vs 4 指令 5/5"方向相反。 →journal/CORRECTION_MAX_3_IS_NOT_A_LIMIT_AND_READOUT_WAS_AN_INFERENCE.md(教训 173)★★★ 收窄后可辩护的说法:一次训练通常只建出【部分解】(1–3 条), 而末段的大更新把已经建出的部分解再走掉一部分。 ★★★ 而"两条硬证据"里的第一条【已被我自己更正】—— 以下是更正后的版本: ①
末段参数更新是【最大】的一段→ ★★ 末段是【较大】的一段(1200→1400 相对变化 37–50%), 但不是唯一最大:REL_s8的400→600是 56.8,比它的1200→1400(47.5)更大。 →journal/CORRECTION_NEVER_LEARNED_DOMINATES_AND_LATE_IS_NOT_THE_MAX.md(教训 175) ② ★★★ 新的、更强的证据:沿快照追踪diag = 1 − mean(四条指令下平均摇杆向量的两两余弦)(0 = 四条指令同一个动作)发现它【会升上去再崩掉】:REL_s7步 1200 = 1.301(完全条件化)→ 步 1400 = 0.002;REL_s8步 1000 = 1.229 → 步 1400 = 0.079。 ⇒ 绑定会建立,然后在最后 200–400 步崩塌。 →journal/RETRACTION_BINDING_DOES_FORM_THEN_COLLAPSES.md(教训 183–184)★★★ 判据 V1(分辨"主干移动"与"读出撑不住"):
FREEZE-TRUNK—— 冻住整个 LNN 主干只训读出;对照GN2-PROBE(同起点同步数,主干不冻)。 冻住后漂移停止 ⇒ 病因在主干;两者都漂 ⇒ 病因在读出。 ★ 用它而不是直接改读出,因为改读出属于循环核模块而NOT_DOING里有"换循环核"。
#C3. ★★★★★★ 一个必须记住的测量陷阱(付过代价,两次)
★★★★★ "到达"有两把【不同的尺子】,而它们的差值会伪装成"数据矛盾":
尺子 定义 6.12px 时 ★ 到达判定 欧氏 dist_px <= arrive_px(12.0)到达 ★★ 环境自报 _dist_cells()曼哈顿"格"距离( CELL_H = 14.4px)★ 0 格("在目标格里") ★★★ -> 所以"她在目标格里"与"她到达了"不是同一件事。 我在
journal/RETRACTION_ARRIVAL_GAP_WAS_MY_OWN_BUG.md里因为这两把尺子 自造过一次"数据矛盾",并差点把它解释成一个机制。★★★ 复评工具现在会打印【它实际使用的判定条件】(
arrive_px/arrive_bonus/ts/train_cmds), 并把两把尺子并排显示(mean-dist欧氏 vscell-dist曼哈顿)。
#D. ★★★★ 一个必须记住的设计缺口(付过代价)
★★★ "中途撤掉 X"与"从来没有 X"是两个不同的实验。
★ 四臂的进度条都是"第 600 步才关",所以每一臂都先享受了 600 步的密集信号 → "撤掉密集信号后能不能学会"这个问题,四臂里一条也没测到, 而报告里却把它叫做"支架撤除实验"。
★★
F2_E(--shaping-off-at 0+β→0.0)就是补这个缺口的那一条。
#D. 三条最有价值的可复用做法(都付过现场代价)
| 规矩 | 现场代价 |
|---|---|
| ★★★ 日志给曲线,检查点给结论 | ★ 同一跑次最好点 35.9% / 末点 0.0% |
| ★★★ 不用末点(也不用中途点)下能力结论 | ★ 我曾在步 700 判断"B 更差",300 步后反转 |
| ★★ 多臂对比必须用【固定种子】复评 | ★ 每个跑次在自己的随机流上评估,日志不能直接比 |
★ 完整的 129 条教训在 journal/(每份都有现场与出处)。
架构名
Darlin—— 它描述的是立场,不是机制:它对着你说话, 并且在你不在的时候仍然在场。(不带撇号:撇号在包名、路径、shell 引用里会到处咬人,而口语里掉的那个 g 是发音的事,不是拼写的事。)角色相关的同人内容放在
characters/,与架构分离 —— 见NOTICE与characters/README.md。