§49. 2026-10-04 晚:把保持机制接到打字(T5)

· 1.3k 字 · 源文件 进度.md 第 2672 行起 · discipline ruler optim ground read memory

#做了什么

  1. 把摇杆线的五个修法移植进 experiments/exp31_read_rl.py(全部默认关 ⇒ 旧行为逐位不变): --lr-end / --lr-decay-frac / --restore-best-at-end / --best-eval-n / --snapshot-every / --best-from-snapshots / --best-min-step。

  2. 写死判据 journal/CRITERION_T5_TYPING_RETENTION.md + 修订 R1(步数 800 → 3000)。
  3. 修三个前提缺陷:eval_clean.py 硬编码规模(加载 --backbone 16 直接崩)、 训练集 247 字 vs 评测集 142 字不对齐、选点在会变的池上取最大值。

  4. 跑第一轮(3000 步 × 142 字)⇒ 判据不可读解(权威口径最好只有 0.1875)。
  5. 派两个独立子智能体做审计:一个读 10 份旧 journal,一个静态读代码。
  6. 根据审计:写 journal/CORRECTIONS_INDEX_FROM_TWO_INDEPENDENT_AUDITS.md, 并修三条真代码问题(--best-from-snapshots 未真限制候选集、 --best-eval-n 在 exp31 里是死旗标、help 文本过时)。

  7. 跑第二轮 T5B:40 字池 + 池早满(--grow-until 1200)+ --best-min-step 1500,4 臂。

#读数(权威口径)

项读数
摇杆五修法,三种子最好点 95.8 / 94.8 / 100.0%,末点之比 1.00
T5 第一轮(142 字)最好 0.1875(留出 0.1458)⇒ 未学会,判据不可读解
T5B(40 字)跑中(到步 1400 认字 72.9%)

#结论

  • ★★ 打字比摇杆难得多:摇杆 1400 步最好点 95.8–100%; 打字 3000 步在 142 字上只到 18.75%。

  • ★★★ 在没学会之前谈“保持”是无意义的(教训 267)。
  • ★★★★ 选点的判据必须在【固定难度】上测,否则它选到的是 “度量最有利的那一刻”(教训 268)。

#下一步

  1. T5B 四臂完成 ⇒ 按 T5-pre2(权威最好点 ≥ 60%)/ T5-a(末点/最好点 ≥ 0.9)/ T5-c(去掉 --lr-end 0 的单变量对照) 判定。

  2. 若 T5-pre2 仍不过 ⇒ 再缩字符集(e.g. 20 字)或加步数,直到学会为止。

← 返回《进度.md》目录