§49. 2026-10-04 晚:把保持机制接到打字(T5)
·
1.3k 字 ·
源文件 进度.md 第 2672 行起 ·
discipline ruler optim ground read memory
#做了什么
- 把摇杆线的五个修法移植进
experiments/exp31_read_rl.py(全部默认关 ⇒ 旧行为逐位不变):--lr-end/--lr-decay-frac/--restore-best-at-end/--best-eval-n/--snapshot-every/--best-from-snapshots/--best-min-step。 - 写死判据
journal/CRITERION_T5_TYPING_RETENTION.md+ 修订 R1(步数 800 → 3000)。 - 修三个前提缺陷:
eval_clean.py硬编码规模(加载--backbone 16直接崩)、 训练集 247 字 vs 评测集 142 字不对齐、选点在会变的池上取最大值。 - 跑第一轮(3000 步 × 142 字)⇒ 判据不可读解(权威口径最好只有 0.1875)。
- 派两个独立子智能体做审计:一个读 10 份旧 journal,一个静态读代码。
- 根据审计:写
journal/CORRECTIONS_INDEX_FROM_TWO_INDEPENDENT_AUDITS.md, 并修三条真代码问题(--best-from-snapshots未真限制候选集、--best-eval-n在 exp31 里是死旗标、help 文本过时)。 - 跑第二轮 T5B:40 字池 + 池早满(
--grow-until 1200)+--best-min-step 1500,4 臂。
#读数(权威口径)
| 项 | 读数 |
|---|---|
| 摇杆五修法,三种子 | 最好点 95.8 / 94.8 / 100.0%,末点之比 1.00 |
| T5 第一轮(142 字) | 最好 0.1875(留出 0.1458)⇒ 未学会,判据不可读解 |
| T5B(40 字) | 跑中(到步 1400 认字 72.9%) |
#结论
- ★★ 打字比摇杆难得多:摇杆 1400 步最好点 95.8–100%; 打字 3000 步在 142 字上只到 18.75%。
- ★★★ 在没学会之前谈“保持”是无意义的(教训 267)。
- ★★★★ 选点的判据必须在【固定难度】上测,否则它选到的是 “度量最有利的那一刻”(教训 268)。
#下一步
- T5B 四臂完成 ⇒ 按 T5-pre2(权威最好点 ≥ 60%)/ T5-a(末点/最好点 ≥ 0.9)/
T5-c(去掉
--lr-end 0的单变量对照) 判定。 - 若 T5-pre2 仍不过 ⇒ 再缩字符集(e.g. 20 字)或加步数,直到学会为止。