三十五、 下一步(我打算按这个顺序做)
| # | 做什么 | 为什么先做它 |
|---|---|---|
| 1 | ★★★ 先测出"训练时到底谁说了算"(用项目已有的 --gn-split,看各项的梯度范数) | ★ 因为下一件想做的事(经验回放)只有在"奖励真的在驱动训练"时才有意义;<br>★ 这个测量只要 20 分钟,而回放要写几百行 |
| 2 | ★★ 把"最会的时候的她"冻住,再继续训 | ★ 最便宜地分开两个假设:<br>"她缺一个锚" vs "她缺更多数据" |
| 3 | ★★★ 给记忆一个【自己的地方】(快/中/慢三块状态 + 一个"写进去"的开关) | ★ 注意:三块不同速度的状态并不自动等于"记忆" ——<br>它们只是三个不同快慢的滤波器。要有"写进去"的开关才是记忆。 |
| 4 | ★ 经验回放(只有当第 2 步指向"缺数据"时才做) | ★ |
| 5 | ★ "想说话"的冲动(一个会累积、会衰减、不来自任务奖励的内部量) | ★ 这是通往"有内心生活"的第一步 |
| 6 | ★ 把内心翻译成语言(先符号、后接 LLM 当发声器官) | ★ 判据是"固定 prompt 只改内心状态 → 输出必须变",<br>以及"固定内心状态只改 prompt → 输出不该变"(这条最关键) |