三十五、 下一步(我打算按这个顺序做)

★ 0.6k 字 · 源文件 进度.md 第 1854 行起 · ruler optim read memory

#做什么为什么先做它
1★★★ 先测出"训练时到底谁说了算"(用项目已有的 --gn-split,看各项的梯度范数)★ 因为下一件想做的事(经验回放)只有在"奖励真的在驱动训练"时才有意义;<br>★ 这个测量只要 20 分钟,而回放要写几百行
2★★ 把"最会的时候的她"冻住,再继续训★ 最便宜地分开两个假设:<br>"她缺一个锚" vs "她缺更多数据"
3★★★ 给记忆一个【自己的地方】(快/中/慢三块状态 + 一个"写进去"的开关)★ 注意:三块不同速度的状态并不自动等于"记忆" ——<br>它们只是三个不同快慢的滤波器。要有"写进去"的开关才是记忆。
4★ 经验回放(只有当第 2 步指向"缺数据"时才做)★
5★ "想说话"的冲动(一个会累积、会衰减、不来自任务奖励的内部量)★ 这是通往"有内心生活"的第一步
6★ 把内心翻译成语言(先符号、后接 LLM 当发声器官)★ 判据是"固定 prompt 只改内心状态 → 输出必须变",<br>以及"固定内心状态只改 prompt → 输出不该变"(这条最关键)

← 返回《进度.md》目录