九、最新(10-01 晚):那个基础 bug 修好了
0.4k 字 ·
源文件 进度.md 第 178 行起 ·
discipline ruler optim external
修了什么:她的"嘴"(策略头)原来初始权重全是 0, 所以从"嘴"回传的梯度也是 0 —— 她的"心"从来没因为"嘴"而改变过。
现在的状态:
| 项 | 结果 |
|---|---|
| 加了一个开关 | ✅ 默认还是旧行为 -> 旧的实验仍然可复现 |
| 打开它之后 | ★ "嘴"的梯度第一次能回到"心" |
| 实测量级 | 1.32(而一直在训"心"的"价值判断"是 1.12 —— 同一量级) |
| 她的初始行为 | ★ 一字未变("一开始不太说话"的设计保留) |
→ 下一步:跑一次对照(旧的 vs 新的),看她"串起来"的能力(现在 43%)会不会上去。 这是"她能不能把心里的话说出来"的第一个直接检验。