1. 为什么不是 Transformer:两个结构差异
这不是"性能更好"的论证,是结构能力的论证。
| Transformer | 我们 | |
|---|---|---|
| 处理"说了一半被打断" | 必须把整个对话历史重新构造成交错序列再重算 | 原生:输入是一条连续流,打断只是流中的新输入 |
| 空闲时还有过程吗 | ❌ 没有调用就没有过程(context 是外部的) | ✅ 时间刻持续推进,状态在演化 |
| 状态在哪 | 在 context 里,外部显式 | 在内部状态里,持续存在 |
| 被新输入调制 | 只能通过重新前向传播 | 每个时间刻都在被调制 |
关键区分:Transformer 的 context ≠ 内部状态。 前者是外部输入的一部分,后者是系统自身的动力学。所有下游能力都源于这个差别。
注意:这是"能做 vs 不能做",不是"做得更好 vs 更差"。所以我们的实验判据应该是能力的有无,而不是准确率的小数点。