关于架构选择

0.4k 字 · 源文件 评审综述.md 第 278 行起 · goal arch read

  1. "有状态递推 + 逐刻在线"这个选择,在需求(一、1.3)下有没有替代方案? 特别是:有没有无状态(含 Transformer/SSM)方案能满足"她一直醒着"与"可打断"?

  2. 判断 6(连续时间没被利用)对不对? 如果对,CfC 相对 GRU 的实际收益是什么? 我们该不该为了"内部独白可以想得快/想得慢"而保留连续时间?

  3. 判断 8 那个冲突(在场 vs 离线巩固):有没有不需要离线阶段的巩固机制?
  4. 如果"语言必须长在架构自己身上"(最硬的需求),那么它的可行边界在哪? 我们现在是"82 维动作空间里打字",实测认字 100% 但整串 43%。 一个 9.3M 参数、逐刻离散动作的模型,能承载多少自然语言? 请给判断与依据。

← 返回《评审综述.md》目录