概述
0.8k 字 ·
源文件 PROJECT.md 第 1 行起 ·
discipline ground read memory selfcorrect
#Darlin · 项目纲领
★★★ 2026-09-27 至 09-30 的三天自主工作期,结论全部在
journal/。 入口顺序:journal/SUMMARY.md(总览)->journal/DIARY.md(逐日结论) ->journal/TASKS.md(执行情况)-> 需要复现时下钻journal/EXPERIMENTS.md与journal/AUDIT.md。那三天的头号成果:解决了「接地的 RL 一放开教师就崩」这个卡了很久的问题。 根因是「熵的定义写错了」(
journal/ENTROPY_BUG.md)——mix模式把log_std当成了熵,使它在损失里出现两次、符号相反, 于是探索幅度被两个项反向拉扯 -> 逐刻行为漂移 -> 策略崩。 必要条件之外的稳定性由「能力门控」提供(A83/3 vs 门控关A91/3)。★ 而找到它的过程本身也值得读:我先后提了 6 个假设, 每一个都被数据否证过(见
journal/SUMMARY.md的「根因链」), 而且我两次在只看到 1 个种子时就下了结论、又自己推翻 (见journal/ERROR_VARIANCE_ASYMMETRY.md—— 方差是不对称的:「崩了」可以下结论,「过了」不能)。
一个基于持续内部状态的智能体架构。 不是 Transformer,不是更大的模型。目标形态是有内心生活的角色。
本文件是项目的唯一权威定义。所有结论都标注了验证状态。