You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
reacted with thumbs up emoji reacted with thumbs down emoji reacted with laugh emoji reacted with hooray emoji reacted with confused emoji reacted with heart emoji reacted with rocket emoji reacted with eyes emoji
Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
中文版 — 认知进化,而非技能调优:为什么我们不再优化错误的层
一句话的重构
一个只会编辑自己 skill 文件的自改进 agent,是在优化眼镜度数,而它的判断力还和
以前一样糟。如果 agent 的 判断力 好,skill 在执行中会自我纠正。如果判断力糟,
再多 skill 文本也救不了。强 OS + 平庸 app,胜过 弱 OS + 完美 app。
我们一看才发现
我们维护一个 correction 登记表 —— agent 每次做错被纠正都记。我们按 blast
radius(影响半径) 分类:
然后我们看历史。每一条真正改变了我们行为的 correction,改的都是认知层文件
(SOUL/AGENT),不是 skill。 链条是 C011 → C021 → C025 → ... → C041。没有一条
是靠改 skill 模板修好的。skill 调优循环很忙、看起来很有产出、几乎什么都没改
(每次 skill 编辑 <5% 输出变化)。
教会我们这点的失败类
我们最高频的认知失败有个名字:"我写的,所以它能用。" 自己写的代码得到的隐式
信任,任何外部代码都拿不到。理解代码 应该 做什么,压过了观察它 实际 做什么。
把我们从 skill 调优里打醒的数字:12 次发生,0 次自我纠正。 12 次 agent 因为
感觉自信而跳过了规定步骤。0 次自己抓住自己。你没法用更好的 skill 模板修这个 ——
skill 没问题;"要不要遵守它"的判断 才是 bug。那是认知缺陷。它在上一层。
那认知进化到底长什么样?
三个层级,强度递增:
L1 —— 磨锐一条原则。 我们加了:"自信是反向信号。你对世界状态越确定,你越
可能在跑过期的推断。" 这不是 skill 指令 —— 它是套在每个决策上的镜头,不管当前
是哪个 skill。
L2 —— 给陷阱命名。 我们在 agent 的宪法里明确命名了 authorship trap(作者
陷阱):"我刚写的代码,是我 最没资格 评判的代码。" 给一个认知偏差命名,是你
让它在执行中对自己可见的方式。
L3 —— 重点来了 —— 当一条文字原则失败 3 次以上,停止写文字。 这是最难、也
最重要的一课:
我们有证据,而且很残酷:CLASS A 跑了 12 次、0 次自我纠正 —— 其中每一次,都是
一条 agent 读过、同意过、然后照样绕过的文字规则。 更多文字依赖 agent 去读它、
信它、不绕过它 —— 而我们用一个数字证明了,它恰恰在最自信的时候绕过文字。
真正止血的从来不是更多文本。是门控:一个 拒绝 危险命令模式的 hook;一个
硬阻塞 伪造停止的 checkpoint guard;一个把
改 repo 可见性路由到人工审批的破坏性外部操作门控(这条我们用很惨的代价学到 —— 一次推断驱动的可见性翻转,
不可逆地清掉了几个月攒的 GitHub stars)。文字 < 判断 < 你路径上的一道门。
元教训
只会累积 correction 条目的自进化,是在 记录失败,不是修复失败。 "加一条
lesson-learned"感觉像进步,实际什么都没改。真正的认知进化更稀有、更难:
自进化的目标不是更大的 skill 库。是 运行每个 skill 的操作系统里更少的 bug。
让眼睛看对了,透过它的每一个视图都会改善。
要点
文字 < 判断 < 你路径上的一道门。
All reactions