场景 1 · 假及格,真翻车 9.1 重点
结果通过不代表过程正确,评价要看两层
起点是「评价」而不是「总结」—— 错误的评价一旦进长期知识,会跨任务放大
两类真实的假及格: 删掉失败的测试用例就宣布通过;嘴上答应「7 天内退款」,钱其实没退。所以「通过」必须拆开看结果和过程。
场景 2 · 三层验证漏斗 9.1
越靠下越靠代码真值,难形式化才交模型
越靠下越依赖代码真值;只有难以形式化的部分,才交给模型评判
设计原则: 能用代码验的绝不用模型。① 结果层读测试、金额、订单状态;② 过程层查政策、权限、动作序列;③ 质量层才用 Rubric 评分并要求引用证据。
场景 3 · 知识 / 指令 / 程序 / 参数 9.2
经验该写进哪,取决于能否被符号表达
路由结果只是提案,未获发布资格 —— 必须经过验证才能进正式能力库
一句话判据: 这条经验能不能写成一句话?能写进 Prompt,能写成流程就进代码,写不出来才动参数。四种沉淀互补而不互斥。
场景 4 · 24 小时的教训 9.2.1
知识记「世界什么样」,经验记「该怎么做」
正式文档要写清:适用场景 / 禁止做法 / 例外 / 证据来源 / 最近验证时间
两种沉淀都要: 只存知识,Agent 知道截止时间却不会提前查;只存经验,它不知道为什么。
场景 5 · 别急着转人工 9.2.2 重点
把可归因的失败,变成一条可回滚的最小规则
Karpathy 称之为「系统提示学习」—— 应该是一条带来源的最小 diff,不是每次重写整份 Prompt
顺序很重要: 先拦下 → 查政策 → 给合规替代方案;只有「用户明确要求」或「涉及安全」才转人工。规则要带来源、可回滚。
场景 6 · 宏录制加速器 9.2.3 重点
把首次探索编译成可复用工作流,重复任务快 8.5–13 倍
把首次探索编译成可复用工作流 —— 类比电子表格里的宏录制
注意生命周期: 捕获 → 参数化 → 状态检查 → 独立回放 → 失效重学。回放前要检查状态,环境变了能检测失效并重学 —— 否则复用会变成复错。
场景 7 · 咕噜视频里找数 9.2.3 重点
Agent 缺能力就自己造工具,答案 100000000
Alita(arXiv:2505.20286)—— Agent 缺能力就自己造工具,这是自举的另一种形态
最强的自举: 能力边界不再是「给了什么工具」,而是「能不能造出缺的那个工具」—— 缺读字幕的工具,就自己封装一个。
场景 8 · 在线离线双循环 9.3
在线只记录证据,离线验证后才发布新版
两个循环由「版本化经验库」连接:在线只记证据,离线验证后才发布新版
架构要点: 把「干活」和「改自己」彻底分开 —— 在线的高频写入是最大风险来源,稳定版只留证据、不改写自己。
场景 9 · 四次撞墙三次 9.3.1 重点
开放任务的闭环,容易产出「像成果的东西」
Trehan 与 Chopra 记录的四次端到端科研尝试:三次在实现或评估阶段失败,只有一次走完
最难识别的失败: 认识论过度乐观 —— 把噪声当成发现,报告读起来还挺像回事。四次分别倒在实现漂移、过度乐观、判断力不足。
场景 10 · 改不了的可信根 9.3.2 重点
进化系统不能自己降低测试门槛来伪装进步
否则只需降低阈值或删掉失败用例,就能把退化伪装成进步
一句话记住: 衡量标准不能被被衡量者修改。验证器、测试用例、发布门槛、审计日志都不能自改。
场景 11 · 后台睡眠学习 9.3.3
空闲时整合新旧结论,过期能力就归档
Claude Code 只加载有界 MEMORY.md 前缀;Hermes 用 Curator 空闲期修剪、变更前存快照
呼应第 3 章: 这就是「记忆压缩与整理机制」在自我进化上的延伸 —— 索引必须有界,否则上下文和注意力都会被撑爆。