发生了什么
UCL 与华为诺亚方舟实验室英国团队在 2026 年 10 月提交的论文中提出 Memento 3,一种让权重完全冻结的语言模型实现「基于模型的递归自我改进」的框架。它的核心不是更新模型参数,而是维护一个可读、可追溯的外部记忆:智能体用一份自然语言规则手册描述它当前对环境物理规律的全部假设,再把这套假设编译成可执行的代码世界模型,用于快速模拟与动作规划。整个循环由「观察—反思—修订—编译—验证」构成,以预测误差驱动规则更新。
与许多追求端到端学习的方案不同,Memento 3 给每次自我修订都设了两道闸门:一是由语言模型判断改后的代码是否忠实于规则手册,二是要求「逐格精确回放」——只有当新规则能精确复现已观测到的状态转移时,修订才会被合并。论文把这套闭环明确表述为通往递归自我改进的一条路径,并强调变化发生在可读的文本与代码上,而不是难以解释的模型权重上。
- 基准:在 ARC-AGI-3 全部 25 个公开游戏上通关,平均 RHAE(相对人类动作效率)为 100.0,即该基准的满分。
- 效率:整套测试共使用 7518 个动作,约为人类基线 17135 个动作的 44%。
- 对照:论文称同一基准上 Claude Opus 5 的平均 RHAE 为 40.7,比 Memento 3 低约 59.3 分。
- 消融:规则手册本身带来约 9% 的动作减少与 18% 的智能体回合减少。
- Pong 案例:以约 9504 帧训练出的反馈控制器,在三个评估种子下取得 21:0,执行期不调用大模型,论文称比 EfficientZero V2 等基于模型的强化学习基线样本效率高约 42 倍。
为什么重要
Memento 3 的意义在于它把「学习」从模型权重挪到了可审计的外部制品上。对企业而言,这一点比分数更重要:当智能体的行为会随经验变化时,监管与运维最难的是「说不清它什么时候变了」。在这套设计里,变的是可读的规则手册与其编译产物,每次改动都附带复现证据,理论上可以把「规则手册与代码的版本」当作变更控制的客体,记录是哪次观测导致了哪条规则被改写。论文也提示了与它同期的另一条研究脉络——有工作把「可塑性」定义为智能体把经验转化为可复用制品的效率,二者都指向同一个方向:靠外部记忆而非改权重来提升智能体。
- 范围:ARC-AGI-3 成绩仅针对公开游戏,摘要未说明是否包含留出(held-out)的评测游戏,也未给出与私人「大奖赛」评测的对比。
- 机制边界:逐格精确回放之所以可行,是因为环境是离散、确定性的;在噪声或随机环境中如何替换这道验证,论文未描述。
- 成本缺口:摘要未报告计算成本,例如语言模型调用次数或墙钟时间。
- 证据强度:判定代码是否忠实于规则手册的判断由语言模型自己做出,论文未给出该判断可靠性的量化;Pong 案例仅一局游戏、三个种子。
- 同期:ARC-AGI-3 公开集上已有多个满分声明,业界对「公开集满分」的解读仍保持谨慎。
需要观察
真正的检验在于这套机制能否走出它被验证过的环境:规则手册式的世界模型在更大、更开放的任务里是否仍然可维护,以及当环境带有随机性时验证闸门如何改造。对已在使用学习型智能体的团队来说,可以先明确一个治理问题——谁有权批准规则手册的修订、自我改进在什么节点必须停下来交给人工复核。

