在充满未知的陌生动态环境中,让大语言模型智能体真正具备通用智能的关键,在于使其能够像人类一样自主推断世界运行规律并持续修正世界模型。然而,传统微调成本极高且易导致灾难性遗忘。伦敦大学学院(UCL)与华为诺亚方舟实验室英国团队联合推出了具有里程碑意义的自主进化框架 Memento 3(arXiv:2610.11794)。Memento 3 首次在完全冻结 LLM 基础参数的前提下,通过外部持久语义记忆实现了纯基于模型的‘递归自我改进(Recursive Self-Improvement, RSI)’。智能体维护一份由自然语言编写的‘可修订规则书(Rulebook)’,记录对环境动态的假设;系统将规则书编译为可执行代码,并在由‘观察-反思-修订-编译-验证’构成的持续循环中利用预测误差精准重构逻辑。只有经过 LLM 语义忠实度审查与单元级精确重放(Cell-Exact Replay)双重校验的代码才会被采纳。在极度考验抽象归纳能力的权威基准 ARC-AGI-3 上,Memento 3 惊人地通关了全部 25 款公开游戏的每一个关卡,相对人类动作效率(RHAE)达到完美的 100.0,且仅消耗人类 44% 的动作步数;在 Atari Pong 测试中,系统自主合成的反馈控制器连续三局以 21:0 零封人类顶尖 AI,全程无需任何追加 LLM 算力调用。

核心要点速览

  • ✓UCL 与华为诺亚开源 Memento 3,在冻结大模型前提下首创基于反思规则书的递归自我改进(RSI)架构
  • ✓将自然语言规则书编译为可执行代码模型,依托单元级精确重放(Cell-Exact Replay)确保零幻觉因果推断
  • ✓ARC-AGI-3 全部 25 关 100% 通关(动作步数仅人类 44%),Atari Pong 以 21:0 零封对手且全程零追加 LLM 调用
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

通向通用人工智能(AGI)的核心瓶颈之一是“递归自我改进(Recursive Self-Improvement, RSI)”。在现实环境中,智能体面对的物理规则、接口协议或复杂业务流程往往未在训练集中完全覆盖。如果每学习一种新环境都要对千亿参数模型进行强化微调,不仅计算资源难以承受,还会遭遇模型遗忘已知知识的巨大风险。现有的“反射式记忆(Reflection Memory)”方法大多停留在零散的文本备忘录层面,无法转化为严格的形式化因果推断与确定性模拟,因而在面对高维抽象谜题与长程连续控制时全面崩溃。

架构亮点与底层机制

UCL 汪军教授团队与华为诺亚方舟实验室打造了全新的模型基递归自进化系统 Memento 3(arXiv:2610.11794):

  1. 自然语言规则书编译为可执行代码(Rulebook-to-Code Compilation):智能体在外部维护一份由自然语言写成的世界运行机制“规则书(Rulebook)”,清晰描述物理因果关系,并由代码生成器编译为高效的独立运行环境与预测代码,摆脱对昂贵大模型单步推演的依赖;
  2. 确定性重放验证门禁(Cell-Exact Replay Verification):每一次对规则书与代码的修订,都必须经历最严苛的物理检验——系统在沙箱中进行单元级精确重放,要求更新后的代码能够 100% 完美复现历史观测到的所有状态转换,同时通过 LLM 对其语义忠实度进行审核,彻底消除幻觉假设;
  3. 多模型群体协同探索(Population Extension):支持并行维护多个世界模型副本,在智能体之间共享交互证据,利用不同假说之间的预测差异最大化信息增益,驱动高效的主动探索(Active Exploration);
  4. 零微调长效自进化(Zero Weight Update RSI):在基座 LLM 权重保持绝对冻结的前提下,通过程序化逻辑的自我编写与环境经验闭环,实现了真正的代码级自我重构与能力跃升。

权威 Benchmark 与实测跑分对比

研究团队在被誉为 AI 智商试金石的抽象推理基准 ARC-AGI-3 与经典强化学习环境上展开了极限压测:

  1. ARC-AGI-3 惊人全通关(25/25 Games Cleared):单智能体版本的 Memento 3 成功通关了全部 25 款公开游戏的每一个隐藏关卡,相对人类动作效率(RHAE)达到满分 100.0;
  2. 动作步数仅用人类 44%:在解开极其复杂的空间与物理谜题时,Memento 3 凭借编译出的精确世界模型进行树搜索规划,总动作消耗仅为人类受试者的 44%,展现出远超传统启发式算法的极简规划美学;
  3. Atari Pong 21:0 零封神话且零模型推理开销:在 Atari Pong 案例研究中,系统通过自主探索合成了一套闭环反馈控制器代码,在三种完全不同发球开局的连续测试中全部以 21:0 碾压对手,并且在该阶段完全无需调用大模型 API,推理成本降至纯 CPU/GPU 计算级别。

开发者实战落地与开箱指南

由 UCL 与华为诺亚开源的 Memento 3(arXiv:2610.11794)为下一代自主科研智能体(AI Scientist)、机器人具身控制系统以及自动化沙箱逆向工程树立了全新架构标杆。面对复杂未知的生产级软硬件环境,工程师不应再盲目寄希望于扩大上下文窗口去装载操作手册。正确的解法是构建“显式规则书 + 代码编译 + 确定性重放”的外部自进化环路:让固定参数的基础模型退居幕后充当“元程序员”,通过代码形式在外部持续打磨世界模型,从而以极低成本实现零遗忘、可解释且算力极其高效的工业级智能体落地。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。