中国人民大学高瓴人工智能学院(RUC AI Box,@huggingface)联合团队在 Hugging Face 与 ArXiv 正式公开了《Agent-Editing World Model: Rethinking World Modeling for LLM Agents》(arXiv: 2609.28416,GitHub: RUCAIBox/Agent-Editing-World-Model)。针对传统语言世界模型盲目试图在脑海中高保真预测复杂环境观测(如重构不可预测的 Shell/网页返回值)的高昂成本与严重幻觉,AEWM 颠覆性地将世界模型重新定义为“对推理与动作如何塑造未来任务进度的因果建模”。结合动作裁判(Action Judge)与状态修正(State Revision),首创 EditAct 机制,在长程搜索、终端编码与复杂工程六大基准上实现平均 3.2 至 6.7 分的大幅跨越。
核心要点速览 (Key Takeaways)
- ✓抛弃传统世界模型徒劳模拟复杂高熵环境输出的沉重包袱,转向直接建模智能体决策对任务状态演化的因果影响。
- ✓提出动作裁判机制(Action Judge),精准将智能体操作解构为关键(Critical)、探索(Exploratory)与噪声(Noisy)三大类别。
- ✓首创 EditAct 机制,不止于口头批判(Critique),更在真实执行反馈下直接修订被污染的历史推理与行动状态。
- ✓在 Action Judge 基准上取得 70.5% 宏 F1 分数,在搜索、终端与软件工程六大严苛评测中全线提升 3.2 至 6.7 分。
- ✓全部训练代码、微调数据与 Action Judge 评测基准已在 GitHub 全量开源。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察