智能体一次失败的调用轨迹(Rollout)所蕴含的有效信息远超过单一的负向奖励信号:智能体当时的观测上下文、选择的特定动作以及环境反馈都是诊断核心。为系统化复用失败轨迹中的工程教训,UIUC 团队推出了目前规模最大的智能体错误诊断基准数据集 Agent Error Dataset(AED)。该数据集汇集了来自 33 种主流环境、19 类 Harness 框架与 23 种策略模型的 9,961 项基准任务,构建出 50,228 组高质量错误-诊断对(Error-Diagnosis Pairs)。团队开发了五阶段 AET(Agentic Error-to-Training)管线,系统捕获真实运行故障,生成因果诊断并对齐实际执行证据。在 3,062 对严格对照重放实验中,首轮纠错提案将验证器通过率从 18.4% 大幅拉升至 51.1%(净增 32.7 个百分点);基于 AED 微调的 Qwen3-8B 在故障定位步精准吻合率上提升至 63.6%,显著超越传统提示词方案。

核心要点速览 (Key Takeaways)

  • ✓涵盖 33 个交互环境、19 类 Harness 与 23 款基座模型的 50,228 组高质量智能体错误-诊断对
  • ✓首轮纠错修复提案将环境重放验证器通过率从 18.4% 大幅提升至 51.1%,净增 32.7 个百分点
  • ✓微调 Qwen3-8B 使故障决策步定位精准率由 47.2% 提升至 63.6%,动作级纠错训练效果显著超越纯成功样本微调
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 在强化学习与模仿学习驱动的大语言模型智能体训练中,业界通常采用简单的二元成功率(0/1 奖惩)作为学习信号,大量由于细微偏差导致任务失败的“负样本轨迹”(Unsuccessful Rollouts)往往被全量丢弃。然而在工程实践中,一次失败的轨迹蕴含着极具价值的信息拓扑:智能体当时的观察上下文、误入歧途的关键分支动作、以及环境抛出的异常堆栈。传统的智能体微调方案无法精确定位是哪一步造成了全局崩溃,导致智能体经常在相似场景下反复踩坑;缺乏成体系、多环境覆盖的“错误-诊断”监督微调数据,成为制约智能体自我反思与容错修复能力提升的根本瓶颈。 ### 架构亮点与底层机制 针对这一长期缺失,UIUC 联合团队正式构建并开源了 Agent Error Dataset(AED),这是目前 AI 智能体领域覆盖最全、规模最大的故障分析与后训练数据集。该数据集汇聚了 50,228 组精细化错误-诊断对,源自 33 种异构交互环境(覆盖软件开发、网页自动化、复杂问答、多工具调度等)、19 类主流 Harness 框架以及 23 款涵盖开源与闭源的底层策略模型。为保证数据真实性与因果可信度,团队研发了五阶段“从错误到训练”(Agentic Error-to-Training, AET)端到端管线: 1. 自然故障采集:在多样化基准中收集原生执行崩溃与逻辑失败样本,完整保留系统执行元数据; 2. 因果诊断与修复生成:通过反向推演定位发生偏离的关键决策步(Pivotal Step),并提出针对性修复建议; 3. 环境证据对齐校验:将生成的修复提案与真实环境记录的执行证据进行严格交叉校验; 4. 受控重放比对验证:在支持回滚重放的环境中,从相同 Checkpoint 切入对照执行修复动作与原始失败动作; 5. 多视图后训练转化:构建解耦的“故障诊断视图”与“行动修复视图”,支持多维度精准对齐训练。 ### 权威 Benchmark 与实测跑分对比 在严格对照的因果测试与智能体后训练微调实验中,AED 展现出颠覆性的训练提效价值: 1. 纠错修复验证率暴涨 32.7%:在 3,062 对严格受控的重放对照组中,依据 AED 模式训练的模型给出的首个修复提案,直接将环境验证器通过率从原始的 18.4% 跃升至 51.1%,单轮修复成功率净增 32.7 个百分点。 2. 精确故障定位提升至 63.6%:基于 AED 的全诊断视角对开源模型 Qwen3-8B 进行监督微调后,其在 943 个严苛留出测试集上的“确切错误决策步定位吻合度”从 47.2% 提升至 63.6%,大幅击败了采用复杂 CoT Prompt 的顶尖闭源模型方案(54.7%)。 3. 动作级修复超越单纯成功集:在 WebShop-lite 基准的策略训练对照中,利用 AED 进行“动作级修复训练”的策略模型,最终得分较仅使用“成功样本训练”的模型高出 6.67 个百分点,实证了高质量负样本因果纠偏的不可替代性。 ### 开发者实战落地与开箱指南 AED 数据集已在学术平台和开源平台开放元数据与训练数据切片。对于正在进行自研 Coding Agent 或垂直行业 Agent 后训练(Post-Training)的算法工程师,AED 提供了即开即用的 JSONL 结构化训练样本,支持直接喂入 SFT(监督微调)和 DPO(直接偏好优化)训练流程。开发者既可以训练专属的“Agent 巡检与诊断探针”(Diagnostic Critic),用于在运行时实时拦截异常动作,也可以用于强化智能体的主动自我纠错修复本能,显著降低大模型在生产环境中的脱轨率。