开发者 3 秒速决决策指标
智能体在推理部署时的自我迭代升级能力(Test-Time Self-Improvement),是当前迈向 AGI 的核心演进方向。这一能力依赖两大互补支柱:能够敏锐识别错误并产出更优解的“反思(Reflection)”,以及能支撑算法经历多轮长时间交互而不发生上下文崩溃的“长程执行(Long-Horizon Execution)”。中国人民大学、微软亚洲研究院与中国科大团队联合推出了 AREX-2 框架:研究团队发现这两种核心能力具备极强的领域无关通用性(Domain-Agnostic),并通过在具备确定性结果校验的机器学习工程(ML Engineering)与算法编程任务中,合成了极具挑战的长程反思训练轨迹。基于 Qwen3.8-27B 打造的 AREX-2 智能体在 MLE-bench Lite 上斩获 81.8 的超高分,并零样本跨域迁移至深度研究(Deep Research)任务,在 BrowseComp 斩获 84.0 分、GAIA 斩获 92.2 分、DeepSearchQA 斩获 93.8 分,展现出随着迭代轮数增加而持续单调提升的强大自进化力。
核心要点速览 (Key Takeaways)
- ✓提出测试时自我进化的两大领域无关支柱:高质量可验证反思与超长程执行连贯性
- ✓基于 Qwen3.8-27B 打造的智能体在 MLE-bench Lite 斩获 81.8 分,Frontier-CS 斩获 70.7 分
- ✓零样本成功迁移至深度研究任务,GAIA 达 92.2 分,DeepSearchQA 达 93.8 分,BrowseComp 达 84.0 分
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
当前大模型自主智能体在执行单步任务时往往表现亮眼,但一旦置身于需要长达数小时甚至数天、历经多轮试错与假设推翻的长程任务(如机器学习建模比赛、复杂科研探索)中,智能体便迅速显露出致命的疲态。最核心的工程困境在于“测试时自我进化(Test-Time Self-Improvement)”的失灵:智能体在多轮迭代中要么缺乏深刻的“反思能力(Reflection)”,仅仅在浅层错误上反复打转而无法产出实质性更优的策略;要么缺乏“长程执行韧性(Long-Horizon Execution)”,随着交互轮数增加发生灾难性上下文漂移或死循环。如何构建具备持续单调递增优化能力的自主进化智能体,成为 AI Agent 研发的前沿圣杯。
架构亮点与底层机制
针对自进化智能体在长程探索中的失速问题,联合研究团队提出了 AREX-2 框架,从数据表征与能力通用性上实现范式破局:
- 自进化双支柱假设与领域无关性(Domain-Agnostic Foundation):团队深入论证了“高质量反思”与“长程执行连贯性”是通用的认知机制,完全可以在具备严密确定性代码与数据反馈的领域进行高效沉淀,随后无损迁移到任意开放场景;
- 源自 ML 工程与算法编程的长程轨迹合成:团队精选机器学习实战竞赛(Kaggle/MLE-bench)与前沿算法竞赛任务,这些任务自带即时的可执行编译器报错、验证集损失及准确率反馈,为长达数十轮的自我批判、假设检验与代码重构提供了确定性客观标尺;
- 多轮自我迭代轨迹蒸馏机制:完整记录智能体从初版 Bug 代码、中期性能瓶颈诊断到终版优秀解法的完整思考脉络,将成功的长程反思范式内化为模型底层权重能力;
- 算力预算动态扩展(Test-Time Budget Scaling):赋予智能体在推理部署期依据任务难度自适应调配反思轮数的能力,实现“想得越多、跑得越好”的持续正向缩放律。
权威 Benchmark 与实测跑分对比
在跨越工程代码实战、复杂算法与真实深度研究三大领域的严酷评测中,AREX-2 呈现出了统治级的跑分战绩:
- MLE-bench Lite 与算法编程登顶:基于开源 Qwen3.8-27B 底座训练的 AREX-2 智能体在 OpenAI 发布的机器学习竞赛基准 MLE-bench Lite 上斩获 81.8 分的超高成绩,在硬核前沿编程基准 Frontier-CS 上达到 70.7 分;
- 零样本迁移横扫 Deep Research 领域:在完全未见过的深度网络检索与多模态复杂任务中展现出惊人的跨域泛化能力——在 BrowseComp 斩获 84.0 分,在 GAIA 基准上达到 92.2 分,在 DeepSearchQA 更是高达 93.8 分,并在超难竞赛 HLE 上取得 52.6 分;
- 多轮迭代单调正向收益验证:消融实验证实,随着允许的自我反思轮数(Rounds Budget)从 1 轮增加至 8 轮以上,AREX-2 的最终任务胜率呈现出严格单调递增态势,彻底粉碎了传统 Agent 多轮对话容易陷入退化的魔咒。
开发者实战落地与开箱指南
AREX-2 的数据合成配方、长程反思训练协议与模型检查点已全面开源。对于正在打造自主软件工程师(SWE Agent)、数据科学 Copilot(Data Science Agent)或学术科研辅助助手(Deep Research Agent)的开发者,AREX-2 证明了一条清晰高效的演进路径:无需为每个下游垂直领域单独采集昂贵的微调数据,只需利用编程与 ML 工程任务中的可验证反馈锤炼长程反思能力,即可打造出在各类复杂长程任务中具备真实自我进化力的下一代顶尖智能体。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。

讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察