赋予大语言模型智能体在测试期(Test-Time)自主迭代完善解题方案的能力,是通往通用自主工程智能体的关键里程碑。来自中国人民大学等研究团队推出全新长程反思智能体框架 AREX-2。该研究发现测试期自演化依赖两大解耦的核心基石:产生优于当前方案的反思能力(Reflection)与支撑跨多轮次持续有效推进的长程执行力(Long-Horizon Execution)。由于这两项能力具备领域通用性,团队在具备严格可验证反馈的机器学习任务与算法编程领域构建了高质量长程反思轨迹合成数据。基于 Qwen3.8-27B 训练的 AREX-2 在 MLE-bench Lite 斩获 81.8 的惊人高分,Frontier-CS 达 70.7;不仅如此,该能力强力迁移至复杂深度研究场景,在 GAIA(92.2)与 DeepSearchQA(93.8)上展现出伴随测试轮次增加而持续自我变强的演进曲线。

核心要点速览 (Key Takeaways)

  • ✓解耦长程自进化为反思批判(Reflection)与长程执行(Long-Horizon Execution)两大通用能力支柱
  • ✓在 Qwen3.8-27B 上取得 MLE-bench Lite 81.8 与 Frontier-CS 70.7 的顶尖表现,并在 GAIA 斩获 92.2 高分
  • ✓突破多轮反思质量退化魔咒,解题质量随分配的反思轮次增加呈现稳健单调上升
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点 当前绝大多数智能体系统在接收到用户指令后,依然依赖单轮次“推演即执行”的线性逻辑,一旦初始构想存在偏差,后续往往在局部盲目修补或提前宣告放弃。然而人类高级工程师解决前沿算法与软件工程问题的本质是一个持续试错、自我批判并逐步收敛的复杂长程迭代过程。如何让大语言模型智能体具备“测试期自我进化”(Test-Time Self-Improvement)的特质——即在运行期间主动发现当前代码缺陷、自我生成修正版本并持续将方案推进至最优解——是当前学术界与产业界面临的核心技术高地。以往的自我纠错研究大多局限于 1~2 轮玩具级短任务,一旦迭代步数拉长,智能体极易出现上下文遗忘、死循环或方案质量劣化。 ### 架构亮点与底层机制 针对上述痛点,联合研究团队提出了 AREX-2,其理论核心在于将智能体的自我进化能力严格拆解为两个正交且领域通用的能力基石: 1. 反思批判能力(Reflection):能够跳出局部局部最优解,准确识别导致性能停滞或测试未通过的根因,并提出在算法逻辑上显著优于现状的新构想; 2. 长程执行韧性(Long-Horizon Execution):能够在数十轮甚至上百轮的持续代码演进中,维持对全局项目目标、历史演变路径与环境反馈证据的精准追踪,避免在长文本累积中发生目标漂移。 团队敏锐地发现:机器学习(ML)工程建模与算法竞技编程具备天然的可执行客观验证环境(准确率、Loss、执行耗时、单元测试),是最理想的自演化监督数据源。团队系统合成了成体系的长程高质量反思轨迹,并对开源底座 Qwen3.8-27B 展开端到端强化对齐。 ### 权威 Benchmark 与实测跑分对比 在覆盖算法竞赛、机器学习工程实战与开放世界复杂任务的多项权威 Benchmark 上,AREX-2 展现出断代式的自迭代优势: 1. ML 实战与算法基准问鼎高分:在模拟 Kaggle 真实竞赛的高难度机器学习工程基准 MLE-bench Lite 上,AREX-2 取得了 81.8 的傲人成绩;在计算机科学前沿算法竞赛基准 Frontier-CS 上斩获 70.7 分。 2. 跨领域泛化零样本迁移:更令人振奋的是,在纯算法与代码领域训练得到的长程反思执行力,无缝迁移至全网深度研究基准:在 BrowseComp 达到 84.0 分,在极具挑战的超难知识基准 HLE 达到 52.6,在通用智能体经典基准 GAIA 达到 92.2,并在 DeepSearchQA 上攀升至 93.8。 3. 随测试轮次单调递增:系统展现出极强的算力扩展一致性——随着分配给智能体的思考与反思轮次预算(Budget of Rounds)增加,任务完成质量保持单调稳健上升,打破了以往智能体“多轮反思反而把对的改错”的退化魔咒。 ### 开发者实战落地与开箱指南 AREX-2 的代码仓库与模型权重已在 GitHub 和 Hugging Face 完整开源。项目提供了标准化的高性能迭代工作流 Runner,开发者可直接将其作为高级 Coding Agent 嵌入现有的 IDE 插件或 CI/CD 流水线中。对于从事自动算法优化(AutoML)、自动化算法竞赛打榜或复杂工程重构的团队,AREX-2 提供了开箱即用的长程自省配置参数,仅需指定迭代轮次上限与可执行环境验证器,即可让智能体开启全自主、持续向上的代码淬炼流程。