核心背景与行业痛点 当前绝大多数智能体系统在接收到用户指令后,依然依赖单轮次“推演即执行”的线性逻辑,一旦初始构想存在偏差,后续往往在局部盲目修补或提前宣告放弃。然而人类高级工程师解决前沿算法与软件工程问题的本质是一个持续试错、自我批判并逐步收敛的复杂长程迭代过程。如何让大语言模型智能体具备“测试期自我进化”(Test-Time Self-Improvement)的特质——即在运行期间主动发现当前代码缺陷、自我生成修正版本并持续将方案推进至最优解——是当前学术界与产业界面临的核心技术高地。以往的自我纠错研究大多局限于 1~2 轮玩具级短任务,一旦迭代步数拉长,智能体极易出现上下文遗忘、死循环或方案质量劣化。 ### 架构亮点与底层机制 针对上述痛点,联合研究团队提出了 AREX-2,其理论核心在于将智能体的自我进化能力严格拆解为两个正交且领域通用的能力基石: 1. 反思批判能力(Reflection):能够跳出局部局部最优解,准确识别导致性能停滞或测试未通过的根因,并提出在算法逻辑上显著优于现状的新构想; 2. 长程执行韧性(Long-Horizon Execution):能够在数十轮甚至上百轮的持续代码演进中,维持对全局项目目标、历史演变路径与环境反馈证据的精准追踪,避免在长文本累积中发生目标漂移。 团队敏锐地发现:机器学习(ML)工程建模与算法竞技编程具备天然的可执行客观验证环境(准确率、Loss、执行耗时、单元测试),是最理想的自演化监督数据源。团队系统合成了成体系的长程高质量反思轨迹,并对开源底座 Qwen3.8-27B 展开端到端强化对齐。 ### 权威 Benchmark 与实测跑分对比 在覆盖算法竞赛、机器学习工程实战与开放世界复杂任务的多项权威 Benchmark 上,AREX-2 展现出断代式的自迭代优势: 1. ML 实战与算法基准问鼎高分:在模拟 Kaggle 真实竞赛的高难度机器学习工程基准 MLE-bench Lite 上,AREX-2 取得了 81.8 的傲人成绩;在计算机科学前沿算法竞赛基准 Frontier-CS 上斩获 70.7 分。 2. 跨领域泛化零样本迁移:更令人振奋的是,在纯算法与代码领域训练得到的长程反思执行力,无缝迁移至全网深度研究基准:在 BrowseComp 达到 84.0 分,在极具挑战的超难知识基准 HLE 达到 52.6,在通用智能体经典基准 GAIA 达到 92.2,并在 DeepSearchQA 上攀升至 93.8。 3. 随测试轮次单调递增:系统展现出极强的算力扩展一致性——随着分配给智能体的思考与反思轮次预算(Budget of Rounds)增加,任务完成质量保持单调稳健上升,打破了以往智能体“多轮反思反而把对的改错”的退化魔咒。 ### 开发者实战落地与开箱指南 AREX-2 的代码仓库与模型权重已在 GitHub 和 Hugging Face 完整开源。项目提供了标准化的高性能迭代工作流 Runner,开发者可直接将其作为高级 Coding Agent 嵌入现有的 IDE 插件或 CI/CD 流水线中。对于从事自动算法优化(AutoML)、自动化算法竞赛打榜或复杂工程重构的团队,AREX-2 提供了开箱即用的长程自省配置参数,仅需指定迭代轮次上限与可执行环境验证器,即可让智能体开启全自主、持续向上的代码淬炼流程。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察