当前的 AI 智能体系统与代码框架在自主进化和自优化(如提示词搜索、工作流生成、脚手架重构)中普遍遵循贪婪策略——一旦某个候选变异在测试基准上出现性能回退,就会被算法立即抛弃。然而复杂系统的搜索空间高度崎岖,绝大多数通往全局最优的质变突破在早期往往表现为临时的负向或劣质状态。蚂蚁集团(Ant Group Research)、北京大学与北京智源人工智能研究院联合提出了 Mara Chain(arXiv:2609.35855)自主进化新范式。Mara Chain 打破了传统贪婪拒绝机制,将未通过评估但包含结构创新或局部潜力的‘失败变体’转化为拓扑进化的阶梯(Stepping Stones)。框架由三大核心引擎驱动:其一,语义与功能去重驱动的进化缓存(Stepping-Stone Buffer);其二,基于失败根因逆向回溯的分层变异器(Hierarchical Mutator);其三,多目标非支配 Pareto 排序淘汰机制。在 AppWorld 基准上,Mara Chain 在减少 65.5% 采样轮数的前提下,相比 GEPA、ACE 和 SkillOpt-Lite 取得了最高 20.5% 的性能跃升;在真实的 TerminalBench 2.1 运维环境中,Mara Chain 更是相比 AHE 和 Meta-Harness 分别大涨 20.2 和 22.5 个百分点,并将官方代码与框架 AntOmniEvo 全面开源。
核心要点速览
- ✓蚂蚁集团与北大、智源联合提出 Mara Chain,打破贪婪优化桎梏,将‘失败候选’转化为系统自演化的拓扑阶梯
- ✓在 AppWorld 基准上超越 GEPA 与 ACE 高达 20.5% 且减少 65.5% 采样轮数;TerminalBench 2.1 解决率相比 AHE 大涨 20.2 个百分点
- ✓全面开源 AntOmniEvo 框架,提供 AST 拓扑去重缓存与分层逆向归因变异器,助力 Coding Agent 自主重构
开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
随着 AI 智能体从单次提示词工程(Prompt Engineering)转向复杂的复合 AI 系统(Compound AI Systems),如何让智能体系统在缺乏人类介入的情况下实现“自主自我演化(Self-Evolution)”成为了工业界前沿的核心命题。目前主流的系统级优化工具(如 GEPA、ACE、SkillOpt-Lite 等)均依赖贪心爬山法(Greedy Hill-Climbing)或强化学习:当系统尝试生成新的工作流、修改执行脚本或合成新的 Agent 技能时,一旦在基准测试中得分不及上一代,就会被判定为“负样本”并立刻废弃。然而,软件工程与复杂智能体任务的解空间极其非凸且充满“欺骗性(Deceptive Fitness)”:无数技术革命在萌芽期都伴随着早期的运行报错与性能退步,单纯贪婪的单调上升策略必然导致智能体在演化数轮后陷入死胡同般的“局部最优”,无法跨越复杂的架构重构断崖。
架构亮点与底层机制
针对贪婪优化与早熟收敛的痼疾,蚂蚁集团、北大与智源团队提出了将失败作为垫脚石的 Mara Chain 进化架构(arXiv:2609.35855,开源项目 AntOmniEvo):
- 跳板缓存池(Stepping-Stone Buffer)与多样性保全:Mara Chain 彻底废除了“只有高分才能存活”的教条。当某个变异体执行失败或得分下降时,系统首先分析其代码 AST 拓扑、语义表征与运行时轨迹。如果该候选方案探索了未被覆盖的调用路径或采用了全新的算法架构,即便当前得分为零,也会被保留在跳板缓存中,作为后续演化的潜在基因底座;
- 逆向归因分层变异器(Hierarchical Mutator):变异模块不仅随机探索,更深度解构失败日志与调用栈。变异器分为两层:宏观层负责探索不同策略的原语组合,微观层针对跳板候选中的特定语法 Bug、未捕获异常进行外科手术式修复,将原本“有缺陷的好点子”快速扶正为高可用技能;
- Pareto 非支配前沿筛选(Multi-Objective Pareto Selection):弃用单一综合得分作为唯一尺度,将任务覆盖面、新颖度指标、执行延迟与代码整洁度纳入多目标优化,确保种群始终维持广阔的探索视野。
权威 Benchmark 与实测跑分对比
Mara Chain 在代表前沿智能体演化水准的基准环境中完成了系统级横向实测:
- AppWorld 移动与桌面生态实测:在复杂的跨应用智能体基准 AppWorld 上,Mara Chain 展现出极高的数据效率与进化上限,相比 GEPA、ACE 以及 SkillOpt-Lite 实现了 7.8% 至 20.5% 的性能领先,且达到最优性能所需的交互探索轮数(Rollouts)足足精简了 65.5%;
- TerminalBench 2.1 运维命令行大考:在充满长程状态依赖的终端自动化评测集 TerminalBench 2.1 中,传统贪婪框架极易因环境命令失误而停滞。Mara Chain 凭借跳板机制成功绕过陷阱,最终解决率相比 AHE(Automated Harness Evolution)和 Meta-Harness 分别暴涨 20.2 和 22.5 个百分点;
- 收敛鲁棒性验证:在连续 50 代高强度自主演化实验中,基线模型平均在第 8 代左右便遭遇适应度停滞,而 Mara Chain 保持了平稳的向上爬升斜率,成功诞生了多个跨层级重构的 Agent 架构。
开发者实战落地与开箱指南
蚂蚁团队已将 Mara Chain 的核心算法与演化框架在 GitHub 开源(ant-research/AntOmniEvo)。对于正在搭建 Coding Agent 自动化评测与自演化流水线的架构师而言,Mara Chain 带来了一场深刻的方法论颠覆:在设计 Agent 评估管道(Eval Harness)时,切勿用硬性的单步及格线扼杀探索性变异。建议将 AntOmniEvo 接入现有的 CI/CD 沙箱,建立包含执行路径差异度感知的 Stepping-Stone 缓存机制,为 Agent 分配“容错预算”,让复杂的业务工具链在失败与修正的非单调跃迁中获得突破性的自主进化能力。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察