类似于 AlphaEvolve 的 LLM 引导程序进化算法(Program Evolution)在算法优化与硬核运筹求解(如圆盘打包 Circle Packing、张量算子加速)中展现出强悍探索力。然而现有进化框架往往不计成本地以固定迭代轮次为目标,极度依赖昂贵的前沿旗舰模型,单个复杂问题的求解往往消耗数十至上百美元。来自新加坡国立大学、斯坦福大学与香港科技大学的研究团队提出了业界首个成本感知(Cost-Aware)的程序进化框架 FrugalEvo(arXiv:2610.03675):彻底摒弃单纯追求无上限迭代的做法,转而追求“单位 Token 成本的收益最大化”。FrugalEvo 采用非对称双模型分工架构——由高智力昂贵模型负责探索高维解题策略,由廉价极速模型负责具体代码实现与局部迭代微调;同时精心设计缓存友好型进化管线,最大化复用跨进化步的前缀 KV 缓存。团队还提出了针对预算感知的新评测指标 BA-AUC。在 10 项数理与系统优化任务及 ALE-Bench-Lite 上,FrugalEvo 全面超越 OpenEvolve、AdaEvolve 和 EvoX;在圆盘打包测试中,使用 GPT-5.6 Terra/Luna 仅花费 1.68 美元,使用 GLM-5.3/Flash 甚至仅花费 0.55 美元,便彻底战胜了平均花费 50 美元的多智能体系统(如 CORAL、SwarmResearch),成本骤降 97%~99%。

核心要点速览

  • ✓提出业界首个成本感知(Cost-Aware)程序进化框架 FrugalEvo,打破传统代码进化算法不计成本的迭代盲区
  • ✓首创非对称强弱双模型协同分工与前缀 KV 缓存最大化复用,建立新标杆评测指标 BA-AUC
  • ✓在经典圆盘打包任务中仅花费 $0.55~$1.68 达成 SOTA,战胜平均花费 $50 的多智能体系统,成本暴降 97%~99%
进化代码搜索降本 97%!斯坦福与新国大开源 FrugalEvo:强弱双模型协同配前缀缓存,仅花 $0.55 击败 $50 智能体群
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

大语言模型引导的代码程序进化搜索(LLM-Guided Program Evolution,如 AlphaEvolve、EvoX)正在成为攻克复杂组合优化、物理模拟算子调优与科学算法突破的关键利器。然而,现有的算法进化框架普遍存在严重的“成本盲区”:其算法设计完全围绕固定的迭代进化轮次(Fixed Iterations)展开,在每一代种群中都反复调用昂贵的最顶级前沿模型(如 GPT-4o 或 Claude 3.5 Sonnet),在实际工业界中单次优化任务的 API 账单常常暴涨至 50 美元甚至数千美元,使得中小企业与科研团队望而却步。如何在有限的实际金钱与算力预算下,最大化每花一分钱所换取的算法增益,已成为进化代码智能体走向实用化的决胜点。

架构亮点与底层机制

针对这一痛点,新加坡国立大学联合斯坦福大学与香港科技大学打造了兼顾卓越性能与极致性价比的代码进化引擎 FrugalEvo(arXiv:2610.03675):

  1. 非对称双模型分工闭环(Dual-LLM Exploration & Implementation):打破“单一模型通吃全流程”的昂贵设计,将思考与编写解耦——由极少数高智力、高单价的大模型充当“战略探索者(Explorer)”,负责跳出局部最优并发掘新颖的算法构思;而将绝大多数繁重琐碎的具体代码编写、单元测试修复与局部调优工作,完全委派给推理成本极低的轻量模型(Implementer);
  2. 进化全流程前缀缓存最大化复用(Cache-Efficient Evolution Harness):针对进化计算多代种群 Prompt 结构高度相似的特点,FrugalEvo 深度重构了上下文 Harness 结构,使连续世代的 Prompt 历史在物理前缀上保持严苛对齐,极大触发现代推理引擎(如 vLLM、SGLang、OpenAI Cache)的前缀 KV 缓存命中率,压降输入 Token 计费达 80% 以上;
  3. 预算感知新指标 BA-AUC(Budget-Aware AUC):首次提出“预算约束曲线下面积(BA-AUC)”评估标尺,定量衡量模型在累积 API 开销曲线下的解题质量爬升速度,告别脱离财务视角的脱靶刷榜。

权威 Benchmark 与实测跑分对比

在跨越 10 个数学与系统运算优化任务以及代表性算法基准 ALE-Bench-Lite 的广泛评测中,FrugalEvo 实现了震撼的降本增效表现:

  1. 十项数理运筹任务 9 项刷新 BA-AUC 纪录:全面超越业界权威基线 OpenEvolve、ShinkaEvolve、AdaEvolve 和 EvoX,在 9 项任务上取得了断层领先的最高 BA-AUC 积分;
  2. 以 0.55 美元击溃 50 美元多智能体方案:在极具挑战的经典几何优化难题“圆盘打包(Circle Packing)”中,FrugalEvo 配合 GLM-5.3 及 Flash 变体仅花费 0.55 美元、配合 GPT-5.6 Terra/Luna 仅花费 1.68 美元,便成功刷新了 SOTA 纪录,战胜了平均花费 50 美元的 CORAL 与 SwarmResearch 多智能体基线,实现 30~90 倍的恐怖成本削减;
  3. ALE-Bench-Lite 平均表现全面胜出:在更贴近日常工程算法的 ALE-Bench-Lite 10 大优化任务中,FrugalEvo 的平均最终代码解法质量稳步超越所有受测基线。

开发者实战落地与开箱指南

FrugalEvo 的完整执行管线、双模型协作 Prompt 套件以及测试基准已在 GitHub(chchenhui/frugalevo)全面开源。对于正在使用 LLM 进行复杂代码优化、量化交易策略搜索、分布式系统参数自调优以及科学计算脚本迭代的工程师,FrugalEvo 提供了一套“既要 SOTA 又要省钱”的标准教科书配方。开发者只需在本地或生产服务中配置一对强弱模型密钥并启用前缀缓存优化,即可用几杯咖啡的成本完成此前耗资上千元的大型代码进化搜索工程。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。