伊利诺伊大学芝加哥分校(UIC)团队揭露了现有分析智能体由人类预先配置工具库的致命硬伤:专家挑选的 21 个通用工具反而拉低了时序异常检测等关键任务表现,盲目自修正更破坏了 38% 的原本正确答案。为此,团队提出 TimeEvo 自进化架构,通过将智能体诊断出的执行失败聚类为能力缺陷,针对性自主编写并校验纯证据型 Python 工具。实测在 10 项基准与 3 种主干模型上,从零工具库起步全面反超人类专家库。
核心要点速览 (Key Takeaways)
- ✓揭示人工工具库的“负向对齐”与“静默伤害”:实证发现由人类专家精选的 21 个时序工具不仅无法泛化,反而在所有测试模型上拉低异常检测准确率;单轮无指导自修正虽修改了 147 个答案,却改错了 56 个原有正确用例。
- ✓失败驱动的闭环自进化链路:将智能体在真实执行中暴露的失败案例聚类为结构性能力盲区,自动化生成度量指标并编写专用代码工具,通过配对准入门控严防工具冗余与膨胀。
- ✓从零起步全方位超车与小模型向大模型迁移:即使初始工具库完全为空,TimeEvo 在 10 项基准与 3 种不同基座模型上均实现准确率全线提升;在轻量低成本模型上进化出的工具库,直接注入强力前沿模型依然稳定增益。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察