Artificial Analysis(@ArtificialAnlys)发布 Intelligence Index v4.3:将 Terminal-Bench 从 2.1 升至 4.0(改用 mini-SWE-agent),并以与 Zapier 合作的 AutomationBench-AA(657 条私有业务工作流)替换 τ³-Banking;Claude Fable 5.1 与 GPT-6 Astra 并列领先得分 53,OpenAI 占据多数性价比前沿。

核心要点速览 (Key Takeaways)

  • 基准:Index v4.3 升级 Terminal-Bench 4.0,并新增 AutomationBench-AA(私有测试集)。
  • 权重:含私有任务/答案的评测权重由 40% 升至 45%;Agents/Coding/General/Science 类别权重不变。
  • 结果:Claude Fable 5.1 与 GPT-6 Astra 并列 53;开源权重侧 GLM-5.3 / Kimi K3 以 44 领先。
ADSponsored