Vals AI 发布 Terminal-Bench 4.0:66 道全新终端任务(交付服务、证明定理、训练 GPU kernel、写取证报告等),专家预估中位耗时约 4 小时,严格 verifier 全过才计分,分数为 avg@3。GPT-6 Astra 以 57.1% 夺冠,领先 Claude Fable 5.1(49.5%)7.6 个百分点、Claude Opus 5(45.5%)11.6 个百分点;其余模型均未过 30%,14/27 个模型在硬件与媒体域得零分。4.0 覆盖软件、科学、ML、运维、硬件、安全、媒体七类,约四分之三任务已超出传统软件工程。

核心要点速览 (Key Takeaways)

  • Terminal-Bench 4.0:66 道新终端任务,中位专家工时约 4 小时,严格 verifier + avg@3
  • GPT-6 Astra 57.1% 登顶,领先 Fable 5.1(49.5%)与 Opus 5(45.5%);其余均未过 30%
  • 覆盖七大类且约 3/4 任务超出传统软件工程,全部与 v2.1 无重叠
ADSponsored