Vals AI 发布 Terminal-Bench 4.0:66 道全新终端任务(交付服务、证明定理、训练 GPU kernel、写取证报告等),专家预估中位耗时约 4 小时,严格 verifier 全过才计分,分数为 avg@3。GPT-6 Astra 以 57.1% 夺冠,领先 Claude Fable 5.1(49.5%)7.6 个百分点、Claude Opus 5(45.5%)11.6 个百分点;其余模型均未过 30%,14/27 个模型在硬件与媒体域得零分。4.0 覆盖软件、科学、ML、运维、硬件、安全、媒体七类,约四分之三任务已超出传统软件工程。
核心要点速览 (Key Takeaways)
- ✓Terminal-Bench 4.0:66 道新终端任务,中位专家工时约 4 小时,严格 verifier + avg@3
- ✓GPT-6 Astra 57.1% 登顶,领先 Fable 5.1(49.5%)与 Opus 5(45.5%);其余均未过 30%
- ✓覆盖七大类且约 3/4 任务超出传统软件工程,全部与 v2.1 无重叠
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察