Vals AI 发布 MysteryMechanism 基准,测试智能体能否通过有限实验从零还原被封存的科学数学机制。GPT-6 Astra 以 53.2% 准确率领先,Claude Fable 5.1 为 47.8%、Claude Opus 5 为 37.4%;Astra 单测约 1.77 美元,约为亚军 Fable 5.1(5.63 美元)的三分之一。
核心要点速览 (Key Takeaways)
- ✓MysteryMechanism:从封存机制与有限实验中还原科学关系的新基准
- ✓GPT-6 Astra 53.2% 登顶,领先 Claude Fable 5.1(47.8%)与 Opus 5(37.4%)
- ✓Astra 单测约 1.77 美元,约为亚军 Fable 5.1(5.63 美元)的三分之一
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察