CoArena(@coastyai,YC S26)发布 CUA KnowledgeBench(Real Company Work):12 小时跨度、10 个私有真实任务 × 5 个种子、覆盖 100+ 应用,以工作产物通过/失败判定。其花费逾 5 万美元跑前沿模型;Claude Fable 5.1 在 50 次十二小时运行中解决 12 次(24%),GPT-6 Astra 勉强进入前三。下一步将投入逾 20 万美元扩展到 1/3/7 天跨度。
核心要点速览 (Key Takeaways)
- ✓新基准面向 12 小时真实公司知识工作的计算机使用(CUA)场景。
- ✓任务按工作产物通过/失败评分,覆盖 100+ 应用与多种子。
- ✓Fable 5.1 约 24% 通过;Astra 仅勉强进入前三;将扩展更长跨度。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察