CoArena(@coastyai,YC S26)发布 CUA KnowledgeBench(Real Company Work):12 小时跨度、10 个私有真实任务 × 5 个种子、覆盖 100+ 应用,以工作产物通过/失败判定。其花费逾 5 万美元跑前沿模型;Claude Fable 5.1 在 50 次十二小时运行中解决 12 次(24%),GPT-6 Astra 勉强进入前三。下一步将投入逾 20 万美元扩展到 1/3/7 天跨度。

核心要点速览 (Key Takeaways)

  • 新基准面向 12 小时真实公司知识工作的计算机使用(CUA)场景。
  • 任务按工作产物通过/失败评分,覆盖 100+ 应用与多种子。
  • Fable 5.1 约 24% 通过;Astra 仅勉强进入前三;将扩展更长跨度。
ADSponsored