Vals 今日发布 Vibe Code Bench 1-100(VCB 1-100):在已通过的完整 Web 应用上,要求模型按依赖顺序完成多轮产品改动,且不能破坏既有行为;首个未完成迭代即终止。官方榜单显示 Claude Opus 5 以 28.53% 领先,Claude Fable 5.1 28.00%、GPT-6 Astra 27.64% 紧随其后。相对只评「从零做出能跑版本」的基准,该套题更贴近真实持续演进的 vibe coding / 编程智能体工作负载。
核心要点速览 (Key Takeaways)
- ✓VCB 1-100 从已通过的完整应用起步,按依赖顺序施加多轮产品请求,首个失败迭代即终止。
- ✓榜单:Claude Opus 5 28.53%,Claude Fable 5.1 28.00%,GPT-6 Astra 27.64%。
- ✓Vals 指出模型自我测试差异大:Opus 5 / Fable 5.1 约三分之一工具调用为浏览器;Grok 4.6 几乎不用浏览器。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察