AI Coder Bench
真实编程任务基准排行。50 项任务,覆盖 Bug 修复、功能开发、重构、系统设计和 Debug & 解释。
📌 7 大官方榜单 · 直连镜像
每张卡片是一家评测机构的 Top-5 缩略图。点「展开完整」查看该机构完整榜单,或直接跳转官方页面。数据 100% 来自各机构,我们不做归纳计算。
Agent Score· 30 个模型- #1Claude Opus 512.19
- #2Claude Fable 512.01
- #3GPT-5.6 Sol10.86
- #4Kimi K310.6
- #5Claude Opus 4.89.78
Pass rate%· 23 个模型- #1Claude Fable 572.9%
- #2Grok 4.669.9%
- #3Gemini 3.7 Flash68.4%
- #4GPT-5.6 Sol67.2%
- #5Grok 4.566.7%
AA Index· 77 个模型- #1Claude Opus 563.1
- #2Claude Fable 562.1
- #3GPT-5.6 Sol60.9
- #4Grok 4.660.9
- #5Kimi K359.7
Avg score%· 29 个模型- #1Claude Fable 583.4%
- #2GPT-5.6 Sol81.6%
- #3GPT-5.580.8%
- #4Claude Opus 580.5%
- #5Gemini 3.7 Flash79.9%
Pass rate%· 35 个模型- #1GPT-5.6 Sol88.0%
- #2o3-pro84.9%
- #3Gemini 2.5 Pro83.1%
- #4o381.3%
- #5Grok 4.679.6%
Pass@1%· 15 个模型- #1DeepSeek-V3100.0%
- #2GPT-4o100.0%
- #3GPT-4o mini100.0%
- #4o3-mini100.0%
- #5o4-mini100.0%
HumanEval+%· 21 个模型- #1o189.0%
- #2o1-mini89.0%
- #3Qwen3.6-Plus87.2%
- #4GPT-4o87.2%
- #5DeepSeek-V386.6%
LMArena AgentAgent
| # | 模型 | Agent Score |
|---|---|---|
| #1 | Claude Opus 5Anthropic | 12.19 |
| #2 | Claude Fable 5Anthropic | 12.01 |
| #3 | GPT-5.6 SolOpenAI | 10.86 |
| #4 | Kimi K3Moonshot AI | 10.6 |
| #5 | Claude Opus 4.8Anthropic | 9.78 |
| #6 | GPT-5.5OpenAI | 8.9 |
| #7 | Claude Sonnet 5Anthropic | 7.14 |
| #8 | GLM-5.2Zhipu AI | 6.74 |
| #9 | Grok 4.5xAI | 6.19 |
| #10 | GPT-5.4OpenAI | 4.99 |
| #11 | GPT-5.6 LunaOpenAI | 4.28 |
| #12 | DeepSeek-V4-FlashDeepSeek | 4.04 |
| #13 | GPT-5.6 TerraOpenAI | 3.78 |
| #14 | Gemini 3.7 FlashGoogle | 3.61 |
| #15 | Claude Sonnet 4.6Anthropic | 3.12 |
| #16 | Kimi K2.7 CodeMoonshot AI | 1.08 |
| #17 | GLM-5.1Zhipu AI | 0.58 |
| #18 | Qwen3.7-MaxQwen | 0.2 |
| #19 | DeepSeek-V4-ProDeepSeek | 0.14 |
| #20 | Gemini 3.5 FlashGoogle | -0.29 |
| #21 | Gemini 3.1 ProGoogle | -0.44 |
| #22 | Kimi K2.6Moonshot AI | -0.56 |
| #23 | Gemini 3 ProGoogle | -2.36 |
| #24 | MiniMax-M3MiniMax | -2.53 |
| #25 | Mistral Medium 3.5Mistral AI | -7.03 |
| #26 | Grok 4.3xAI | -8.47 |
| #27 | -9.1 | |
| #28 | Gemini 2.5 ProGoogle | -10.1 |
| #29 | MiniMax-M2.7MiniMax | -11.17 |
| #30 | Nemotron-UltraNvidia | -14.63 |
「其他榜单排名」列显示该模型在其他榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。各榜单口径不同,数值不可直接横向比较。
LMArena Agent 榜:基于真实的 Agent 编码会话,由真人盲评打分(signal-based agent score)。数据取自 arena.ai/leaderboard/agent,我们 1:1 镜像,不做二次计算。
📊 7 大数据源方法论
LMArena Agent 榜:基于真实的 Agent 编码会话,由真人盲评打分(signal-based agent score)。数据取自 arena.ai/leaderboard/agent,我们 1:1 镜像,不做二次计算。
Agent Score30 个模型CursorBench 是 Cursor 官方的 Agent 编码基准(v3.2),任务来自真实 Cursor 会话中的多文件、模糊需求场景。指标为 pass rate (%)。数据镜像自 cursor.com/cursorbench 官方快照。
Pass rate%23 个模型Artificial Analysis 综合 20+ benchmark(MMLU-Pro、GPQA、HLE、SciCode、IFBench、Terminal-bench 等)合成一个 Intelligence Index,是"综合能力"最全面的商业评测机构。
AA Index77 个模型所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。各榜单方式不同,请勿直接横向比较不同榜单的原始数值。