2026 年 6 月

AI Coder Bench

真实编程任务基准排行。50 项任务,覆盖 Bug 修复、功能开发、重构、系统设计和 Debug & 解释。

7数据源
83模型总数
777任务数
August 2026期间
2026-08-15最近更新
我们从 6 大公开评测机构直接拉取原始榜单,不做二次加权、不做综合排名。想深入了解,点每张卡片右上角「查看官方榜单」。

📌 7 大官方榜单 · 直连镜像

每张卡片是一家评测机构的 Top-5 缩略图。点「展开完整」查看该机构完整榜单,或直接跳转官方页面。数据 100% 来自各机构,我们不做归纳计算。

LMArena Agent
真人盲评的真实 Agent 编码会话
Agent
指标:Agent Score· 30 个模型
  1. #1Claude Opus 512.19
  2. #2Claude Fable 512.01
  3. #3GPT-5.6 Sol10.86
  4. #4Kimi K310.6
  5. #5Claude Opus 4.89.78
官方 ↗
CursorBench
Cursor 官方 Agent 编码基准 (v3.2)
Agent
指标:Pass rate%· 23 个模型
  1. #1Claude Fable 572.9%
  2. #2Grok 4.669.9%
  3. #3Gemini 3.7 Flash68.4%
  4. #4GPT-5.6 Sol67.2%
  5. #5Grok 4.566.7%
官方 ↗
Artificial Analysis
综合 20+ benchmark 的智能指数
综合
指标:AA Index· 77 个模型
  1. #1Claude Opus 563.1
  2. #2Claude Fable 562.1
  3. #3GPT-5.6 Sol60.9
  4. #4Grok 4.660.9
  5. #5Kimi K359.7
官方 ↗
LiveBench
题库定期换新,防止训练污染
推理
指标:Avg score%· 29 个模型
  1. #1Claude Fable 583.4%
  2. #2GPT-5.6 Sol81.6%
  3. #3GPT-5.580.8%
  4. #4Claude Opus 580.5%
  5. #5Gemini 3.7 Flash79.9%
官方 ↗
Aider Polyglot
133 道真实编程任务,6 种语言
编码
指标:Pass rate%· 35 个模型
  1. #1GPT-5.6 Sol88.0%
  2. #2o3-pro84.9%
  3. #3Gemini 2.5 Pro83.1%
  4. #4o381.3%
  5. #5Grok 4.679.6%
官方 ↗
LiveCodeBench
持续更新的竞赛编程题库
推理
指标:Pass@1%· 15 个模型
  1. #1DeepSeek-V3100.0%
  2. #2GPT-4o100.0%
  3. #3GPT-4o mini100.0%
  4. #4o3-mini100.0%
  5. #5o4-mini100.0%
官方 ↗
EvalPlus
HumanEval+ 严格版测试套件
编码
指标:HumanEval+%· 21 个模型
  1. #1o189.0%
  2. #2o1-mini89.0%
  3. #3Qwen3.6-Plus87.2%
  4. #4GPT-4o87.2%
  5. #5DeepSeek-V386.6%
官方 ↗

LMArena AgentAgent

指标: Agent Score·30 个模型·拉取于 2026-08-15

查看官方榜单 ↗
#模型Agent Score其他榜单排名
#1
Claude Opus 5Anthropic
12.19
C
A #1
L #4
ALE
#212.01
C #1
A #2
L #1
ALE
#310.86
C #4
A #3
L #2
A #1
L
E #21
#4
Kimi K3Moonshot AI
10.6
C #12
A #5
L #6
ALE
#59.78
C #9
A #7
L #13
A #8
L #10
E #11
#6
GPT-5.5OpenAI
8.9
C #17
A #9
L #3
A #19
LE
#77.14
C #13
A #12
L #15
AL
E #8
#8
GLM-5.2Zhipu AI
6.74
C #19
A #15
L #22
ALE
#96.19
C #5
A #11
L #14
ALE
#10
GPT-5.4OpenAI
4.99
C
A #14
L #9
ALE
#114.28
C #14
A #16
L #20
ALE
#124.04
C #15
A #18
L #17
ALE
#133.78
C #7
A #8
L #10
ALE
#143.61
C #3
A #10
L #5
ALE
#153.12
C #21
A #20
L #21
A #13
L #9
E #15
#16
Kimi K2.7 CodeMoonshot AI
1.08
C #20
A #25
L #25
ALE
#17
GLM-5.1Zhipu AI
0.58
C
A #29
LALE
#180.2
C
A #22
L #19
A #15
L #13
E
#190.14
C #10
A #13
L #11
ALE
#20-0.29
C #22
A #17
L #16
ALE
#21-0.44
C
A #21
L #12
ALE
#22
Kimi K2.6Moonshot AI
-0.56
C #23
A #24
L #23
A #16
LE
#23-2.36
C
A #19
L #18
ALE
#24
MiniMax-M3MiniMax
-2.53
C
A #23
L #27
ALE
#25-7.03
C
A #41
LALE
#26-8.47
C
A #34
L #29
ALE
#27-9.1
C
A #31
L #26
ALE
#28-10.1
C
A #26
L
A #3
L #11
E #10
#29-11.17
C
A #33
LALE
#30-14.63
C
A #47
LALE
排名颜色:#1#2#3#4-5#6-10#11+

「其他榜单排名」列显示该模型在其他榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。各榜单口径不同,数值不可直接横向比较。

LMArena Agent 榜:基于真实的 Agent 编码会话,由真人盲评打分(signal-based agent score)。数据取自 arena.ai/leaderboard/agent,我们 1:1 镜像,不做二次计算。

📊 7 大数据源方法论

LMArena Agent 榜:基于真实的 Agent 编码会话,由真人盲评打分(signal-based agent score)。数据取自 arena.ai/leaderboard/agent,我们 1:1 镜像,不做二次计算。

Agent Score30 个模型

CursorBench 是 Cursor 官方的 Agent 编码基准(v3.2),任务来自真实 Cursor 会话中的多文件、模糊需求场景。指标为 pass rate (%)。数据镜像自 cursor.com/cursorbench 官方快照。

Pass rate%23 个模型

Artificial Analysis 综合 20+ benchmark(MMLU-Pro、GPQA、HLE、SciCode、IFBench、Terminal-bench 等)合成一个 Intelligence Index,是"综合能力"最全面的商业评测机构。

AA Index77 个模型

LiveBench 每月更新题库,防止模型通过"背题"刷分。覆盖推理、数学、编码、语言、指令跟随、数据分析等 6 大能力。

Avg score%29 个模型

133 道真实编码任务(Bug 修复 / 功能开发),覆盖 6 种语言。指标为 pass_rate_2。

Pass rate%35 个模型

持续更新的竞赛编程题库,指标为 Pass@1。

Pass@1%15 个模型

HumanEval+ 严格版测试套件,164 道题。

HumanEval+%21 个模型

所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。各榜单方式不同,请勿直接横向比较不同榜单的原始数值。