2026 实时验证

AI Coding 模型排行榜

聚合全球 7 大权威基准镜像与真实开发任务场景评测。官方公开数据透明对齐,中立客观,无付费排名。

7数据源
95模型总数
777评测用例
September 2026数据周期
2026-09-12最近更新
我们从 6 大公开评测机构直接拉取原始榜单,不做二次加权、不做综合排名。想深入了解,点每张卡片右上角「查看官方榜单」。
🧩适配矩阵⚔️横向 PK
ADSponsored

📌 7 大官方榜单 · 直连镜像

每张卡片是一家评测机构的 Top-5 缩略图。点「展开完整」查看该机构完整榜单,或直接跳转官方页面。数据 100% 来自各机构,我们不做归纳计算。

LMArena Agent
真人盲评的真实 Agent 编码会话
Agent
指标:Agent Score· 30 个模型
  1. #1Claude Fable 5.113.85
  2. #2GPT-6 Astra12.39
  3. #3Claude Opus 511.06
  4. #4Claude Fable 59.09
  5. #5Claude Opus 4.87.57
官方 ↗
CursorBench
Cursor 官方 Agent 编码基准 (v3.2)
Agent
指标:Pass rate%· 25 个模型
  1. #1Claude Fable 5.175.6%
  2. #2Claude Fable 572.9%
  3. #3Gemini 3.8 Flash71.8%
  4. #4Grok 4.669.9%
  5. #5Gemini 3.7 Flash68.4%
官方 ↗
Artificial Analysis
官方 Coding Index 编程专项指数
编码
指标:Coding Index· 92 个模型
  1. #1Claude Fable 5.153.4
  2. #2GPT-6 Astra52.8
  3. #3Claude Opus 550.7
  4. #4Claude Fable 549.7
  5. #5Muse Spark 1.348.2
官方 ↗
LiveBench Coding
题库定期换新,代码生成/补全专项
编码
指标:Coding score%· 37 个模型
  1. #1DeepSeek-V4 (Next-Gen MoE)78.4%
  2. #2Claude Fable 5.174.2%
  3. #3Claude Fable 571.7%
  4. #4Claude Opus 571.7%
  5. #5Muse Spark 1.370.9%
官方 ↗
Aider Polyglot
133 道真实编程任务,6 种语言
编码
指标:Pass rate%· 33 个模型
  1. #1GPT-5.588.0%
  2. #2o3-pro84.9%
  3. #3Gemini 2.5 Pro83.1%
  4. #4o381.3%
  5. #5Grok 4.679.6%
官方 ↗
LiveCodeBench
持续更新的竞赛编程题库
编码
指标:Pass@1%· 15 个模型
  1. #1DeepSeek-V3100.0%
  2. #2GPT-4o100.0%
  3. #3GPT-4o mini100.0%
  4. #4OpenAI o3-mini (High Reasoning Coding)100.0%
  5. #5o4-mini100.0%
官方 ↗
EvalPlus
HumanEval+ 严格版测试套件
编码
指标:HumanEval+%· 18 个模型
  1. #1o189.0%
  2. #2o1-mini89.0%
  3. #3Qwen3.6-Plus87.2%
  4. #4GPT-4o87.2%
  5. #5DeepSeek-V386.6%
官方 ↗

LMArena AgentAgent

指标: Agent Score·30 个模型·拉取于 2026-09-12

查看官方榜单 ↗

不知道哪个模型最契合你的预算与技术栈?

回答 3 个问题,3 秒为您匹配最适合的编程大模型与套餐

开启 3 秒智能向导
#模型Agent Score性价比 Value其他榜单排名选型行动
#113.85
7.9
C #1
A #1
L #2
ALE
#212.39
7.8
C
A #2
L #13
ALE
#3
Claude Opus 5Anthropic
11.06
5.1
C
A #3
L #4
ALE
#49.09
7.2
C #2
A #4
L #3
ALE
#57.57
13.6
C #11
A #11
L #19
A #8
L #10
E
#67.51
12
C #6
A #6
L #10
ALE
#7
Kimi K3Moonshot AI
6.46
21.5
C #14
A #9
L #6
ALE
#85.88
31.9
C #15
A #18
L #8
AL
E #8
#9
Hunyuan-T1Tencent
5.23
434.2
C
A #38
LALE
#10
GPT-5.5OpenAI
5.22
16.8
C #19
A #17
L #15
A #1
L
E #14
#11
GLM-5.2Zhipu AI
4.56
51.9
C #21
A #25
L #20
ALE
#124.23
67.9
C
A #5
L #5
ALE
#134.14
118.2
C #12
A #20
L #18
ALE
#143.97
40.8
C #10
A #13
L #9
ALE
#153.84
82.3
C #3
A #12
L #22
ALE
#163.83
39.7
C #7
A #16
L #23
ALE
#173.12
43
C #4
A #8
L #16
A #5
LE
#18
GLM-5.3Zhipu AI
2.62
56.6
C #18
A #7
L #7
ALE
#192.17
326.7
C #17
A #23
L #26
ALE
#201.46
26.4
C #9
A #10
L #17
ALE
#210.73
246
C #16
A #19
L #21
ALE
#22-0.08
240.1
C
A #26
L #11
ALE
#23-1.27
18.5
C #23
A #29
L #28
A #13
L #9
E
#24-3.12
212.5
C
A #31
L #33
A #15
L #13
E
#25
MiniMax-M3MiniMax
-5.38
157.1
C
A #32
L #35
ALE
#26-5.41
60.7
C
A #24
L #29
ALE
#27-5.6
40.9
C
A #30
L #30
AL
E #18
#28-10.12
46.1
C
A #53
LALE
#29-13.22
77.8
C
A #41
LALE
#30-13.73
77.7
C
A #42
L #27
ALE
排名颜色:#1#2#3#4-5#6-10#11+

「其他榜单排名」列显示该模型在其他榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。各榜单口径不同,数值不可直接横向比较。

LMArena Agent 榜:基于真实的 Agent 编码会话,由真人盲评打分(signal-based agent score)。数据取自 arena.ai/leaderboard/agent,我们 1:1 镜像,不做二次计算。

ADSponsored
📊 7 大数据源方法论

LMArena Agent 榜:基于真实的 Agent 编码会话,由真人盲评打分(signal-based agent score)。数据取自 arena.ai/leaderboard/agent,我们 1:1 镜像,不做二次计算。

Agent Score30 个模型

CursorBench 是 Cursor 官方的 Agent 编码基准(v3.2),任务来自真实 Cursor 会话中的多文件、模糊需求场景。指标为 pass rate (%)。数据镜像自 cursor.com/cursorbench 官方快照。

Pass rate%25 个模型

Artificial Analysis 编程专项指数 (Coding Index):专注评估代码生成、推理与补全能力,从综合能力全面切换为编程专项指标。

Coding Index92 个模型

LiveBench 编程专项:提取 LiveBench 中代码补全 (code completion)、代码生成 (code generation)、JS、Python 与 TypeScript 五大核心编程任务得分。

Coding score%37 个模型

133 道真实编码任务(Bug 修复 / 功能开发),覆盖 6 种语言。指标为 pass_rate_2。

Pass rate%33 个模型

持续更新的竞赛编程题库,指标为 Pass@1。

Pass@1%15 个模型

HumanEval+ 严格版测试套件,164 道题。

HumanEval+%18 个模型

所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。各榜单方式不同,请勿直接横向比较不同榜单的原始数值。