2026 实时验证

AI Coding 模型排行榜

聚合全球 7 大权威基准镜像与真实开发任务场景评测。官方公开数据透明对齐,中立客观,无付费排名。

6数据源
103模型总数
0评测用例
September 2026数据周期
2026-09-30最近更新
●我们从 6 大公开评测机构直接拉取原始榜单,不做二次加权、不做综合排名。想深入了解,点每张卡片右上角「查看官方榜单」。
🧩适配矩阵⚔️横向 PK
ADSponsored

📌 7 大官方榜单 · 直连镜像

每张卡片是一家评测机构的 Top-5 缩略图。点「展开完整」查看该机构完整榜单,或直接跳转官方页面。数据 100% 来自各机构,我们不做归纳计算。

LMArena Code ★
真人盲评实时代码生成与编程 Elo 天梯
编码
指标:Coding Elo· 51 个模型
  1. #1Claude Opus 5.51820.3
  2. #2GPT-6 Astra1792
  3. #3Claude Fable 5.11753
  4. #4Claude Sonnet 5.51698.8
  5. #5Claude Opus 51694
官方 ↗
LMArena Agent
真人盲评的真实 Agent 编码会话
Agent
指标:Agent Score· 33 个模型
  1. #1Claude Fable 5.114.06
  2. #2Claude Opus 5.511.84
  3. #3GPT-6 Astra10.36
  4. #4Claude Opus 59.54
  5. #5GPT-6 Sol8.8
官方 ↗
CursorBench
Cursor 官方 Agent 编码基准 (v4.0)
Agent
指标:Pass rate%· 12 个模型
  1. #1Claude Opus 5.557.8%
  2. #2Claude Fable 5.151.8%
  3. #3Claude Opus 546.6%
  4. #4Grok 4.746.3%
  5. #5GPT-5.6 Sol41.7%
官方 ↗
Artificial Analysis
专业权威第三方独立大模型智力指数
综合
指标:Intelligence Index· 97 个模型
  1. #1Claude Opus 5.557.6
  2. #2Claude Sonnet 5.556
  3. #3Claude Fable 5.153.4
  4. #4GPT-6 Astra52.7
  5. #5Claude Opus 550.8
官方 ↗
LiveBench
题库定期换新,月度防污染编程评测
编码
指标:Score%· 43 个模型
  1. #1Claude Fable 5.183.4%
  2. #2Claude Opus 5.583.2%
  3. #3Claude Fable 583.0%
  4. #4GPT-6 Astra82.2%
  5. #5Muse Spark 1.381.6%
官方 ↗
LMArena Text
全球主流大模型盲评文本对话与综合能力 Elo 积分
对话
指标:Arena Elo· 87 个模型
  1. #1Claude Opus 5.51508.6
  2. #2Claude Opus 4.81505.4
  3. #3Claude Fable 51503.8
  4. #4Claude Fable 5.11501.3
  5. #5Muse Spark 1.31496.2
官方 ↗

LMArena Code编码

指标: Coding Elo·51 个模型·拉取于 2026-09-30

查看官方榜单 ↗
✨

不知道哪个模型最契合你的预算与技术栈?

体验「四大王牌套餐对决」与「$20包月 vs API 真实盈亏平衡测算仪」

前往比价与盈亏测算↗
#模型Coding Elo性价比 Value其他榜单排名选型行动
#11820.3
20
L #2
C #1
A #1
L #2
L #1
#21792
8.1
L #3
C—
A #4
L #4
L #17
#31753
7.8
L #1
C #2
A #3
L #1
L #4
#41698.8
25.9
L—C—
A #2
L #17
L—
#5
Claude Opus 5Anthropic
1694
4.8
L #4
C #3
A #5
L #9
L #7
#6
GPT-6 SolOpenAI
1692.3
37.6
L #5
C—
A #8
L #11
L #32
#71671
47.2
L #19
C—
A #11
L #13
L #16
#8
Kimi K3Moonshot AI
1658.5
23.8
L #12
C—
A #15
L #10
L #9
#91654.7
65.2
L #16
C #11
A #7
L #5
L #5
#101636.3
43.4
L #13
C #4
A #10
L #19
L #45
#11
Hunyuan-T1Tencent
1633
513.1
L #11
C—
A #42
L—
L #33
#121625.9
7.6
L #6
C—
A #6
L #3
L #3
#13
GLM-5.3Zhipu AI
1622.9
64.4
L #18
C—
A #12
L #23
L #15
#141620.3
418
L #14
C—
A #20
L #6
L #19
#151620.2
42
L #23
C #6
A #13
L #15
L #23
#161619.3
11.9
L #8
C #5
A #9
L #7
L #12
#17
GLM-5.2Zhipu AI
1604.3
60.8
L #15
C—
A #30
L #31
L #20
#181593
87
L #27
C—
A #19
L #12
L #8
#191591.8
271
L #28
C—
A #29
L #27
L #46
#201583.3
633.2
L #21
C—
A #25
L #34
L #41
#211582.2
130.6
L #20
C—
A #26
L #18
L #28
#221581.4
83.5
L #17
C #7
A #18
L #26
L #6
#231557.1
14
L #7
C—
A #17
L #22
L #2
#241551.9
42.8
L #22
C—
A #22
L #25
L #25
#251539.9
30
L #9
C #9
A #23
L #24
L #29
#261536.3
76.9
L #31
C—
A #28
L #30
L #13
#271521.4
20.9
L—C—
A #32
L #33
L #24
#281519.7
26.4
L #24
C #8
A #16
L #16
L #27
#291517.3
121.9
L—C—
A #53
L—
L #34
#301516.9
246.4
L #26
C #10
A #24
L #29
L #36
#311514.9
216.5
L #29
C—
A #34
L #32
L #22
#32
GPT-5.5OpenAI
1512.4
18.1
L #10
C—
A #14
L #8
L #14
#33
Kimi K2.6Moonshot AI
1508.7
74.8
L—C—
A #39
L #35
L #30
#34
GLM-5.1Zhipu AI
1508.6
54.8
L—C—
A #40
L—
L #26
#351499.1
37.9
L—C—
A #31
L #28
L #18
#36
MiniMax-M3MiniMax
1482.4
199.8
L #30
C—
A #35
L #41
L #44
#371481.6
226.2
L—C—
A #36
L #37
L #31
#38
Kimi K2.7 CodeMoonshot AI
1473
47.6
L—C—
A #41
L #38
L—
#39
GPT-5.4OpenAI
1465
28.5
L #25
C—
A #21
L #14
L #21
#401446.3
50.1
L #32
C—
A #33
L #20
L #10
#411439.7
128
L—C—
A #48
L #42
L #35
#421439.1
44.1
L—C—
A #37
L—
L #11
#43
GLM-4-PlusZhipu AI
1434.6
74.9
L—C—
A #47
L—
L #43
#441397.1
417.4
L—C—
A #44
L #36
L #37
#451397
189.5
L—C—
A #46
L—
L #52
#46
DeepSeek-V3DeepSeek
1361.7
550.6
L—C—
A #50
L—
L #50
#471356.5
66.5
L—C—
A #43
L #43
L #42
#481329.5
43.9
L—C—
A #54
L—
L #53
#491263.2
83.9
L #33
C—
A #60
L—
L #48
#50
Mistral Large 3Mistral AI
1229.9
23.9
L—C—
A #73
L—
L #54
#511226.9
23.9
L—C—
A #56
L—
L #38
排名颜色:#1#2#3#4-5#6-10#11+

「其他榜单排名」列显示该模型在其他榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。各榜单口径不同,数值不可直接横向比较。

LMArena Code 榜:LMSYS 代码竞技场,基于开发者真实盲评代码生成与竞赛挑战计算 Elo 天梯分。数据取自 arena.ai/leaderboard/code 实时同步,我们 1:1 镜像展示,不做二次加权。

ADSponsored
📊 6 大权威数据源方法论

LMArena Code 榜:LMSYS 代码竞技场,基于开发者真实盲评代码生成与竞赛挑战计算 Elo 天梯分。数据取自 arena.ai/leaderboard/code 实时同步,我们 1:1 镜像展示,不做二次加权。

Coding Elo51 个模型

LMArena Agent 榜:基于真实的 Agent 编码与多轮工具会话,由真人盲评打分(signal-based agent score)。数据镜像自 arena.ai/leaderboard/agent。

Agent Score33 个模型

CursorBench 是 Cursor 官方的 Agent 编码基准(v4.0),任务来自真实 Cursor 会话中的多文件、模糊需求场景。指标为 pass rate (%)。数据镜像自 cursor.com/cursorbench 官方快照。

Pass rate%12 个模型

Artificial Analysis 综合指数 (Intelligence Index):专注评估前沿大模型的综合推理、智商与代码质量,覆盖 600+ 主流前沿模型,每日高频跟踪最新发布。

Intelligence Index97 个模型

LiveBench 编程专项:每月定期换新防污染题库,提取代码补全 (code completion)、代码生成 (code generation)、JS、Python 与 TypeScript 等核心编程得分。

Score%43 个模型

LMArena Text 榜:全球最大规模真人盲测竞技场(Chatbot Arena),评估大语言模型跨领域文本生成与复杂指令遵从的综合 Elo 评分。数据实时镜像自 arena.ai/leaderboard/text。

Arena Elo87 个模型

所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。各榜单方式不同,请勿直接横向比较不同榜单的原始数值。