2026 Live Verified

AI Coding Models Leaderboard

Aggregated official benchmark mirrors and real-world coding task scenarios. 100% verified, objective, and zero paid placement.

6Boards
103Models ranked
0Evaluation Tasks
September 2026Period
2026-09-30Last update
●We fetch raw rankings from 6 public benchmark providers directly — no re-weighting, no composite score. Click "Open official board" on each card to go to the source.
🧩Tool Matrix⚔️VS Compare
ADSponsored

📌 7 official boards · mirrored 1:1

Each card previews a provider's Top 5. Click "View full" for the complete board, or jump to the official page. Data is 100% from each provider — we do no aggregation or math.

LMArena Code ★
Human preference blind battle coding Elo leaderboard
Coding
Metric:Coding Elo· 51 models
  1. #1Claude Opus 5.51820.3
  2. #2GPT-6 Astra1792
  3. #3Claude Fable 5.11753
  4. #4Claude Sonnet 5.51698.8
  5. #5Claude Opus 51694
Official ↗
LMArena Agent
Human preference on real agentic coding sessions
Agent
Metric:Agent Score· 33 models
  1. #1Claude Fable 5.114.06
  2. #2Claude Opus 5.511.84
  3. #3GPT-6 Astra10.36
  4. #4Claude Opus 59.54
  5. #5GPT-6 Sol8.8
Official ↗
CursorBench
Cursor's first-party agentic coding benchmark (v4.0)
Agent
Metric:Pass rate%· 12 models
  1. #1Claude Opus 5.557.8%
  2. #2Claude Fable 5.151.8%
  3. #3Claude Opus 546.6%
  4. #4Grok 4.746.3%
  5. #5GPT-5.6 Sol41.7%
Official ↗
Artificial Analysis
Independent industry standard Intelligence Index
Overall
Metric:Intelligence Index· 97 models
  1. #1Claude Opus 5.557.6
  2. #2Claude Sonnet 5.556
  3. #3Claude Fable 5.153.4
  4. #4GPT-6 Astra52.7
  5. #5Claude Opus 550.8
Official ↗
LiveBench
Contamination-resistant coding suite (completion, generation, JS, Python, TS)
Coding
Metric:Score%· 43 models
  1. #1Claude Fable 5.183.4%
  2. #2Claude Opus 5.583.2%
  3. #3Claude Fable 583.0%
  4. #4GPT-6 Astra82.2%
  5. #5Muse Spark 1.381.6%
Official ↗
LMArena Text
Chatbot Arena text and general capability Elo rating
Chat
Metric:Arena Elo· 87 models
  1. #1Claude Opus 5.51508.6
  2. #2Claude Opus 4.81505.4
  3. #3Claude Fable 51503.8
  4. #4Claude Fable 5.11501.3
  5. #5Muse Spark 1.31496.2
Official ↗

LMArena CodeCoding

Metric: Coding Elo·51 models·fetched 2026-09-30

Open official board ↗
✨

Not sure which model fits your budget & stack?

Try 4-Way Plan Showdowns & $20/mo vs API Cost Break-Even Meter

Compare Plans & Costs↗
#ModelCoding EloValue ScoreCross-board ranksActions
#11820.3
20
L #2
C #1
A #1
L #2
L #1
#21792
8.1
L #3
C—
A #4
L #4
L #17
#31753
7.8
L #1
C #2
A #3
L #1
L #4
#41698.8
25.9
L—C—
A #2
L #17
L—
#5
Claude Opus 5Anthropic
1694
4.8
L #4
C #3
A #5
L #9
L #7
#6
GPT-6 SolOpenAI
1692.3
37.6
L #5
C—
A #8
L #11
L #32
#71671
47.2
L #19
C—
A #11
L #13
L #16
#8
Kimi K3Moonshot AI
1658.5
23.8
L #12
C—
A #15
L #10
L #9
#91654.7
65.2
L #16
C #11
A #7
L #5
L #5
#101636.3
43.4
L #13
C #4
A #10
L #19
L #45
#11
Hunyuan-T1Tencent
1633
513.1
L #11
C—
A #42
L—
L #33
#121625.9
7.6
L #6
C—
A #6
L #3
L #3
#13
GLM-5.3Zhipu AI
1622.9
64.4
L #18
C—
A #12
L #23
L #15
#141620.3
418
L #14
C—
A #20
L #6
L #19
#151620.2
42
L #23
C #6
A #13
L #15
L #23
#161619.3
11.9
L #8
C #5
A #9
L #7
L #12
#17
GLM-5.2Zhipu AI
1604.3
60.8
L #15
C—
A #30
L #31
L #20
#181593
87
L #27
C—
A #19
L #12
L #8
#191591.8
271
L #28
C—
A #29
L #27
L #46
#201583.3
633.2
L #21
C—
A #25
L #34
L #41
#211582.2
130.6
L #20
C—
A #26
L #18
L #28
#221581.4
83.5
L #17
C #7
A #18
L #26
L #6
#231557.1
14
L #7
C—
A #17
L #22
L #2
#241551.9
42.8
L #22
C—
A #22
L #25
L #25
#251539.9
30
L #9
C #9
A #23
L #24
L #29
#261536.3
76.9
L #31
C—
A #28
L #30
L #13
#271521.4
20.9
L—C—
A #32
L #33
L #24
#281519.7
26.4
L #24
C #8
A #16
L #16
L #27
#291517.3
121.9
L—C—
A #53
L—
L #34
#301516.9
246.4
L #26
C #10
A #24
L #29
L #36
#311514.9
216.5
L #29
C—
A #34
L #32
L #22
#32
GPT-5.5OpenAI
1512.4
18.1
L #10
C—
A #14
L #8
L #14
#33
Kimi K2.6Moonshot AI
1508.7
74.8
L—C—
A #39
L #35
L #30
#34
GLM-5.1Zhipu AI
1508.6
54.8
L—C—
A #40
L—
L #26
#351499.1
37.9
L—C—
A #31
L #28
L #18
#36
MiniMax-M3MiniMax
1482.4
199.8
L #30
C—
A #35
L #41
L #44
#371481.6
226.2
L—C—
A #36
L #37
L #31
#38
Kimi K2.7 CodeMoonshot AI
1473
47.6
L—C—
A #41
L #38
L—
#39
GPT-5.4OpenAI
1465
28.5
L #25
C—
A #21
L #14
L #21
#401446.3
50.1
L #32
C—
A #33
L #20
L #10
#411439.7
128
L—C—
A #48
L #42
L #35
#421439.1
44.1
L—C—
A #37
L—
L #11
#43
GLM-4-PlusZhipu AI
1434.6
74.9
L—C—
A #47
L—
L #43
#441397.1
417.4
L—C—
A #44
L #36
L #37
#451397
189.5
L—C—
A #46
L—
L #52
#46
DeepSeek-V3DeepSeek
1361.7
550.6
L—C—
A #50
L—
L #50
#471356.5
66.5
L—C—
A #43
L #43
L #42
#481329.5
43.9
L—C—
A #54
L—
L #53
#491263.2
83.9
L #33
C—
A #60
L—
L #48
#50
Mistral Large 3Mistral AI
1229.9
23.9
L—C—
A #73
L—
L #54
#511226.9
23.9
L—C—
A #56
L—
L #38
Rank color:#1#2#3#4-5#6-10#11+

The "Cross-board ranks" column shows this model's rank on the other boards at a glance (grey = not tested there). Boards use different methodologies, so raw values are not directly comparable.

LMArena Code board: LMSYS Coding Arena Elo ratings based on real developer blind tests on challenging code prompts. Sourced directly from arena.ai/leaderboard/code and mirrored 1:1.

ADSponsored
📊 6 benchmark providers

LMArena Code board: LMSYS Coding Arena Elo ratings based on real developer blind tests on challenging code prompts. Sourced directly from arena.ai/leaderboard/code and mirrored 1:1.

Coding Elo51 models

LMArena Agent board: real agentic coding sessions scored by human blind votes (signal-based agent score). Sourced from arena.ai/leaderboard/agent and mirrored 1:1.

Agent Score33 models

CursorBench is Cursor's first-party agentic coding benchmark (v4.0). Tasks come from real Cursor sessions with ambiguous, multi-file requirements. Metric: pass rate (%). Mirrored from Cursor's official cursor.com/cursorbench snapshot.

Pass rate%12 models

Artificial Analysis Intelligence Index: Tracks reasoning, quality, and coding intelligence across 600+ models, continuously updated as new frontier models release.

Intelligence Index97 models

LiveBench Coding: Monthly refreshed contamination-resistant suite extracting code completion, generation, JavaScript, Python, and TypeScript performance.

Score%43 models

LMArena Text board: The global standard LMSYS Chatbot Arena tracking cross-domain text generation and complex instruction-following Elo ratings from arena.ai/leaderboard/text.

Arena Elo87 models

All rankings and numbers come directly from official sources; we only do name matching and aggregate presentation, no weighting or re-ranking. Boards use different methodologies, so do not compare raw values across boards.