AI Coding 模型排行榜
聚合全球 7 大权威基准镜像与真实开发任务场景评测。官方公开数据透明对齐,中立客观,无付费排名。
📌 7 大官方榜单 · 直连镜像
每张卡片是一家评测机构的 Top-5 缩略图。点「展开完整」查看该机构完整榜单,或直接跳转官方页面。数据 100% 来自各机构,我们不做归纳计算。
Coding Elo· 51 个模型- #1Claude Opus 5.51820.3
- #2GPT-6 Astra1792
- #3Claude Fable 5.11753
- #4Claude Sonnet 5.51698.8
- #5Claude Opus 51694
Agent Score· 33 个模型- #1Claude Fable 5.114.06
- #2Claude Opus 5.511.84
- #3GPT-6 Astra10.36
- #4Claude Opus 59.54
- #5GPT-6 Sol8.8
Pass rate%· 12 个模型- #1Claude Opus 5.557.8%
- #2Claude Fable 5.151.8%
- #3Claude Opus 546.6%
- #4Grok 4.746.3%
- #5GPT-5.6 Sol41.7%
Intelligence Index· 97 个模型- #1Claude Opus 5.557.6
- #2Claude Sonnet 5.556
- #3Claude Fable 5.153.4
- #4GPT-6 Astra52.7
- #5Claude Opus 550.8
Score%· 43 个模型- #1Claude Fable 5.183.4%
- #2Claude Opus 5.583.2%
- #3Claude Fable 583.0%
- #4GPT-6 Astra82.2%
- #5Muse Spark 1.381.6%
Arena Elo· 87 个模型- #1Claude Opus 5.51508.6
- #2Claude Opus 4.81505.4
- #3Claude Fable 51503.8
- #4Claude Fable 5.11501.3
- #5Muse Spark 1.31496.2
LMArena Code编码
不知道哪个模型最契合你的预算与技术栈?
体验「四大王牌套餐对决」与「$20包月 vs API 真实盈亏平衡测算仪」
| # | 模型 | Coding Elo | 性价比 Value | 选型行动 |
|---|---|---|---|---|
| #1 | Claude Opus 5.5Anthropic | 1820.3 | 20 | |
| #2 | GPT-6 AstraOpenAI | 1792 | 8.1 | |
| #3 | Claude Fable 5.1Anthropic | 1753 | 7.8 | |
| #4 | Claude Sonnet 5.5Anthropic | 1698.8 | 25.9 | |
| #5 | Claude Opus 5Anthropic | 1694 | 4.8 | |
| #6 | GPT-6 SolOpenAI | 1692.3 | 37.6 | |
| #7 | Qwen3.8-MaxQwen | 1671 | 47.2 | |
| #8 | Kimi K3Moonshot AI | 1658.5 | 23.8 | |
| #9 | Muse Spark 1.3Meta | 1654.7 | 65.2 | |
| #10 | Grok 4.7xAI | 1636.3 | 43.4 | |
| #11 | Hunyuan-T1Tencent | 1633 | 513.1 | |
| #12 | Claude Fable 5Anthropic | 1625.9 | 7.6 | |
| #13 | GLM-5.3Zhipu AI | 1622.9 | 64.4 | |
| #14 | DeepSeek-V4-FlashDeepSeek | 1620.3 | 418 | |
| #15 | Grok 4.6xAI | 1620.2 | 42 | |
| #16 | GPT-5.6 SolOpenAI | 1619.3 | 11.9 | |
| #17 | GLM-5.2Zhipu AI | 1604.3 | 60.8 | |
| #18 | Gemini 3.7 FlashGoogle | 1593 | 87 | |
| #19 | Qwen3.8-27BQwen | 1591.8 | 271 | |
| #20 | GPT-6 LunaOpenAI | 1583.3 | 633.2 | |
| #21 | DeepSeek-V4-ProDeepSeek | 1582.2 | 130.6 | |
| #22 | Gemini 3.8 FlashGoogle | 1581.4 | 83.5 | |
| #23 | Claude Opus 4.8Anthropic | 1557.1 | 14 | |
| #24 | Grok 4.5xAI | 1551.9 | 42.8 | |
| #25 | Claude Sonnet 5Anthropic | 1539.9 | 30 | |
| #26 | Gemini 3.6 FlashGoogle | 1536.3 | 76.9 | |
| #27 | Claude Sonnet 4.6Anthropic | 1521.4 | 20.9 | |
| #28 | GPT-5.6 TerraOpenAI | 1519.7 | 26.4 | |
| #29 | Doubao Seed 2.0 ProByteDance | 1517.3 | 121.9 | |
| #30 | GPT-5.6 LunaOpenAI | 1516.9 | 246.4 | |
| #31 | Qwen3.7-MaxQwen | 1514.9 | 216.5 | |
| #32 | GPT-5.5OpenAI | 1512.4 | 18.1 | |
| #33 | Kimi K2.6Moonshot AI | 1508.7 | 74.8 | |
| #34 | GLM-5.1Zhipu AI | 1508.6 | 54.8 | |
| #35 | Gemini 3.5 FlashGoogle | 1499.1 | 37.9 | |
| #36 | MiniMax-M3MiniMax | 1482.4 | 199.8 | |
| #37 | Qwen3.6-PlusQwen | 1481.6 | 226.2 | |
| #38 | Kimi K2.7 CodeMoonshot AI | 1473 | 47.6 | |
| #39 | GPT-5.4OpenAI | 1465 | 28.5 | |
| #40 | Gemini 3.1 ProGoogle | 1446.3 | 50.1 | |
| #41 | Gemini 3.5 Flash-LiteGoogle | 1439.7 | 128 | |
| #42 | Gemini 3 ProGoogle | 1439.1 | 44.1 | |
| #43 | GLM-4-PlusZhipu AI | 1434.6 | 74.9 | |
| #44 | GPT-5.4 miniOpenAI | 1397.1 | 417.4 | |
| #45 | MiniMax-M2.7MiniMax | 1397 | 189.5 | |
| #46 | DeepSeek-V3DeepSeek | 1361.7 | 550.6 | |
| #47 | Grok 4.3xAI | 1356.5 | 66.5 | |
| #48 | Claude Haiku 4.5Anthropic | 1329.5 | 43.9 | |
| #49 | Mistral Medium 3.5Mistral AI | 1263.2 | 83.9 | |
| #50 | Mistral Large 3Mistral AI | 1229.9 | 23.9 | |
| #51 | Gemini 2.5 ProGoogle | 1226.9 | 23.9 |
「其他榜单排名」列显示该模型在其他榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。各榜单口径不同,数值不可直接横向比较。
LMArena Code 榜:LMSYS 代码竞技场,基于开发者真实盲评代码生成与竞赛挑战计算 Elo 天梯分。数据取自 arena.ai/leaderboard/code 实时同步,我们 1:1 镜像展示,不做二次加权。
📊 6 大权威数据源方法论
LMArena Code 榜:LMSYS 代码竞技场,基于开发者真实盲评代码生成与竞赛挑战计算 Elo 天梯分。数据取自 arena.ai/leaderboard/code 实时同步,我们 1:1 镜像展示,不做二次加权。
Coding Elo51 个模型LMArena Agent 榜:基于真实的 Agent 编码与多轮工具会话,由真人盲评打分(signal-based agent score)。数据镜像自 arena.ai/leaderboard/agent。
Agent Score33 个模型CursorBench 是 Cursor 官方的 Agent 编码基准(v4.0),任务来自真实 Cursor 会话中的多文件、模糊需求场景。指标为 pass rate (%)。数据镜像自 cursor.com/cursorbench 官方快照。
Pass rate%12 个模型Artificial Analysis 综合指数 (Intelligence Index):专注评估前沿大模型的综合推理、智商与代码质量,覆盖 600+ 主流前沿模型,每日高频跟踪最新发布。
Intelligence Index97 个模型LiveBench 编程专项:每月定期换新防污染题库,提取代码补全 (code completion)、代码生成 (code generation)、JS、Python 与 TypeScript 等核心编程得分。
Score%43 个模型LMArena Text 榜:全球最大规模真人盲测竞技场(Chatbot Arena),评估大语言模型跨领域文本生成与复杂指令遵从的综合 Elo 评分。数据实时镜像自 arena.ai/leaderboard/text。
Arena Elo87 个模型所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。各榜单方式不同,请勿直接横向比较不同榜单的原始数值。