AI Coding 模型排行榜
聚合全球 7 大权威基准镜像与真实开发任务场景评测。官方公开数据透明对齐,中立客观,无付费排名。
📌 7 大官方榜单 · 直连镜像
每张卡片是一家评测机构的 Top-5 缩略图。点「展开完整」查看该机构完整榜单,或直接跳转官方页面。数据 100% 来自各机构,我们不做归纳计算。
Agent Score· 30 个模型- #1Claude Fable 5.113.85
- #2GPT-6 Astra12.39
- #3Claude Opus 511.06
- #4Claude Fable 59.09
- #5Claude Opus 4.87.57
Pass rate%· 25 个模型- #1Claude Fable 5.175.6%
- #2Claude Fable 572.9%
- #3Gemini 3.8 Flash71.8%
- #4Grok 4.669.9%
- #5Gemini 3.7 Flash68.4%
Coding Index· 92 个模型- #1Claude Fable 5.153.4
- #2GPT-6 Astra52.8
- #3Claude Opus 550.7
- #4Claude Fable 549.7
- #5Muse Spark 1.348.2
Coding score%· 37 个模型- #1DeepSeek-V4 (Next-Gen MoE)78.4%
- #2Claude Fable 5.174.2%
- #3Claude Fable 571.7%
- #4Claude Opus 571.7%
- #5Muse Spark 1.370.9%
Pass rate%· 33 个模型- #1GPT-5.588.0%
- #2o3-pro84.9%
- #3Gemini 2.5 Pro83.1%
- #4o381.3%
- #5Grok 4.679.6%
Pass@1%· 15 个模型- #1DeepSeek-V3100.0%
- #2GPT-4o100.0%
- #3GPT-4o mini100.0%
- #4OpenAI o3-mini (High Reasoning Coding)100.0%
- #5o4-mini100.0%
HumanEval+%· 18 个模型- #1o189.0%
- #2o1-mini89.0%
- #3Qwen3.6-Plus87.2%
- #4GPT-4o87.2%
- #5DeepSeek-V386.6%
LMArena AgentAgent
不知道哪个模型最契合你的预算与技术栈?
回答 3 个问题,3 秒为您匹配最适合的编程大模型与套餐
| # | 模型 | Agent Score | 性价比 Value | 选型行动 |
|---|---|---|---|---|
| #1 | Claude Fable 5.1Anthropic | 13.85 | 7.9 | |
| #2 | GPT-6 AstraOpenAI | 12.39 | 7.8 | |
| #3 | Claude Opus 5Anthropic | 11.06 | 5.1 | |
| #4 | Claude Fable 5Anthropic | 9.09 | 7.2 | |
| #5 | Claude Opus 4.8Anthropic | 7.57 | 13.6 | |
| #6 | GPT-5.6 SolOpenAI | 7.51 | 12 | |
| #7 | Kimi K3Moonshot AI | 6.46 | 21.5 | |
| #8 | Claude Sonnet 5Anthropic | 5.88 | 31.9 | |
| #9 | Hunyuan-T1Tencent | 5.23 | 434.2 | |
| #10 | GPT-5.5OpenAI | 5.22 | 16.8 | |
| #11 | GLM-5.2Zhipu AI | 4.56 | 51.9 | |
| #12 | Muse Spark 1.3Meta | 4.23 | 67.9 | |
| #13 | DeepSeek-V4-ProDeepSeek | 4.14 | 118.2 | |
| #14 | Qwen3.8-MaxQwen | 3.97 | 40.8 | |
| #15 | Gemini 3.8 FlashGoogle | 3.84 | 82.3 | |
| #16 | Grok 4.5xAI | 3.83 | 39.7 | |
| #17 | Grok 4.6xAI | 3.12 | 43 | |
| #18 | GLM-5.3Zhipu AI | 2.62 | 56.6 | |
| #19 | DeepSeek-V4-FlashDeepSeek | 2.17 | 326.7 | |
| #20 | GPT-5.6 TerraOpenAI | 1.46 | 26.4 | |
| #21 | GPT-5.6 LunaOpenAI | 0.73 | 246 | |
| #22 | Qwen3.8-27BQwen | -0.08 | 240.1 | |
| #23 | Claude Sonnet 4.6Anthropic | -1.27 | 18.5 | |
| #24 | Qwen3.7-MaxQwen | -3.12 | 212.5 | |
| #25 | MiniMax-M3MiniMax | -5.38 | 157.1 | |
| #26 | Gemini 3.6 FlashGoogle | -5.41 | 60.7 | |
| #27 | Gemini 3.1 ProGoogle | -5.6 | 40.9 | |
| #28 | Mistral Medium 3.5Mistral AI | -10.12 | 46.1 | |
| #29 | MiniMax-M2.7MiniMax | -13.22 | 77.8 | |
| #30 | Gemini 3.5 Flash-LiteGoogle | -13.73 | 77.7 |
「其他榜单排名」列显示该模型在其他榜单里的排名徽章,一眼看清跨榜单表现(灰色 = 该榜单未测过此模型)。各榜单口径不同,数值不可直接横向比较。
LMArena Agent 榜:基于真实的 Agent 编码会话,由真人盲评打分(signal-based agent score)。数据取自 arena.ai/leaderboard/agent,我们 1:1 镜像,不做二次计算。
📊 7 大数据源方法论
LMArena Agent 榜:基于真实的 Agent 编码会话,由真人盲评打分(signal-based agent score)。数据取自 arena.ai/leaderboard/agent,我们 1:1 镜像,不做二次计算。
Agent Score30 个模型CursorBench 是 Cursor 官方的 Agent 编码基准(v3.2),任务来自真实 Cursor 会话中的多文件、模糊需求场景。指标为 pass rate (%)。数据镜像自 cursor.com/cursorbench 官方快照。
Pass rate%25 个模型Artificial Analysis 编程专项指数 (Coding Index):专注评估代码生成、推理与补全能力,从综合能力全面切换为编程专项指标。
Coding Index92 个模型LiveBench 编程专项:提取 LiveBench 中代码补全 (code completion)、代码生成 (code generation)、JS、Python 与 TypeScript 五大核心编程任务得分。
Coding score%37 个模型所有排名和数值都直接来自官方数据源,我们只做名称匹配和聚合展示,不做任何加权、加分或二次排名。各榜单方式不同,请勿直接横向比较不同榜单的原始数值。