10 月 8 日 JetBrains 开源 Mellum2.1 Thinking:架构仍为 12B MoE / 2.5B 激活、131K 上下文、Apache 2.0;几乎全部增益来自百万级真实沙箱 RL。同管线自评:SWE-bench Verified 47.0(Mellum2 仅 2.0)、LiveCodeBench v6 82.0;HF 可下,vLLM 一键服务,GGUF/MTP 即将到来。

核心要点速览

  • ✓模型规格:12B MoE / 2.5B 激活、131K 上下文、Apache 2.0;架构相对 Mellum2 不变(HF 模型卡)
  • ✓Agent 跃迁:同管线 SWE-bench Verified 2.0→47.0、SWE-bench Pro 0.0→28.0、Terminal-Bench 2.1 0.6→17.4(Pi v0.73.1 harness)
  • ✓编码强度:LiveCodeBench v6 82.0(同组领先 Qwen3.5-9B 75.4)、HumanEval+ 91.5、BFCL v4 62.3
  • ✓吞吐:官方称重载下同组最快,单请求 MTP 约 1.6×;仍落后 Qwen3.5-9B 的 SWE Verified 50.0 / Pro 38.0
  • ✓落地:vllm serve JetBrains/Mellum2.1-12B-A2.5B-Thinking --reasoning-parser qwen3;GGUF / Ollama / LM Studio / MTP head 即将发布(JetBrains 博客)
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

本地与边缘编程 Agent 需要「够快、够小、还能进仓库改代码」的开源权重。JetBrains 在 6 月开源的 Mellum2(12B MoE / 2.5B 激活)吞吐出色,但官方坦言它还不能在真实仓库里可靠地探索、编辑并自检。10 月 8 日发布的 Mellum2.1 把几乎全部算力押在后训练:把 RL 从短收尾阶段升级为主训练,并在自建基础设施上跑了数百万次真实沙箱。

架构亮点与底层机制

架构相对 Mellum2 未改:12B 总参 / 2.5B 激活、28 层、64 专家中激活 8、131K 上下文、Apache 2.0(见 Hugging Face 模型卡)。变化集中在三块:① RL 规模与方法实验;② 数学/竞程/科学/工具/软件工程任务更严过滤;③ 软件工程在真实仓库 + shell + 文件编辑工具里训练,以测试通过为奖励。目标画像是 Agent 系统里的快速 worker / sub-agent,也可自托管保数据不出境。

权威 Benchmark 与实测跑分对比

以下分数均为 JetBrains 同管线 thinking 模式自评(非第三方独立榜),Agent 评测统一用开源 Pi v0.73.1(shell+文件工具、114K 上下文)。相对 Mellum2:SWE-bench Verified 2.0→47.0,SWE-bench Pro 0.0→28.0,Terminal-Bench 2.1 0.6→17.4。同组对比 Qwen3.5-9B / Gemma 4 E4B:Mellum2.1 在 LiveCodeBench v6(82.0)、HumanEval+(91.5)、MBPP+(79.4)、BFCL v4(62.3)领先;仍落后 Qwen3.5-9B 的 SWE Verified(50.0)与 Pro(38.0)。吞吐上官方称重载下同组最快,单请求 MTP 约 1.6×。HarmBench 从 21.5 降到 8.5(越低越好)。

开发者实战落地与开箱指南

权重已在 Hugging Face:JetBrains/Mellum2.1-12B-A2.5B-Thinking。推荐用 vLLM:

vllm serve JetBrains/Mellum2.1-12B-A2.5B-Thinking \
  --max-model-len 131072 --reasoning-parser qwen3 \
  --enable-auto-tool-choice --tool-call-parser hermes

面向仓库内任务时可接 Pi / 自研 harness,让模型读改测闭环。GGUF(llama.cpp / Ollama / LM Studio)与 vLLM 的 MTP speculative head 即将发布——适合先在 GPU 上用 bf16/vLLM 验证 Agent 工作流,再等量化包上边缘机。注意:SWE 分数为官方自报,接入前请用自己的回归集复测。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。