OpenRouter 于 2026-10-02 上线 Model Router Benchmarks:7 个模型路由(Auto、Jev、NVIDIA Switchyard、Unbiased Pareto、Sakana Fugu 等)在 GPQA Diamond、Tau3 Banking、MMMU Pro Vision、SWE Atlas QA、Deep SWE、Terminal Bench 2.1 上对照质量、速度和成本。Router Index 默认质量 60% / 时间 20% / 成本 20%。openrouter/pareto-code 与 Fusion 不在这张榜上。

核心要点速览 (Key Takeaways)

  • ✓官宣:@OpenRouter 2026-10-02 22:08 UTC;博文 Model Router Benchmarks(Brian Thomas,10/2/2026);页面 openrouter.ai/benchmarks/routers
  • ✓七个路由 slug:openrouter/auto、typesafe/jev-router、nvidia/switchyard、unbiased/pareto、sakana/fugu-max、sakana/fugu-ultra、sakana/fugu-ultra-v2。openrouter/pareto-code 与 Fusion 未入榜
  • ✓Router Index 默认质量 60% / 时间 20% / 成本 20%(0–10,可调权重),不等于原始正确率
  • ✓公开 stats(2026-10-04 SGT):Deep SWE 113 题,Switchyard Flash+Opus 5.5 与只走 Opus 5.5 均为 83/113(约 $279 / $285);Flash+GPT-6 Sol 74/113、约 $55
  • ✓Terminal Bench 2.1(89 题):GPT-6 Astra 直连 77/89($66.50),Opus 5.5 74/89($24.00);Pareto 同题量一档 71/89($27.20)
🧭

把技术选型换算成你的开发预算

29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

模型路由已经从「选一家推理供应商」变成「同一条请求里换模型」。贵的前沿模型和便宜的开源模型价差很大:OpenRouter 在 2026-10-02 博文里举例,GPT-6 Astra 的平均每 token 实付价比 DeepSeek v4 Flash 高 48 倍以上,Codex 里平均 10–49 轮会话大约贵 21 倍。法律检索、写代码、长程 agent 的规划段和机械执行段,最优模型也不是同一个。

但换模型本身有代价:输入缓存要重建,只看 prompt 很难判断难度,会话阶段的启发式可能和模型下一步不一致,路由计算还会加延迟。官方账号 @OpenRouter 于 2026-10-02 22:08 UTC 宣布 Model Router Benchmarks:把 7 个路由放在 6 项基准上,同时看质量、速度和成本。页面会持续加路由、改分数,不是一次性冻榜。

架构亮点与底层机制

博文把「router」拆成两类。Provider routing 是 OpenRouter 从第一天就在做的事:同一模型在多家供应商之间按价格、速度、可用性和数据政策挑选并失败回退。这次榜单比的是 model routing:请求发给一个路由 slug,由它决定用哪个(或哪些)模型回答。

博文划分的三种被测风格:

  • 混合执行:Unbiased 的 Pareto(unbiased/pareto)和 Sakana 的 Fugu。不公开用了哪些模型、多久换一次,按统一的每 token 价格计费,有时会升级到前沿模型。
  • 每轮选一个模型:Auto Router(openrouter/auto)和 Jev Router(typesafe/jev-router)。选谁是透明的,按被选中模型的标准价计费。Auto 用近 7 天社区花费份额;Jev 用决策模型判断任务类型、难度和更强模型的边际收益,再从池子里挑够用的最便宜候选。
  • 预设配对切换:NVIDIA Switchyard(nvidia/switchyard)在便宜模型和更强模型之间切换。榜上测了多组配对,调用时也可以自己指定。

博文明确 没有 放进这张榜的:openrouter/pareto-code(按编码智力档位选一个模型)、-latest 家族别名,以及 Fusion(多模型委员会再综合)。它们用途不同,需要另一套比较方法。不要把榜上的 Unbiased Pareto 和文档里的 Pareto Code 当成同一个东西。

页面上的 Router Index 把质量、速度、成本合成 0–10 分。默认权重是质量 60%、每任务时间 20%、成本 20%,滑条可以改。因此格子里的指数分不等于原始正确率。

权威 Benchmark 与实测跑分对比

官宣图和公开接口 [/api/frontend/v1/stats/router-benchmarks](https://openrouter.ai/api/frontend/v1/stats/router-benchmarks)(2026-10-04 SGT 拉取,truncated: false,112 条成功 run)对得上的六项是:GPQA Diamond、Tau3 Banking、MMMU Pro Vision、SWE Atlas QA、Deep SWE、Terminal Bench 2.1。接口里另有 search_hle,不在这六列里。下列数字是该接口的 原始 accuracy 与 total_cost,不是页面上的 Router Index;只比较题量相同的 run。

Deep SWE,均为 113 题:

路由 / 配对正确花费run 时间
Switchyard:GLM-5.3-Flash + Claude Opus 5.583/113$278.712026-09-28
Switchyard:只走 Claude Opus 5.583/113$285.012026-09-23
Switchyard:GPT-6 Sol + GPT-6 Astra80/113$265.412026-09-28
Switchyard:DeepSeek V4.1 Flash + GPT-6 Sol74/113$54.612026-09-28
Auto Router,cost tier high65/113$166.942026-09-29
Auto Router,cost tier medium62/113$90.352026-09-29
Switchyard:只走 GPT-6 Luna60/113$7.502026-09-23

Terminal Bench 2.1,均为 89 题(约 2026-09-30):GPT-6 Astra 直连 77/89($66.50),Claude Opus 5.5 直连 74/89($24.00),GPT-6 Sol 71/89($16.02),Unbiased Pareto 的一档 run 71/89($27.20;另一条是 145/178,不能并进这列),GPT-6 Luna 63/89($1.22),Fugu Max 58/89($50.25)。Jev 的 Deep SWE 是 159/226,Pareto 的 Deep SWE 是 153/226,和 113 题那组不是同一分母。GPQA Diamond 在 198 题这档:Switchyard Sol+Astra 187/198($6.71),Jev 186/198($3.15),Switchyard Flash+Sol 185/198($1.45)。

开发者实战落地与开箱指南

这些路由都走现有 Chat Completions,把 model 换成路由 slug 即可。对照表:基准页,说明:博文。

  1. 要市场花费驱动、可调贵贱:openrouter/auto,用 cost tier(文档为 low / medium / high / xhigh / max)。见 Auto Router。
  2. 要透明选模加推理档位:typesafe/jev-router,可用 models / excluded_models 收窄候选池。见 Jev Router。
  3. 要便宜/强模型配对:nvidia/switchyard,在 models 里给出至多三个候选;不给则用近 7 天用量默认对。见 Switchyard。
  4. 混合路由:unbiased/pareto、sakana/fugu-max、sakana/fugu-ultra-v2。计费是统一 token 价,不是「被选中模型的标价」。
  5. 编码场景若只想「按智力档位钉一个模型」,用文档中的 openrouter/pareto-code(min_coding_score 0–1)。它 不在 这张榜里。

先用自己的仓库跑一小段 agent,再看 Activity 里实际命中的模型和缓存命中,不要只抄 Router Index。博文也写了:榜单代表的是通用任务,不是你的工作负载。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。