开发者 3 秒速决决策指标
OpenRouter 于 2026-10-02 上线 Model Router Benchmarks:7 个模型路由(Auto、Jev、NVIDIA Switchyard、Unbiased Pareto、Sakana Fugu 等)在 GPQA Diamond、Tau3 Banking、MMMU Pro Vision、SWE Atlas QA、Deep SWE、Terminal Bench 2.1 上对照质量、速度和成本。Router Index 默认质量 60% / 时间 20% / 成本 20%。openrouter/pareto-code 与 Fusion 不在这张榜上。
核心要点速览 (Key Takeaways)
- ✓官宣:@OpenRouter 2026-10-02 22:08 UTC;博文 Model Router Benchmarks(Brian Thomas,10/2/2026);页面 openrouter.ai/benchmarks/routers
- ✓七个路由 slug:
openrouter/auto、typesafe/jev-router、nvidia/switchyard、unbiased/pareto、sakana/fugu-max、sakana/fugu-ultra、sakana/fugu-ultra-v2。openrouter/pareto-code与 Fusion 未入榜 - ✓Router Index 默认质量 60% / 时间 20% / 成本 20%(0–10,可调权重),不等于原始正确率
- ✓公开 stats(2026-10-04 SGT):Deep SWE 113 题,Switchyard Flash+Opus 5.5 与只走 Opus 5.5 均为 83/113(约 $279 / $285);Flash+GPT-6 Sol 74/113、约 $55
- ✓Terminal Bench 2.1(89 题):GPT-6 Astra 直连 77/89($66.50),Opus 5.5 74/89($24.00);Pareto 同题量一档 71/89($27.20)
把技术选型换算成你的开发预算
29+ 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
模型路由已经从「选一家推理供应商」变成「同一条请求里换模型」。贵的前沿模型和便宜的开源模型价差很大:OpenRouter 在 2026-10-02 博文里举例,GPT-6 Astra 的平均每 token 实付价比 DeepSeek v4 Flash 高 48 倍以上,Codex 里平均 10–49 轮会话大约贵 21 倍。法律检索、写代码、长程 agent 的规划段和机械执行段,最优模型也不是同一个。
但换模型本身有代价:输入缓存要重建,只看 prompt 很难判断难度,会话阶段的启发式可能和模型下一步不一致,路由计算还会加延迟。官方账号 @OpenRouter 于 2026-10-02 22:08 UTC 宣布 Model Router Benchmarks:把 7 个路由放在 6 项基准上,同时看质量、速度和成本。页面会持续加路由、改分数,不是一次性冻榜。
架构亮点与底层机制
博文把「router」拆成两类。Provider routing 是 OpenRouter 从第一天就在做的事:同一模型在多家供应商之间按价格、速度、可用性和数据政策挑选并失败回退。这次榜单比的是 model routing:请求发给一个路由 slug,由它决定用哪个(或哪些)模型回答。
博文划分的三种被测风格:
- 混合执行:Unbiased 的 Pareto(
unbiased/pareto)和 Sakana 的 Fugu。不公开用了哪些模型、多久换一次,按统一的每 token 价格计费,有时会升级到前沿模型。 - 每轮选一个模型:Auto Router(
openrouter/auto)和 Jev Router(typesafe/jev-router)。选谁是透明的,按被选中模型的标准价计费。Auto 用近 7 天社区花费份额;Jev 用决策模型判断任务类型、难度和更强模型的边际收益,再从池子里挑够用的最便宜候选。 - 预设配对切换:NVIDIA Switchyard(
nvidia/switchyard)在便宜模型和更强模型之间切换。榜上测了多组配对,调用时也可以自己指定。
博文明确 没有 放进这张榜的:openrouter/pareto-code(按编码智力档位选一个模型)、-latest 家族别名,以及 Fusion(多模型委员会再综合)。它们用途不同,需要另一套比较方法。不要把榜上的 Unbiased Pareto 和文档里的 Pareto Code 当成同一个东西。
页面上的 Router Index 把质量、速度、成本合成 0–10 分。默认权重是质量 60%、每任务时间 20%、成本 20%,滑条可以改。因此格子里的指数分不等于原始正确率。
权威 Benchmark 与实测跑分对比
官宣图和公开接口 [/api/frontend/v1/stats/router-benchmarks](https://openrouter.ai/api/frontend/v1/stats/router-benchmarks)(2026-10-04 SGT 拉取,truncated: false,112 条成功 run)对得上的六项是:GPQA Diamond、Tau3 Banking、MMMU Pro Vision、SWE Atlas QA、Deep SWE、Terminal Bench 2.1。接口里另有 search_hle,不在这六列里。下列数字是该接口的 原始 accuracy 与 total_cost,不是页面上的 Router Index;只比较题量相同的 run。
Deep SWE,均为 113 题:
| 路由 / 配对 | 正确 | 花费 | run 时间 |
|---|---|---|---|
| Switchyard:GLM-5.3-Flash + Claude Opus 5.5 | 83/113 | $278.71 | 2026-09-28 |
| Switchyard:只走 Claude Opus 5.5 | 83/113 | $285.01 | 2026-09-23 |
| Switchyard:GPT-6 Sol + GPT-6 Astra | 80/113 | $265.41 | 2026-09-28 |
| Switchyard:DeepSeek V4.1 Flash + GPT-6 Sol | 74/113 | $54.61 | 2026-09-28 |
| Auto Router,cost tier high | 65/113 | $166.94 | 2026-09-29 |
| Auto Router,cost tier medium | 62/113 | $90.35 | 2026-09-29 |
| Switchyard:只走 GPT-6 Luna | 60/113 | $7.50 | 2026-09-23 |
Terminal Bench 2.1,均为 89 题(约 2026-09-30):GPT-6 Astra 直连 77/89($66.50),Claude Opus 5.5 直连 74/89($24.00),GPT-6 Sol 71/89($16.02),Unbiased Pareto 的一档 run 71/89($27.20;另一条是 145/178,不能并进这列),GPT-6 Luna 63/89($1.22),Fugu Max 58/89($50.25)。Jev 的 Deep SWE 是 159/226,Pareto 的 Deep SWE 是 153/226,和 113 题那组不是同一分母。GPQA Diamond 在 198 题这档:Switchyard Sol+Astra 187/198($6.71),Jev 186/198($3.15),Switchyard Flash+Sol 185/198($1.45)。
开发者实战落地与开箱指南
这些路由都走现有 Chat Completions,把 model 换成路由 slug 即可。对照表:基准页,说明:博文。
- 要市场花费驱动、可调贵贱:
openrouter/auto,用 cost tier(文档为 low / medium / high / xhigh / max)。见 Auto Router。 - 要透明选模加推理档位:
typesafe/jev-router,可用models/excluded_models收窄候选池。见 Jev Router。 - 要便宜/强模型配对:
nvidia/switchyard,在models里给出至多三个候选;不给则用近 7 天用量默认对。见 Switchyard。 - 混合路由:
unbiased/pareto、sakana/fugu-max、sakana/fugu-ultra-v2。计费是统一 token 价,不是「被选中模型的标价」。 - 编码场景若只想「按智力档位钉一个模型」,用文档中的
openrouter/pareto-code(min_coding_score0–1)。它 不在 这张榜里。
先用自己的仓库跑一小段 agent,再看 Activity 里实际命中的模型和缓存命中,不要只抄 Router Index。博文也写了:榜单代表的是通用任务,不是你的工作负载。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察