vLLM Semantic Router(vllm-sr)团队于 10 月 11 日在 Hugging Face 以 Apache-2.0 开源 Decision 3.0 系列(d3、d3-flash、d3-mini、d3-nano、d3-lite、d3-edge),基于 Qwen3.5/3.8,支持文本、图片和视频输入,一次调用直接输出选择题、是/否、打分三类问题的概率而不生成文本。官方口径:27B 旗舰 d3 在 Jev Decision Index 0.3.1 得 64.7,领先 Perplexity Decider v1.1(62.8)和上一代 Decision 2.0(55.9);单张 MI325X 上文本请求中位延迟 55ms。vLLM 官方账号转发祝贺。

核心要点速览

  • ✓六档尺寸:d3-edge 0.59B、d3-lite 0.85B、d3-nano 2.2B、d3-mini 4.5B、d3-flash 8.4B、d3 26.1B,全部 Apache-2.0(HF 合集)
  • ✓官方口径 Jev Decision Index 0.3.1:d3 64.7,Perplexity Decider v1.1 62.8,Jev 60.1,Decision 2.0 55.9
  • ✓视觉榜(Vision Index 0.3.1):d3 71.6,Perplexity Decider v1.1 70.6,JEV-27B-VL 69.6
  • ✓单张 AMD MI325X、单并发中位延迟:d3 文本 55ms / 图片 273ms / 10 秒视频 553ms;d3-edge 文本仅 6.7ms
  • ✓不生成文本,直接给每个选项打概率;同一输入可一次问多道 Choice / Yes-No / Score 题
vLLM Semantic Router 开源 Decision 3.0:0.6B–27B 六款多模态决策模型,官方测评 Jev Decision Index 第一
🖼️要闻配图
点击全屏高清查看
🧭

本地显存不够?先比较云端 API 与自部署的实际成本

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

Agent 和网关里大量调用其实不是“写一段话”,而是“选一个”:这条请求该路由到哪个模型、这次工具调用要不要拦、这张截图里有没有发票。用大模型生成文本再解析答案,既慢又难校准置信度。这类“System 1 决策模型”(社区常称 Jev 类模型)正在成为独立赛道,vLLM Semantic Router 团队此次开源的 Decision 3.0 是目前覆盖尺寸最全的一套开放权重方案。

架构亮点与底层机制

系列共六款,全部基于 Qwen3.5(0.8B–9B)或 Qwen3.8-27B 微调,参数从 d3-edge 的 0.59B 到旗舰 d3 的 26.09B(含 0.46B 视觉编码器)。输入可以是文本或 JSON,再加多张图片(PNG/JPEG/WebP)和多段视频(按 2 fps 抽帧,最多 32 帧)。模型不生成文本:你在一次调用里给出若干道 Choice、Yes/No 或 Score 问题,每道题单独做一次前向,直接返回每个选项的概率,方便设阈值、做路由。

权威 Benchmark 与实测跑分对比

以下均为官方模型卡口径、团队自测:Jev Decision Index 0.3.1 上 d3 得 64.7,高于 Perplexity Decider v1.1(62.8)、Fastino GLiDE(60.2)、Jev(60.1)和上一代 Decision 2.0(55.9);视觉榜 d3 71.6,对比 JEV-27B-VL 69.6。速度方面,单张 AMD MI325X、单并发下 d3 文本中位 55ms、带图 273ms、10 秒视频 553ms;d3-edge 文本中位 6.7ms,但公共集得分只有 28.82,小模型适合做前置粗筛。独立第三方复测暂未见。

开发者实战落地与开箱指南

安装 transformers==5.17.0 后用 AutoModel.from_pretrained("vllm-sr/d3", trust_remote_code=True) 加载,调用 model.system_one(state=..., questions=..., images=..., videos=...) 即可拿到概率结果。实用思路是用 0.6B–2B 档在网关里做意图路由和工具调用审查,把难题交给 27B 或通用大模型。注意它需要 trust_remote_code,生产前请审阅仓库代码;全部权重见 Hugging Face 合集。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。