Perplexity 在 Hugging Face 发布 Apache-2.0 的 pplx-decider-v1.1-27b,基于 Qwen3.8-27B,不生成文本而是直接输出带概率的分类/路由/打分答案;Decision Index 总分 61.56(v1 为 56.4,Jev 为 57.9),并可通过 Perplexity Decisions API 调用。

核心要点速览

  • ✓Decision Index 总分 61.56,比 v1(56.4)高 5.16 分,比 Jev(57.9)高 3.66 分,同一 Qwen3.8-27B 底座
  • ✓分项:Language 69.45、Retrieval 61.26、Tools 78.88、Knowledge 48.18(仍低于 Jev 的 51.4)
  • ✓提升主要来自取消全注意力层的因果掩码(noncausal)以及加入 tasksource 等更多训练数据
  • ✓输出头是 [255, 5120] 的 BF16 readout,不是全词表 lm_head;权重约 49 GiB,需 CUDA GPU
  • ✓托管调用:POST /v1/decisions,支持 noul / choice / score 三类问题,一次请求可问多个问题(文档)
Perplexity 开源 pplx-decider-v1.1-27b 决策模型:Decision Index 从 56.4 提到 61.56,反超 Jev 3.6 分
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

Agent 系统里大量调用其实不是“写回答”,而是分类、路由、按规则打分:这条工单归哪个团队、这段检索结果是否相关、这次工具调用该不该继续。用聊天模型做这些事,要靠 prompt 让它吐出标签再解析文本,既慢又拿不到可阈值化的概率。Perplexity 的 pplx-decider-v1.1-27b 就是专门为“做决定”训练的开源模型,Apache-2.0 授权。

架构亮点与底层机制

底座是 Qwen3.8-27B,但输出端换成了一个 BF16 的 [255, 5120] 决策头(readout),不是全词表 lm_head,模型只在给定候选上输出概率。相比 v1,v1.1 把全注意力层改为非因果(noncausal)注意力,并加入 tasksource 等更多数据;推理时需用仓库自带的 DecisionModel 实现并只施加一次校准温度,否则复现不了评测结果。

权威 Benchmark 与实测跑分对比

据模型卡,Decision Index 总分 61.56,v1 为 56.4,Jev 为 57.9。分项:Language 69.45、Retrieval 61.26、Tools 78.88(v1 为 79.3)、Arts 44.66,Knowledge 48.18 仍落后 Jev 的 51.4。以上均为官方自报,暂无独立复测。

开发者实战落地与开箱指南

自托管需 Python 3.12+、CUDA GPU,权重约 49 GiB。不想自己部署可直接调用 Decisions API:POST /v1/decisions,传入 state 和多个命名问题(noul 是/否、choice 单选、score 量表),返回每题的概率和置信度。适合把 Agent 中的意图路由、RAG 相关性判断、评审打分从大模型对话里拆出来。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。