AWS Strands Labs 于 2026-10-01 发布 Strands Decider 2B(strands-labs/strands-decider Apache-2.0;权重 HF hobson-v19):去掉 LM head,换成选项打分头;JevBench public 167/231≈72.3%、Brier≈0.35;RTX 3090 中位约 115ms。pip install strands-decider 即可做路由、工具选择与 before_tool_call 门控。

核心要点速览 (Key Takeaways)

  • ✓官博 2026-10-01;代码仓 strands-labs/strands-decider Apache-2.0(API 核实 ★140);权重 StrandsAgents/strands-decider-2B-hobson-v19
  • ✓架构:Qwen3.5-2B torso + rank-16 LoRA + ~1M 参数 pointer head;输出 noul/choice/score + 置信度,非自由文本
  • ✓跑分(HF/官博自报):JevBench public 167/231(≈72.3%),Brier≈0.348;2B 档宣称 33 家里第 3(不含刚过 2B 则第 1)
  • ✓延迟:RTX 3090 中位约 115ms;M3 MacBook 小任务约 153ms(官博图示,随 task size 近似线性)
  • ✓落地:pip install strands-decider → ask/serve;可挂 Strands InterventionHandler.before_tool_call 拦未 grounding 的工具调用
🧭

阅读完核心要点?进一步了解模型实力与实际开销

7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算

🔬

深度技术解析与实战评估

核心背景与行业痛点

Agent 流水线里大量决策其实是「在有限选项里选一个」:模型路由、工具是否该调、参数是否 grounded、策略分类。用大模型做这些又贵又慢,且缺少稳定置信度。TypeSafe Jev 把「决策模型 / system one」推上台面后,开源与本地替代迅速跟进。AWS Strands Labs 在 2026-10-01 放出 Strands Decider 2B:专为低延迟本地实验与 harness 门控设计,而不是又一个聊天模型。

架构亮点与底层机制

底座取 Qwen3.5-2B torso,去掉 LM head,换上约百万级 pointer head:用选项位置隐状态对 <answer> 位置打分,一次前向给出选项分布;torso 用 rank-16 LoRA。题型含 noul(是否)、choice(N 选一)、score(有序量表),每答带校准置信度。代码与训练脚本在 strands-labs/strands-decider(Apache-2.0);发布检查点为 HF hobson-v19。可挂 Strands InterventionHandler.before_tool_call,在工具执行前问「参数是否用户说过」「是否过早调用」,返回 Proceed/Deny/Confirm/Guide。

权威 Benchmark 与实测跑分对比

数字均来自官博/HF 自报,非第三方复现:JevBench public 167/231(≈72.3%),Brier ≈0.348,ECE≈0.050(window 4096);作者称 2B 档 33 模型中第 3(剔除刚过 2B 则第 1)。内部集示例:held-out short 0.641(n=6000)、contractnli 0.872、musique 0.884。延迟:RTX 3090 中位约 115ms,M3 小任务约 153ms,随 task token 近似线性。局限也写明:长文档多步弱、换问句常同答、score/noul 换 rubric 迁移差——上线前务必用自己的流量标定阈值。

开发者实战落地与开箱指南

  1. pip install strands-decider;权重首次从 HF 拉基座+LoRA+head。
  2. CLI:strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19 --state '...' --choice '...';或 serve --port 8000 本地 HTTP(默认绑 127.0.0.1、无鉴权,仅实验)。
  3. Python:StrandsDeciderModel.load(...);示例见仓内 examples/strands/。
  4. 用途优先:路由、工具选择、guardrail、before_tool_call 门控;难推理仍交给大模型,形成 hybrid agent。
  5. 复现训练见仓内 training/recipe.sh(H100 集群约 1h+;单卡 3090 约 11h)——只消费推理可跳过。