微软 10 月 9 日发布首个自研决策模型 Microsoft-Decision-1:不生成文本,而是对给定选项输出校准概率,面向路由、分类、校验、Agent 护栏与 AI 评审。官方称其在 36 项盲测基准上准确率最高、P50 延迟约为 GPT-6 Sol 的 1/35,扰动下决策翻转率 1.3%;已在 Microsoft Foundry、OpenRouter 可用,32K 上下文。

核心要点速览

  • ✓价格:输入 $0.042/百万 Token、输出 $0,32,768 Token 上下文(OpenRouter 模型页)
  • ✓官方口径:36 项训练盲测基准、近 15 万题准确率第一;比第二名 H2O-Lightning-4B v1.1 快 2.5 倍,比 GPT-6 Sol 快 35 倍(微软博客)
  • ✓鲁棒性:同一请求做 8 类扰动,平均决策翻转率 1.3%,选项改写/倒序/打乱时为 0 次翻转
  • ✓底座:由 Qwen3.5-9B 后训练为单次前向打分,微软称后续将换到 MAI 与 OpenAI 底座
  • ✓内部实测:Xbox Research 标注 1 万+ 条反馈,质量接近 GPT-6 Sol,速度快 14 倍以上、成本低约 200 倍(厂商口径)
微软发布 Microsoft-Decision-1 决策模型:基于 Qwen3.5-9B 后训练,输入 $0.042/百万 Token、输出免费,已上 Foundry 与 OpenRouter
🖼️要闻配图
点击全屏高清查看
🧭

把技术选型换算成你的开发预算

40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟

🔬

深度技术解析与实战评估

核心背景与行业痛点

过去一个月,“决策模型”成了 Agent 工程里的新品类:OpenAI Decisions API、Perplexity、AWS、Liquid AI 都推出了只输出结构化选择与概率、不生成长文本的小模型。痛点很直接——Agent 每一步都要做路由、校验、是否继续之类的判断,用大模型来做既慢又贵,还要解析自由文本。10 月 9 日微软带着首个自研方案 Microsoft-Decision-1 入场,Satya Nadella 亲自发帖宣布。

架构亮点与底层机制

模型由 Qwen3.5-9B 后训练而来,做单次前向打分:给定固定选项,直接返回每个选项的校准概率,支持是/否、多选、评分以及按 rubric 评审 AI 回答和 Agent 动作。概率本身就是 API 的一部分,应用可按置信度决定执行、延后或转人工。微软称后续会换到 MAI 和 OpenAI 底座,但 API 形态保持不变;OpenRouter 页面注明权重会持续更新,且不适用于开放式生成、对话、翻译或摘要。

权威 Benchmark 与实测跑分对比

以下均为微软官方口径,尚无第三方复现:在 36 项训练盲测基准、近 15 万道题上准确率第一;速度比第二名 H2O-Lightning-4B v1.1 快 2.5 倍,P50 延迟约为 GPT-6 Sol 的 1/35;8 类扰动下平均决策翻转率 1.3%;在 11 个安全基准的 5,250 条请求上拦截有害请求并保持可用性。内部案例:Xbox Research 处理 1 万+ 条反馈,质量接近 GPT-6 Sol,快 14 倍以上、便宜约 200 倍。

开发者实战落地与开箱指南

可在 Microsoft Foundry 模型目录或 OpenRouter 调用,价格为输入 $0.042/百万 Token、输出免费,上下文 32K。注意它走 OpenRouter Decisions API(POST /api/alpha/decisions,问题类型为 choice / noul / score),不兼容 chat completions SDK。建议用在 Agent 下一步“继续/停止/重试/转交”判断、模型路由、工单分级和 LLM-as-judge 上,并通过 openrouter-decisions skill 用自己的探测集与其他决策模型对比后再锁定版本。

实战指南准备好将技术转化为生产力?

即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。