返回行业动态
模型与产品

微软推出决策小模型 Microsoft-Decision-1:延迟约为 GPT-6 Sol 的 1/35

微软于 2026 年 10 月 9 日发布 Microsoft-Decision-1,一款专做结构化决策打分的小模型。它不生成文本,只对一组固定选项返回校准过的概率,支持是/否、多选、评分以及按评分标准为大模型输出与智能体动作评级,用于路由、分类、优先级判定、校验与工作流控制。该模型由 Qwen3.5-9B 后训练而来,已上线 Microsoft Foundry 并接入 OpenRouter,输入每百万 token 0.042 美元、输出免费。微软自测称其在 36 项对训练保密的基准、近 15 万道题上准确率最高,P50 延迟约为 GPT-6 Sol 的 1/35。

来源:Microsoft 官方博客(Command Line):Introducing Microsoft-Decision-1原标题:Introducing Microsoft-Decision-1, our model for fast decision-making查看原文
浅色数据中心机房里成排服务器机柜纵深延伸,画面中央悬浮三向分叉的发光路径与概率刻度环,配中文标题「决策模型上新」

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

微软在 2026 年 10 月 9 日发布 Microsoft-Decision-1,并把它定位为「决策模型」这一新类别的成员:与生成文本或推理复杂问题的大语言模型不同,它面向的是软件可以直接消费的结构化输出。给出一组固定选项后,它为每个选项返回一个校准概率,覆盖是/否判断、单选与多选、打分,以及依据评分标准对大模型回答或智能体动作所做的评级,全部通过一次结构化的 API 调用完成。模型已上线 Microsoft Foundry,并计划很快通过 OpenRouter 提供。

在基座上,微软选择对开源小模型 Qwen3.5-9B 做后训练以实现超低延迟的单次推理打分,并表示后续会把它重新迁移到自家 MAI 模型与 OpenAI 的底座之上。微软给出的内部用例显示,Xbox 研究团队用它把一万多条玩家反馈分门别类,称质量与 GPT-6 Sol 相当、速度快约 14 倍、成本约为其 1/200;Copilot 团队用它做回答质量质检;值班工程师用它在线拉取上下文;微软 Discovery 用它为实验打分后再决定是否重规划。

  • 速度:官方称在实测中响应最快,P50 延迟约为 GPT-6 Sol 的 1/35,比测试中的第二名快约 4.5 倍。
  • 准确率:在 36 项对训练保密的基准、近 15 万道题上取得最高准确率,官方称其泛化性覆盖路由、排序、长上下文、多语言与分布外任务。
  • 稳健性:对同一请求做八种形式扰动时,平均决策翻转率约 1.3%,选项释义改写或顺序打乱时未见翻转。
  • 安全:在 11 项基准、5250 条请求上测试,官方称能拦截有害请求、越狱与提示注入,同时保持较高可用性。
  • 定价:输入每百万 token 0.042 美元、输出免费,与 TypeSafe 的 Jev 标价一致。

为什么重要

Decision-1 的出现,说明「决策模型」正在从单个创业公司的概念变成一个被大厂接手的标准软件层。智能体在生产环境里的大量工作并不是写文案,而是反复做同一类小判断:这封邮件是不是垃圾、该把工单派给哪个团队、智能体应当直接执行还是转人工。把这类判断交给低价、低延迟、带置信度的专用模型,可以让应用在模型「有九成把握」时自动行动,并把不确定的个案交还给人。微软称其第一个客户就是自己,而路由决策在 Copilot、GitHub 与 Xbox 之间大量存在,也让微软有动机把它留在自家平台内完成。

  • 局限一:速度与准确率数据均为微软自测,尚无可复现的第三方评测;其对比对象 GPT-6 Sol 是通用模型,本就不是为快速分类而设计。
  • 局限二:该模型只能从既定选项里做判断,不能写文本、解释理由或调用工具,适合的是高频重复的判断型负载。
  • 局限三:基座来自阿里巴巴的通义千问 Qwen3.5-9B,对存在「国产模型合规」要求的采购方可能成为额外考量;微软称将迁移至 MAI 与 OpenAI 底座,但未给出时间表,也未说明迁移后的定价是否变化。

需要观察

接下来值得关注两点:一是开发者能否在自己的数据上复现微软宣称的速度与准确率,二是微软是否会让 Decision-1 直接承担 Copilot、GitHub 等产品内部的模型路由。同一时间,OpenAI 的 Decisions API、Cloudflare 的 Clef 系列、Perplexity 与 AWS 都已涉足这一类别,决策模型的单价正在迅速贴近每百万 token 零点零几美元,围绕它的真正竞争会转向生态与治理能力,而非单点价格。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。