发生了什么
微软在 2026 年 10 月 9 日发布 Microsoft-Decision-1,并把它定位为「决策模型」这一新类别的成员:与生成文本或推理复杂问题的大语言模型不同,它面向的是软件可以直接消费的结构化输出。给出一组固定选项后,它为每个选项返回一个校准概率,覆盖是/否判断、单选与多选、打分,以及依据评分标准对大模型回答或智能体动作所做的评级,全部通过一次结构化的 API 调用完成。模型已上线 Microsoft Foundry,并计划很快通过 OpenRouter 提供。
在基座上,微软选择对开源小模型 Qwen3.5-9B 做后训练以实现超低延迟的单次推理打分,并表示后续会把它重新迁移到自家 MAI 模型与 OpenAI 的底座之上。微软给出的内部用例显示,Xbox 研究团队用它把一万多条玩家反馈分门别类,称质量与 GPT-6 Sol 相当、速度快约 14 倍、成本约为其 1/200;Copilot 团队用它做回答质量质检;值班工程师用它在线拉取上下文;微软 Discovery 用它为实验打分后再决定是否重规划。
- 速度:官方称在实测中响应最快,P50 延迟约为 GPT-6 Sol 的 1/35,比测试中的第二名快约 4.5 倍。
- 准确率:在 36 项对训练保密的基准、近 15 万道题上取得最高准确率,官方称其泛化性覆盖路由、排序、长上下文、多语言与分布外任务。
- 稳健性:对同一请求做八种形式扰动时,平均决策翻转率约 1.3%,选项释义改写或顺序打乱时未见翻转。
- 安全:在 11 项基准、5250 条请求上测试,官方称能拦截有害请求、越狱与提示注入,同时保持较高可用性。
- 定价:输入每百万 token 0.042 美元、输出免费,与 TypeSafe 的 Jev 标价一致。
为什么重要
Decision-1 的出现,说明「决策模型」正在从单个创业公司的概念变成一个被大厂接手的标准软件层。智能体在生产环境里的大量工作并不是写文案,而是反复做同一类小判断:这封邮件是不是垃圾、该把工单派给哪个团队、智能体应当直接执行还是转人工。把这类判断交给低价、低延迟、带置信度的专用模型,可以让应用在模型「有九成把握」时自动行动,并把不确定的个案交还给人。微软称其第一个客户就是自己,而路由决策在 Copilot、GitHub 与 Xbox 之间大量存在,也让微软有动机把它留在自家平台内完成。
- 局限一:速度与准确率数据均为微软自测,尚无可复现的第三方评测;其对比对象 GPT-6 Sol 是通用模型,本就不是为快速分类而设计。
- 局限二:该模型只能从既定选项里做判断,不能写文本、解释理由或调用工具,适合的是高频重复的判断型负载。
- 局限三:基座来自阿里巴巴的通义千问 Qwen3.5-9B,对存在「国产模型合规」要求的采购方可能成为额外考量;微软称将迁移至 MAI 与 OpenAI 底座,但未给出时间表,也未说明迁移后的定价是否变化。
需要观察
接下来值得关注两点:一是开发者能否在自己的数据上复现微软宣称的速度与准确率,二是微软是否会让 Decision-1 直接承担 Copilot、GitHub 等产品内部的模型路由。同一时间,OpenAI 的 Decisions API、Cloudflare 的 Clef 系列、Perplexity 与 AWS 都已涉足这一类别,决策模型的单价正在迅速贴近每百万 token 零点零几美元,围绕它的真正竞争会转向生态与治理能力,而非单点价格。

