微软 Decision-1 AI 模型发布
TECH

微软 Decision-1 AI 模型发布

31+
Signals

战略概览

  • 01.
    微软在 Microsoft Foundry 推出了 Microsoft-Decision-1,该模型读取提供的内容以及一组预定义的答案选项,并为每个选项返回一个校准后的概率分数,而不是生成开放式文本。
  • 02.
    Decision-1 基于阿里巴巴开源权重的 90 亿参数 Qwen3.5-9B 基础模型,由微软工程师进行后训练,最终成为一款未公开权重的闭源产品。
  • 03.
    定价为每百万输入 token 0.042 美元,输出 token 免费,因为模型仅返回分数而非生成的文本。
  • 04.
    微软表示,Decision-1 在涵盖近 15 万个问题的 36 项基准测试中是其测试过的最准确的模型,运行速度比亚军 H2O-Lightning-4B 快 2.5 倍,比 GPT-6 Sol 快约 35 倍。

微软最新商用模型实为阿里巴巴模型的再训练版本

此次发布最关键的细节并非速度声明,而是模型来源。微软并未为结构化决策构建新的基础模型,也未使用其与 OpenAI 合作的模型。相反,它将阿里巴巴开源权重的 Qwen3.5-9B [1](一个 90 亿参数的基础模型)进行后训练,最终由其 CEO 亲自发布 [15]。对于一家在基础模型领域投入巨资的公司而言,选择中国实验室的开源发布作为旗舰 Foundry SKU 的基础,传递出一个明确信号:价值不再存在于模型权重本身,而在于后训练、校准和分发。

然而这一方向随后逆转。Decision-1 发布时完全不开放权重,其 Hugging Face 页面返回 404 错误,这意味着客户无法进行自托管或微调 [3]。微软还表示,计划将该模型重新基于其自身的 MAI 模型和 OpenAI 模型,而不仅仅是当前的 Qwen 基础 [4],但并未公布时间表或向后兼容性保证 [5]。这对当前将 Decision-1 集成到智能体控制循环中的用户构成了真正的集成风险,因为被替换的正是团队已针对其调整阈值的部分:特定 90 亿参数模型的评分分布和延迟特征。

开发者立即注意到了这种不对称性。在 Hacker News 上,评论者指出 Decision-1 基于 Qwen 系列中较小的模型之一,与 Cloudflare 的 Clef、Strands decider 以及大量其他已发布的模型相同 [6],这削弱了微软构建了某种结构性专有技术的前提。开发者社区中流传的最尖锐、最 cynical 的批评更简单:真正令人印象深刻的是将一个开源权重模型变为闭源产品。

数据视角:微软选择回避的对比

Decision-1 的定价在绝对数值上确实具有攻击性。输入 token 每百万 0.042 美元,输出 token 免费,因为模型输出的是分数而非文本 [7]。其准确性和延迟声明同样精心构建:微软报告称,在涵盖约 15 万个问题的 36 项基准测试中,其准确率最高,达到 83.5%,中位延迟为 85 毫秒 [8],比亚军 H2O-Lightning-4B 快约 2.5 倍 [9],而被广泛引用的 headline 数据是比 GPT-6 Sol 快 35 倍 [2]。

最后一个对比值得深究,因为 GPT-6 Sol 是通用生成模型,而非决策模型。与买家实际会列入短名单的竞品相比,情况则趋于平缓:Decision-1 与 TypeSafe 的 Jev 在价格上完全持平,均为每百万输入 token 0.042 美元,高于 Cloudflare 的 Clef-flash(每百万 token 0.038 美元,且提供可自托管的 Apache 2.0 权重),比 OpenAI 的 Decisions API(约每百万 0.10 美元)便宜约 2.4 倍,远低于 Cloudflare 更大的 Clef(每百万 0.24 美元)[10]。eesel.ai 的分析直截了当地指出:微软仅将自己的价格与 GPT Sol 比较,而非 GPT Terra、GPT Luna,更非 Jev [10]。

微软真正具有可衡量优势的是上下文长度——32,768 token 的窗口,优于 Clef-flash 的 24,576 [10]——这对于需要阅读长工单线程、代码差异或事件时间线后再评分选项的决策至关重要。这比 35 倍的宣传更窄但更站得住脚,值得注意的是,这并非发布会主打的卖点。

校准不等于正确

从机制上看,Decision-1 所做的事情足够不同寻常而引人兴趣。你不是要求模型写出答案再解析,而是提供内容和一组固定的候选选项,它返回每个选项的校准概率 [11]。微软公布的稳健性数据是此次发布最强的技术部分:模型在平均 1.3% 的输入扰动下会改变决策,而在选项描述被改写、选项顺序被颠倒或打乱时,决策完全不会翻转 [7]。任何曾与 LLM 作为评判者管道中的位置偏差作斗争的人都会明白,为什么这才是从业者应关注的头条。Remio.ai 认为,将结构化选择与开放式生成分离,才是此次发布的真正故事 [12],而非附加的高管背书。

风险出现在使用场景中。微软将 Decision-1 定位用于路由、分类、优先级排序、验证、工作流和智能体控制、模型路由、数据标注、AI 评判、事件响应路由、内容过滤、安全筛查、计算机 UI 使用和机器人等领域 [7]。这些正是自信的数字比犹豫的文本更危险的地方。The Decoder 的分析直接指出:校准的置信度分数不等于正确性保证,基准准确率不等于高影响工作流的安全性,且已发布结果仍需独立验证 [8]。一个犹豫不决的生成模型至少会向下一个读取它的系统发出怀疑信号;而一个 0.91 的分数交给自主智能体时,读取为许可。

从业者反应已发现数据表与实际部署之间的裂痕。在机器学习社区中,一位动手测试者报告称,在 Foundry 中的实际生产延迟远高于广告宣传的中位数,且请求速率限制会重塑任何高流量路由设计。其他人质疑比较方法本身,指出某竞品的模型卡片报告的实测中位数远低于微软图表中使用的数据——这一差异表明微软对竞品的计时方式可能与自身不同。这些并不否定模型的质量,但确实说明在信任营销曲线之前,应在自己的流量上进行基准测试。

一个约三十天内形成的市场类别

跳出微软视角,更持久的故事是市场类别的异常快速形成。TypeSafe AI 的 Jev 于 2026 年 9 月开创了决策模型或 System One 类别 [13]。OpenAI 于 9 月 29 日跟进,推出基于专用 GPT-6 Luna 的 Decisions API,分类耗时约 150 毫秒,而标准 Luna 调用约为 1.6 秒 [13]。Cloudflare 在 10 月推出 Clef 和 Clef-flash,采用 Apache 2.0 许可且与 Jev API 兼容,切换成本趋近于零 [13]。微软于 10 月 9 日进入一个已包含超过 100 个决策模型的领域 [14]。

为何每个主要平台都想要这一特定原语,归根结底是单位经济效益。微软自身的内部案例说明了一切:Xbox Research 使用与 GPT-5 相当的质量对超过 1 万条玩家反馈进行分类,运行速度比 GPT-5 快 14 至 100 倍,成本约为其 1/200 [2][15]。任何通过前沿 LLM 运行高流量分类、审核或智能体路由的公司,都在为此支付类似的多倍费用,而谁拥有这一层,谁就拥有了对每个智能体决策的计量收费权。对此次发布的报道将 Decision-1 定位在微软 Azure、Fabric、Foundry 和 Copilot 的四层 AI 栈中 [15]。

但问题在于,这种极易复制的原语难以建立护城河。拥有开源基础模型、公开的评分接口和已成为标准的 Jev 兼容 API,差异化迅速收窄至价格、延迟和分发——而微软仅在分发上具有绝对优势。这种分裂体现在发布后的反响中:面向开发者的评论偏向机制和可复制性,有开发者视频将此举描述为明显奇怪的举动,而另一批金融相关受众则将公告视为股票催化剂而非产品发布。两种解读都可能正确。Decision-1 是一次温和的技术进步,却是一次重大的分发事件,而只有后者难以复制。

历史背景

TypeSafe AI 推出了 Jev,即决策模型或 System One 类别的首个模型,创造了 Decision-1 现在进入的这一类别。
OpenAI 推出了其 Decisions API,基于专用版本的 GPT-6 Luna,返回分类答案的耗时约为 150 毫秒,而标准 Luna 调用约为 1.6 秒。
Cloudflare 发布了基于 Qwen3.8-27B 的 Clef 和基于 Qwen3.5-9B 的 Clef-flash,采用 Apache 2.0 许可,完全兼容 Jev API 且可自托管,作为闭源决策模型产品的开源权重竞争对手。
微软在 Microsoft Foundry 推出 Microsoft-Decision-1,加入一个已包含超过 100 个决策模型的领域。

关键关系图

关键玩家
主题

微软 Decision-1 AI 模型发布

事实来源

15 条引用
  1. [1] Microsoft Skipped OpenAI's Decision Model and Built Its Own on Alibaba's Qwen
  2. [2] Microsoft Decision-1 AI Model
  3. [3] Microsoft Decision-1
  4. [4] Microsoft Launches Decision-1: Fast Decision-Scoring Model Built on Qwen3.5-9B
  5. [5] Microsoft Decision-1 AI Model: 35x Speed
  6. [6] Microsoft-Decision-1 Hacker News discussion thread
  7. [7] Microsoft-Decision-1 Model in Microsoft Foundry
  8. [8] Microsoft's Decision-1 Model Enters the Fast-Growing AI Decision Model Race
  9. [9] Microsoft Enters Decision Model Race With Qwen-Based Microsoft-Decision-1
  10. [10] Microsoft Decision-1 Pricing
  11. [11] Microsoft Decision-1: A Cheap Text-Only Decision Model Built on Qwen
  12. [12] Microsoft Decision-1 Model Arrives but Nadella's Endorsement Is Not the Main Story
  13. [13] Decision Models
  14. [14] Microsoft Launches Decision-1 as 100 AI Models Enter the Market
  15. [15] Microsoft's Nadella Unveils Tech Giant's New Fast Decision-Making AI Model

来源文章

Top 3

THE SIGNAL.

Analysts

“认为 Decision-1 的基准声明仍需独立验证,校准的置信度不等于正确性,且基准性能不等于高影响工作流的安全性,这些工作流仍需人工监督。其总结:此次发布更多改变了可用的架构,而非改变了 AI 能理解的内容。”

The Decoder
科技新闻与分析媒体,the-decoder.com

“称微软的表述具有误导性,因为比较对象是 GPT-6 Sol 而非实际竞争集:微软仅将自己的价格与 GPT Sol 比较,而非 GPT Terra、GPT Luna,更非 Jev。与该竞争集相比,Decision-1 与 Jev 价格持平,且比 Cloudflare 可自托管的 Clef-flash 更贵。”

eesel.ai
独立 AI 定价与产品分析网站

“反驳了定价和新颖性声明,指出其价格具有竞争力,但每百万输入 token 0.042 美元与 Jev 相同而非更便宜,且这是基于 Qwen 系列中较小的模型之一,与 Cloudflare 的 Clef、Strands decider 以及大量其他已发布模型相同。”

Hacker News commenters
news.ycombinator.com 关于 Decision-1 发布的讨论帖

“认为此次发布的核心是将结构化选择与开放式生成分离的架构创新,而非纳德拉对模型的个人背书。”

Remio.ai
独立 AI 评论网站
The Crowd

“Introducing Microsoft-Decision-1, our new model for fast decision-making. It delivers top performance on structured decision tasks, outperforming both LLMs and other decision models in latency and quality. We're already testing it across Microsoft for everything from incident response to...”

@@satyanadella11325

“OpenAI Decision crushed by @Microsoft-Decision-1 at Space Invaders 👾 Decision-1 decided 3.5x faster so it scored 3,320 and cleared 4 waves while OpenAI's decision API scored 1,300 taking over 300ms per decision on average Run decision models -> https://t.co/RbcCOIht9R”

@@atomic_chat_hq783

“Microsoft-Decision-1 is live on OpenRouter. Microsoft's numbers: highest accuracy across 36 blind benchmarks (~150K questions), 4.5x faster than the runner-up, 35x faster than GPT-6 Sol, and decisions flip on just 1.3% of perturbed inputs. Post-trained from Qwen3.5-9B. $0.042/M”

@@OpenRouter594

“Introducing Microsoft-Decision-1, our model for fast decision-making”

@u/Greedyanda572
Broadcast
Microsoft-Decision-1 (What an odd release?!?)

Microsoft-Decision-1 (What an odd release?!?)

Microsoft Decision-1: Same Price as Jev, Built on Qwen

Microsoft Decision-1: Same Price as Jev, Built on Qwen

Microsoft's New Decision Model: A Fresh AI Catalyst and the $537 Test | Oct 9

Microsoft's New Decision Model: A Fresh AI Catalyst and the $537 Test | Oct 9