一个真正的新模型类别,还是仅仅是一个单token的LLM?
Nadella亲自发布了Decision-1,将其定位为在延迟和质量方面超越通用LLM和其他决策模型[1]。但更尖锐的反应并非来自高管的表述——而是来自工程师们对“决策模型”本身定义的拆解。在r/singularity的发布帖中,争论分为两派:一派认为Decision-1“字面意义上”不过是将标准LLM的输出截断为单个token并限制logprobs;另一派则反驳称,专为决策评分设计的模型完全跳过了自回归推理的开销,因此在结构上对窄域选择任务更高效,而不仅仅是约束方式不同。另一条质疑线索则质疑其市场定位本身,指出Copilot已经封装了第三方聊天模型,认为Decision-1更像是一个Azure生态系统的企业级布局,而非前沿聊天模型的竞争对手。
独立评论普遍认为,类别标签的重要性不如底层架构信号。“Decision-1的意义在于挑战了通用LLM的默认使用,而非因为CEO发布了它,”Sophie Larsen[2]指出,并警告称微软的内部基准数据仍需独立验证。Reddit上的另一条讨论甚至追溯到LLM之前的时代,评论者指出,分类器式决策模型早于生成式AI时代——BERT时代的分类器就做过类似的事——用现代工具构建这类模型“极其简单”,这引发了一个问题:Decision-1的真正贡献是创造了一个新原语,还是仅仅对旧有模型进行了良好封装和定价?



