为何2.8万亿参数真正改变了开源的数学逻辑
Kimi K3的规模意义不仅在于 headline 数字,更在于其结构性门槛。此前的开源权重前沿模型——如DeepSeek的V4-Pro(1.6万亿参数)、Meta的Llama系列——虽具备能力,但始终比顶级闭源模型低一个层级 [1]。Kimi K3采用混合专家(MoE)架构,总参数达2.8万亿,每次token推理仅激活256个专家中的220亿活跃参数,是首个由月之暗面自身宣称可与GPT-5.6 Sol和Claude Fable 5处于同一基准层级的开源权重发布 [1]。
MoE在此处的关键在于推理经济性。尽管总参数高达2.8万亿,K3在推理过程中每个token仅激活220亿参数——其计算足迹大致相当于更小的稠密模型。这意味着运行K3的API成本并不与其 headline 参数数量成正比。每百万输入token 3美元、输出token 15美元的定价,与Anthropic计划于2026年9月对同等能力水平实施的定价一致 [1]。对于评估API供应商的企业买家而言,问题变成了:为何要为更低的能力支付相同价格?这正是月之暗面设下的定价陷阱。


