效率声明背后的架构
Kimi K3最引人注目的数字是2.8万亿总参数,但更关键的是每次请求激活的参数数量。该模型在新的Stable LatentMoE框架下,每次请求仅激活896个专家中的16个——约1.8%——并结合了月之暗面AI称之为Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)的两项新机制[1]。月之暗面AI自己的技术报告将这一成果描述为相比Kimi K2在扩展效率上提升了约2.5倍,并称K3虽略逊于顶级专有模型(Claude Fable 5、GPT-5.6 Sol),但在其评估套件中持续优于其他测试模型[1]。实际部署足迹同样重要:通过MXFP4/MXFP8量化后的权重将存储需求从5.6TB压缩至约1.56TB,减少了约72%,使拥有强大基础设施的组织更有可能实现自托管[2]。每次请求激活的参数约为1040亿,占2.8万亿总参数的极小部分[2]——故事的核心是稀疏性,而非暴力堆叠规模。



