架构揭秘:Kimi K3高效性能的背后
Kimi K3最引人注目的数字是2.8万亿参数,但真正解释其性能的是1040亿——即每次处理token时激活的参数数量,因为专家混合路由机制每次仅激活896个专家中的16个。这种稀疏性使得模型规模接近Kimi K2三倍的情况下,仍能在发布当天由第三方推理服务商部署,而非仅限于月之暗面自己的数据中心。
效率不仅体现在稀疏性上。月之暗面将MoE设计与两项新架构组件结合:Kimi Delta Attention(KDA),一种混合线性注意力机制,用更低成本的长上下文替代方案取代标准的二次方注意力;以及Attention Residuals(AttnRes),旨在保留混合注意力方案通常会牺牲的精度[1]。发布的模型卡片详细说明了具体配置:共93层,其中69层为KDA层,24层为门控多头潜在注意力层,16万token词汇量,推理时采用MXFP4权重量化与MXFP8激活以提升效率,内置4.01亿参数的MoonViT-V2视觉编码器,实现原生图像理解而非后期附加[2]。
该架构在开发者真正关心的基准测试中取得了回报。K3在Arena的前端代码竞技场中排名第一,超越Anthropic自家的Fable 5[3],并在人工分析智能指数(Artificial Analysis Intelligence Index)中全球排名第三,仅以微弱差距落后于GPT-5.6 Sol[4]。对于一款以免费可下载权重形式发布、而非按量计费API的模型而言,能接近全球两大顶尖闭源模型的排名,正是这一细节将一次常规的开源发布转变为行业事件。



