效率源于必要:K3飞跃背后的架构设计
月之暗面AI总裁张予同将Kimi K3的构建策略描述为将约束转化为方法:“我们知道我们没有奢侈到可以简单地扩大算力规模。这迫使我们专注于基础研究和效率提升。”[1]正是这种约束催生了K3的新架构——Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE——这些技术建立在一个2.8万亿参数的专家混合结构之上[2],其中每个token仅激活1040亿参数,且896个专家中仅有16个被触发[3]。月之暗面称其成果为“每单位算力的智能水平提升2.5倍,而不仅仅是更多参数”[3]。一位YouTube实测博主发现,尽管相比Kimi K2总专家数翻了一倍以上,但每个token触发的专家比例实际上更小,表明其效率主张是架构层面的真实突破,而非营销话术——这一观察来自视频评测,而非月之暗面自身技术报告中的数据。自行运行发布权重的社区测试者也指出,这种效率背后存在现实权衡:即使采用降低精度的方式,模型权重仍需占用约六块GPU的多GPU服务器配置,因此“开源权重”并不意味着可在单台机器上运行。


