月之暗面如何在没有前沿芯片的情况下构建出前沿模型
Kimi K3是月之暗面AI迄今为止最大的模型:总参数达2.8万亿,分布在896个专家中,每次仅激活16个专家——约占总数的1.8%。将这种混合专家架构与Kimi Delta Attention结合,后者是一种线性注意力机制与注意力残差(Attention Residuals)结合的混合设计,最终得到一个具备原生视觉能力、支持100万token上下文窗口的模型,其计算开销仅为同等规模密集模型的一小部分[1]。
这种以效率为先的设计被解读为不仅是工程选择。媒体报道认为,这种稀疏激活模式是月之暗面在美方对华实验室施加的算力出口管制上限下,最大化能力的策略,而非简单地购买更多芯片[2]。成果体现在数据上:K3在GDPval-AA v2中得分为1,687,排名第三,仅次于Claude Fable 5 Max(1,815)和GPT-5.6 Sol Max(1,747.8),在人工分析智能指数中得分为57[3]。它还在前端代码竞技场中全面领先,在开发者盲测的网页编码任务中击败了Claude Fable 5[2]。



