受限之下的创新:芯片禁令如何催生更优架构
面对高端芯片获取受限,中国人工智能实验室并未通过复制美国架构来追赶——而是被迫走上另一种创新路径:用更少的算力榨取更强的能力。深度求索最新的架构“流形约束超连接”(mHC)在字节跳动2024年“超连接”研究的基础上进行了延伸,但在结构上截然不同[1],它通过Sinkhorn-Knopp迭代投影将混合矩阵约束为双随机矩阵,解决了此前因训练不稳定而难以规模化应用的问题[2]。深度求索首席执行官梁文峰被列为该论文的共同作者。
同样的模式也体现在深度求索的稀疏注意力(DSA)中,该技术在其早期的“多头潜在注意力”(MLA)创新基础上,引入了一个轻量级索引器,用于决定查询实际需要关注哪些标记[3]。仅MLA一项就已将键值缓存内存比标准多头注意力降低了57倍;DSA的索引器进一步将每个标记的内存压缩至132字节,即使在极长上下文长度下也能实现接近常数时间的解码。这一切并非复制自OpenAI或Anthropic——而是针对中国实验室真实困境(即先进芯片不足)而进行的原创系统工程。追踪该领域的分析人士认为,正是这种算力稀缺,而非其阻碍,推动了中国开发者实现真正的效率突破,而非简单复制美国模型行为[4]。



