架构之赌:不对称编码器-解码器战胜暴力堆叠规模
V4.1-Flash 拥有5520亿参数的混合专家骨干网络,看似庞大,但真正起作用的是其因果编码器-解码器架构:一个20层编码器使用仅80亿活跃参数读取提示,随后一个独立的20层解码器使用160亿活跃参数生成回复 [1]。这打破了大多数大语言模型仍在使用的纯解码器 Transformer 范式——在该范式中,每个 token 无论用于读取还是写入,都需支付相同的每 token 计算成本,与其角色无关 [2]。DeepSeek 的表述非常直接:‘一个20层编码器使用仅80亿活跃参数读取您的输入,然后一个20层解码器使用160亿参数生成回复’ [2]。
这种架构分离也是实现模型激进内存占用压缩的关键。KV 缓存大小压缩至约每 token 890 字节,约为前代 V4-Flash 所需空间的四分之一,从而将 HBM 需求减少约4倍,持久化 SSD 存储需求减少约8倍 [2][5]。除了5520亿骨干参数外,DeepSeek 还添加了一组独立的1960亿参数‘Engram’条件记忆模块,这些模块仅在需要时被调用,而非始终保持激活状态 [4][5]。综合来看,该模型并非简单地比前代‘更大’,而是重构为大部分参数存储在内存高效、选择性激活的模块中,而非密集计算单元中——后者必须对每个 token 都运行。这正是 DeepSeek 能够以极低的常规 API 成本提供持续超过每秒180个 token 的流式传输速度,部分测试者报告甚至达到每秒300至400个 token 的根本原因 [2]。



