架构玄机:7630 亿参数,仅激活 80 至 160 亿
V4.1-Flash 的表面数字具有误导性。该模型虽拥有 5520 亿参数主干和额外 1960 亿 Engram 参数,总计 7630 亿[1],但其新型因果编码器-解码器设计——一个 40 层 Transformer 分为 20 层因果编码器和 20 层解码器——通过将解码器的全局 KV 缓存从编码器的最终隐藏状态直接投影而来,而非在每一解码层重新计算[1],从而实现无论底层权重多大,每 token 在预填充阶段仅激活 80 亿参数,解码阶段仅激活 160 亿参数[1]。结合 FP4 KV 缓存(E2M1 格式)和压缩稀疏注意力 2(Compressed Sparse Attention 2),每 token 的全局 KV 缓存占用降至 890 字节——约为 DeepSeek-V4-Flash 的四分之一,约是 DeepSeek-V1 的 437 分之一[2]。上下文窗口扩展至 100 万 token,DeepSeek 表示从 4K 扩展到 100 万 token 仅增加约 25% 的计算量[3],表明起作用的是架构本身,而不仅仅是暴力计算。


