深入因果编码器-解码器:DeepSeek 如何消除 KV 缓存税
DeepSeek 此次真正的创新并非参数规模的炫耀,而是对 Transformer 在处理长输入与短输出时计算资源分配方式的结构性重构。V4.1-Flash 将其 40 层 Transformer 分为 20 层因果编码器和 20 层解码器;关键在于,解码器的全局 KV 缓存直接从编码器的最终隐藏状态投影而来,而非在解码器内部逐层重新计算 [1]。这一单一设计选择——即因果编码器-解码器(CED)架构——正是激活参数数量呈现极端不对称的原因:在 5520 亿参数的主干网络中,预填充阶段(读取提示)仅激活约 80 亿参数,解码阶段(生成 token)则上升至约 160 亿,即使在 100 万 token 的上下文窗口内也是如此 [2]。对于一个大部分周期都在重新读取不断增长的文件树、测试输出和终端日志而非编写新代码的编码代理而言,这种不对称性几乎完美匹配真实工作负载。DeepSeek 还叠加了 SWA Bounded Replay 技术,通过仅重放最近的 token 来重建滑动窗口注意力的 KV 状态,而非将其持久化到磁盘,以及 CSA2 注意力模式共享方案;这些技术共同将持久性 KV 缓存占用减少至 DeepSeek-V4-Flash 的约八分之一,总服务内存降至前代 HBM 的约四分之一 [3]。这看起来更像是一次基础设施优化披上了模型发布的外衣,其回报不仅体现在基准测试图表中,更直接反映在 DeepSeek 自身的托管利润率上。X 平台上的 AI 研究人员对此工程设计普遍表示赞赏:独立解析和 CED 架构的并排可视化迅速传播,Hugging Face 联合创始人 Thomas Wolf 称此次发布标志着回归开放权重排行榜榜首,并赞扬 DeepSeek 在不牺牲能力的前提下榨取了如此高的效率。



