价格下调背后的架构
本周 DeepSeek 引发关注的不仅是基准分数——更是一项让长上下文推理成本低到近乎免费的架构决策。结合压缩稀疏注意力与高度压缩注意力的混合注意力设计意味着,在100万 token 上下文设置下,V4 Pro 所需的单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的27%,KV 缓存仅为10%[1]。其底层是一个总参数量为1.6万亿的混合专家模型,每个 token 仅激活490亿参数,训练数据超过32万亿 token,并以 MIT 许可证开源权重发布[2]。Greyhound Research 分析师 Sanchit Vir Gogia 认为这是刻意为之的设计选择而非副作用:V4 Pro “专为降低长上下文推理成本而打造,单 token 计算量约为前代的四分之一,内存占用仅为十分之一”[3]。正是这种效率,使得本周通过编码代理测试该模型的开发者报告称,端到端任务的实际成本仅为几美分而非数美元——起作用的是架构本身,而不仅仅是折扣。



