0.28 美元价格标签背后的技术
DeepSeek-V4-Flash-0731 是一款专家混合模型,总参数量为 2840 亿,但每个 token 仅激活 130 亿参数 [1],并搭配混合压缩注意力机制,显著降低了其 100 万 token 上下文窗口的内存占用 [1]。这种组合——将大部分计算从模型主体中路由出去,再压缩长对话的内存成本——正是 DeepSeek 能够在缓存未命中时对每百万输入 token 收取 0.14 美元、输出 token 仅收 0.28 美元的原因 [2],几乎在每 token 基础上压倒了所有前沿实验室。
然而真正的焦点是缓存命中价格:每百万输入 token 仅 0.0028 美元,相比缓存未命中价格折扣高达 98% [2]。这一定价结构透露出明确意图——它专为重复性代理模式设计,例如工具 schema 或系统提示在会话中被数千次复用,而非一次性聊天查询。Reddit 上的技术讨论指出,其核心技术在于多头潜在注意力(Multi-head Latent Attention)压缩 KV 缓存,加上自 V3.2 版本延续下来的强化学习后训练增益——这正是 DeepSeek 自 R1 以来持续迭代的架构脉络,如今已足够成熟,使常规编码和代理任务的成本降至几分之一美分。



