DeepSeek V4 Flash 成本效益颠覆
TECH

DeepSeek V4 Flash 成本效益颠覆

27+
Signals

战略概览

  • 01.
    DeepSeek 于 2026 年 7 月 31 日正式发布 DeepSeek-V4-Flash-0731 通用版本,这是其 2026 年 4 月预览版的重新训练版本,保留了相同的 API 端点、延迟特征和定价。
  • 02.
    该模型采用专家混合(Mixture-of-Experts)设计,总参数量为 2840 亿,但每个 token 仅激活 130 亿参数,并结合混合压缩注意力机制,在低推理成本下实现了 100 万 token 的上下文窗口。
  • 03.
    定价方面,缓存未命中时每百万输入 token 为 0.14 美元,缓存命中时仅为 0.0028 美元(折扣达 98%),每百万输出 token 为 0.28 美元。
  • 04.
    尽管价格低廉,V4-Flash-0731 在 Artificial Analysis 智能指数中得分达到 50 分——比之前的 Flash 预览版高出 10 分——并且在代理类基准测试中已超越 DeepSeek 自家更昂贵的 V4-Pro-Preview 模型。

0.28 美元价格标签背后的技术

DeepSeek-V4-Flash-0731 是一款专家混合模型,总参数量为 2840 亿,但每个 token 仅激活 130 亿参数 [1],并搭配混合压缩注意力机制,显著降低了其 100 万 token 上下文窗口的内存占用 [1]。这种组合——将大部分计算从模型主体中路由出去,再压缩长对话的内存成本——正是 DeepSeek 能够在缓存未命中时对每百万输入 token 收取 0.14 美元、输出 token 仅收 0.28 美元的原因 [2],几乎在每 token 基础上压倒了所有前沿实验室。

然而真正的焦点是缓存命中价格:每百万输入 token 仅 0.0028 美元,相比缓存未命中价格折扣高达 98% [2]。这一定价结构透露出明确意图——它专为重复性代理模式设计,例如工具 schema 或系统提示在会话中被数千次复用,而非一次性聊天查询。Reddit 上的技术讨论指出,其核心技术在于多头潜在注意力(Multi-head Latent Attention)压缩 KV 缓存,加上自 V3.2 版本延续下来的强化学习后训练增益——这正是 DeepSeek 自 R1 以来持续迭代的架构脉络,如今已足够成熟,使常规编码和代理任务的成本降至几分之一美分。

一场 DeepSeek 仍在主导的价格战

OpenAI 在 V4-Flash-0731 发布前夕,将 GPT-5.6 Luna 的价格下调约 80%——输入从每百万 token 1 美元降至 0.20 美元,输出从 6 美元降至 1.20 美元 [3]。即便如此,DeepSeek 的新定价仍比这一已大幅折扣的 GPT-5.6 Luna 输出价格低约 4.3 倍 [3]。投资者迈克尔·伯里(Michael Burry)认为 OpenAI 的降价实属防御之举,真正的故事是 OpenAI 在为 DeepSeek 的发布做准备,而非单纯向客户传递效率红利 [3],而 OpenAI 官方声明则坚称降价反映的是智能成本降低,从而扩展 AI 可负担的应用场景,而非出于竞争恐慌 [3]

Ciente 的分析进一步凸显了这场博弈的关键:DeepSeek 无需在推理能力上超越 Claude 或 GPT-5.6,只需让常规企业工作负载变得异常便宜即可 [4]。在标准化测试套件中,V4-Flash 的成本约为 3 美分,而 GPT-5.6 Sol 则高达 1.86 美元 [4]——这一差距足以重塑采购决策,而不仅仅是榜单排名。

从聊天模型到代理主力

重新训练的 0731 版本不仅更便宜,而且在实际消耗大量 token 的任务上能力显著提升。其在 Artificial Analysis 智能指数中的得分相比 4 月预览版跃升 10 分至 50 分 [2],而在 Terminal-Bench 2.1(一项代理命令行任务基准)中,得分上升 17 分至 79%,接近 Opus-4.8 的 85.0 分,并超过 DeepSeek 自家更昂贵的 V4-Pro-Preview [2]。另一项对该基准的独立评估甚至给出更高分数:82.7% 对比 V4-Pro-Preview 的 72.1% [2][5]——无论哪种数据,都表明一个廉价模型击败同厂高端旗舰的故事成立。

这种能力跃升不仅体现在基准图表中,也反映在真实路由数据上。OpenRouter 报告称,V4-Flash 在其原始发布一个月内即占 DeepSeek 代理类 token 流量的 70%,而 DeepSeek 在该平台的整体 token 份额从 2026 年 1 月的 9% 翻倍至 6 月的 18%,并于 5 月中旬成为 OpenRouter 上使用最多的模型 [6]。社交媒体讨论也印证了这一点:内容创作者指出,一旦模型达到“足够好”的门槛,成本便取代原始基准分数成为决定因素,而自托管社区已开始在高端本地硬件上运行量化版本,完全避免按 token 付费。

华尔街感受到挤压

最明显的信号是:这已不仅是开发者论坛的话题——与 V4-Flash 消息直接相关的 AI 基础设施关联股票出现报告性下跌,包括英伟达(Nvidia)约 17%、甲骨文(Oracle)、博通(Broadcom)和 AMD 下跌 12–20%,微软(Microsoft)跌幅超 3% [7]。逻辑很直接——当前大量 AI 基础设施建设的定价假设是推理将持续昂贵且利润丰厚;而一个完整测试套件仅需 3 美分的模型直接挑战了这一前提 [4]

媒体将此描述为 AI 定价‘归零竞赛’的加速 [8],这与 OpenRouter 的采用数据一致:足够便宜的智能正在快速夺取 token 份额,真正受威胁的是西方实验室的高端企业定价模式——这些收入原本用于资助前沿模型训练,而不仅仅是它们的排行榜位置。

历史背景

DeepSeek-R1 的发布引发了广泛称为 AI ‘斯普特尼克时刻’的现象,在推理基准上匹敌 OpenAI o1,但披露的训练成本仅为一小部分。
DeepSeek V4 发布,推出 V4-Pro(1.6 万亿参数)和 V4-Flash(2840 亿)作为预览代产品,后者后来被 V4-Flash-0731 取代。
DeepSeek 正式发布 V4-Flash-0731,一款重新训练的公开通用版本,同日在 Hugging Face 上发布采用 MIT 许可证的开源权重。

关键关系图

关键玩家
主题

DeepSeek V4 Flash 成本效益颠覆

DE

DeepSeek

中国 AI 实验室,开发并发布了 V4-Flash-0731,通过激进低价和开放的 MIT 许可证权重,抢占代理类 token 份额,并挤压西方 incumbent 的利润空间。

OP

OpenAI

在 DeepSeek 发布前后将 GPT-5.6 Luna 定价下调约 80%,将降价解释为扩展可行的 AI 应用场景而非防御反应,但仍被 DeepSeek 在输出价格上超越。

AR

Artificial Analysis

独立基准测试公司,测定了 V4-Flash-0731 的智能指数、Terminal-Bench 得分和每任务成本,成为报道中引用成本效益主张的权威参考。

OP

OpenRouter

API 路由市场平台,其数据显示 V4-Flash 在发布一个月内占 DeepSeek 代理类 token 流量的 70%,且 DeepSeek 在 2026 年 1 月至 6 月间整体 token 份额从 9% 翻倍至 18%。

MI

Michael Burry

投资者,公开将 OpenAI 的降价视为对 DeepSeek V4 发布的先发制人反应,推动了价格战叙事。

NV

Nvidia, Oracle, Broadcom, AMD, Microsoft

美国 AI 基础设施关联股票据报因担忧超低价中国模型定价会破坏当前基础设施支出背后的溢价假设而下跌(英伟达约 17%,其他 12–20%,微软超 3%)。

事实来源

9 条引用
  1. [1] DeepSeek-V4-Flash Model Card
  2. [2] DeepSeek V4 Flash 0731 Scores 50 on the Artificial Analysis Intelligence Index
  3. [3] OpenAI Explains Why It Cut Prices as Michael Burry Points to DeepSeek V4
  4. [4] DeepSeek's V4 Flash Is Unreasonably Cheap - and That's Bad News for US AI Margins
  5. [5] DeepSeek V4 Flash Beta
  6. [6] DeepSeek V4 Adoption Insights
  7. [7] DeepSeek Drops New Bombshell on AI Stocks
  8. [8] DeepSeek's Cheap New AI Model Fuels a Price War
  9. [9] DeepSeek API News: V4 Release (April 24, 2026)

来源文章

Top 5

THE SIGNAL.

Analysts

认为 OpenAI 最近的降价并非主要为了扩大需求,而是为应对 DeepSeek V4 模型发布的竞争压力所做的准备。

Michael Burry
投资者

将其自身降价归因于效率提升而非竞争恐慌,主张更便宜的智能可扩展 AI 任务的可及市场。

OpenAI
AI 实验室声明

认为 DeepSeek 无需在原始智能上击败 OpenAI,只需侵蚀支撑西方 AI 实验室经济模式的高利润企业流量即可。

Ciente Editorial Team
科技/商业分析媒体
The Crowd

DeepSeek V4 Flash is beating models like Opus 5, GPT-5.6, Kimi K3, and Claude Fable 5 that cost 50x more Watch👇 https://t.co/X9Xk8c32Sh

@@Oluwaphilemon18

Your next AI subscription might be 110GB of RAM. DeepSeek V4 Flash 0731, a 284B model with 13B active parameters and a 1M context window, can now run locally through llama.cpp. The setup: Download the GGUF. Choose 3-bit (~110GB), Q4 (~162GB), or lossless Q8 (~169GB). Load it https://t.co/h3hnID2XU3

@@noclipepe12

GPT-5.6 vs. Gemini vs Kimi K3 vs. DeepSeek V4 Flash vs. Claude: A No-Login Way to Settle the Debate Four AI models, one prompt, zero logins, here's what actually happened when I put them head to head. Every few weeks, a new "best AI model" ranking makes the rounds, and every https://t.co/Cn8B4pTuyp

@@Oluwaphilemon18

DeepSeek V4 Flash API is 18x cheaper on input, 28x cheaper on output, and matches Opus 4.8. Time for Claude to atleast reduce sonnet pricing

@u/hibzy71500
Broadcast
DeepSeek V4 Flash: The Best Open Model You can Actually Run!

DeepSeek V4 Flash: The Best Open Model You can Actually Run!

Don't Miss This Free DeepSeek V4 Flash API Offer

Don't Miss This Free DeepSeek V4 Flash API Offer

DeepSeek V4 Flash Free and It's Actually Insane

DeepSeek V4 Flash Free and It's Actually Insane