DeepSeek-V4-Flash-0731 官方测试版发布
TECH

DeepSeek-V4-Flash-0731 官方测试版发布

35+
Signals

战略概览

  • 01.
    DeepSeek 于 2026 年 7 月 31 日发布了 DeepSeek-V4-Flash-0731 的官方公开测试版,沿用了预览版的 2840 亿参数、130 亿激活参数的 MoE 架构和 100 万 token 上下文长度,仅进行了重新后训练。
  • 02.
    重新后训练后的模型在 Terminal Bench 2.1 上得分 82.7(此前为 61.8),在 DeepSWE 上得分 54.4(此前为 7.3),反映出智能体能力的重大飞跃。
  • 03.
    该模型目前在 Artificial Analysis Intelligence Index 上得分为 50,与 Gemini 3.6 Flash 持平,仅比 GPT-5.6 Luna 低 1 分,而每项任务的成本却低约 60%。
  • 04.
    此次升级仅适用于 V4-Flash API,并新增了对原生 OpenAI Responses API 的支持,可直接集成 Codex CLI;V4-Pro 和面向消费者的 App/Web 模型未作改动,官方 V4-Pro 版本预计即将发布。

一次重训,而非重建:DeepSeek 如何在不推出新模型的情况下实现智能体能力跃升

DeepSeek-V4-Flash-0731 并非全新模型发布,而是在 2026 年 4 月发布的预览版所采用的完全相同的 2840 亿参数、130 亿激活参数 MoE 架构和 100 万 token 上下文窗口基础上进行的重新后训练 [1]。该公司自己的更新日志明确指出,架构和规模完全相同,仅后训练堆栈发生了变化 [1]。然而,此次重训带来的基准测试提升之大,堪比代际跃迁:Terminal Bench 2.1 从 61.8 提升至 82.7,而更具挑战性的智能体编码基准 DeepSWE 则从 7.3 跃升至 54.4 [2]

OfficeChai 的分析将其精准定义为仅通过训练升级而非推出新模型 [3],BiGGo 的报道则指出其机制是通过对现有权重应用强化学习和基于蒸馏的调优,而非重新预训练 [4]。这一区别至关重要:DeepSeek 正在证明,仅通过后训练即可获得显著的智能体能力提升,而无需承担训练全新基础模型的资本成本——相比那些通过发布新架构来追逐相同提升的竞争对手,这是一种更低成本、更快速的杠杆。

价格战背后的算计:即便在降价 80% 后仍能压倒 GPT-5.6 Luna

7 月 31 日的测试版发布,恰逢 OpenAI 将 GPT-5.6 Luna 定价下调约 80% 之后,日经亚洲(Nikkei Asia)明确将此次发布视为 DeepSeek 与其美国竞争对手之间 AI 价格战的升级 [5]。尽管 OpenAI 已降价,DeepSeek 在其第一方 API 上的每任务成本仍比 GPT-5.6 Luna 低约 60% [3],同时在 Artificial Analysis 的智能与成本帕累托前沿上占据一席之地 [6]

其经济优势远不止于表面定价。DeepSeek 的缓存命中折扣率为 98%,远高于行业标准的 90% [6],其公开费率显示,缓存未命中时输入 token 为每百万 0.14 美元,缓存命中时为每百万 0.0028 美元,输出为每百万 0.28 美元 [3]。彭博社对此次公开测试版发布的报道同样聚焦于 DeepSeek 将增强的智能体能力作为首要卖点,而价格则作为后续杠杆 [7]

小模型,大基准:2840 亿/130 亿参数模型击败更大对手的实际意义

此次基准测试持平之所以引人注目,是因为它掩盖了巨大的规模差距。V4-Flash-0731 是一个 2840 亿参数模型,每个 token 仅激活 130 亿参数 [8],但其在 Artificial Analysis Intelligence Index 上得分为 50,与谷歌的 Gemini 3.6 Flash 持平,仅比 GPT-5.6 Luna 的最高配置低 1 分 [6]。在 GDPval-AA v2 上,其 Elo 评分从 1189 提升至 1559,超过了智谱的 GLM-5.2(1510),在开源权重系统中仅次于月之暗面的 Kimi K3(1687) [6]

Reddit 社区 r/LocalLLaMA 的测试强化了这一观点,讨论中反复指出,一个 2840 亿/130 亿激活参数的 MoE 模型在击败远为庞大的开源权重竞争对手的同时,运行所需 VRAM 显著更少,这代表了一个真实的效率故事,而不仅仅是基准测试的人为产物。独立的 YouTube 测试者将其模型通过自己的编码智能体套件进行测试,也报告了相较于预览版的巨大提升,其中一位称其为当前可用于智能体编码的性价比最高的模型之一。

基准测试持平背后的可靠性警示

基准测试的故事并非毫无争议。Artificial Analysis 自己的报告指出,尽管 V4-Flash-0731 有大幅提升,但在 GDPval-AA v2 上仍落后于 Kimi K3 [6],其更广泛的模型对比页面也将此次发布定位在当前帕累托前沿领导者之下,而非顶端 [9]

X 平台上的独立评论提出了更具体的警告:一位专注于 DeepSeek 的知名分析师认为,该模型在 GDPval-AA v2、Terminal-Bench 2.1、SciCode、HLE 和 GPQA Diamond 上接近 GPT-5.6 Luna,但在幻觉和全知类指标上明显较弱,在更难的推理基准上则进一步落后——这提醒人们,头条的持平分数可能掩盖了在生产环境中智能体使用时更为重要的可靠性差距。这一警告在早期的实测报告中得到呼应,一些真实测试发现,较小的 Flash 模型在处理更难问题时偶尔会放弃任务或进行过多的工具调用,仍需更大的 V4-Pro 模型来挽救 Flash 无法自行解决的失败。

下一步:V4-Pro 将继承相同的处理

DeepSeek 非常明确地指出此次更新范围有限:仅 V4-Flash API 发生变化,V4-Pro API 和面向消费者的 App/Web 模型未受影响,官方 V4-Pro 版本即将发布 [1]。这种发布顺序遵循了 DeepSeek 路线图中已显现的模式——V4-Pro 和 V4-Flash 于 2026 年 7 月 20 日左右同时进入通用可用阶段,大约在 4 月 24 日预览版发布后的 90 天,就在此次测试版发布前几天,旧的 deepseek-chat 和 deepseek-reasoner 别名被弃用,转而采用稳定的 v4-pro 和 v4-flash 模型 ID [10]

如果将使 Flash 在 Terminal Bench 2.1 上从 61.8 提升至 82.7 的相同重新后训练处理应用于 Pro,考虑到更大模型的起点已更高(V4-Pro-Preview 在此次更新前得分为 72.1)[2],下一次发布可能会显著重置 DeepSeek 自身产品线的顶端。值得注意的是,Codex CLI 支持目前仅限于 Flash,Pro 版的 Codex 支持预计在 2026 年 8 月推出 [11]

历史背景

DeepSeek 发布了 V4-Pro(1.6 万亿参数)和 V4-Flash(2840 亿参数)作为具有 100 万 token 上下文窗口的开源权重预览模型。
V4-Pro 和 V4-Flash 预览模型在约 90 天的预览期后进入通用可用阶段。
旧的 deepseek-chat 和 deepseek-reasoner 模型别名被弃用,转而采用稳定的 deepseek-v4-pro 和 deepseek-v4-flash 模型 ID。
DeepSeek 发布了 V4-Flash-0731 的官方公开测试版,在智能体基准测试上取得重大提升,并支持原生 OpenAI Responses API/Codex。

关键关系图

关键玩家
主题

DeepSeek-V4-Flash-0731 官方测试版发布

DE

DeepSeek (deepseek_ai)

V4-Flash-0731 的开发者和发布者;通过官方 API 更新日志和 X 账号宣布发布,控制定价和 API 访问权限。

AR

Artificial Analysis

独立基准测试公司,在其 Intelligence Index 上为 V4-Flash-0731 评分 50,在 GDPval-AA v2 上评分为 1559 Elo,为 DeepSeek 相对于 OpenAI、谷歌、月之暗面和智谱模型的声明提供了第三方验证。

OP

OpenAI

竞争对手,其 GPT-5.6 Luna 模型在 Intelligence Index 上与 V4-Flash-0731 得分接近(51 对 50);OpenAI 在此次发布前不久将 GPT-5.6 Luna 定价下调了约 80%,而 DeepSeek 的每任务成本仍比其低约 60%。

GO

Google (Gemini 3.6 Flash)

竞争对手,其模型在 Intelligence Index 得分上(50)被 V4-Flash-0731 追平,根据 Artificial Analysis 的帕累托前沿定位。

使用

使用 Codex CLI / OpenAI Responses API 工具的开发者

原生 Responses API 支持的受益者,可将 Codex CLI 请求直接路由到 DeepSeek V4-Flash。

事实来源

13 条引用
  1. [1] DeepSeek API Updates
  2. [2] DeepSeek V4-Flash-0731 Benchmark Report
  3. [3] DeepSeek Releases DeepSeek V4-Flash-0731, Gives Opus 4.8-Level Performance At A Fraction Of The Price
  4. [4] DeepSeek V4-Flash-0731 Release Coverage
  5. [5] DeepSeek Releases Beta Version of V4 Models as AI Price War Heats Up
  6. [6] DeepSeek V4-Flash-0731 Scores 50 on the Artificial Analysis Intelligence Index, 10 Points Above Previous DeepSeek V4-Flash
  7. [7] DeepSeek Unveils Public Beta API for Flagship AI Model
  8. [8] deepseek-ai/DeepSeek-V4-Flash - Hugging Face
  9. [9] DeepSeek V4 Flash (non-reasoning) - Artificial Analysis
  10. [10] DeepSeek V4 General Availability
  11. [11] DeepSeek V4-Flash Official Release
  12. [12] Responses API Guide - DeepSeek API Docs
  13. [13] Codex Agent Integration - DeepSeek API Docs

来源文章

Top 5

THE SIGNAL.

Analysts

V4 Flash 0731 在智能与每任务成本的帕累托前沿上占有一席之地,尽管 OpenAI 近期降价,其得分仍仅比 GPT-5.6 Luna 低 1 分。

Artificial Analysis (research team)
独立 AI 基准测试机构

将此次发布定义为训练/后训练升级而非新模型,并将其与 Anthropic 的 Opus 4.8 在编码基准上的表现以及 OpenAI 的定价举措进行对比。

OfficeChai (analysis)
AI 行业新闻/分析媒体
The Crowd

🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We've massively upgraded its Agent capabilities—benchmark scores are now far surpassing the V4-Pro-Preview. Check out the massive performance leap below! 👇 🔷 The official V4-Flash now natively supports the [OpenAI Responses API]

@@deepseek_ai19849

DeepSeek V4 Flash GA has a score of 50 on the Artificial Analysis Intelligence Index Massive 10 points higher than V4 Flash Preview. V4 Flash has now the same score as Gemini 3.6 Flash

@@AiBattle_520

I've been too optimistic V4-Flash-0731 is "cheaper 5.6 Luna (Max)". It's near-equal on GDPval-AA v2, Terminal-Bench v2.1, SciCode, HLE, GPQA Diamond. Well behind on CritPt but on 𝜏³-Banking it's closer to Sol… it suffers on LCR and Omniscience/Hallucinations… it's way smaller.

@@teortaxesTex288

DeepSeek-V4-Flash has been updated, "The official release of DeepSeek-V4-Pro will follow soon"

@u/Nunki08939
Broadcast
Deepseek V4 Flash (0731 - Fully Tested): TOP 5 in my TESTS! This is AN ACTUAL COMEBACK!!!

Deepseek V4 Flash (0731 - Fully Tested): TOP 5 in my TESTS! This is AN ACTUAL COMEBACK!!!

New DeepSeek V4 Flash 0731 Looks Seriously Good for Local AI

New DeepSeek V4 Flash 0731 Looks Seriously Good for Local AI

Whale Wokeup: DeepSeek V4-Flash Is Out of Preview — And It's Brutal

Whale Wokeup: DeepSeek V4-Flash Is Out of Preview — And It's Brutal