DeepSeek V4.1-Flash 发布
TECH

DeepSeek V4.1-Flash 发布

45+
Signals

战略概览

  • 01.
    DeepSeek 于 2026 年 9 月 10 日正式发布 DeepSeek-V4.1-Flash,这是一款多模态专家混合模型,拥有 5520 亿参数主干和额外 1960 亿 Engram 参数(总计 7630 亿),上下文窗口达 100 万 token,基于新的因果编码器-解码器架构(一个 40 层 Transformer,分为 20 层因果编码器和 20 层解码器)。
  • 02.
    该设计通过将解码器的全局 KV 缓存从编码器的最终隐藏状态投影而来,使得模型在预填充阶段(读取输入)每 token 仅激活 80 亿参数,在解码阶段(生成输出)激活 160 亿参数,与模型整体大小无关。
  • 03.
    自 2026 年 9 月 14 日 04:00 UTC 起,所有对 deepseek-v4-pro 的请求将自动路由至 V4.1-Flash,并按 Flash 系列费率计费,实质上淘汰了 V4-Pro;旧有名称 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 也暂时被路由至 V4.1-Flash。
  • 04.
    模型权重以 MIT 许可证在 Hugging Face 上开源,无访问限制,支持通过 vLLM、SGLang 和 Transformers 部署。
  • 05.
    V4.1-Flash 在多个代理和编码基准测试中表现优于或媲美 GPT-5.6 Sol 和 Claude Opus-5,在 Terminal-Bench 2.1 上得分为 90.6(对比 88.8 和 89.1),在 DeepSWE v1.1 上得分为 74.2(对比 73.0 和 74.0)。
  • 06.
    非高峰时段 API 定价下调至每百万缓存命中输入 token 0.02 元人民币,缓存未命中输入为 1 元,输出为 4 元,高峰时段定价为非高峰时段的两倍。

架构玄机:7630 亿参数,仅激活 80 至 160 亿

V4.1-Flash 的表面数字具有误导性。该模型虽拥有 5520 亿参数主干和额外 1960 亿 Engram 参数,总计 7630 亿[1],但其新型因果编码器-解码器设计——一个 40 层 Transformer 分为 20 层因果编码器和 20 层解码器——通过将解码器的全局 KV 缓存从编码器的最终隐藏状态直接投影而来,而非在每一解码层重新计算[1],从而实现无论底层权重多大,每 token 在预填充阶段仅激活 80 亿参数,解码阶段仅激活 160 亿参数[1]。结合 FP4 KV 缓存(E2M1 格式)和压缩稀疏注意力 2(Compressed Sparse Attention 2),每 token 的全局 KV 缓存占用降至 890 字节——约为 DeepSeek-V4-Flash 的四分之一,约是 DeepSeek-V1 的 437 分之一[2]。上下文窗口扩展至 100 万 token,DeepSeek 表示从 4K 扩展到 100 万 token 仅增加约 25% 的计算量[3],表明起作用的是架构本身,而不仅仅是暴力计算。

以极低代价击败 GPT-5.6 Sol 和 Claude Opus 5

DeepSeek 明确对标两大闭源模型领军者。在 Terminal-Bench 2.1 上,V4.1-Flash 得分为 90.6,高于 GPT-5.6 Sol 的 88.8 和 Claude Opus-5 的 89.1;在 DeepSWE v1.1 上得分为 74.2,分别高于 73.0 和 74.0[2]。这些差距虽小,但伴随着非高峰 API 定价:每百万缓存命中输入 token 0.02 元人民币,缓存未命中输入 1 元,输出 4 元(高峰时段为双倍)[4],远低于前沿实验室的典型定价。该模型的竞争对象也不仅限于 OpenAI 和 Anthropic;报道指出 Moonshot AI 的 Kimi K3 是其在开源、低成本模型细分市场中的直接对手[5],凸显当前最激烈的竞争正发生在快速迭代的开源权重玩家之间,而不只是对抗闭源实验室。独立测试迅速捕捉到这一点——一位专注于设计任务的评测者发现,V4.1-Flash 在日常设计任务中达到领先闭源模型 98% 的得分,成本却仅为约 1.4%,被视为开源模型正在缩小与闭源模型差距的证据。

淘汰 V4-Pro 并非可选项

此次并非并行发布、保留旧模型运行。自 2026 年 9 月 14 日 04:00 UTC 起,所有对 deepseek-v4-pro 的请求将自动路由至 V4.1-Flash 并按 Flash 系列费率计费,实质上淘汰 V4-Pro;旧有名称 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 也暂时被路由至新模型[6]。DeepSeek 表示,其内部及外部测试显示 V4.1-Flash 在性能、成本、速度和总完成时间上均超越 V4-Pro[4],这是强制迁移而非提供选项的理由。实际上,每个 V4-Pro 集成将在发布后数日内切换至架构截然不同的新模型,无论特定工作负载是否已针对其验证过。

相比上一次 DeepSeek 震撼,此次几乎未引起波澜

此次发布引人注目的背景不仅是技术性的。2025 年 1 月,DeepSeek 的 V3 和 R1 发布曾引发历史性单日抛售,英伟达股价下跌约 17%——市值蒸发约 6000 亿美元,创下当时美国股市史上单一公司单日最大市值损失纪录[7]。而 V4.1-Flash 的发布,尽管在编码基准测试中以极低价格匹敌或超越两大当前前沿闭源模型,却未引发类似市场动荡[7]。这一反差本身值得注意:十八个月后,一家中国实验室发布能与顶级闭源模型竞争的开源、MIT 许可权重,已从震惊变为常态,延续了 DeepSeek 在 V4 系列早期将其主模型线拆分为 Pro 和 Flash 两个变体的模式[8]

关键点:你仍需服务器集群才能自行运行

MIT 许可的权重可自由从 Hugging Face 下载,支持 vLLM、SGLang 和 Transformers,且无使用门槛限制谁可以使用[1]。但开放不等于可及:即便有降低规模化服务成本的 KV 缓存优化,一个拥有 5520 亿主干、总计 7630 亿参数的模型仍需服务器级多 GPU 硬件才能自托管[1]。效率提升主要惠及已有基础设施的运营方——如 DeepSeek 自身的 API 或资源充足的大型企业——而非让单个工作站就能运行前沿级模型。

历史背景

DeepSeek 发布首个公开模型系列 DeepSeek Coder。
DeepSeek 发布 V3 和 R1 推理模型,引发市场震荡,英伟达股价单日下跌约 17%,创下当时美国股市史上单一公司单日最大市值损失纪录。
DeepSeek 的 V4 系列将其主模型线拆分为 Pro 和 Flash 两个变体,现发布 V4.1-Flash 以取代并超越 V4-Pro。
V4.1-Flash 正式发布,以 MIT 许可在 Hugging Face 开源权重,同日生效新的 Flash 级 API 定价。

关键关系图

关键玩家
主题

DeepSeek V4.1-Flash 发布

DE

DeepSeek

V4.1-Flash 的开发者和发布方;将其定位为新型 CED 架构家族中最小的模型,旨在扩展至更大模型,以之取代 V4-Pro 并下调 Flash 级 API 价格。

OP

OpenAI (GPT-5.6 Sol)

作为基准竞争对手被引用,DeepSeek 声称在编码和代理任务上表现相当或更优,且每 token 定价远低于对方,削弱了 OpenAI 的差异化优势。

AN

Anthropic (Claude Opus 5)

作为另一基准竞争对手被引用,DeepSeek 声称在 DeepSWE v1.1 和 Terminal-Bench 2.1 等编码基准上表现匹配或略胜一筹。

MO

Moonshot AI (Kimi K3)

直接的中国竞争对手,其 Kimi K3 模型被列为 V4.1-Flash 在开源、低成本模型细分市场中的竞争对象。

HU

Hugging Face

分发平台,托管 MIT 许可的 V4.1-Flash 权重,供自托管部署。

开发

开发者和运行代理及编码工作负载的 API 用户

KV 缓存减少的主要受益者,因内存占用更低、吞吐更高,降低了长时间、输入密集型代理任务的成本。

事实来源

8 条引用
  1. [1] DeepSeek-V4.1-Flash (Hugging Face model card)
  2. [2] DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache and Cross-Layer Attention Reuse
  3. [3] DeepSeek V4.1 Flash Explained: How It Cuts AI Memory 8x
  4. [4] DeepSeek Formally Launches V4.1-Flash, Routes V4-Pro Requests to Flash
  5. [5] DeepSeek V4.1 Flash Model Launch
  6. [6] DeepSeek API Updates
  7. [7] Why DeepSeek Didn't Cause an Investor Frenzy Again in 2025
  8. [8] DeepSeek Timeline: Release Dates

来源文章

Top 5

THE SIGNAL.

Analysts

将 V4.1-Flash 视为人工智能竞争正从原始基准分数转向长期代理任务运行成本的证据,因为随着代理工作时间延长,上下文承载成本主导了经济性。当代理工作更久时,AI 经济越来越取决于在整个任务中维持上下文的成本。

Grant Harvey
首席撰稿人,《The Neuron》

认为每 token 的智能不如正确完成整个任务的总成本重要:‘每 token 最聪明的模型可能不如正确完成整个工作的成本重要。’

Grant Harvey
首席撰稿人,《The Neuron》
The Crowd

🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6

@@deepseek_ai22940

We benchmarked DeepSeek V4.1 Flash by @deepseek_ai. It reached 98% of GPT-6 Astra's score at 1.4% of the cost on everyday design tasks based on user requests. Every model except Astra scored lower AND cost more. Are open models overtaking closed ones? Full results below ⇘️

@@OpenDesignHQ9341

DeepSeek has open-sourced some new code repositories, making it easier to deploy V4.1 Flash as well as subsequent open-source models: https://github.com/deepseek-ai/deepseek-recipe https://github.com/deepseek-ai/DeepSelect https://github.com/deepseek-ai/DeepJIT

@@tianyi883
Broadcast
Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)

Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)

DeepSeek V4.1 Flash Is INSANELY GOOD! Fast, Cheap, Powerful! (Fully Tested)

DeepSeek V4.1 Flash Is INSANELY GOOD! Fast, Cheap, Powerful! (Fully Tested)

🚨 DeepSeek V4.1 Flash VAZOU! 1M de Contexto, Visão e Velocidade ABSURDA!

🚨 DeepSeek V4.1 Flash VAZOU! 1M de Contexto, Visão e Velocidade ABSURDA!