DeepSeek V4.1 Flash 模型发布
战略概览
- 01.DeepSeek 于 2026 年 9 月 8 日至 9 月 10 日开启了为期两天的 V4.1 Flash 内部/API 测试,模型 ID 为 deepseek-v4.1-flash-expires-on-0910。
- 02.开发者通过保持现有的 base_url 并仅更换模型名称即可接入测试版,测试期间定价与 deepseek-v4-flash 一致,且每个账户最多支持 20 个并发请求。
- 03.DeepSeek 计划于 2026 年 9 月 10 日左右(北京时间)正式发布 V4.1 Flash,此后新的更低 Flash 定价将生效,V4 Pro 的流量将自动被路由至 V4.1 Flash 并按更低费率计费。
- 04.V4.1 Flash 采用全新架构的模型,原生集成了多模态文本与图像处理能力,而非像以往那样将视觉功能作为附加的独立变体提供。
全新架构,而非附加的视觉模式
此前 DeepSeek 发布的具备图像能力的版本 V4-Flash-Vision-Exp,是在 V4-Flash 基础上叠加的独立实验性变体;而 V4.1 Flash 则采用了全新设计的模型,将多模态文本与图像处理能力原生集成到底层模型中[2]。测试版的官方并发限制被刻意压低至每账户 20 个请求,远低于 V4 Flash 标准的 2,500 请求上限[1],但实际通过测试的用户报告吞吐量在每秒 300 至 420 个 token 之间,峰值接近 507 tok/s——约为当前公开 V4 Flash 的 ~128 tok/s 的三倍[1]。早期 Hacker News 用户的反馈主要集中在这一速度跃升[2],有评论者指出,对于许多产品应用场景而言,原始生成速度比微小的质量提升更为重要[2]。
不到五个月内四次发布,表明这是一场价格战,而不仅仅是升级
自 2026 年 4 月以来,V4.1 Flash 是 DeepSeek 发布的第四个模型:旗舰版 V4(含 V4 Pro)于 4 月 24 日发布[3],V4-Flash 于 7 月 31 日通过公开测试版 API 实现通用可用,并连续七周成为 OpenRouter 上使用最多的模型[4],V4-Flash-Vision-Exp 于 8 月 21 日增加了实验性图像输入功能,明确作为对 Anthropic Opus 4.8 的测试[5],如今 V4.1 Flash 的测试版于 9 月 8 日上线[6]。Flash 级别的发布伴随着反复的价格下调,这一模式表明 DeepSeek 正在 OpenRouter 等平台上与 Moonshot 的 Kimi K3 和 Qwen 等国内竞争对手争夺开发者份额[4]。这一发布节奏背后有真实资本支撑:DeepSeek 于 7 月完成了约 74 亿美元的私募融资,由腾讯和网易领投,估值达 3500 亿元人民币[4]——这笔资金为分析师所描述的“以能力和价格取胜,而盈利能力尚存疑问”的战略提供了支撑[4]。
一项基准声明正面临压力测试
一份来自 OpenDesign 的独立基准测试在 X 平台上广泛传播,发现 V4.1 Flash 在日常设计任务中的得分约为顶级 GPT-6 Astra 的 98%,而成本仅为后者的约 1.4%,这引发了关于开源模型正在缩小与闭源前沿模型差距的讨论。Reddit 上的反应则更为审慎:尽管对价格和速度表示兴奋,但一些评论者认为该基准测试存在“刷分”嫌疑而非具有代表性;至少有一位用户报告称,在真实调试任务中 V4 Pro 表现优于 V4.1 Flash,直接挑战了“全面超越”的说法。基准测试中的亮眼数据与实际编码表现不稳定之间的差距,是 9 月 10 日发布前最明显的未解问题。
历史背景
关键关系图
事实来源
[1] DeepSeek V4.1 Flash Leak: Pricing, Concurrency Limits, and V4 Pro Routing
[2] Hacker News discussion: DeepSeek V4.1 Flash beta
[3] DeepSeek Unveils Newest Flagship a Year After AI Breakthrough
[4] DeepSeek Releases Official V4 Flash Model as China's AI Race Intensifies
[5] DeepSeek Unveils Test Model to Rival Anthropic's Opus 4.8
[6] DeepSeek Launches Limited-Time Multimodal Beta of V4.1 Flash
来源文章
THE SIGNAL.
“指出新测试模型最突出的特点是速度,仅简单评论道“哇,真快。””
“认为对于许多产品应用场景而言,原始速度可能比微小的质量提升更重要,表示他“宁愿选择一个稍差但快两倍的模型。””
“测量发现 V4.1 Flash 端到端速度显著快于 DeepSeek 此前的 Vision-Exp 变体,提速范围达 3.9 倍至 6 倍。”
“We benchmarked DeepSeek V4.1 Flash by @deepseek_ai. It reached 98% of GPT-6 Astra's score at 1.4% of the cost on everyday design tasks based on user requests. Every model except Astra scored lower AND cost more. Are open models overtaking closed ones? Full results below ⇘️”
“鉴于 DS V4.1 Flash 模型在性能、费用、速度、总用时等各项指标上都全面超越了 V4 Pro。再以更高的价格、更慢的速度和更多的算力消耗给 DS 用户提供原有性能较差的 V4 Pro 模型会不太合适。V4.1 Flash 正式上线之后,V4.1 Pro 上线之前,V4 Pro 模型的请求都会被路由到 V4.1 Flash,并按 Flash 计费”
“new deepseek v4.1 flash pricing is absurd...”
“DeepSeek V4.1 Flash achieved 98% of top-ranked GPT-6 Astra's average score, at just 1% of its average cost”

DeepSeek V4.1 Flash Is INSANELY GOOD! Fast, Cheap, Powerful! (Fully Tested)

The NEW DeepSeek V4.1 Flash is MUCH BETTER than you think

DeepSeek V4.1 Flash LEAKED! 1M Context, Vision, and ABSURD Speed!