
DeepSeek V4-Flash-Vision-Exp 多模态视觉模型发布
战略概览
- 01.2026年8月21日,DeepSeek 在 DeepSeek API 平台上推出了实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,在代理、推理和世界知识等文本能力方面与 V4-Flash 保持一致的同时,增加了原生图像输入功能。
- 02.该模型通过 model="deepseek-v4-flash-vision-exp" 调用,支持聊天补全、消息和响应 API 格式,图像可通过 base64、外部 URL 或免费的 Files API 提供。
- 03.每张图像最多被标记为 384 个 token,并按标准 V4-Flash 文本价格计费,图像输入无额外溢价;非高峰时段输入价格为每百万 token 0.22 美元,高峰 UTC 时段升至每百万 0.44 美元。
- 04.同日发布的 DeepSeek Harness 0.1.1 为开发者提供了开箱即用的新视觉模型支持,便于在其 API 基础上构建代理工具。
营销宣传与 DeepSeek 自家数据表之间的差距
DeepSeek 的宣传强调该模型“接近 Opus-4.8”,但其公布的基准测试数据表讲述了一个更有限的故事:TheNextWeb 的分析指出,在列出的十一项基准测试中,该模型仅在三项中胜出 [2]。在仓库级编码任务(NL2Repo,57.7 对比 69.7)上,该模型落后 Opus 4.8 近两位数,在 DSBench-Hard(63.6 对比 71.7)上差距稍小 [2],而在 Agents' Last Exam 和 ZeroBench 等任务上仅略微领先 [3]。DeepSeek 还承认,其在某些比较中使用的纯文本 V4-Flash 基线忽略了特定基准任务中的多模态元素,这夸大了视觉模型的表观优势 [2]。
实际测试使基准测试故事更加复杂
独立于 DeepSeek 自身数据之外的实际测试呈现出更为混杂的画面。一次动手视频评测发现,该模型能近乎完美地转录密集数学公式,并准确提取多系列商业图表中的具体数值,但在多语言手写识别上表现糟糕——完全遗漏了一整段乌尔都语文本,并在一段印尼语段落中产生幻觉内容,促使评测者警告观众切勿盲目信任其输出。社区对该发布的讨论也反映了这种分歧:有用户报告该模型在混乱的真实世界截图中严重误标内容,另一项关于车牌识别的并排对比发现,尽管结果准确,但其速度较慢且 token 效率低于开源权重的竞品。整体情绪是热情欢迎该模型终于填补了代理能力的空白,但始终伴随着一种谨慎的声音:在精心筛选的任务上取得的高分并不总能顺利转化为混乱真实世界图像的表现。
一个外界无法验证的‘Exp’标签
DeepSeek 基准测试表中的每一项数据均为自报:该公司尚未发布 V4-Flash-Vision-Exp 的模型权重、架构细节或技术报告 [3],导致外部研究人员无法独立验证这些分数。这种不确定性也在讨论该发布的开发者社区中浮现,评论者指出该模型的开源权重状态仍未确认。在上述情况改变之前,“接近 Opus 4.8”这一说法诚实地说只是 DeepSeek 自己的主张,尚未经过独立验证。
历史背景
关键关系图
事实来源
[1] DeepSeek V4-Flash-Vision-Exp API Launch Announcement
[2] DeepSeek Releases V4-Flash-Vision-Exp, Matches Opus 4.8 On Some Multimodal Benchmarks
[3] DeepSeek V4-Flash-Vision-Exp API: Pricing, Limits and Benchmark Details
[4] DeepSeek Releases Experimental Flash Vision Model That Rivals Opus 4.8 On Agent Benchmarks
[5] DeepSeek Launches DeepSeek-V4-Flash-Vision-Exp for Multimodal API Service
[6] DeepSeek Vision-Exp Image Processing Cost Breakdown
来源文章
THE SIGNAL.
“认为真正的故事不是发布了一个新模型,而是 DeepSeek 将视觉能力嫁接到了一个已经以商品化价格提供的模型系列上,这对每个任务需要多次 API 调用的代理工作流尤为重要。”
“提醒称,DeepSeek 自己的基准测试表显示,该模型在公布的十一项基准测试中仅在三项上击败 Opus 4.8,应缓和‘媲美 Opus 4.8’的标题式表述。”
“警告称,不应将狭窄的基准测试优势误认为强细粒度视觉理解的证明,鉴于该模型尚未发布权重或技术报告。”
“DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model.”
“wtf is happening today: DeepSeek has launched DeepSeek-V4-Flash-Vision-Exp, an experimental multimodal model built for agents that need to see. And its performance on visual-agent benchmarks moves close to or even outperforms Opus 4.8. Again: this is the Flash model.”
“DeepSeek just shipped V4 Flash Vision. Same strong text performance. Much better multimodal agents. Near Opus 4.8 on key benchmarks. API model: deepseek-v4-flash-vision-exp DeepSeek Harness 0.1.1 supports it out of the box”
“DeepSeek-V4-Flash-Vision-Exp”

DeepSeek V4-Flash Vision Is Out: Whale Opened Its Eyes

HUGE Gemini 4.0 Leaks, DeepSeek V4 Flash Vision + V5 Leaks, Ox Alpha is Minimax? & More! AI NEWS

DeepSeek V4-Flash-Vision-Exp上线!大模型终于"睁眼"了:多模态Agent能力暴涨,接近Opus 4.8,API正式开放!