自报基准测试 vs Opus 4.8:胜负参半,而非全面领先
DeepSeek 将于 2026 年 8 月 21 日在 DeepSeek API 平台上线的 V4-Flash-Vision-Exp 定位为在文本能力上与 DeepSeek-V4-Flash 持平,同时缩小与 Anthropic 的 Claude Opus 4.8 在多模态代理方面的差距 [1]。部分数据支持这一说法:在 Agents' Last Exam 上,DeepSeek 得分为 27.3,高于 Opus 4.8 的 25.7;在 ZeroBench 上以 35.0 对 34.0 略胜一筹 [5]。在 ApexBench 上以 36.5 对 39.4 略逊一筹,在 Toolathlon-Verified 和 Chartography 上两者得分相差不到 1 分 [2]。然而,《TheNextWeb》的报道提供了更完整的背景:在 DeepSeek 发布的 11 项基准测试中,它实际上仅赢了 3 项,且比较对象的选择也经过精心考量——DeepSeek 选择与当前活跃的 Opus 4.8 对比,而非更新的 Opus 5 [3]。
这些注意事项远不止基准测试的选择。The Decoder 指出,DeepSeek 的评估是通过其内部的 Harness Minimal Mode 进行的,这意味着性能数据尚未经过独立验证 [4]。更进一步,当底层的 V4-Flash 文本模型被强制忽略附带图像时,其 ApexBench 得分骤降至 26.2——这提醒我们,多模态提升是真实的,但绝对数值仍来自单一、自我管理的测试框架,而非中立第三方 [5]。而 DeepSeek 未能弥补的差距,恰恰可能是对付费客户最重要的:NL2Repo 是一项仓库级编码基准测试,Opus 4.8 仍以 12 分优势领先(69.7 对 57.7),TheNextWeb 称这对企业部署构成真正的竞争劣势 [3]。


