十一项测试赢三项:Opus 对比背后的基准表
DeepSeek 自身的发布声明将 V4-Flash-Vision-Exp 描述为在多模态代理任务上缩小了与 Anthropic 的 Claude Opus 4.8 的差距 [1]。该模型并非从零构建的多模态系统,而是将 DeepSeek 现有的 V4-Flash 主干——一种稀疏的专家混合架构(总参数 2840 亿,激活参数 130 亿)——扩展加入视觉编码器,同时保持文本性能不变 [1]。
然而,一旦独立媒体汇总 DeepSeek 公布的所有数据,‘媲美 Opus’的说法便显得复杂。DeepSeek 的模型在 Agents' Last Exam(27.3 对比 25.7)、ZeroBench Pass@5(35.0 对比 34.0)和 DeepSWE(59.3 对比 58.0)中胜出,但在 ApexBench Pass@1(36.5 对比 39.4)、Chartography(64.3 对比 65.0)以及最关键的 NL2Repo 上落后,差距达 12 分(57.7 对比 69.7)[2]。OfficeChai 的统计一针见血:DeepSeek 在其公布的 11 项测试中仅在 3 项上击败 Opus 4.8 [2]。这很重要,因为评估本身是通过 DeepSeek 自有的内部‘Harness Minimal Mode’运行,而非独立复现的基准测试套件 [2]——XenoSpectrum 直接强调了这一点,警告称基准表上的微弱优势并不能证明模型能准确读取精细视觉细节 [3]。



