以 Opus 的价格实现前沿智能:基准测试的真实表现
Anthropic 的基准测试主张在成本维度上异常具体,而不仅仅是原始能力。在 Frontier-Bench v0.1 上,Opus 5 的得分超过前代 Opus 4.8 一倍以上,同时每任务成本更低 [1]。独立基准测试网站 MarkTechPost 记录了该主张背后的精确数据:Opus 5 得分为 43.3%,Opus 4.8 为 18.7%,Fable 5 为 33.7% [2]。在 CursorBench 3.2 的最大努力模式下,Opus 5 以每任务成本一半的代价,得分与 Fable 5 的峰值仅相差不到 0.5 个百分点 [1];在计算机操作基准 OSWorld 2.0 上,它以约三分之一的成本超越 Fable 5 的最佳成绩 [1],MarkTechPost 的拆解显示其得分为 70.57% [2]。Artificial Analysis 自主的知识工作评估 AA-Briefcase 将 Opus 5 定位在 1,720 Elo 分数——领先 Fable 5 的 1,574 分 146 分,分析质量 Elo 分数高出近 300 分 [3]。在所有列出的基准测试中,模式一致:Opus 5 无需全面击败 Fable 5 即可成为更具吸引力的选择,它只需以极低的成本接近其水平即可,而其定价与所取代的 4.8 代模型完全相同。



