95%的完成率指标衡量的是合规性,而非真实技能
这些基准测试数据表面上看非常惊人。GPT-5.5在英国AI安全研究所的专家级网络安全任务中取得了71.4%(±8.0%)的通过率,优于Claude Mythos Preview的68.6%和OpenAI此前发布的GPT-5.4(52.4%)[1]。在Irregular的原子挑战套件中,同一模型在网络安全攻击模拟挑战中达到98%,在漏洞研究与利用挑战中达到92%[2]。OpenAI更新的专用模型GPT-5.6-Cyber在公司自有的高级网络安全完成率基准测试中报告了95%的完成率,相比之下,GPT-5.5-Cyber为57.3%,而标准GPT-5.6 Sol模型在启用常规安全防护机制的情况下仅为1.5%[3]。
GPT-5.5与Mythos的对比也超出了基准测试报告本身,成为外部热议话题。在r/ArtificialInteligence论坛上,一位声称亲自使用GPT-5.5进行漏洞挖掘的用户直接回应了Anthropic关于Mythos“过于危险而无法发布”的说法——该说法曾由负责此次网络安全评估的同一AI安全研究所验证。该用户在实际使用该模型进行漏洞研究后的结论是:“相当不错……但远未达到‘过于危险而无法发布’的程度。”
最后这一对比揭示了关键问题。VentureBeat对此次发布的分析直言不讳:完成率指标衡量的是模型尝试任务的频率,而非任务是否正确完成,称之为“披着能力指标外衣的拒绝率指标”[4]。从1.5%跃升至95%的完成率,看起来更像是OpenAI放宽了原本限制基础模型的防护机制,而非原始技能的飞跃。不过,真实的能力提升在其他方面也有所体现:据称GPT-5.6-Cyber在Chrome的V8引擎中发现了两个此前未知的漏洞(其中一个被分配CVE-2026-15903编号),在移动操作系统中发现多个漏洞,并在一款流行操作系统内核中发现超过400个权限提升漏洞[3]。
开源模型正从另一角度缩小差距。DeepSeek-V4-Flash在Cybergym安全基准测试中得分76.7,约为其前一版本38.7分的两倍[5],DeepSeek还发布了一个专为自主夺旗式安全研究和多步利用规划设计的蒸馏版本DeepSeek-V4-Fable[6]。与OpenAI受控的Daybreak Red层级不同,这些模型可公开下载——能力曲线不仅在上升,还在扩散。


