自称‘第二名’的说法与独立排行榜不符
阿里巴巴在发布材料中将通义千问3.8-Max描述为“当今最强大的模型之一,可与领先前沿AI模型媲美,仅次于Fable 5”[1],但独立排行榜呈现的情况更为复杂。在Arena.ai的前端代码榜上,通义千问3.8-Max以1,668分排名第四,落后于Claude Opus 5最大努力模式(1,705分)和月之暗面的Kimi K3最大努力模式(1,676分);在视觉榜上表现更佳,以1,305分排名第二,仅略低于Claude Fable 5高努力模式(1,318分)[2]。在SWE-bench Pro上,通义千问3.8-Max得分为67.7,高于GPT-5.6 Sol的64.6,但低于Claude Opus 4.8的69.2,远逊于Fable 5的80.0 [3]。媒体报道指出,‘第二名’的说法并未伴随阿里巴巴自身发布的基准测试数据支持 [4]。在X平台上,阿里巴巴官方账号@Alibaba_Qwen的发布帖主导了此次事件的社交传播;独立评论相对较少,但也重复了相同的说法,强调通义千问3.8-Max在前端代码榜上仅以1分之差落后于Claude Opus 5高努力模式,将这一微小差距解读为‘实质领先’,这种解读比其#4的排名更具攻击性。


