阿里巴巴通义千问3.8-Max发布
TECH

阿里巴巴通义千问3.8-Max发布

44+
Signals

战略概览

  • 01.
    通义千问3.8-Max是一个拥有2.4万亿参数的专家混合模型,每次推理激活约950亿参数,并具备100万token的上下文窗口。
  • 02.
    阿里巴巴在其发布的宣传材料中声称,该模型在前沿模型中‘仅次于Fable 5’。
  • 03.
    实际可用上下文比宣传的100万token更窄:最大输入为99.1万个token(开启深度思考时为98.3万个),最大输出为13.1万个token,推理预算最多为26.2万个token。
  • 04.
    定价为每百万输入token 2美元,每百万输出token 6美元,缓存token价格更低。
  • 05.
    该模型已通过阿里云API和新上线的公测平台QwenWork广泛开放,权重计划于次周在Hugging Face和ModelScope上开源——这是阿里巴巴首次在Max级别模型上进行开源发布。
  • 06.
    在Arena.ai排行榜上,通义千问3.8-Max在前端代码榜(Frontend Code Arena)排名第四(得分1,668),落后于Claude Opus 5最大努力模式(1,705)和Kimi K3最大努力模式(1,676);在视觉榜(Vision Arena)上排名第二(得分1,305),仅落后于Claude Fable 5高努力模式(1,318)。
  • 07.
    阿里巴巴展示了一次为期16天的自主编码运行,构建了一个名为oh-my-cli的项目,截至2026年7月30日,该项目已累计265次提交、127个拉取请求和151个问题,完整执行轨迹已公开发布在GitHub上。

自称‘第二名’的说法与独立排行榜不符

阿里巴巴在发布材料中将通义千问3.8-Max描述为“当今最强大的模型之一,可与领先前沿AI模型媲美,仅次于Fable 5”[1],但独立排行榜呈现的情况更为复杂。在Arena.ai的前端代码榜上,通义千问3.8-Max以1,668分排名第四,落后于Claude Opus 5最大努力模式(1,705分)和月之暗面的Kimi K3最大努力模式(1,676分);在视觉榜上表现更佳,以1,305分排名第二,仅略低于Claude Fable 5高努力模式(1,318分)[2]。在SWE-bench Pro上,通义千问3.8-Max得分为67.7,高于GPT-5.6 Sol的64.6,但低于Claude Opus 4.8的69.2,远逊于Fable 5的80.0 [3]。媒体报道指出,‘第二名’的说法并未伴随阿里巴巴自身发布的基准测试数据支持 [4]。在X平台上,阿里巴巴官方账号@Alibaba_Qwen的发布帖主导了此次事件的社交传播;独立评论相对较少,但也重复了相同的说法,强调通义千问3.8-Max在前端代码榜上仅以1分之差落后于Claude Opus 5高努力模式,将这一微小差距解读为‘实质领先’,这种解读比其#4的排名更具攻击性。

一场无人独立验证的16天自主编码马拉松

发布中最常被引用的证据是一个名为oh-my-cli的项目,阿里巴巴声称通义千问3.8-Max在约16天内基本独立完成并维护了该项目,截至2026年7月30日,累计265次提交、127个拉取请求和151个问题,完整执行轨迹已公开发布在GitHub上 [5]。这种透明度较为罕见,但并未阻止外界质疑。Kanerika公司AI开发经理Amit Jena指出,关注的焦点不应是参数数量:“真正值得检验的说法是,阿里巴巴声称该模型在16天内完成了一个软件工程项目。这句话被广泛转载,却从未被质疑。16天的‘自主’究竟意味着什么?人类介入了多少次?输出代码是否通过了代码审查?”[1]一位未具名的行业分析师提出了相同的问题,强调该演示的持续时间并未说明过程中有多少人为修正被纳入 [1]

开源Max级别模型才是更大的结构性突破

在基准测试争议之下,隐藏着一个真正的首次:这是阿里巴巴首次承诺在Max级别开源通义千问模型,权重计划在API发布后一周内上线Hugging Face和ModelScope [6],同时还将发布较小的Qwen3.8-27B版本。阿里巴巴于2026年7月19日在上海世界人工智能大会(WAIC)上预览了该模型,仅比月之暗面AI发布其开源权重的Kimi K3晚几天,这标志着中国AI实验室之间在开源基准测试领域展开的更广泛竞争 [7]。Forrester副总裁兼首席分析师Charlie Dai认为这才是真正的信号:“阿里巴巴正在缩小差距,但更大的故事是开源权重模型的快速成熟。企业现在拥有了可信的专有前沿模型替代方案,尤其是在软件工程、领域定制、数据主权和成本敏感部署方面,开源的重要性往往不亚于模型的绝对性能。”[1]Gartner高级首席分析师Nitish Tyagi将这一转变与单位经济联系起来:“Gartner此前曾预测,若无更强的成本控制,AI编码成本可能超过普通开发者的薪资。开源权重、专家混合架构与百万token上下文窗口的结合,标志着向更经济可行的AI辅助软件开发迈出了重要一步。”[1]市场也视其为真正的结构性转变:阿里巴巴港股在发布当日上涨7%,收于125.20港元 [6]

宣传规格在细读条款后缩水

宣传的100万token上下文窗口是理论上限而非实际可用值:有效最大输入为99.1万个token(开启深度思考时为98.3万个),最大输出限制为13.1万个token,推理预算上限为26.2万个token [8]。定价为每百万输入token 2美元,每百万输出token 6美元,缓存token价格更低 [8]。该模型还新增了多模态能力 [7]。此次发布不仅关乎模型本身:阿里巴巴同日推出的QwenWork公测版直接对标Claude Cowork、ChatGPT Work和腾讯WorkBuddy,将竞争从原始模型基准测试扩展至企业级AI办公产品类别 [6]。这些细节并未削弱发布本身,但解释了为何花旗分析师认为这一事件的重点并非‘通义千问击败Fable 5’,而是前沿模型发布的速度正推动企业转向模型无关的采购策略——根据具体任务选择最便宜或最佳的模型,而非锁定单一供应商,从而削弱任何一家实验室的竞争护城河 [4]

历史背景

在通义千问3.8-Max发布日整整三年前,发布了首批可下载的通义千问模型Qwen-7B和Qwen-7B-Chat。
发布了Qwen3.7-Max,一款仅限API使用且未开源权重的模型,在SWE-bench Pro上得分为60.6。
在WAIC上海展会上预览了Qwen3.8-Max-Preview,时间在月之暗面AI发布开源权重的Kimi K3之后几天,宣称拥有2.4万亿参数,排名仅次于Fable 5,但未发布基准测试数据。
正式发布Qwen3.8-Max,通过API和QwenWork公测版广泛提供,并宣布将于次周开源权重,标志着在近期旗舰模型保持专有后,重新回归顶级模型开源策略。

关键关系图

关键玩家
主题

阿里巴巴通义千问3.8-Max发布

事实来源

8 条引用
  1. [1] Alibaba takes aim at OpenAI and Anthropic with Qwen3.8-Max launch
  2. [2] Qwen3.8-Max Ranks #4 on Frontend Code Arena, #2 on Vision Arena
  3. [3] Qwen 3.8 Benchmarks
  4. [4] Alibaba's Qwen3.8-Max Claims Second Place Behind Fable 5, No Benchmarks Published
  5. [5] Qwen Autonomous Coding Audit
  6. [6] Alibaba's AI model Qwen3.8-Max made widely accessible ahead of open-weights release
  7. [7] Alibaba Previews Qwen3.8-Max, a 2.4 Trillion Parameter Multimodal Model, Days After Moonshot's Kimi K3 Open-Weight Launch
  8. [8] Alibaba Qwen Releases Qwen3.8-Max

来源文章

Top 5

THE SIGNAL.

Analysts

质疑16天自主编码演示是否真的无需人工干预,以及生成的代码是否经得起审查

Unnamed industry analyst (cited by InfoWorld)
对自主编码说法持怀疑态度

频繁且快速的AI模型发布正推动企业转向模型无关的采购方式,削弱单一模型的竞争优势,并将优势转向基础设施/平台提供商

Citi analysts
覆盖阿里巴巴的金融分析师

阿里巴巴正在缩小与专有模型领导者的差距,企业现在拥有了可信的开源权重替代方案,适用于软件工程、领域定制、主权和成本敏感部署

Charlie Dai, VP and principal analyst at Forrester
VP and Principal Analyst, Forrester

16天自主编码的说法值得更多审视;开源权重在发布代码库、许可证和模型卡之前仍只是承诺;旗舰模型可能并非企业实际部署的选择,反而是较小的Qwen3.8-27B更可能被采用

Amit Jena, development manager for AI at Kanerika
Development Manager for AI, Kanerika

其意义不在于参数数量,而在于对AI部署成本的竞争压力;开源权重、MoE架构与100万token上下文的结合使AI辅助开发更具经济可行性,但企业必须权衡部署位置和责任风险

Nitish Tyagi, senior principal analyst at Gartner
Senior Principal Analyst, Gartner
The Crowd

📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autonomous coding: 10+ days of [truncated in source]

@@Alibaba_Qwen21266

Qwen3.8-Max went live today and the open weights land next week, which would make it the largest open model ever released. The current record is DeepSeek V4 Pro at 1.6T, this one is 2.4T. It is also sitting one point behind Claude Opus 5 High on Arena's frontend code board: [truncated in source]

@@slash1sol65

do you understand what Qwen just did? > Alibaba drops Qwen3.8-Max > 2.4 trillion parameters, native multimodal, built for agents > it lands #4 on Arena's Frontend Code board > score: 1,668 > Claude Opus 5 High sits at 1,669 > one point. one > it beats Fable 5. it beats GPT-5.6 [truncated in source]

@@polydao63

Qwen3.8-27B announced alongside Qwen3.8-Max

@u/TKGaming_112600
Broadcast
Qwen3.8 MAX Preview Is HERE – Is THIS the BEST Open Model Yet?

Qwen3.8 MAX Preview Is HERE – Is THIS the BEST Open Model Yet?

Qwen 3.8 Max (Fully Tested): AN ACTUAL OPEN FABLE COMPETITOR!

Qwen 3.8 Max (Fully Tested): AN ACTUAL OPEN FABLE COMPETITOR!

Qwen 3.8 Max IS INSANE! Second To Fable? New Open Model King? (Fully Tested)

Qwen 3.8 Max IS INSANE! Second To Fable? New Open Model King? (Fully Tested)