Opus 4.6 在消费级硬件上本地运行
TECH

Opus 4.6 在消费级硬件上本地运行

31+
Signals

战略概览

  • 01.
    阿里巴巴发布了 Qwen3.8-27B,这是一款拥有 277.8 亿参数、采用 Apache 2.0 许可证的开源模型,宣称可在个人笔记本电脑上完全离线运行,性能与 Claude Opus 4.6 处于同一水平。
  • 02.
    Qwen3.8-27B 原生支持 262,144 个 token 的上下文窗口(可通过 YaRN 扩展至 100 万),支持文本、图像和视频输入,由阿里巴巴通义实验室于 2026 年 8 月 14 日发布。
  • 03.
    SGLang 报告称,在单张 RTX 5090 上使用 NVFP4 量化和推测解码技术运行 Qwen3.8-27B 时,吞吐量超过每秒 200 个 token,模型权重约为 16.5GB —— 这正是本事件的核心数据点。
  • 04.
    独立社区在 RTX 5090 上使用通用 GGUF 量化(非优化的 SGLang/NVFP4 路径)进行的基准测试结果远低于此,具体速度在 73 至 119 个 token/秒之间,取决于量化等级和上下文长度。
  • 05.
    Andrew Zhu 在一台配备 5 张 RTX 3090 的设备上本地运行了 DeepSeek V4 Flash 0731(总参数 2840 亿 / 激活参数 130 亿,GGUF 权重 104GB),称其达到了‘Opus 级别的智能,零 token 成本’,解码速度为每秒 20 至 30 个 token。
  • 06.
    Simon Willison 在搭载 M5 芯片的 MacBook Pro 上通过 LM Studio 本地运行阿里巴巴的 Qwen3.6-35B-A3B(Q4 量化,20.9GB),并判断其在‘鹈鹕骑自行车’SVG 生成基准测试中击败了 Claude Opus 4.7。
  • 07.
    根据 explainx.ai 汇总的五项重叠基准测试,Qwen3.8-27B 仅在一项测试中击败了 Claude Opus 4.6 Max(SWE-bench Pro,61.7 对 53.4),在其余四项测试中均落后,包括 GPQA Diamond(89.2 对 91.3)和 Humanity's Last Exam(30.8 对 40.0)。
  • 08.
    另一款更大的配套模型 Qwen3.8-Max(总参数 2.4 万亿,约 950 亿激活参数)于 2026 年 8 月 3 日发布,承诺‘下周’开源权重;该模型在 Vals Index 上与 Claude Opus 4.7 打成平手(66.1 对 66.1),测试成本约为后者的 2.3 倍,但 Claude Opus 4.8 在 SWE-bench 上以 89.2% 对 87.3% 击败了它。

并非 Opus 本地运行,而是 27B 模型挑战者与之对比

推动这一话题的推文和帖子描述为‘在本地运行 Opus 4.6’,但这并非事实。2026 年 8 月 14 日发布的实际上是 Qwen3.8-27B,这是阿里巴巴通义实验室推出的一款 277.8 亿参数的开源模型,采用 Apache 2.0 许可证,体积足够小,可在无网络连接的笔记本电脑上完全运行 [1]。它被定位为性能接近 Claude Opus 4.6,而非 Opus 本身在消费级硬件上运行 [2]。基准测试结果呈现的是复杂局面,而非全面胜利:根据 explainx.ai 汇总的五项重叠测试,Qwen3.8-27B 仅在 SWE-bench Pro(61.7 对 53.4)一项测试中击败 Opus 4.6 Max,在 GPQA Diamond(89.2 对 91.3)和 Humanity's Last Exam(30.8 对 40.0)等测试中均落后 [3]。一款 27B 模型在某项编码基准上接近闭源前沿模型确实值得关注 —— 但这与‘Opus 4.6 在笔记本上运行’是两个不同的说法。

病毒式传播的‘RTX 5090 每秒 200 个 token’是优化后的最佳情况

本事件的核心速度数据 —— 单张 RTX 5090 每秒 200 多个 token —— 来自 SGLang 在发布日的基准测试,该结果通过 NVFP4 量化和推测解码在约 16.5GB 权重上实现 [4]。大多数用户在家中运行模型时无法达到这一速度。社区使用通用 GGUF 量化在相同 RTX 5090 上的测试结果远低于此:基础 Q4 量化下约为每秒 73 个 token,启用推测解码后提升至约 87 个 token/秒,Q5 量化等级下达到约 119 个 token/秒 [4]。这一差距也体现在另一个‘本地 Opus’的说法中:当一位爱好者在配备 5 张 RTX 3090 的设备上本地运行 DeepSeek V4 Flash 0731(一款声称达到‘Opus 级智能’的 2840 亿参数模型)时,解码速度仅为每秒 20 至 30 个 token [5]。本地运行接近前沿水平的推理确实存在,但头条吞吐量数据依赖于大多数用户无法复制的优化设置。

在直接编码测试中,云端 Opus 仍具速度优势

社区测试将本地运行的 Qwen 模型与云端托管的 Claude Opus 4.6 在实际编码任务中进行对比(而非静态基准表),发现 Opus 在直接对比中仍更快,即使面对双 RTX 3090 的本地设置,任务完成时间也大约只有后者的一半或更少,本地模型的吞吐量处于每秒 22 至 50 个 token 的范围。尽管评测者仍认为本地模型的输出质量具有竞争力,但社交媒体上最响亮的帖子所暗示的速度优势在实际编码对比中并未显现。

这是六个月内第二次‘本地模型击败 Opus’ —— 细节问题反复出现

Claude Opus 4.6 于 2026 年 2 月 5 日发布,此后已被 Opus 4.7 和 Opus 4.8 两次超越 [6]。‘本地模型击败 Opus’的说法已成为一种反复出现的现象,而非一次性事件。2026 年 4 月,开发者 Simon Willison 在搭载 M5 芯片的 MacBook Pro 上通过 LM Studio 本地测试了阿里巴巴的 Qwen3.6-35B-A3B,认为其在一项特定创意基准测试中击败了 Claude Opus 4.7 —— 即生成一只骑自行车的鹈鹕的 SVG 图像 [7]。2026 年 8 月,阿里巴巴又推出了更大的配套模型 Qwen3.8-Max(总参数 2.4 万亿),宣称其在 Vals Index 上与 Opus 4.7 打成平手,且每次测试成本低约 2.3 倍 —— 但仅加载其权重就需要超过 1TB 内存和至少 8 张 H100 或 B300 GPU,与消费级硬件完全无缘 [8]。每次发布都在纸面上缩小了与闭源前沿模型的差距;但每次也都伴随着在病毒式传播中被忽略的细节问题。

连比较方法本身也存在争议

除了硬件限制外,分析师指出,基准测试本身的可靠性也存在问题:Qwen 的自报分数和引用的 Opus 数据来自不同的智能体框架、温度设置和提示配置,使得直接比较难以验证 —— 并引发怀疑,即某些模型可能专门针对排行榜优化,而非提升通用能力 [3]。这种怀疑在社区对发布的反应中也表现得非常明显:在 Reddit 上,热门评论者认为该模型在实践中表现更接近 Anthropic 的中端模型 Sonnet 而非 Opus,并指出无论基准分数如何,将一款 27B 的开源模型与一款据称拥有数万亿参数的闭源模型进行比较都是误导性的。

历史背景

Claude Opus 4.6 发布,确立了本地/开源权重模型现在所对标的新前沿基准。
Qwen3.6-35B-A3B 发布并在 MacBook Pro 上本地测试,Willison 判断其在鹈鹕绘图基准测试中击败了 Claude Opus 4.7 —— 这是‘本地模型击败 Opus’叙事的早期实例。
Qwen3.8-Max(2.4 万亿参数)发布,承诺下周开源权重,并声称在成本低得多的情况下与 Claude Opus 4.7 在 Vals Index 上打成平手。
Qwen3.8-27B 以 Apache 2.0 发布,明确宣传可在个人笔记本电脑上运行,且性能与 Claude Opus 4.6 相当 —— 这正是推动本次新闻事件的具体事件。

关键关系图

关键玩家
主题

Opus 4.6 在消费级硬件上本地运行

事实来源

8 条引用
  1. [1] Qwen3.8-27B: Specs, Benchmarks, and Local Hardware Requirements
  2. [2] Alibaba's Local Qwen3.8-27B Model Is Comparable to the Frontier Claude 4.6 From Just 6 Months Ago
  3. [3] Qwen3.8-27B Open-Weight Model vs Claude Opus Comparison
  4. [4] Qwen3.8-27B-GGUF Community Benchmark Discussion
  5. [5] DeepSeek V4 Flash 0731: I Ran the Opus 4.6 Equivalent Locally
  6. [6] Qwen3.8-27B Local Inference
  7. [7] Qwen Beats Opus
  8. [8] AI News: Qwen3.8-Max (2.4T) and 27B

来源文章

Top 5

THE SIGNAL.

Analysts

对一款 27B 的开源模型能在笔记本电脑上本地运行并匹配六个月前最强且最昂贵的模型表示震惊。

Paul Couvert
AI 评论员,X/Twitter (@itsPaulAi)

认为需要数据中心才能接近 Opus 4.6 级别能力的时代正在结束。

teiferer
Hacker News 评论者

认为开源/开源权重的本地模型现在与前沿闭源模型的差距已不到一年。

doug_durham
Hacker News 评论者

反驳了更大规模的 Qwen3.8-Max 模型‘随处可运行’的说法,指出旗舰级模型的真正本地部署仍需数据中心级硬件,与较小的 27B 版本不同。

Jamin Ball
分析师,被《Latent Space AI News》文摘引用

亲自证实,经过重新训练的开源模型可在消费级(尽管是堆叠的)GPU 硬件上完全离线提供 Opus 级别的智能,代价是 token 吞吐量远低于云 API。

Andrew Zhu
独立 AI 实践者,Medium 博主
The Crowd

So yeah, you can now run Opus 4.6 max locally. Just let that sink in. https://t.co/4qFnfrFAF2

@@kimmonismus7052

I can't believe it Qwen3.8-27B is matching Opus 4.6 Max... the model that was the best (and the most expensive) just 6 months ago. And you can run it on your laptop. Locally. Fully open weights and under apache license. This level of intelligence in such a small model is sooo

@@itsPaulAi4383

201 days later, Opus 4.6 Max quality fits on a single RTX 5090 and not even an RTX PRO 6000 https://t.co/gjAkZOzZla

@@TheAhmadOsman3323

Local uncensored Opus 4.6 at home - Qwen3.8 27B heretic

@u/Temporary_Idea8880858
Broadcast
Qwopus3.6 27B MTP vs Claude Opus 4.6 | Local vs Cloud Head-to-Head

Qwopus3.6 27B MTP vs Claude Opus 4.6 | Local vs Cloud Head-to-Head

I Bought an RTX 5090 to Run AI Locally — Here's Why

I Bought an RTX 5090 to Run AI Locally — Here's Why

Qwen3.6 27B vs Claude Opus 4.6 | Local Head-to-Head

Qwen3.6 27B vs Claude Opus 4.6 | Local Head-to-Head