Anthropic发布Claude Sonnet 5.5
TECH

Anthropic发布Claude Sonnet 5.5

35+
Signals

战略概览

  • 01.
    Anthropic于2026年9月28日发布了Claude Sonnet 5.5,将其定位为比约六天前发布的旗舰模型Claude Opus 5.5更快、更便宜的中端配套产品。
  • 02.
    Sonnet 5.5延续了Sonnet 5的定价——每百万输入令牌2美元,每百万输出令牌10美元,每百万缓存读取令牌0.20美元——仅为Opus 5.5每百万4美元/20美元费率的一半。
  • 03.
    在代理编码基准测试Terminal-Bench 4.0上,Sonnet 5.5得分为70.6%,高于Opus 5.5的66.4%,远超Sonnet 5的10.3%。
  • 04.
    Anthropic表示,Sonnet 5.5的输出生成速度比Sonnet 5快超过30%,并且由于需要更少的令牌和工具调用即可达成相同结果,可将完成任务的总成本降低最多30%。
  • 05.
    在知识工作和计算机使用基准测试GDPval-AA与OSWorld 2.1上,尽管存在价格差距,Sonnet 5.5的得分仍与Opus 5.5相差仅一到两个百分点。
  • 06.
    Sonnet 5.5是首款搭载前沿级网络防护机制的Sonnet级别模型,此前这类防护措施仅用于Anthropic最强大的模型,包括旨在阻止其自身推理过程被提取的分类器。
  • 07.
    该模型已在Claude平台、亚马逊云服务(AWS)、谷歌云(Google Cloud)和微软Azure上线,并已集成至Cursor的模型选择器中,支持调节推理强度。

“更便宜的编码之王”宣传背后有个星号注释

Anthropic将Claude Sonnet 5.5宣传为更便宜的编码冠军:它在Terminal-Bench 4.0上得分为70.6%,优于Opus 5.5的66.4%,远超Sonnet 5的10.3%,同时每令牌成本减半——每百万2美元/10美元,对比Opus 5.5的每百万4美元/20美元[1]。Anthropic及其企业合作伙伴将此视为明确胜利:得益于更少的工具调用,输出速度快达30%,每项任务成本降低最多30%[2]。但这一宣传存在一个漏洞。独立基准测试公司Artificial Analysis发现,在最大推理强度下,Sonnet 5.5在每个Intelligence Index任务中生成了约19.3万个输出令牌——这是该公司对任何模型测得的最高值,比Opus 5.5完成相同任务所需多出约60%[3]。在此强度层级,“价格减半”的计算大幅缩水:相比Opus 5.5,每项任务多消耗约60%的令牌严重削弱了Sonnet 5.5的每令牌价格优势,即使其名义费率仍仅为Opus 5.5的一半[4]。

社区的真实洞见:Opus作为协调者,Sonnet作为子代理

发布后最有价值的发现并非来自Anthropic自身的材料,而是开发者几乎立即形成的工作流模式:使用Opus 5.5进行开放式推理规划,而将定义清晰的实施步骤委托给Sonnet 5.5。这种分工方式与Cursor对该模型的基准测试结果一致——在评估真实编码会话的CursorBench上,Sonnet 5.5的得分从低强度时的35.8%上升至最大强度时的55.5%,仅次于Opus 5.5,表明其效用高度依赖于任务分配的推理预算[5]。对于范围明确、定义清晰的任务,低或中等强度设置似乎足以使Sonnet 5.5既更便宜,又在多个早期用户间流传的非正式对比测试中,质量达到甚至优于同等低强度下的Opus 5.5——这直接挑战了“Sonnet 5.5只是简化版Opus”的叙事。不过,并非所有独立测试都持相同观点:在更开放的生成性任务中,将Sonnet 5.5与Opus 5.5及竞品模型并列比较时,Opus仍被视为更全面的执行者,表明编码基准测试的胜利并不能自动延伸至所有类型任务。

前沿级防护机制对合法安全工作造成干扰

Sonnet 5.5是首款搭载前沿级网络防护机制的Sonnet级别模型,此前此类机制仅用于Anthropic最强大的模型,包括旨在阻止模型自身推理过程被提取的分类器[1]。独立报道指出,此举是为了防范更快、更便宜的编码模型被滥用[6]。实际上,早期用户报告称这些防护机制会出现误判,将诸如检查数据源、更改密码或执行例行安全审计等良性操作误识别为对抗性探测。这类误拒行为对正在评估是否将敏感工作流接入新模型的安全与IT团队而言,构成了真实的运营成本。

在知识密集型任务上无法完全替代Opus

尽管在编码和代理能力方面有所提升,Sonnet 5.5并不能全面取代Opus 5.5。Artificial Analysis测量发现,其在奖励广泛知识和严谨推理的任务上明显落后于Opus 5.5:事实准确性得分为54%,低于Opus 5.5的66%;在Humanity's Last Exam和SciCode上的得分也低约六个百分点[3]。Anthropic自身的基准测试显示,两者在现实职业任务(GDPval-AA)和计算机使用(OSWorld 2.1)上得分接近,表明差距主要集中在事实回忆和科学推理类别,而非整体能力[2]。

历史背景

Anthropic在Sonnet 5.5发布前约一周推出了Claude Opus 5.5,作为其旗舰模型,定价为每百万输入/输出令牌4美元/20美元,Sonnet 5.5被定位为其更快、更便宜的中端补充选项。
Sonnet 5.5作为Sonnet 5的直接升级版推出,在保持相同每令牌定价的同时,运行速度提升超过30%,并在Terminal-Bench 4.0上得分大幅提升(70.6%对比Sonnet 5的10.3%)。

关键关系图

关键玩家
主题

Anthropic发布Claude Sonnet 5.5

AN

Anthropic

Claude Sonnet 5.5 及更广泛的 Claude 5.5 模型系列的开发者和发布者

CU

Cursor

AI 编程工具,已将 Sonnet 5.5 添加至其模型选择器中,并支持调整努力程度,同时通过 CursorBench 对其进行了基准测试

AR

Artificial Analysis

独立基准测试公司,测量了 Sonnet 5.5 的 Intelligence Index 分数、不同努力程度下的 token 使用量,以及在事实准确性方面与 Opus 5.5 的差距

BO

Box

企业客户报告称,在生产工作流中,Sonnet 5.5 的速度比前代模型快 2.4 倍,且 token 使用量减少了 12%

ZE

Zendesk

企业客户报告称,使用 Sonnet 5.5 处理支持工单的速度提高了 20%

LO

Lovable

编程代理初创公司报告称,Sonnet 5.5 所需的工具调用次数减少了三分之一,shell 执行次数大约减少了一半

事实来源

6 条引用
  1. [1] Claude Sonnet 5.5 | Anthropic
  2. [2] Anthropic launches Claude Sonnet 5.5 with 30% cost reduction per task due to faster speeds and fewer tool calls
  3. [3] Claude Sonnet 5.5 | Artificial Analysis
  4. [4] Anthropic Releases Claude Sonnet 5.5
  5. [5] Claude Sonnet 5.5 | Cursor Docs
  6. [6] Sonnet 5.5 ships with frontier-grade cyber safeguards

来源文章

Top 5

THE SIGNAL.

Analysts

“报告称Sonnet 5.5在Box的工作流中比前代模型更准确、更快,且消耗的令牌更少”

Yashodha Bhavnani, VP at Box
对效率提升持积极态度

“表示该模型的速度直接提升了客户支持的处理吞吐量”

Abhinay Kathuria, Director of AI at Zendesk
对客服响应速度提升持积极态度

“强调在使用Sonnet 5.5进行编码代理时,工具调用和shell执行的开销显著减少”

Fabian Hedin, CTO of Lovable
对代理效率提升持积极态度

“称赞Sonnet 5.5在Terminal-Bench上的表现接近顶级水平,同时指出其在最大推理强度下每项任务消耗的输出令牌异常高,削弱了部分成本主张,并指出其在事实准确性和科学推理基准测试中落后于Opus 5.5”

Artificial Analysis (independent benchmarking firm)
混合评价——编码表现强劲但存在令牌效率问题
The Crowd

“Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family. It's a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work.”

@@claudeai54131

“what the fuck, why is Sonnet 5.5 this good?? gave Sonnet and Opus 5.5 the exact same prompt. Sonnet came back with this masterpiece. all in a SINGLE HTML file. Sonnet won this one, it's not even close”

@@filicroval2102

“Claude Sonnet 5.5 vs. Claude Opus 5.5 vs. GPT-6 Astra on generating an animated 3D chariot race using Three.js. >Sonnet 5.5 is competing with GPT-6 Astra, but Sonnet's lower pricing makes it a better value than Astra. >Opus 5.5 is undisputed king.”

@@AI_Screening126

“Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family”

@u/ClaudeOfficial2200
Broadcast
Introducing Claude Sonnet 5.5

Introducing Claude Sonnet 5.5

Claude Sonnet 5.5 Is Coming But Something Doesn't Add Up

Claude Sonnet 5.5 Is Coming But Something Doesn't Add Up

Anthropic Just Dropped Claude Sonnet 5.5 (MAJOR UPGRADE)

Anthropic Just Dropped Claude Sonnet 5.5 (MAJOR UPGRADE)