摘要
- Anthropic周一发布Claude Sonnet 5.5,输入价格为每百万token 2美元、输出价格为每百万token 10美元——与Sonnet 5持平,仅为Opus 5.5价格的一半。
- Anthropic称,Sonnet 5.5在Terminal-Bench 4.0上的得分为70.6%,高于Opus 5.5的66.4%;独立测试机构Artificial Analysis也给出了类似结论,分别为63.6%和59.6%。
- Artificial Analysis将其排在仅次于Opus 5.5的位置,但表示它在每项任务上的token消耗高于其测试过的任何模型。
Anthropic周一发布了Claude Sonnet 5.5,这是对6月推出的Sonnet 5的升级版本。Anthropic表示,这款中档模型的运行速度比前代快30%以上。
不过,这款模型最突出的地方在于编码能力。在Terminal-Bench 4.0测试中——这项测试衡量AI代理能否通过自主输入命令完成复杂的专业任务,评分方式为完成任务的占比——Sonnet 5.5取得了70.6%的成绩。Opus 5.5得分为66.4%,而Sonnet 5仅为10.3%。
简单来说,这款更便宜的模型完成了更多任务。独立测试机构Artificial Analysis运行了自己的版本测试,也得出了相同结论:Sonnet 5.5为63.6%,Opus 5.5为59.6%,OpenAI的GPT-6 Astra为59.1%。
Artificial Analysis在社交平台上表示,Claude Sonnet 5.5(max)在Terminal-Bench上取得了显著进步,在Terminal-Bench 4.0和Terminal-Bench-Science两项测试中都位居顶级模型之列。该机构称,在Terminal-Bench 4.0中,它的得分为64%,比Claude Sonnet 5(max)高出50个百分点,也略高于Opus 5.5和GPT-6。
成绩还取决于“effort(努力程度)”设置,这个调节项会让模型花更长时间思考,以换取更好的答案和更高的账单。Anthropic表示,在High effort设置下,Sonnet 5.5在FrontierCode上的表现可与GPT-6 Sol持平,而单项任务成本约为后者的五分之一。
在GDPval-AA测试中——该测试使用类似国际象棋等级分的Elo系统,对44种职业中的真实专业工作进行评分——Sonnet 5.5得分为1844,Opus 5.5为1846,基本可视为打平。GPT-6 Sol得分为1487。
竞争对手在价格上也进行了匹配。OpenAI上周将GPT-6 Sol的价格下调至输入每百万token 2美元、输出每百万token 10美元;其中档模型GPT-5.6 Terra的定价为输入每百万token 2美元、输出每百万token 12美元。Anthropic没有公布Terra的基准测试结果。
问题在于
Sonnet 5.5是个“高产”模型。在max effort设置下,它在每个测试任务中平均生成约19.3万个token,这是Artificial Analysis测得的最高水平,较Opus 5.5高出约60%。按此计算,每项任务成本为7.60美元,约比Sonnet 5高出50%,这与Anthropic所称“最多可节省30%成本”的说法并不一致。
Anthropic所说的节省来自较低设置:在Medium effort——其应用中的默认设置——下,公司称Sonnet 5.5以不到Sonnet 5最佳编码成绩十分之一的成本,就能超过后者的最佳编码表现。Artificial Analysis则表示,High effort是性价比最高的设置。对日常用户而言,这意味着只要将调节档位保持在较低水平,就能以旗舰级模型的一小部分价格获得接近旗舰级的编码能力。
Anthropic公布的表格为公司自报数据,而Artificial Analysis测试的是一个预发布版本,其中存在一个漏洞。Anthropic预计,这一问题对成绩影响不大,或者可能只是略微低估了其分数。Anthropic还表示,在需要持续判断力的复杂工作上,Opus 5.5仍明显更强。
面向高吞吐、成本敏感型应用打造的Claude Haiku 5.5预计将在未来几周内推出。












