继上周发布旗舰模型Claude Opus 5.5后,Anthropic再次扩充Claude 5.5家族,推出Opus 5.5的低成本替代互补方案Sonnet 5.5。
美东时间28日周一,Anthropic推出Claude Sonnet 5.5,称这是Claude 5.5家族的第二款模型。与上一代Sonnet 5相比,新模型输出速度提升超过30%,在保持API价格不变的情况下,由于完成相同任务通常所需的Token更少,单项任务成本最高可下降30%。
在多项基准测试中,Sonnet 5.5 在低或中等努力水平下,以大约Sonnet 5十分之一的成本就超过了Sonnet 5的最佳得分。

Anthropic表示,Sonnet 5.5尤其适合日常知识工作、修复代码、制作文档、幻灯片和电子表格等“边界清晰”的任务,是更强大的Opus 5.5之外、更快且成本更低的工作伙伴。公司同时称,新模型是迄今速度最快的Sonnet模型。

值得注意的是,第三方AI基准测试平台Artificial Analysis的数据显示,在最高推理强度下,Sonnet 5.5的综合智能指数达到56分,仅比Opus 5.5低2分,并在部分智能体和知识工作测试中与Opus 5.5基本持平。不过,要达到接近Opus 5.5的表现,Sonnet 5.5也付出了较高的Token消耗代价。
不涨价,却能把单任务成本压低三成
Sonnet 5.5此次最直接的卖点并不是降低API标价,而是用更少的Token和更快的生成速度完成相同任务。
Anthropic表示,Sonnet 5.5的API价格与Sonnet 5保持一致,为每百万Token输入2美元、输出10美元;但在内部测试中,新模型完成相同工作通常需要明显更少的Token,因此单任务成本最高可以下降30%。
与此同时,Sonnet 5.5的输出速度比Sonnet 5快30%以上。Anthropic称,这意味着用户不仅能够以相同的Token单价获得更快响应,还能够在更多任务中减少模型调用和工具调用次数,从而进一步压低实际使用成本。
媒体指出,Anthropic此次强调的“30%成本下降”实际上更多来自效率提升,而非价格下调:模型通过更少的工具调用、更少的Token以及更快的输出速度完成工作,因此实际每项任务的成本下降。
Anthropic还表示,在部分基准测试中,Sonnet 5.5在Low或Medium推理强度下,就可以超过Sonnet 5此前的最佳成绩,而成本约为后者的十分之一;在另一项编程测试中,Sonnet 5.5在High模式下的成绩比Sonnet 5高约10个百分点,但单任务成本约为后者的十五分之一。
这意味着,Anthropic此次升级的重点并不是简单地把模型推向“更强”,而是试图扩大性能—成本曲线上的可用区间:对于不需要旗舰模型的日常任务,用户可以用较低的推理强度换取更快、更便宜的结果;而在复杂任务上,则可以提高推理强度,进一步逼近Opus级别的能力。
第三方测试:能力逼近Opus,但Token消耗创纪录
Artificial Analysis的测试则提供了另一幅更复杂的图景。
该平台表示,Sonnet 5.5在其Intelligence Index中获得56分,在最高推理强度下较Sonnet 5提升18分,排名仅次于Opus 5.5。其在Terminal-Bench 4.0中的得分达到64%,高于Opus 5.5和GPT-6 Astra的60%;在AA-Briefcase、GDPval-AA和AutomationBench-AA等测试中,也与Opus 5.5达到近似水平。
但Artificial Analysis同时指出,Sonnet 5.5为获得这样的成绩消耗了非常多的输出Token。
在最高推理强度下,Sonnet 5.5每个Intelligence Index任务平均使用约19.3万个输出Token,这是该平台测试过的模型中最高的水平,比Opus 5.5或Sonnet 5高出约60%,更是GPT-6 Astra的约7倍。

这也形成了此次发布一个颇值得关注的反差:Sonnet 5.5的API标价没有上涨,但如果用户选择最高推理强度,模型为了追求更高性能所消耗的Token可能大幅增加。
Artificial Analysis据此认为,在“智能水平—单任务成本”的比较中,Sonnet 5.5并非所有推理强度都处于最具成本优势的位置;高强度模式下,其性能已经非常接近Opus 5.5,但Token消耗也随之明显上升。
不过,这些测试是在Sonnet 5.5正式发布前的版本上进行的。Artificial Analysis表示,Anthropic后来发现该预发布版本存在一个可能影响结构化输出请求的Bug,并已在正式版本中修复,因此相关评测还将重新进行。由此来看,目前第三方数据更适合作为参考,而非最终性能定论。
从“写代码”扩展到办公生产力
相比Opus 5.5主要面向复杂编程、智能体和知识工作,Anthropic对Sonnet 5.5的定位明显更加偏向日常生产力。
Anthropic称,新模型擅长修复Bug、制作经过润色的文档、幻灯片和电子表格,同时具备更强的设计能力,可以进一步完善用户界面,并根据模板制作只需少量人工修改的演示文稿。
公司还特别强调了模型的文字表达能力。Anthropic表示,和上一代模型相比,Sonnet 5.5能够写出更加清晰的内容,而更快的速度也使其适合快速迭代和多人协作。
从产品策略来看,这意味着Anthropic并没有试图让Sonnet 5.5完全替代Opus 5.5,而是进一步拉开两者的产品定位:Opus承担最复杂、最需要能力的任务,Sonnet则争夺规模更大的日常工作和高频任务。
TechCrunch也将Sonnet 5.5描述为Anthropic更偏向日常工作的“更快、更便宜的工作伙伴”,并指出其重点应用场景包括编程和办公文档处理。
安全护栏首次向Sonnet级别下沉
除了速度和成本,安全能力也是此次升级的重要变化。
Anthropic表示,Sonnet 5.5在自动化行为审计中,大多数alignment和诚实性指标都优于或持平Sonnet 5。同时,新模型首次拥有与Anthropic最强模型类似的网络安全防护机制和fallback机制。
当模型面对特定高风险网络安全任务时,可以启用更严格的安全护栏并将部分请求转交给其他模型;而对于普通软件开发任务,Anthropic称这一机制不会产生影响。
这一变化尤其值得关注,因为此前Sonnet系列与Opus系列在网络安全能力和安全防护上的定位存在明显区别。Anthropic此次让Sonnet 5.5获得更接近旗舰模型的安全机制,也意味着随着中端模型能力越来越接近前沿水平,安全控制正在从旗舰模型向更广泛的模型层级下沉。
而这也延续了Anthropic此前发布Opus 5.5时的产品思路:模型能力提升与安全护栏同步推进。上周发布的Opus 5.5同样强调了网络安全等高风险场景的安全机制。
Claude 5.5家族还缺最后一块拼图
Sonnet 5.5是Claude 5.5家族继Opus 5.5之后的第二款模型。
Anthropic表示,Sonnet 5.5现已全面上线,未来几周还将推出Claude Haiku 5.5。届时,Claude 5.5家族将进一步覆盖从高端复杂任务到日常高频任务、再到更强调速度和成本的不同应用场景。
这也是Anthropic近期连续更新模型家族的延续。9月22日发布的Opus 5.5定位于更高端的智能体编程和知识工作,运行成本较Opus 5下降40%;如今Sonnet 5.5则在保持原有价格的基础上,通过降低Token消耗和提升速度来降低单任务成本。
从商业化角度看,Anthropic正在将模型竞争的重点从单纯的“谁的基准测试分数更高”,进一步推向单位任务成本、响应速度、Token效率和安全性。
而Artificial Analysis此次测试暴露出的另一个趋势同样值得关注:当中端模型通过提高推理强度不断逼近旗舰模型时,“模型本身的API价格”可能已经不足以衡量真实使用成本,完成一项任务究竟需要多少Token、多少次工具调用以及多长时间,正在成为AI模型商业竞争的新变量。



