返回行业动态
模型与产品

Anthropic 发布 Claude Sonnet 5.5:价格不变,编码基准反超 Opus 5.5

Anthropic 于 9 月 28 日发布 Claude 5.5 家族第二款模型 Sonnet 5.5,输入输出维持 2 美元与 10 美元每百万 token,官方称生成速度提升逾 30%、单任务成本最多下降 30%。其 Terminal-Bench 4.0 由 Sonnet 5 的 10.3% 升至 70.6%,并在该项目上超过 Opus 5.5 的 66.4%。独立评测提醒该模型在高档位每任务消耗 token 明显偏多,官方亦承认 Opus 5.5 在开放式复杂任务上仍更强。

来源:Anthropic 官方发布:Introducing Claude Sonnet 5.5原标题:Introducing Claude Sonnet 5.5查看原文
夜景下的软件研发办公区,成排工位与纵深排列的显示器背光形成透视引导线,远处是玻璃幕墙外的城市灯火,顶部深色结构上有一行白色中文标题

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

Anthropic 于 2026 年 9 月 28 日发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型,模型标识为 claude-sonnet-5-5。该模型已在 Claude 平台、Claude Code、Amazon Bedrock、Google Cloud 与 Microsoft Foundry 上线,保持 100 万 token 上下文与 12.8 万 token 最大输出,知识截止日期为 2026 年 6 月。

定价与 Sonnet 5 完全一致:输入 2 美元、输出 10 美元每百万 token,缓存读取 0.2 美元、缓存写入 2.5 美元。Anthropic 称其输出生成速度比 Sonnet 5 快 30% 以上,并因完成同一任务所需 token 更少,把单任务成本最多压低 30%。

关键变化

  • Terminal-Bench 4.0:70.6%,Sonnet 5 为 10.3%,Opus 5.5 为 66.4%(Xhigh 档位)
  • CursorBench 4.0:55.5%,Sonnet 5 为 34.1%,Opus 5.5 为 57.8%
  • OSWorld 2.1:80.1%,Sonnet 5 为 57.0%,Opus 5.5 为 81.8%
  • GDPval-AA v2.1:1844 Elo,Opus 5.5 为 1846,Sonnet 5 为 1449,OpenAI GPT-6 Sol 为 1487
  • Chartography(无工具):61.6%,Sonnet 5 为 15.6%

Anthropic 明确表示 Sonnet 5.5「并未推进模型能力前沿」,其对齐评估聚焦于一组定向风险。由于网络安全能力较 Sonnet 5 提升明显,这是首个启用与 Opus 5.5 同级网络防护措施的 Sonnet 模型,高风险网络安全任务会被回落到 Sonnet 5 处理。

为什么重要

对按 token 计费的智能体团队而言,这一代的卖点不是单价,而是「完成任务所需的 token 总量」。Anthropic 的对比口径显示,Sonnet 5.5 在 High 档位可以用约五分之一的单任务成本与 GPT-6 Sol 在 FrontierCode 上打平;官方建议把 Opus 5.5 留给需要持续判断的开放式复杂工作,把 Sonnet 5.5 作为默认定档。

不确定之处

  • 独立评测机构 Artificial Analysis 测得 Sonnet 5.5 为 63.6%,高于 Opus 5.5 的 59.6% 与 GPT-6 Astra 的 59.1%;但其同时指出该模型在 Max 档位每个测试任务写出约 19.3 万 token,比 Opus 5.5 多约 60%,单任务成本约 7.6 美元,反而比 Sonnet 5 高约 50%,与「最多省 30%」的官方口径存在张力
  • Anthropic 公布的基准表属自报数据,独立机构测试的是修复了结构化输出缺陷的预发布版本
  • 把 thinking 关闭的既有调用方需改用 between_tools 设置,关闭思考现在会返回 400;面向高并发场景的 Claude Haiku 5.5 官方称将在未来数周补齐
编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

Anthropic 发布 Claude Sonnet 5.5:编码基准反超 Opus 5.5,价格不变|北京拓实科技