发生了什么
Anthropic 于 2026 年 9 月 28 日发布 Claude Sonnet 5.5,这是 Claude 5.5 家族的第二款模型,模型标识为 claude-sonnet-5-5。该模型已在 Claude 平台、Claude Code、Amazon Bedrock、Google Cloud 与 Microsoft Foundry 上线,保持 100 万 token 上下文与 12.8 万 token 最大输出,知识截止日期为 2026 年 6 月。
定价与 Sonnet 5 完全一致:输入 2 美元、输出 10 美元每百万 token,缓存读取 0.2 美元、缓存写入 2.5 美元。Anthropic 称其输出生成速度比 Sonnet 5 快 30% 以上,并因完成同一任务所需 token 更少,把单任务成本最多压低 30%。
关键变化
- Terminal-Bench 4.0:70.6%,Sonnet 5 为 10.3%,Opus 5.5 为 66.4%(Xhigh 档位)
- CursorBench 4.0:55.5%,Sonnet 5 为 34.1%,Opus 5.5 为 57.8%
- OSWorld 2.1:80.1%,Sonnet 5 为 57.0%,Opus 5.5 为 81.8%
- GDPval-AA v2.1:1844 Elo,Opus 5.5 为 1846,Sonnet 5 为 1449,OpenAI GPT-6 Sol 为 1487
- Chartography(无工具):61.6%,Sonnet 5 为 15.6%
Anthropic 明确表示 Sonnet 5.5「并未推进模型能力前沿」,其对齐评估聚焦于一组定向风险。由于网络安全能力较 Sonnet 5 提升明显,这是首个启用与 Opus 5.5 同级网络防护措施的 Sonnet 模型,高风险网络安全任务会被回落到 Sonnet 5 处理。
为什么重要
对按 token 计费的智能体团队而言,这一代的卖点不是单价,而是「完成任务所需的 token 总量」。Anthropic 的对比口径显示,Sonnet 5.5 在 High 档位可以用约五分之一的单任务成本与 GPT-6 Sol 在 FrontierCode 上打平;官方建议把 Opus 5.5 留给需要持续判断的开放式复杂工作,把 Sonnet 5.5 作为默认定档。
不确定之处
- 独立评测机构 Artificial Analysis 测得 Sonnet 5.5 为 63.6%,高于 Opus 5.5 的 59.6% 与 GPT-6 Astra 的 59.1%;但其同时指出该模型在 Max 档位每个测试任务写出约 19.3 万 token,比 Opus 5.5 多约 60%,单任务成本约 7.6 美元,反而比 Sonnet 5 高约 50%,与「最多省 30%」的官方口径存在张力
- Anthropic 公布的基准表属自报数据,独立机构测试的是修复了结构化输出缺陷的预发布版本
- 把 thinking 关闭的既有调用方需改用 between_tools 设置,关闭思考现在会返回 400;面向高并发场景的 Claude Haiku 5.5 官方称将在未来数周补齐

