返回行业动态
模型与产品

Anthropic 发布 Claude Haiku 5.5:首个可调推理强度的 Haiku,平均运行成本降约 75%

Anthropic 于 10 月 7 日发布轻量级模型 Claude Haiku 5.5(claude-haiku-5-5),称其为迄今最快、最便宜、能力最强的小模型,首次在 Haiku 系列引入可调推理强度,并具备 100 万 token 上下文与最高 128K 输出。定价为 10 万 token 以内每百万输入 0.10 美元、输出 0.50 美元,超过后升至 0.50 / 2.50 美元,官方称相较 Haiku 4.5 平均运行成本降约 75%。同日 Anthropic 将 Sonnet 5.5 缓存读取价减半至每百万 0.10 美元,并为 Max、Team 订阅者新增月度 API 额度。

来源:Anthropic(Claude 官方):Introducing Claude Haiku 5.5原标题:Introducing Claude Haiku 5.5查看原文
浅色数据机房中服务器机柜纵深延伸,前景一台轻薄笔记本电脑亮起蓝光,配中文标题「轻量模型上线」

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

Anthropic 于 2026 年 10 月 7 日发布轻量级模型 Claude Haiku 5.5(模型 id claude-haiku-5-5),并称其为迄今最快、最便宜、能力最强的小模型。该模型面向高频、成本敏感的调用场景,官方点名的用例包括摘要、上下文压缩、数据库查询与分类请求,也可作为 Opus 5.5、Sonnet 5.5 的编码子智能体。它提供 100 万 token 上下文与最高 128K 输出,是 Haiku 系列首个带「推理强度」(effort)调节的模型,用户可在成本与智能之间自行取舍。模型已上架 Claude 平台,并同步在亚马逊云科技、谷歌云与微软 Azure 提供。

  • 定价:10 万 token 以内每百万输入 0.10 美元、输出 0.50 美元;超过 10 万 token 升至 0.50 / 2.50 美元。对比 Haiku 4.5(1 / 5 美元),官方称平均运行成本降约 75%,10 万 token 以内便宜约 90%。
  • 速度:官方称标准速度下为迄今最快模型,适合实时客服、浏览器操作等对延迟敏感的任务。
  • 基准(官方自报):OSWorld 2.1 离线子集 72.4%、Terminal-Bench 4.0 39.2%、附带工具的 Humanity's Last Exam 57.4%;同批 Sonnet 5.5 的 Terminal-Bench 4.0 为 70.6%。
  • 同日调整:Sonnet 5.5 缓存读取价自每百万 0.20 美元降至 0.10 美元,官方称使其多数智能体任务成本降约 20%。
  • 订阅权益:Max 5x 每月 100 美元、Max 20x 每月 200 美元 API 额度,Team 最高 500 美元共享。

为什么重要

这次发布把竞争焦点从「旗舰能力」推向「单位任务成本」。Anthropic 把缓存读取降价、可调推理强度与月度 API 额度打包在同一批发布,指向的是智能体与子智能体规模化落地时的成本模型:当模型被反复调用、且大量请求集中在小提示词区间,每百万 token 的单价比拼会让位于「完成一次任务的总开销」与端到端延迟。官方引用 Asana 的早期测试称,任务完成延迟下降逾 30%、每轮智能体推理最高快 2.5 倍,说明轻量模型正在被放进真实工作流,而非停留在演示层面。对预算受限、又需要把模型嵌入既有系统的企业而言,小模型的可调控性比旗舰模型的绝对能力更具采购意义。

不确定之处

其一,上述基准均为官方自报,尚未见独立复现,OSWorld 与 Terminal-Bench 的口径差异需第三方核实。其二,Haiku 5.5 的网络安全护栏比 Haiku 4.5 更严格、但比近期其他模型更宽松,生物护栏与 Sonnet 5 / 5.5、Opus 5 一致,实际可及的任务边界仍取决于申请与验证流程。其三,可调推理强度对成本—精度曲线的影响官方仅有图表、未给机制说明,生产环境的路由规则与阈值仍需企业用自身标注数据调校。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。