返回行业动态
模型与产品

Cloudflare 开源决策模型 Clef:把智能体的分诊判断从大模型里拆出来

Cloudflare 于 10 月 1 日开源两个「决策模型」:270 亿参数的 Clef 与 90 亿参数的 Clef-flash,权重以 Apache 2.0 协议发布在 Hugging Face,并同步托管在 Workers AI。它们不生成文字,而是读入一段状态与一组带类型的问题,一次前向计算返回每个候选答案的概率,供智能体直接用于工单分诊、工具选择与安全拦截。官方称在 43 项基准中 Clef-flash 中位延迟 38.8 毫秒、Clef 为 209.3 毫秒,分别比同类模型 Jev 快约 13 倍与 2.5 倍,并同步推出强化学习微调服务。基准为厂商自测,尚无独立复现。

来源:Cloudflare 官方博客:Introducing Clef: our open-source decision models, and new RL fine-tuning platform原标题:Introducing Clef: our open-source decision models, and new RL fine-tuning platform查看原文
数据中心冷通道深处的发光分层塔与同心光环,象征把决策从生成式模型拆成独立层级

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

Cloudflare 在 10 月 1 日发布官方博客,开源其 Workers AI 团队训练的首批模型 Clef 与 Clef-flash。权重以 Apache 2.0 协议发布在 Hugging Face,同时以 @cf/cloudflare/clef 与 @cf/cloudflare/clef-flash 的名称托管在 Workers AI 上。同批发布的还有一个强化学习微调服务,先由 Cloudflare 的前置交付工程师陪跑客户自有数据,之后再做成自助平台。

与常见的生成式大模型不同,这两个模型的输出是「概率」而不是文字。调用方传入一段输入状态与一组带类型的问题,模型在一次前向计算中为每个候选答案给出概率,不做自由生成,也不需要解析输出。Cloudflare 给出的示例是一条客服消息:问题有多紧急、该由哪个团队处理。

  • Clef 为 270 亿参数,底座是 Qwen3.8-27B,面向精度要求更高的判定。
  • Clef-flash 为 90 亿参数,底座是 Qwen3.5-9B,面向延迟敏感的热路径。
  • 两者上下文窗口均为 64K,支持一次请求最多 64 个问题,并带视觉编码器,可读入图片与视频帧。
  • 问题类型只有三种:noul 给出「是」的概率;choice 从给定选项中选一个并按选项给出概率与置信度;score 按有序量表给出加权分数。
  • 接口沿用 TypeSafe 的 Jev 规范,已有集成只需更换端点和模型名。

数字与口径

官方口径下,速度是这两个模型最突出的卖点。数值全部来自 Cloudflare 自行组织的 43 项测试,需要在引用时区分「实测」与「厂商自测」。

  • 延迟:Clef-flash 中位 38.8 毫秒、P95 为 122.4 毫秒;Clef 中位 209.3 毫秒;对照的 Jev 中位 524.1 毫秒。
  • 基准:在 10 项决策基准中,Clef 系模型在 7 项取得最高分,例如工具选择类 BFCL 达 98.47(Clef)与 98.76(Clef-flash),银行客服意图分类 BANKING77 宏平均 F1 为 94.20。
  • 反向弱项同样明确:在考察知识的 GPQA Diamond 与 MMLU-Pro 上 Jev 仍然领先;窄域意图集 CLINC150+OOS 上 Clef-flash 只有 66.77,远低于完整版 Clef 的 97.43。
  • 托管价格:第三方解读给出 Workers AI 上 Clef 约每百万输入 token 0.24 美元、Clef-flash 约 0.09 美元,输出不计费;博客本身未直接列价。
  • 开放程度:权重开放,但训练数据与完整流水线未公开,属「开放权重」而非可完整复现的开源。

为什么对企业有意义

智能体系统里,大量调用并不是生成任务,而是有界判定:这条工单要不要升级、这个请求该拦还是该放、下一步该调哪个工具。用前沿大模型回答这类问题,既贵又要解析半成品 JSON。决策模型把这一步变成结构化概率输出,阈值可以直接写进控制流,「不确定就交给人」也从口号变成可度量的参数。

这不是孤例。AWS 在同期开源了 Strands Decider 2B,同样是不生成文字、只输出选项与置信度的小模型,可在消费级显卡上低于 100 毫秒完成判定;更早的 TypeSafe Jev 与 Liquid AI 的 d1 指向同一品类。多家厂商在八天内先后落子,说明决策层正在从提示词工程变成智能体栈里的独立组件。

不确定之处

第一,所有性能数字均来自厂商自测,尚无第三方复现,已有独立测试者报告 Clef-flash 实测延迟约 661 毫秒,与官方 38.8 毫秒的口径差距明显,量级结论需谨慎引用。第二,训练数据与训练流程未公开,企业如需追溯数据来源或做合规评估,目前缺少依据。第三,RL 微调服务现阶段不是自助产品,排期与定价都需要与 Cloudflare 单独沟通。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。