发生了什么
Cloudflare 在 10 月 1 日发布官方博客,开源其 Workers AI 团队训练的首批模型 Clef 与 Clef-flash。权重以 Apache 2.0 协议发布在 Hugging Face,同时以 @cf/cloudflare/clef 与 @cf/cloudflare/clef-flash 的名称托管在 Workers AI 上。同批发布的还有一个强化学习微调服务,先由 Cloudflare 的前置交付工程师陪跑客户自有数据,之后再做成自助平台。
与常见的生成式大模型不同,这两个模型的输出是「概率」而不是文字。调用方传入一段输入状态与一组带类型的问题,模型在一次前向计算中为每个候选答案给出概率,不做自由生成,也不需要解析输出。Cloudflare 给出的示例是一条客服消息:问题有多紧急、该由哪个团队处理。
- Clef 为 270 亿参数,底座是 Qwen3.8-27B,面向精度要求更高的判定。
- Clef-flash 为 90 亿参数,底座是 Qwen3.5-9B,面向延迟敏感的热路径。
- 两者上下文窗口均为 64K,支持一次请求最多 64 个问题,并带视觉编码器,可读入图片与视频帧。
- 问题类型只有三种:noul 给出「是」的概率;choice 从给定选项中选一个并按选项给出概率与置信度;score 按有序量表给出加权分数。
- 接口沿用 TypeSafe 的 Jev 规范,已有集成只需更换端点和模型名。
数字与口径
官方口径下,速度是这两个模型最突出的卖点。数值全部来自 Cloudflare 自行组织的 43 项测试,需要在引用时区分「实测」与「厂商自测」。
- 延迟:Clef-flash 中位 38.8 毫秒、P95 为 122.4 毫秒;Clef 中位 209.3 毫秒;对照的 Jev 中位 524.1 毫秒。
- 基准:在 10 项决策基准中,Clef 系模型在 7 项取得最高分,例如工具选择类 BFCL 达 98.47(Clef)与 98.76(Clef-flash),银行客服意图分类 BANKING77 宏平均 F1 为 94.20。
- 反向弱项同样明确:在考察知识的 GPQA Diamond 与 MMLU-Pro 上 Jev 仍然领先;窄域意图集 CLINC150+OOS 上 Clef-flash 只有 66.77,远低于完整版 Clef 的 97.43。
- 托管价格:第三方解读给出 Workers AI 上 Clef 约每百万输入 token 0.24 美元、Clef-flash 约 0.09 美元,输出不计费;博客本身未直接列价。
- 开放程度:权重开放,但训练数据与完整流水线未公开,属「开放权重」而非可完整复现的开源。
为什么对企业有意义
智能体系统里,大量调用并不是生成任务,而是有界判定:这条工单要不要升级、这个请求该拦还是该放、下一步该调哪个工具。用前沿大模型回答这类问题,既贵又要解析半成品 JSON。决策模型把这一步变成结构化概率输出,阈值可以直接写进控制流,「不确定就交给人」也从口号变成可度量的参数。
这不是孤例。AWS 在同期开源了 Strands Decider 2B,同样是不生成文字、只输出选项与置信度的小模型,可在消费级显卡上低于 100 毫秒完成判定;更早的 TypeSafe Jev 与 Liquid AI 的 d1 指向同一品类。多家厂商在八天内先后落子,说明决策层正在从提示词工程变成智能体栈里的独立组件。
不确定之处
第一,所有性能数字均来自厂商自测,尚无第三方复现,已有独立测试者报告 Clef-flash 实测延迟约 661 毫秒,与官方 38.8 毫秒的口径差距明显,量级结论需谨慎引用。第二,训练数据与训练流程未公开,企业如需追溯数据来源或做合规评估,目前缺少依据。第三,RL 微调服务现阶段不是自助产品,排期与定价都需要与 Cloudflare 单独沟通。

