← 返回博客
Ai预计阅读 10 分钟

Cloudflare 发布 270 亿参数决策模型,在 Jev 自己的本职工作上将其击败

发布于 2026年10月6日
Cloudflare 发布 270 亿参数决策模型,在 Jev 自己的本职工作上将其击败

Cloudflare 在十月初以 Apache 2.0 许可证发布了 Clef。这是一个基于 Qwen3.8-27B 构建的 270 亿参数模型,它不写文章,而是给选项打分。

这一类别规模不大且很具体。决策模型接收一个输入和一组候选模式选项,然后返回一个排序,而不是生成一句话。Typesafe AI 的 Jev 开创了这一方法,并成为其参照标准。Clef 作为第二个认真入场的参与者出现,而根据 Cloudflare 公布的数据,它在准确率和延迟两方面都击败了现有领先者。

架构有何不同

Clef 采用仅预填充设计。它读取输入并并行地为模式选项打分,而不是一次一个地输出 token。正是这一选择解释了大部分性能差距,因为传统语言模型调用中昂贵的部分是解码循环。

在 BANKING77 这一标准意图分类基准上,Clef 得分 94.20 macro-F1,而 Jev 为 79.74。Cloudflare 还报告称,较小配置 Clef-flash 的中位延迟为 38.8 毫秒,并称这大约比 Jev 524.1 毫秒的基线快 13 倍。

接口与得分同样重要。Clef 兼容 Jev API,因此已经接入 Jev 的团队无需重写集成代码即可替换端点。Clef 还可在一个 64,000 token 的上下文窗口内接受多模态输入,而 Jev 仅支持文本,且上限为 32,000。

Cloudflare 的表述很直白:对于路由、分类和结构化选择而言,生成文本是浪费工作。如果你需要的答案是十二个类别之一,那么一个先写一段话、然后再对其进行后处理的模型,所做的工作比任务本身所需要的更难。

这与嵌入方法相比处于什么位置

值得把决策模型与解决同一问题的旧方法区分开来。多年来,团队一直使用嵌入进行路由和分类:将输入嵌入,与带标签的示例进行比较,选出最近的一个。这方法有效且成本低,但它需要一个带标签的集合来比较,并且当决策取决于指令而不是相似度时,它就会力不从心。

决策模型将模式和一组选项作为请求的一部分。它能回答比相似度检查更广泛的问题:一条消息属于哪个类别、三个工具中该调用哪一个、路由到哪个模型,以及若干策略中哪一条适用。指令存在于请求中,而不是存在于一个维护的示例索引中,这使得改变行为更容易,无需重新标注任何内容。

代价在于,决策模型仍然是一个执行打分的语言模型,因此继承了语言模型的失败模式。它可能以高置信度犯错,而且其置信度分数并未校准为路由策略无需测试就能信任的概率。仅预填充设计消除了解码成本,但并没有消除判断模型何时在猜测的问题。

无论如何,成本计算才是让这一类别变得有趣的原因。通过生成式模型路由一个请求,会在关键路径上产生一次完整生成的成本,通常为几百毫秒和几百个 token。Cloudflare 报告称,Clef 的 flash 配置中位延迟低于 40 毫秒。对于一个在每个用户回合中做出多次路由决策的智能体来说,这种差异会不断累积,而且会累积在用户真正能感知到的步骤上。

这一类别正在快速标准化

让这件事不止是一家厂商发布的,是围绕决策模型的工具链迅速变得厚实起来。

9 月 30 日,SGLang 添加了原生的 /v1/decisions 和 /v1/systemone 路由,让语言和视觉模型无需逐 token 生成即可充当分类器和打分器。该框架通过将 Qwen3.8-27B 作为多模态决策模型运行来展示这一能力,并报告在低于 100 毫秒延迟的情况下一次尝试就击败了 Pokemon FireRed。

几天后,llama.cpp 通过新的 /v1/systemone 端点添加了对决策模型的支持,覆盖包括 Kev-4B 和 OpenJev 在内的开放模型,并计划在 0.6.0 版本中发布。小模型可在 CPU 上运行,其中一些支持用于分类的图像输入。

Respan 推出了自己的产品 Span-01,一个超并行推理分类器,用于检测智能体轨迹中的提示注入、幻觉和工具误用。它使用 RLAIF 训练,并在单次前向传递中评估多个未见过的行为定义。Respan 将其定价为每百万输入 token 两美分,并提供免费的 Lite 版本。

这就是四个独立项目在两周内将决策模型视为值得原生实现的接口。当一种模式同时出现在推理框架、本地运行时和一家初创公司的产品线中时,它就不再是稀奇事物了。

为什么这对智能体路由很重要

最先受益的人,是那些构建调用其他模型的智能体的人。智能体需要决定使用哪个工具、路由到哪个模型、某个请求是否是注入尝试,以及某个响应是否有依据。如今,许多团队通过要求大型模型以 JSON 回答并寄希望于格式保持正确来实现这些步骤。

一个能在几十毫秒内返回分数的分类器改变了这一决策的成本。通过语言模型路由一个请求会产生一次完整生成的成本,而且是在关键路径上付出这个成本。通过仅预填充打分器进行路由,成本只是其中一小部分,而且完成得更快。如果准确率站得住脚,实际效果就是智能体更多的控制流可以以机器速度而不是 token 速度运行。

一根发着青色微光的磨砂玻璃条悬浮在纯灰色石面上方

Cloudflare 自己的论点关乎基础设施经济学。该公司表示,对于大多数生产工作负载,开放权重模型现在的运行成本比封闭等效模型便宜 15% 到 90%,并且开放权重追赶的时代已经结束。Clef 被作为证据提出:一个可下载、采用 Apache 2.0 许可的模型,在竞争对手自己的基准类别上超越了专有竞争对手,并且可以自托管。

在相信标题之前该核查什么

有三个注意事项值得牢记。

第一,基准是由厂商选择的。BANKING77 是一个真实且广泛使用的意图数据集,但单个 macro-F1 数字并不能描述模型在包含稀有类别、模糊输入和对抗性措辞的生产分布中的表现。独立评估能比一篇发布文章说明更多问题。

第二,兼容 Jev API 是一种关于请求形态的主张,而不是关于行为的主张。一个可直接替换的端点如果返回不同的置信度校准,仍然可能破坏围绕原始版本调优的路由策略。

第三,这一比较是针对已发布的 Jev 进行衡量的。Typesafe AI 有自己的版本正在推进,而挑战者与领先者之间的差距很少会长期保持不变。

这些都没有削弱一个更持久的观点。决策模型之所以存在,是因为路由、门控和分类在智能体基础设施实际做的事情中占很大一部分,而用文本生成器来完成这些工作从来都不太合适。Clef、Span-01 以及 SGLang 和 llama.cpp 中的新端点正在汇聚到同一个理念上:有些模型调用应该返回一个数字,而不是一句话。现在的问题是,这些实现中哪一个最终会成为所有其他人智能体循环的底层,以及这个类别会保持竞争多久。

相关文章