Cloudflare 推出 270 億參數決策模型,在 Jev 的主場擊敗 Jev

Cloudflare 在十月初以 Apache 2.0 授權釋出了 Clef。這是一個以 Qwen3.8-27B 為基礎打造的 270 億參數模型,它不寫文章,只為選項評分。
這個類別很小、很明確。決策模型接收一段輸入與一組候選 schema 選項,然後回傳一份排序,而不是生成一段句子。Typesafe AI 的 Jev 開創了這個做法,並成為此領域的基準。Clef 是第二個認真投入的參與者,而就 Cloudflare 公布的數字來看,它在準確度與延遲上都勝過現任領先者。
架構有何不同
Clef 採用僅做 prefill 的設計。它讀取輸入後平行地為各 schema 選項評分,而不是一次吐出一個 token。光是這個選擇就解釋了大部分的效能差距,因為傳統語言模型呼叫中最昂貴的部分就是解碼迴圈。
在標準意圖分類基準 BANKING77 上,Clef 的 macro-F1 為 94.20,Jev 則是 79.74。Cloudflare 也指出,較小型的組態 Clef-flash 延遲中位數為 38.8 毫秒,並形容這比 Jev 的 524.1 毫秒基準快上約 13 倍。
介面與分數同樣重要。Clef 相容於 Jev API,因此已經接上 Jev 的團隊可以直接替換端點,不必重寫整合程式碼。Clef 也能在 64,000 個 token 的脈絡視窗內接受多模態輸入,而 Jev 僅支援文字,上限為 32,000。
Cloudflare 的說法很直白:對路由、分類與結構化選擇而言,生成文字是白費工。如果你要的答案只是十二個類別中的一個,那麼一個先寫出一段文字再進行後處理的模型,等於在做一件比任務本身更難的事。
與嵌入向量方法的關係
值得把決策模型與解決同一問題的舊方法區分開來。多年來,團隊一直用嵌入向量來做路由與分類:把輸入嵌入,與已標註的範例比對,挑出最接近的一個。這做法可行,也很便宜,但它需要有標註資料集可供比對,而且當決策取決於指令而非相似度時,它就顯得吃力。
決策模型把 schema 與一組選項當成請求的一部分。它能回答的問題範圍比相似度比對更廣:一則訊息屬於哪個類別、三個工具中該呼叫哪一個、該路由到哪個模型、以及多條政策中哪一條適用。指令存在於請求之中,而非存放在需要維護的範例索引裡,因此要改變行為時更容易,不必重新標註任何東西。
代價在於,決策模型終究還是一個在做評分的語言模型,因此也繼承了語言模型的失效模式。它可能以很高的信心給出錯誤答案,而它的信心分數並未校準到讓路由政策可以不經測試就信任的機率。僅做 prefill 的設計移除了解碼成本,但並沒有移除「判斷模型何時只是在猜」這個問題。
無論如何,真正讓這個類別有意思的是成本算術。用生成式模型路由一筆請求,代價是在關鍵路徑上跑完整次生成,往往要數百毫秒與數百個 token。Cloudflare 指出 Clef 的 flash 組態延遲中位數低於 40 毫秒。對一個每輪使用者互動就要做數次路由決策的代理來說,這個差距會不斷累積,而且累積在使用者真正感受到的那一步上。
這個類別正快速標準化
讓這件事不只是一家廠商發表新品的,是決策模型周邊工具成形的速度之快。
9 月 30 日,SGLang 新增了原生的 /v1/decisions 與 /v1/systemone 路由,讓語言與視覺模型能扮演分類器與評分器,而不必逐 token 生成。該框架以 Qwen3.8-27B 作為多模態決策模型來展示這項能力,並報告在一次嘗試中、低於 100 毫秒延遲的情況下勝過 Pokémon FireRed。
幾天後,llama.cpp 透過新的 /v1/systemone 端點加入決策模型支援,涵蓋 Kev-4B、OpenJev 等開源模型,並計畫在 0.6.0 版推出。小型模型可在 CPU 上執行,部分還支援用於分類的圖像輸入。
Respan 也推出了自家的 Span-01,這是一款超平行推理分類器,用於偵測代理軌跡中的提示注入、幻覺與工具誤用。它以 RLAIF 訓練,能在單次前向傳遞中評估多個未曾見過的行為定義。Respan 定價為每百萬輸入 token 兩美分,並提供免費的 Lite 版本。
這是四項各自獨立的專案,在兩週之內都把決策模型視為值得原生實作的介面。當一個模式同時出現在推論框架、本機執行環境與一家新創的產品線裡,它就不再只是新奇事物。
這對代理路由為何重要
最先受益的,是那些在建構會呼叫其他模型的代理的人。代理必須決定要用哪個工具、要路由到哪個模型、某筆請求是不是注入攻擊,以及某個回應是否有根據。如今許多團隊實作這些步驟的方式,是要求大型模型用 JSON 回答,然後祈禱格式不會跑掉。
一個能在數十毫秒內回傳分數的分類器,會改變這類決策的成本。用語言模型路由一筆請求,代價是跑完整次生成,而且是在關鍵路徑上付這個代價。透過僅做 prefill 的評分器來路由,成本只是其中一小部分,而且完成得更快。若準確度站得住腳,實際效果就是代理的控制流程有更多部分能以機器速度、而非 token 速度運行。

Cloudflare 自己的論點談的是基礎設施經濟學。該公司表示,對大多數生產工作負載而言,開放權重模型的成本已比封閉模型低 15% 到 90%,而開放權重只能追趕的時代已經結束。Clef 就是被拿來當證據的:一個可下載、以 Apache 2.0 授權的模型,在競爭對手自家的基準類別上勝過專有模型,而且可以自行託管。
在相信標題之前該確認什麼
有三點但書值得記住。
第一,這些基準是由廠商挑選的。BANKING77 是真實且被廣泛使用的意圖資料集,但單一 macro-F1 數字無法描述模型在充滿罕見類別、模糊輸入與對抗性措辭的生產分布上表現如何。獨立評測能比一篇發表文章說明得更多。
第二,Jev API 相容講的是請求格式,而不是行為。一個可直接替換的端點若回傳的信心校準不同,仍可能弄壞原本針對原版調校過的路由政策。
第三,這項比較是對照已發表的 Jev。Typesafe AI 自己也有數個版本正在開發中,而挑戰者與現任者之間的差距很少能長久不變。
這些都無損於那個更長久的要點。決策模型之所以存在,是因為路由、閘控與分類占了代理基礎設施實際工作的一大部分,而用文字生成器來做這些事,向來就是一種彆扭的搭配。Clef、Span-01,以及 SGLang 和 llama.cpp 的新端點,都正匯聚到同一個想法上:有些模型呼叫應該回傳一個數字,而不是一句話。現在的問題是,這些實作之中哪一個最後會墊在所有人的代理迴圈底下,以及這個類別還會爭鬥多久。