← ブログに戻る
Ai読了目安 15 分

Cloudflare、Jevの得意分野でJevを凌ぐ27B意思決定モデルを投入

公開日 2026年10月6日
Cloudflare、Jevの得意分野でJevを凌ぐ27B意思決定モデルを投入

Cloudflareは10月初旬、Apache 2.0ライセンスの下でClefをリリースした。これはQwen3.8-27Bをベースにした270億パラメータのモデルで、文章を書くのではなく、選択肢をスコアリングする。

このカテゴリーは小さく、特定的だ。意思決定モデルは入力と候補となるスキーマ選択肢のセットを受け取り、生成された文章ではなくランキングを返す。Typesafe AIのJevがこのアプローチを確立し、その基準点となった。Clefは2番目の本格的な参入者として登場し、Cloudflareが公表した数値では、精度とレイテンシの両方で既存モデルを上回っている。

アーキテクチャの違い

Clefはプレフィル専用の設計を採用している。入力を読み取り、スキーマの選択肢を並列にスコアリングする。トークンを1つずつ出力するのではない。この1つの選択が性能差の大部分を説明する。従来の言語モデル呼び出しで高コストな部分はデコードループだからだ。

標準的な意図分類ベンチマークであるBANKING77で、ClefはマクロF1 94.20を記録し、Jevの79.74を上回った。Cloudflareはまた、より小さい構成のClef-flashが中央値38.8ミリ秒のレイテンシを持ち、これはJevのベースライン524.1ミリ秒より約13倍速いと説明している。

インターフェースはスコアと同じくらい重要だ。ClefはJev-API互換なので、すでにJevに接続しているチームは統合コードを書き換えずにエンドポイントを差し替えられる。Clefはまた、64,000トークンのコンテキストウィンドウ内でマルチモーダル入力を受け付けるが、Jevはテキストのみで32,000トークンが上限だ。

Cloudflareの説明は率直だ。ルーティング、分類、構造化選択において、テキストを生成するのは無駄な作業である。必要な答えが12個のカテゴリーのうちの1つなら、段落を書いてから後処理するモデルは、タスクに必要な以上に難しいことをしている。

埋め込みとの関係

意思決定モデルを、同じ問題に対する従来のアプローチから切り分けて考える価値がある。チームは何年も埋め込みでルーティングと分類を行ってきた。入力を埋め込み、ラベル付き例と比較し、最も近いものを選ぶ。これは機能し、安価だが、比較対象となるラベル付きセットが必要であり、判断が類似度ではなく指示に依存する場合は苦戦する。

意思決定モデルは、スキーマと選択肢のセットをリクエストの一部として受け取る。類似度チェックで可能な範囲より広い質問に答えられる。メッセージがどのカテゴリーに属するか、3つのツールのどれを呼び出すか、どのモデルにルーティングするか、複数のポリシーのどれが適用されるか、といったことだ。指示は維持管理された例のインデックスではなくリクエスト内に存在するため、何もラベル付けし直さずに振る舞いを変えやすい。

引き換えに、意思決定モデルは依然としてスコアリングを行う言語モデルであり、その失敗モードを受け継ぐ。高い確信度で誤ることがあり、その信頼度スコアは、テストなしにルーティングポリシーが信頼できる確率に較正されているわけではない。プレフィル専用設計はデコードコストを取り除くが、モデルが推測しているときをどう知るかという問題は取り除かない。

それでも、このカテゴリーを興味深くしているのはコスト計算だ。生成モデルを通してリクエストをルーティングすると、クリティカルパス上で完全な生成が必要になり、多くの場合数百ミリ秒と数百トークンを要する。Cloudflareによれば、Clefはflash構成で中央値40ミリ秒未満だ。ユーザーの1ターンごとに複数のルーティング判断を行うエージェントでは、その差が積み重なり、しかもユーザーが実際に体感するステップで積み重なる。

カテゴリーは急速に標準化している

これを単なる1ベンダーの製品発表以上のものにしているのは、意思決定モデル周辺のツール群が急速に厚みを増していることだ。

9月30日、SGLangはネイティブの/v1/decisionsと/v1/systemoneルートを追加し、言語モデルと視覚モデルがトークンごとの生成なしに分類器およびスコアラーとして機能できるようにした。同フレームワークはQwen3.8-27Bをマルチモーダル意思決定モデルとして実行してこの能力を実証し、100ミリ秒未満のレイテンシで一発でPokemon FireRedを打ち負かしたと報告した。

数日後、llama.cppは新しい/v1/systemoneエンドポイントを通じて意思決定モデルサポートを追加した。Kev-4BやOpenJevを含むオープンモデルを対象とし、バージョン0.6.0での出荷を計画している。小規模モデルはCPU上で動作し、一部は分類用の画像入力もサポートする。

Respanは自社の参入製品Span-01を発表した。エージェントトレースにおけるプロンプトインジェクション、ハルシネーション、ツール誤用を検出するための超並列推論分類器だ。RLAIFで訓練され、単一のフォワードパスで複数の未見の行動定義を評価する。Respanは入力100万トークンあたり2セントで提供し、無料のLite版もある。

これは、意思決定モデルをネイティブに実装する価値のあるインターフェースとして扱う4つの別々のプロジェクトが、2週間以内に現れたということだ。あるパターンが推論フレームワーク、ローカルランタイム、スタートアップの製品ラインに同時に現れるとき、それはもはや珍しいものではない。

エージェントルーティングにとって重要な理由

最初に恩恵を受けるのは、他のモデルを呼び出すエージェントを構築している人々だ。エージェントは、どのツールを使うか、どのモデルにルーティングするか、リクエストがインジェクションの試みかどうか、応答が根拠に基づいているかを判断する必要がある。今日、多くのチームはこれらのステップを、大規模モデルにJSONで答えてもらい、形式が保たれることを願う形で実装している。

数十ミリ秒でスコアを返す分類器は、その判断のコストを変える。言語モデルを通してリクエストをルーティングすると完全な生成が必要になり、しかもクリティカルパス上でそれを要する。プレフィル専用スコアラーを通せば、その何分の一かのコストで済み、より早く完了する。精度が維持されるなら、実用的な効果として、エージェントの制御フローのより多くをトークン速度ではなくマシン速度で実行できるようになる。

単一のすりガラスのバーが青緑色に光り、無地の灰色の石の表面のすぐ上に浮かんでいる

Cloudflare自身の主張はインフラ経済に関するものだ。同社は、ほとんどの本番ワークロードでオープンウェイトモデルがクローズドの同等品より15~90%安く動作するようになり、オープンウェイトが追いかける時代は終わったと述べている。Clefはその証拠として提示されている。ダウンロード可能でApache 2.0ライセンスのモデルであり、競合他社自身のベンチマークカテゴリーでプロプライエタリな競合モデルを上回り、セルフホストできる。

見出しを信じる前に確認すべきこと

留意すべき注意点が3つある。

第一に、ベンチマークはベンダーが選んだものだ。BANKING77は実在し広く使われている意図データセットだが、単一のマクロF1値は、稀なクラス、曖昧な入力、敵対的な言い回しを含む本番分布全体でモデルがどう振る舞うかを表すものではない。独立した評価のほうが、ローンチ記事よりも多くを決着させられるだろう。

第二に、Jev-API互換性はリクエスト形状についての主張であり、振る舞いについての主張ではない。異なる信頼度較正を返すドロップインエンドポイントは、元のJev向けに調整されたルーティングポリシーを依然として壊しうる。

第三に、比較は公表されているJevに対して測定されている。Typesafe AIにも進行中のリリースがあり、挑戦者と既存王者の差は長くとどまらないことが多い。

それでも、より長く残る論点は消えない。意思決定モデルが存在するのは、ルーティング、ゲーティング、分類がエージェントインフラの実際の仕事の大きな割合を占めており、それらをテキスト生成器で行うのは常に不格好な適合だったからだ。Clef、Span-01、そしてSGLangとllama.cppの新しいエンドポイントは同じ考えに収束しつつある。一部のモデル呼び出しは、文章ではなく数値を返すべきだ。今問われているのは、これらの実装のどれが他社のエージェントループの土台になるのか、そしてこのカテゴリーがどれだけの間、争いの的であり続けるのかだ。

関連記事