文章を書くことを拒否するモデルが、今や1日1兆トークンを処理している

TypeSafe AIは2026年9月15日にJevをリリースし、9月27日にはウェイトリストを撤廃した。その売り込みはあまりに狭く、最初は誤植に聞こえるほどだ。Jevはテキストを生成しない。状態の断片と型付きの質問群を送ると、あらかじめ定義したスキーマから導かれた回答が返ってくる。それぞれには確率と信頼度の値が付いている。
答えられる内容をカバーするのは3つのプリミティブだ。Choiceは、あなたが用意したリストから1つの選択肢を選ぶ。Scoreは、入力を順序付けられた記述的レベルに対して評価する。Noulは、はい/いいえの質問に対して、答えが「はい」である確率を返す。
製品はこれで全部だ。チャットも、段落も、マークダウンも、AIであることの言い訳もない。
なぜこれが求められるのか
ディオゴ・アルメイダはTypeSafe AIを創業し、以前はOpenAIで、ChatGPTの振る舞いを形作った指示追従手法に取り組んでいた。彼は2024年に退社した。それ以来、彼の主張は一貫している。チャットインターフェースはソフトウェアにとって間違った形だ。コードは文章を返してほしいわけではない。分岐に使える値を求めているのだ。
LLMを本番システムに組み込んだことのある人なら誰でも、彼が語る苦痛に心当たりがある。モデルにサポートチケットを分類させると、分類から始まり、さらに支援を申し出る文言で終わる、友好的な段落が返ってくる。そこで正規表現を書く。するとモデルがフォーマットを変え、正規表現が壊れる。そこでJSONモードを追加すると、時折JSONが不正な形になる。壊れやすかったのはモデルではなかった。インターフェースだったのだ。
Jevは生成そのものを取り除くことで、それを回避する。自己回帰的なトークン生成ではなく並列サンプラーを使う。つまり、推論が走る前に取り得る出力が列挙される。スキーマ準拠は、願うものではなく、アーキテクチャが保証するものになる。TypeSafe自身の数値では、エンドツーエンドのレイテンシは70~500ミリ秒だ。

同社は「校正された意思決定のための強化学習(Reinforcement Learning for Calibrated Decisions)」と呼ぶ手法でこれを訓練した。強調点は「校正された(calibrated)」という語にある。信頼度スコアは、0.85が実際に「およそ85パーセントのケースがそうなる」を意味して初めて役に立つ。そして大半の言語モデルは、自分の回答について楽観的すぎることで悪名高い。アプリがしきい値以上なら自動で動き、以下なら人にエスカレーションするのであれば、校正はおまけではなく設計そのものになる。
本番で同じくらい重要な第2の性質があり、それは見落とされやすい。呼び出しの前に出力空間が固定されているため、同じ状態と同じ質問での2回の実行は同じ回答を返す。再現性は、ほとんどのチームがインシデントレビューの後に初めて必要だと気づくものだ。3週間前にシステムが特定のチケットを特定の方法で振り分けた理由を誰かが尋ねても、誰も再現できない、という場面で。意思決定モデルなら、その問いに答えられる。
導入曲線はあっという間に異様なものになった
Vercelは2日目にJevを自社のAI Gatewayに追加し、その後、ゲートウェイ史上最も早く採用されたモデルになったと報告した。24時間以内に有料チームのほぼ13パーセントが使用し、これはGPT-5.6ファミリーの約2倍、Fable 5.1の6倍以上だった。Netlifyが続いた。LangChainは、モデルルーティングと、実行前にツール呼び出しを検査するミドルウェアを備えたTypeSafeClassifier連携をリリースした。数日のうちに5つの独立したElixirクライアントが登場した。こうした細部は、開発者たちがすでにこういう形のものを探していたことを物語っている。
規模の数字は無視するのが難しい。アルメイダはウォール・ストリート・ジャーナルに対し、Jevはローンチから約1週間で1日あたり約1兆トークンを処理しており、フォーチュン500企業のおよそ4分の1が利用していると語った。The Informationは、TypeSafeが10億ドル以上を目標とするラウンドを交渉中で、関心を示す投資家の一部は同社を100億ドル超と評価していると報じた。アルメイダは資金調達報道についてコメントを拒否した。
コスト構造が、その引力の一部を説明する。入力は100万トークンあたり0.042ドル、出力は無料で、コンテキストウィンドウは32,000トークンだ。分類ジョブをフロンティアモデル経由で回す場合と比べると、計算はもはや接戦ではない。
実際に威力を発揮する場面
TypeSafeが公開したワークフロー評価では、Jevは4つの社内タスクでSonnetクラスのモデルと精度で同等でありながら、レイテンシとコストはごく一部にとどまり、最強のフロンティア構成には6.3ポイント劣る。性能はタスクによって分かれる。顧客サービス分類で76.0パーセント、請求書処理で61.8パーセントだ。
同社はまた、Jevにやらせるべきでないことについて異例なほど率直だ。ドキュメントは、算術、日付比較、大規模でノイズの多い状態をまたぐ計数に使うことを警告し、そうしたロジックは通常のコードに置き、変動するエイリアスではなくバージョン固定のモデルIDに固定するようチームに促している。
その指針は、このカテゴリーの正直な境界を示している。Jevは、はるかに優れたインターフェースと言語レベルの文脈理解を備えた分類器であり、すでに構造化されていた作業を対象としている。チケットを請求か技術かに振り分ける、不正利用シグナルをスコアリングする、エージェントのツール呼び出しが下流で金を使う前にゲートする、検索結果をランク付けする、といったものだ。そうした枠では、高価なリランカーやプロンプトエンジニアリングされたフロンティア呼び出しを置き換え、しかもその置き換えははるかに速く、はるかに安い。
競合の一群は3週間以内に登場した
これほど明らかなカテゴリーが静かなままでいるはずがない。Cloudflareは10月1日にClefとClef-flashをリリースした。それぞれQwen 3.8-27Bと9Bバックボーンをベースにした、Apache 2.0の2つのオープンウェイト意思決定モデルだ。同じリクエスト形状を受け付け、ビジョン入力と65,536トークンのコンテキストウィンドウを追加し、RLファインチューニングサービスも付属する。Cloudflare自身のレイテンシ数値では、Clef-flashの中央値は38.8ミリ秒で、Jevは524.1ミリ秒。この差は、リクエストパス上のあらゆるものにとって問題になるほど大きい。OpenAIのプロトコル作業とCloudflareのローンチはいずれも同じアイデアに依拠しており、ClefはJev向けに書かれたコードがそのまま動き続けるように設計された。
Fastino Labsは同じ期間にGLiDEとGLiNER2.5-Decideをリリースした。オープンな複製も登場した。Jeff v1.1はQwen3.5とGemma 4をファインチューニングして0.8Bと2Bの意思決定モデルにし、ワークステーションGPU上で22~28ミリ秒で回答する。述べておく価値のある注意点があり、MarkTechPostがそれを指摘している。Fastinoの比較は、TypeSafeのホストモデルではなく、自社のテストスイートとJevのオープンな再現実装に対して行われているため、ベンダー間の数値はクリーンなランキングではない。
それでも、TypeSafeが打ち立てたものを消し去ることはない。同社は、1年かけてゆっくりと形成されてきた分裂に名前を与えた。人向けに言語を生成するモデルと、ソフトウェアのために意思決定を返すモデルの分裂だ。第2のカテゴリーがリクエスト形状と100万トークンあたりの価格を持つと、それは研究上の珍品ではなくなり、予算項目になり始める。
これをどう扱うか
チームにとっての実務的な問いは地味だ。現在フロンティアモデルに金を払ってやらせていることを見渡し、その呼び出しのうち、トークンを使って生成した応答からコードが1つの値を読み出すだけで終わるものがいくつあるか数えてみよう。チケットの振り分け、モデレーションのゲート、リードスコアリング、関連度ランキング、ツール呼び出しの承認。そのそれぞれが移行候補だ。
移行する理由は、意思決定モデルの方が賢いからではない。単に、インターフェースがあなたと喧嘩しなくなるのだ。状態を送れば、校正された確率が付いた境界のある回答が返り、コードが分岐する。しきい値未満ならエスカレーションし、以上なら実行する。算術は本来あるべき場所であるコードに置いておく。
コスト面の論拠もある。そしてそれは財務チームが挙げるものだ。意思決定モデルの出力は段落ではなく数百バイトであり、フロンティアの価格が最も痛むのは出力トークンだ。100万入力トークンあたり0.042ドル、出力無料で1セントの何分の一かで済むルーティング呼び出しは、正当化が必要だった予算項目を、そうでないものに変える。
それは「推論」よりも小さな約束だが、ほとんどの本番システムが言語モデルから得ようとしていたものにより近い。
関連記事
Step 5はバージョン番号を4つ飛ばしてオープンモデル2位に着地した。だが誰もAPIを叩いていない
ベンチマークの順位は、作り手がモデルを評価するために使うシグナルだ。呼び出し量は、使い手が実際に使うことで生み出すシグナルだ。
Gemini Omni 1.1 Flash、4つのリクエストを連結して40秒のショットに。ワークフローこそが製品だ。
Googleは、価格設定にレビューゲートを組み込んだ制作パイプラインを投入した。
Microsoft、部分文字起こしのレイテンシを100ミリ秒に短縮。文字起こしの目的が変わる。
100ミリ秒を下回ると、文字起こし製品は誰かがまだ話している間に応答できる。
Synthesiaは10年をかけてアバターを録画してきた。今度は、アバターに話し返してもらおうとしている。
人が自発的に繰り返す研修ツールは、誰かに割り当てられてこなすツールとは別物だ。