← 返回部落格
Ai預計閱讀 11 分鐘

一個拒絕寫句子的模型,如今每天處理一兆個詞元

發布於 2026年10月5日
一個拒絕寫句子的模型,如今每天處理一兆個詞元

TypeSafe AI 於 2026 年 9 月 15 日推出 Jev,並在 9 月 27 日撤下候補名單。它的產品定位狹窄到乍聽之下像是打錯字:Jev 不生成文字。你送進一段狀態和一組具型別的問題,它會回傳從你事先定義的結構描述中取出的答案,每個答案都附帶一個機率和一個信心值。

三種基本原語涵蓋它會回答的內容。Choice 會從你提供的清單中挑選一個選項。Score 會依據有序的描述層級為輸入評分。Noul 則回答是/否問題,並附上答案為「是」的機率。

這就是整個產品。沒有聊天、沒有段落、沒有 Markdown,也不會為了自己是 AI 而道歉。

為什麼會有人想要這種東西

Diogo Almeida 創立了 TypeSafe AI,先前在 OpenAI 研究指令遵循方法,這些方法形塑了 ChatGPT 的行為。他於 2024 年離開。此後他的論點始終一致:聊天介面不是軟體該有的形狀。程式碼要的不是回傳一句話,而是一個可以據以分支的數值。

任何曾把 LLM 接進生產系統的人,都認得他描述的痛苦。你請模型分類一張客服工單,結果拿回一段親切的段落,開頭是分類結果,結尾是提供進一步協助。於是你寫了正規表達式。接著模型改了格式,正規表達式就壞了。然後你加上 JSON 模式,偶爾 JSON 還是格式錯誤。模型從來不是脆弱的那一環,介面才是。

Jev 透過完全移除生成來避開這個問題。它使用平行取樣器,而非自迴歸式詞元生成,這表示可能的輸出會在推論執行前就被列舉出來。符合結構描述不再是你祈禱發生的事,而是架構保證的事。TypeSafe 自家數據顯示端到端延遲介於 70 到 500 毫秒之間。

一排小型黃銅撥桿嵌在霧黑色控制台上,沐浴在暖色燈光下

該公司用一種稱為「校準決策強化學習」(Reinforcement Learning for Calibrated Decisions)的方法訓練它。重點落在「校準」這個詞上。信心分數唯有在 0.85 真的代表大約 85% 的情況會如此時才有用,而大多數語言模型對自己的答案出了名地過度樂觀。如果你的應用程式要在超過某個閾值時自動採取行動,低於閾值時升級給真人處理,那麼校準就不再是加分項,而是整個設計的核心。

還有第二個特性在生產環境中同樣重要,卻很容易被忽略。因為輸出空間在呼叫前就已固定,兩次以相同狀態和相同問題執行的結果會回傳相同答案。可重現性往往是大多數團隊在事故檢討之後才發現自己需要的東西:有人問為什麼系統三週前把某張特定工單導向某個特定方向,卻沒有人能重建當時的決策。決策模型讓這個問題有答案。

採用曲線迅速變得離奇

Vercel 在第二天就把 Jev 加入其 AI Gateway,隨後回報它成為該閘道史上採用速度最快的模型。近 13% 的付費團隊在 24 小時內開始使用,大約是 GPT-5.6 家族的兩倍,也是 Fable 5.1 的六倍以上。Netlify 隨後跟進。LangChain 推出 TypeSafeClassifier 整合,包含模型路由,以及在執行前篩檢工具呼叫的中介軟體。數天內出現五個獨立的 Elixir 用戶端,這種細節正告訴你,開發者早就一直在尋找這種形狀的東西。

規模數字更難忽視。Almeida 告訴《華爾街日報》,Jev 在推出約一週內每天處理大約一兆個詞元,且約有四分之一《財星》500 大企業在使用它。《The Information》報導,TypeSafe 正在洽談一輪目標 10 億美元以上的募資,部分感興趣的投資人對該公司的估值超過 100 億美元。Almeida 拒絕對該募資報導置評。

成本結構說明了部分吸引力。輸入每百萬個詞元 0.042 美元,輸出免費,上下文視窗為 32,000 個詞元。相較於把分類工作導向前沿模型,兩者的算術差距不再接近。

這東西真正站得住腳的地方

TypeSafe 公布的工作流程評估顯示,Jev 在四項內部任務的準確率上與 Sonnet 等級模型相當,延遲和成本卻只有一小部分,但落後最強的前沿配置 6.3 個百分點。效能依任務而異:客服分類 76.0%,發票處理 61.8%。

該公司也異常直接地說明不該要求 Jev 做什麼。其文件警告不要用它來做算術、日期比較,或在龐大嘈雜的狀態中計數,並建議團隊把那些邏輯留在一般程式碼中,並固定使用版本化的模型 ID,而不是浮動別名。

這段指引點出這個類別誠實的邊界。Jev 是一個分類器,只是介面好得多,並具備語言層級的情境理解,瞄準的是本來就已經結構化的工作:把工單路由到帳務或技術部門、為濫用訊號評分、在代理人的工具呼叫於下游花錢之前先設閘門、為搜尋結果排名。在這些位置上,它取代昂貴的重排序器或靠提示工程調校的前沿模型呼叫,而且取代方案在速度和成本上都大幅勝出。

競爭者組合在三週內到齊

一個如此明顯的類別不會一直安靜。Cloudflare 在 10 月 1 日推出 Clef 和 Clef-flash,兩個以 Apache 2.0 授權的開放權重決策模型,分別建立在 Qwen 3.8-27B 與 9B 骨幹上。它們接受同樣的請求形狀,加入視覺輸入與 65,536 個詞元的上下文視窗,並附帶 RL 微調服務。Cloudflare 自家的延遲數據顯示,Clef-flash 中位數為 38.8 毫秒,而 Jev 為 524.1 毫秒,這差距大到足以對任何位於請求路徑上的事物產生影響。OpenAI 的協定工作和 Cloudflare 的發布都倚賴同一個想法,而 Clef 的設計也讓針對 Jev 撰寫的程式碼能繼續運作。

Fastino Labs 也在同一時間窗口內推出 GLiDE 與 GLiNER2.5-Decide。開放復刻版也出現了:Jeff v1.1 將 Qwen3.5 和 Gemma 4 微調成 0.8B 與 2B 的決策模型,在工作站 GPU 上可在 22 到 28 毫秒內回答。有一個值得說明的注意事項,MarkTechPost 也提出了:Fastino 的比較是對上自家的測試套件以及一個 Jev 的開放復刻版,而非 TypeSafe 的代管模型,因此跨廠商的數字並非乾淨的排名。

這些都不會抹去 TypeSafe 所建立的事。該公司為一個已慢慢成形一年的分野命名:一邊是為人生成語言的模型,另一邊是為軟體回傳決策的模型。一旦第二個類別有了請求形狀和每百萬詞元價格,它就不再是研究上的新奇事物,而開始成為預算中的一個項目。

該怎麼運用這件事

對團隊來說,實際的問題並不光鮮。看看你目前付錢請前沿模型做哪些事,然後數一數其中有多少呼叫,最後只是讓程式碼從一個你花了詞元生成的回應中讀出單一數值。工單路由、審核閘門、潛在客戶評分、相關性排名、工具呼叫核准。這些每一項都是可以搬過去的候選。

搬過去的理由和決策模型比較聰明無關。純粹是介面不再跟你作對。你送出一段狀態,拿回一個有界的答案,附帶一個校準過的機率,然後你的程式碼據以分支。低於閾值就升級處理,高於閾值就採取行動,並把算術留在它該待的程式碼裡。

還有一個成本面的論點,而這會是財務團隊提出的那一種。決策模型的輸出是幾百位元組,而不是一整個段落,而輸出詞元正是前沿模型定價最痛的地方。一趟路由呼叫在每百萬輸入詞元 0.042 美元、輸出免費的情況下只花不到一美分,讓原本需要解釋正當性的預算項目,變成不需要解釋的項目。

這是一個比「推理」更小的承諾,卻更貼近大多數生產系統本來就試圖從語言模型身上得到的東西。

相關文章