← 返回博客
Ai预计阅读 10 分钟

一个拒绝写句子的模型,如今每天处理一万亿个 token

发布于 2026年10月5日
一个拒绝写句子的模型,如今每天处理一万亿个 token

TypeSafe AI 于 2026 年 9 月 15 日发布了 Jev,并于 9 月 27 日撤下了等候名单。它的宣传语狭窄到起初听起来像是打错了字:Jev 不生成文本。你向它发送一段状态和一组带类型的问题,它返回从你预先定义的模式中提取的答案,每个答案都附带概率和置信度值。

三个原语覆盖了它能回答的内容。Choice 从你提供的列表中选出一个选项。Score 根据有序的描述性等级对输入进行评分。Noul 用答案为“是”的概率回答一个是/否问题。

这就是整个产品。没有聊天,没有段落,没有 Markdown,也没有作为 AI 的道歉。

为什么有人会想要这个

Diogo Almeida 创立了 TypeSafe AI,此前曾在 OpenAI 从事影响 ChatGPT 行为的指令遵循方法研究。他于 2024 年离开。此后他的论点始终一致:聊天界面对于软件来说是错误的形态。代码不想要一句话作为返回。它想要一个可以据以分支的值。

任何曾将 LLM 接入生产系统的人都能认出他所描述的痛点。你让模型对一张支持工单进行分类,返回的却是一段友好的文字,以分类开头,以“如需进一步帮助”结尾。然后你写一个正则表达式。接着模型改变了格式,正则表达式失效了。然后你加上 JSON 模式,偶尔 JSON 又会格式错误。模型从来都不是脆弱的部分。界面才是。

Jev 通过完全移除生成来绕开这一点。它使用并行采样器,而非自回归 token 生成,这意味着可能的输出在推理运行之前就已经被枚举出来。Schema 一致性不再是你希望发生的事,而成为架构保证的事。TypeSafe 自己的数字显示,端到端延迟在 70 到 500 毫秒之间。

暖光下,一排小黄铜拨杆嵌在哑光黑色控制台中

该公司用一种它称为“面向校准决策的强化学习”的方法训练它。重点落在“校准”这个词上。置信度分数只有在 0.85 确实意味着大约 85% 的情况下会走向那个结果时才有用,而大多数语言模型对自己的答案出了名地乐观。如果你的应用要在高于阈值时自动行动、低于阈值时升级给人工,那么校准就不再是加分项,而是整个设计。

还有第二个在生产中同样重要的特性,而且很容易被忽视。由于输出空间在调用前就固定了,相同状态和相同问题的两次运行会返回相同的答案。可复现性是大多数团队只有在事故复盘时才意识到自己需要的东西:有人问为什么系统三周前以某种特定方式路由了某张特定工单,却没人能重建当时的过程。决策模型让这个问题变得可以回答。

采用曲线很快变得奇怪

Vercel 在第二天就把 Jev 加入了其 AI Gateway,随后报告称它成为该网关历史上采用速度最快的模型。近 13% 的付费团队在 24 小时内开始使用它,大约是 GPT-5.6 家族的两倍,也是 Fable 5.1 的六倍多。Netlify 紧随其后。LangChain 发布了 TypeSafeClassifier 集成,包含模型路由和可在执行前筛查工具调用的中间件。几天内出现了五个独立的 Elixir 客户端,这种细节说明开发者早已在寻找这种形态的东西。

规模数字更难忽视。Almeida 告诉《华尔街日报》,Jev 在发布后大约一周内每天处理约一万亿个 token,且大约四分之一的《财富》500 强公司正在使用它。《The Information》报道称,TypeSafe 正在谈判一轮目标为 10 亿美元或更多的融资,一些有意向的投资者对公司的估值超过 100 亿美元。Almeida 拒绝就融资报道置评。

成本结构解释了部分吸引力。输入为每百万 token 0.042 美元,输出免费,上下文窗口为 32,000 个 token。与通过前沿模型来路由分类任务相比,成本上的差距变得悬殊。

这东西真正站得住脚的地方

TypeSafe 发布的工作流评估显示,在四项内部任务上,Jev 的准确率与 Sonnet 级模型持平,而延迟和成本仅为其一小部分,但落后于最强的前沿配置 6.3 个百分点。性能因任务而异:客户服务分类为 76.0%,发票处理为 61.8%。

该公司对于 Jev 不应被要求做什么也异常直接。其文档警告不要用它进行算术、日期比较,或在大规模含噪状态中进行计数,并告诉团队把这些逻辑留在普通代码中,并固定到一个带版本号的模型 ID,而不是浮动别名。

这一指引指向了该类别诚实的边界。Jev 是一个接口好得多、且具备语言级上下文理解能力的分类器,面向本就结构化的任务:将工单路由到账单或技术部门、给滥用信号评分、在智能体调用工具并产生下游花费之前进行门控、对搜索结果排序。在这些位置,它取代昂贵的重排序器或经过提示工程的前沿模型调用,而且替代方案在速度和成本上都大幅胜出。

竞争对手在三周内涌现

如此明显的一个类别不会保持安静。Cloudflare 于 10 月 1 日发布了 Clef 和 Clef-flash,这是两个采用 Apache 2.0 许可的开放权重决策模型,分别基于 Qwen 3.8-27B 和 9B 主干构建。它们接受相同的请求形态,增加了视觉输入和 65,536 token 上下文窗口,并附带强化学习微调服务。Cloudflare 自己的延迟数据显示,Clef-flash 中位数为 38.8 毫秒,而 Jev 为 524.1 毫秒,这一差距足以对请求路径中的任何环节产生影响。OpenAI 的协议工作和 Cloudflare 的发布都依赖同一个理念,而 Clef 的设计使得针对 Jev 编写的代码可以继续工作。

Fastino Labs 在同一时间窗口内发布了 GLiDE 和 GLiNER2.5-Decide。开放复刻版也出现了:Jeff v1.1 将 Qwen3.5 和 Gemma 4 微调成 0.8B 和 2B 决策模型,在工作站 GPU 上可在 22 到 28 毫秒内给出答案。有一个值得说明的注意事项,MarkTechPost 也指出了:Fastino 的对比是针对其自己的测试套件以及 Jev 的开放复刻版,而不是 TypeSafe 的托管模型,因此跨厂商的数字并不是一个干净的排名。

这些都无法抹去 TypeSafe 所确立的东西。该公司为一种已经缓慢形成一年的分野命了名:一边是为人生成语言的模型,另一边是为软件返回决策的模型。一旦第二类有了请求形态和每百万 token 的价格,它就不再是研究上的猎奇之物,而开始成为预算中的一个条目。

该如何利用这一点

对团队来说,实际问题并不光鲜。看看你目前花钱让前沿模型做的事情,数一数其中有多少调用最终只是让代码从你花费 token 生成的响应中读取一个值。工单路由、审核门控、线索评分、相关性排序、工具调用审批。每一项都是可以迁移的候选。

迁移的理由与决策模型是否更聪明无关。只是接口不再和你作对。你发送一个状态,拿回一个附有校准概率的有限答案,然后你的代码进行分支。低于阈值就升级给人工,高于阈值就自动执行,并把算术留在代码里,那是它该待的地方。

还有成本方面的理由,这也是财务团队会提出的理由。决策模型的输出是几百字节,而不是一段话,而输出 token 正是前沿模型定价最伤人的地方。一次路由调用在每百万输入 token 0.042 美元、输出免费的情况下只需不到一美分,这会把一个需要论证的预算条目变成一个无需论证的条目。

这比“推理”的承诺要小,但它更贴近大多数生产系统原本就想从语言模型那里得到的东西。

相关文章