← Voltar ao blog
Aicerca de 9 min de leitura

Um modelo que se recusa a escrever frases agora processa um trilhão de tokens por dia

Publicado 5 de out. de 2026
Um modelo que se recusa a escrever frases agora processa um trilhão de tokens por dia

A TypeSafe AI lançou o Jev em 15 de setembro de 2026 e removeu a lista de espera em 27 de setembro. A proposta é tão específica que à primeira vista parece um erro de digitação: o Jev não gera texto. Você envia a ele um pedaço de estado e um conjunto de perguntas tipadas, e ele retorna respostas extraídas de um esquema que você definiu previamente, cada uma carregando uma probabilidade e um valor de confiança.

Três primitivas cobrem o que ele responderá. Choice escolhe uma opção de uma lista que você fornece. Score avalia a entrada em relação a níveis descritivos ordenados. Noul responde a uma pergunta de sim ou não com a probabilidade de a resposta ser sim.

Esse é o produto inteiro. Sem chat, sem parágrafos, sem markdown, sem desculpas por ser uma IA.

Por que alguém iria querer isso

Diogo Almeida fundou a TypeSafe AI e trabalhou anteriormente na OpenAI nos métodos de seguimento de instruções que moldaram o comportamento do ChatGPT. Ele saiu em 2024. Seu argumento desde então tem sido consistente: uma interface de chat é a forma errada para software. O código não quer uma frase de volta. Ele quer um valor no qual possa ramificar.

Qualquer um que já conectou um LLM a um sistema de produção reconhece a dor que ele descreve. Você pede a um modelo para classificar um ticket de suporte, e recebe de volta um parágrafo amigável que começa com a classificação e termina com uma oferta para ajudar mais. Então você escreve uma regex. Então o modelo muda sua formatação, e a regex quebra. Então você adiciona um modo JSON, e ocasionalmente o JSON está malformado. O modelo nunca foi a parte frágil. A interface era.

O Jev contorna isso eliminando completamente a geração. Ele usa um amostrador paralelo em vez de geração de tokens autorregressiva, o que significa que as saídas possíveis são enumeradas antes da inferência ser executada. A conformidade com o esquema deixa de ser algo que você espera e se torna algo que a arquitetura garante. Os próprios números da TypeSafe colocam a latência ponta a ponta entre 70 e 500 milissegundos.

Uma fileira de pequenas alavancas de latão embutidas em um console preto fosco sob luz quente

A empresa o treinou com um método que chama de Aprendizado por Reforço para Decisões Calibradas. A ênfase recai sobre a palavra calibrado. Uma pontuação de confiança só é útil se 0,85 realmente significa que cerca de 85 por cento dos casos seguem esse caminho, e a maioria dos modelos de linguagem é notoriamente otimista em relação às suas próprias respostas. Se sua aplicação vai agir automaticamente acima de um limite e escalar para um humano abaixo dele, a calibração deixa de ser um bônus e se torna todo o design.

Há uma segunda propriedade que importa tanto quanto em produção, e é fácil de ignorar. Como o espaço de saída é fixo antes da chamada, duas execuções com o mesmo estado e as mesmas perguntas retornam a mesma resposta. A reprodutibilidade é a coisa que a maioria das equipes descobre que precisa somente após uma revisão de incidente, quando alguém pergunta por que o sistema encaminhou um ticket específico de uma maneira específica três semanas atrás e ninguém consegue reconstruir isso. Um modelo de decisão torna essa pergunta respondível.

A curva de adoção ficou estranha rápido

A Vercel adicionou o Jev ao seu AI Gateway no segundo dia e depois relatou que ele se tornou o modelo mais rapidamente adotado na história do gateway. Quase 13 por cento das equipes pagantes o estavam usando em 24 horas, cerca de duas vezes a taxa da família GPT-5.6 e mais de seis vezes a do Fable 5.1. A Netlify seguiu. A LangChain lançou integrações do TypeSafeClassifier com roteamento de modelo e middleware que filtra chamadas de ferramentas antes da execução. Cinco clientes Elixir independentes apareceram em dias, o que é o tipo de detalhe que mostra que os desenvolvedores já estavam procurando por esse formato de coisa.

Os números de escala são mais difíceis de ignorar. Almeida disse ao Wall Street Journal que o Jev estava processando cerca de um trilhão de tokens por dia dentro de aproximadamente uma semana após o lançamento, e que cerca de um quarto das empresas da Fortune 500 o estavam usando. O The Information relatou que a TypeSafe está negociando uma rodada mirando US$ 1 bilhão ou mais, com alguns investidores interessados avaliando a empresa em mais de US$ 10 bilhões. Almeida se recusou a comentar sobre o relatório de financiamento.

A estrutura de custos explica parte da atração. A entrada custa US$ 0,042 por milhão de tokens com saída gratuita, e a janela de contexto é de 32.000 tokens. Comparado a rotear um trabalho de classificação por um modelo de fronteira, a aritmética deixa de ser próxima.

Onde a coisa realmente se sustenta

As avaliações de fluxo de trabalho publicadas pela TypeSafe colocam o Jev em paridade com modelos da classe Sonnet em precisão em quatro tarefas internas, a uma fração da latência e do custo, enquanto fica atrás da configuração de fronteira mais forte em 6,3 pontos. O desempenho varia por tarefa: 76,0 por cento na classificação de atendimento ao cliente, 61,8 por cento no processamento de faturas.

A empresa também é incomumente direta sobre o que o Jev não deve ser solicitado a fazer. Sua documentação adverte contra usá-lo para aritmética, comparação de datas ou contagem em um estado grande e ruidoso, e diz às equipes para manter essa lógica em código comum e fixar a um id de modelo versionado em vez de um alias flutuante.

Essa orientação aponta para a fronteira honesta da categoria. O Jev é um classificador com uma interface muito melhor e compreensão de contexto em nível de linguagem, e é voltado para trabalho que já era estruturado: encaminhar um ticket para faturamento ou técnico, pontuar um sinal de abuso, bloquear a chamada de ferramenta de um agente antes que ele gaste dinheiro a jusante, classificar resultados de busca. Nesses espaços, ele substitui um reranker caro ou uma chamada de fronteira projetada por prompt, e a substituição é mais rápida e mais barata por uma margem ampla.

O conjunto de concorrentes chegou em três semanas

Uma categoria tão óbvia não fica quieta. A Cloudflare lançou o Clef e o Clef-flash em 1º de outubro, dois modelos de decisão de pesos abertos sob Apache 2.0, construídos sobre o Qwen 3.8-27B e um backbone de 9B, respectivamente. Eles aceitam o mesmo formato de requisição, adicionam entrada de visão e uma janela de contexto de 65.536 tokens, e vêm com um serviço de ajuste fino por RL. Os próprios números de latência da Cloudflare colocam o Clef-flash em uma mediana de 38,8 milissegundos contra 524,1 milissegundos do Jev, o que é uma diferença grande o suficiente para importar em qualquer coisa em um caminho de requisição. O trabalho de protocolo da OpenAI e o lançamento da Cloudflare se apoiaram na mesma ideia, e o Clef foi projetado para que o código escrito para o Jev continue funcionando.

A Fastino Labs lançou o GLiDE e o GLiNER2.5-Decide na mesma janela. Réplicas abertas também apareceram: o Jeff v1.1 faz ajuste fino do Qwen3.5 e do Gemma 4 em modelos de decisão de 0,8B e 2B que respondem em 22 a 28 milissegundos em uma GPU de estação de trabalho. Há uma ressalva que vale a pena declarar, e o MarkTechPost a fez: as comparações da Fastino são feitas contra seus próprios conjuntos de testes e uma reprodução aberta do Jev, em vez do modelo hospedado da TypeSafe, então os números entre fornecedores não são uma classificação limpa.

Nada disso apaga o que a TypeSafe estabeleceu. A empresa deu um nome a uma divisão que vinha se formando lentamente por um ano, entre modelos que geram linguagem para pessoas e modelos que retornam decisões para software. Uma vez que a segunda categoria tem um formato de requisição e um preço por milhão de tokens, ela deixa de ser uma curiosidade de pesquisa e passa a ser um item de linha.

O que fazer com isso

A pergunta prática para uma equipe não é glamorosa. Olhe para o que você está atualmente pagando um modelo de fronteira para fazer, e conte quantas dessas chamadas terminam com código lendo um único valor de uma resposta que você gastou tokens gerando. Encaminhamento de tickets, portões de moderação, pontuação de leads, classificação de relevância, aprovação de chamadas de ferramentas. Cada um deles é um candidato a migrar.

A razão para migrar não tem nada a ver com um modelo de decisão ser mais inteligente. A interface simplesmente para de lutar contra você. Você envia um estado, recebe de volta uma resposta limitada com uma probabilidade calibrada anexada, e seu código ramifica. Escale abaixo do limite, aja acima dele, e mantenha a aritmética no código, onde ela pertence.

Há também um argumento do lado do custo, e é o que as equipes financeiras farão. A saída de um modelo de decisão é de algumas centenas de bytes em vez de um parágrafo, e os tokens de saída são onde o preço de fronteira dói mais. Uma chamada de roteamento que custa frações de centavo a US$ 0,042 por milhão de tokens de entrada com saída gratuita transforma um item de linha que precisava de justificativa em um que não precisa.

Essa é uma promessa menor do que "raciocínio", e se mapeia mais de perto ao que a maioria dos sistemas de produção já estava tentando obter de um modelo de linguagem.

Artigos relacionados