Cloudflare lança modelo de decisão de 27B que supera o Jev no próprio terreno

A Cloudflare lançou o Clef nos primeiros dias de outubro sob licença Apache 2.0. É um modelo de 27 bilhões de parâmetros construído sobre o Qwen3.8-27B, e não escreve prosa. Ele pontua escolhas.
A categoria é pequena e específica. Um modelo de decisão recebe uma entrada e um conjunto de escolhas de esquema candidatas e então retorna um ranking, em vez de uma frase gerada. O Jev, da Typesafe AI, estabeleceu a abordagem e se tornou o ponto de referência para ela. O Clef chega como o segundo concorrente sério e, pelos números publicados pela Cloudflare, supera o incumbente tanto em precisão quanto em latência.
Como a arquitetura difere
O Clef usa um design apenas de prefill (prefill-only). Ele lê a entrada e pontua as opções de esquema em paralelo, em vez de emitir tokens um a um. Essa única escolha explica a maior parte da diferença de desempenho, porque a parte cara de uma chamada convencional a um modelo de linguagem é o loop de decodificação.
Na BANKING77, um benchmark padrão de classificação de intenções, o Clef alcança 94,20 de macro-F1 contra 79,74 do Jev. A Cloudflare também informa que o Clef-flash, a configuração menor, tem latência mediana de 38,8 milissegundos, o que ela descreve como aproximadamente 13 vezes mais rápido que a linha de base de 524,1 milissegundos do Jev.
A interface importa tanto quanto a pontuação. O Clef é compatível com a API do Jev, então uma equipe já integrada ao Jev pode trocar o endpoint sem reescrever o código de integração. O Clef também aceita entrada multimodal dentro de uma janela de contexto de 64.000 tokens, enquanto o Jev é apenas texto e limitado a 32.000.
O enquadramento da Cloudflare é direto: para roteamento, classificação e seleção estruturada, gerar texto é trabalho desperdiçado. Se a resposta que você precisa é uma entre doze categorias, um modelo que escreve um parágrafo e depois o pós-processa está fazendo algo mais difícil do que a tarefa exige.
Onde isso se situa em relação aos embeddings
Vale separar os modelos de decisão da abordagem mais antiga para o mesmo problema. Equipes fazem roteamento e classificação com embeddings há anos: transformam a entrada em embedding, comparam com exemplos rotulados e escolhem o mais próximo. Isso funciona, e é barato, mas exige um conjunto rotulado para comparar e tem dificuldades quando a decisão depende de instruções e não de similaridade.
Um modelo de decisão recebe um esquema e um conjunto de opções como parte da requisição. Ele pode responder a uma gama mais ampla de perguntas do que uma verificação de similaridade permite: a qual categoria uma mensagem pertence, qual de três ferramentas chamar, para qual modelo rotear e qual de várias políticas se aplica. As instruções ficam na requisição, e não em um índice de exemplos mantido, o que facilita mudar o comportamento sem rotular nada de novo.
O trade-off é que um modelo de decisão ainda é um modelo de linguagem fazendo a pontuação, então ele herda os modos de falha de um. Ele pode errar com alta confiança, e suas pontuações de confiança não são calibradas para uma probabilidade em que uma política de roteamento possa confiar sem testes. O design apenas de prefill elimina o custo de decodificação, mas não elimina o problema de saber quando o modelo está chutando.
A matemática de custo é o que torna a categoria interessante de qualquer forma. Rotear uma requisição por meio de um modelo generativo custa uma geração completa no caminho crítico, muitas vezes várias centenas de milissegundos e algumas centenas de tokens. A Cloudflare reporta o Clef abaixo de 40 milissegundos de mediana na configuração flash. Para um agente que toma várias decisões de roteamento por turno do usuário, essa diferença se acumula, e se acumula justamente na etapa que o usuário realmente sente.
A categoria está se padronizando rápido
O que torna isso mais do que o lançamento de um fornecedor é a velocidade com que o ferramental em torno dos modelos de decisão se adensou.
Em 30 de setembro, o SGLang adicionou rotas nativas /v1/decisions e /v1/systemone, permitindo que modelos de linguagem e de visão atuem como classificadores e pontuadores sem geração token a token. O framework demonstrou o recurso executando o Qwen3.8-27B como modelo de decisão multimodal e relatou ter vencido Pokémon FireRed em uma única tentativa, com latência abaixo de 100 milissegundos.
Poucos dias depois, o llama.cpp adicionou suporte a modelos de decisão por meio de um novo endpoint /v1/systemone, cobrindo modelos abertos como Kev-4B e OpenJev, com lançamento previsto na versão 0.6.0. Modelos pequenos rodam em CPUs, e alguns suportam entradas de imagem para classificação.
A Respan lançou sua própria entrada, o Span-01, um classificador de raciocínio hiperparalelo para detectar injeção de prompt, alucinação e uso indevido de ferramentas em traços de agentes. Ele é treinado com RLAIF e avalia múltiplas definições de comportamento nunca vistas em uma única passagem forward. A Respan o precifica em dois centavos por milhão de tokens de entrada, com uma versão Lite gratuita.
Isso são quatro projetos separados tratando modelos de decisão como uma interface que vale a pena implementar nativamente, em duas semanas. Quando um padrão aparece em um framework de inferência, em um runtime local e na linha de produtos de uma startup ao mesmo tempo, ele deixou de ser uma curiosidade.
Por que isso importa para o roteamento de agentes
As pessoas que tendem a ganhar primeiro são as que constroem agentes que chamam outros modelos. Um agente precisa decidir qual ferramenta usar, para qual modelo rotear, se uma requisição é uma tentativa de injeção e se uma resposta tem fundamento. Hoje, muitas equipes implementam essas etapas pedindo a um modelo grande que responda em JSON e torcendo para o formato se manter.
Um classificador que retorna uma pontuação em dezenas de milissegundos muda o custo dessa decisão. Rotear uma requisição por meio de um modelo de linguagem custa uma geração completa, e custa no caminho crítico. Rotear por meio de um pontuador apenas de prefill custa uma fração disso e termina mais rápido. Se a precisão se sustentar, o efeito prático é que mais do fluxo de controle de um agente pode rodar na velocidade da máquina, e não na velocidade dos tokens.

O próprio argumento da Cloudflare é sobre economia de infraestrutura. A empresa diz que modelos de pesos abertos agora custam de 15% a 90% menos que equivalentes fechados para a maioria das cargas de produção, e que a era dos pesos abertos correndo atrás acabou. O Clef é apresentado como evidência: um modelo baixável, licenciado sob Apache 2.0, que supera um concorrente proprietário na própria categoria de benchmark do concorrente e pode ser auto-hospedado.
O que verificar antes de acreditar na manchete
Vale manter três ressalvas em mente.
Primeiro, os benchmarks são escolhidos pelo fornecedor. O BANKING77 é um conjunto de dados de intenções real e amplamente usado, mas um único número de macro-F1 não descreve como um modelo se comporta em uma distribuição de produção com classes raras, entradas ambíguas e formulações adversariais. Uma avaliação independente resolveria mais do que um post de lançamento consegue.
Segundo, a compatibilidade com a API do Jev é uma afirmação sobre o formato da requisição, não sobre o comportamento. Um endpoint substituto que retorna uma calibração de confiança diferente ainda pode quebrar uma política de roteamento ajustada em torno do original.
Terceiro, a comparação é medida contra o Jev conforme publicado. A Typesafe AI tem seus próprios lançamentos em andamento, e a distância entre um desafiante e um incumbente raramente permanece fixa por muito tempo.
Nada disso elimina o ponto mais duradouro. Modelos de decisão existem porque roteamento, gating e classificação representam uma grande parte do que a infraestrutura de agentes realmente faz, e fazê-los com um gerador de texto sempre foi um encaixe desajeitado. O Clef, o Span-01 e os novos endpoints no SGLang e no llama.cpp estão convergindo para a mesma ideia: algumas chamadas a modelos deveriam retornar um número, e não uma frase. A questão agora é qual dessas implementações vai acabar por baixo do loop de agente de todo mundo, e por quanto tempo a categoria permanece disputada.
Artigos relacionados
JetBrains coloca um orquestrador de agentes dentro de cada IDE que lança
A JetBrains não está competindo pela qualidade do modelo. Está competindo pela camada onde os agentes são iniciados e revisados.
A fotografia de produtos com IA está se tornando um negócio de templates
A questão incômoda nas imagens de produtos com IA não é se elas parecem boas, mas se ainda retratam o produto que está sendo vendido.
Boston Dynamics Cortou um Dedo do Atlas e Chamou Isso de Progresso
Deixar de fora o dedo mindinho não foi uma concessão de custo. Surgiu de um experimento com fita adesiva e um dia digitando.
Spira Maxima dispensa o clipe e entrega o vídeo completo
A geração ficou barata. A finalização continuou manual. Essa lacuna é o mercado que a Spira Maxima mira.