← Voltar ao blog
Aicerca de 8 min de leitura

Cloudflare lança modelo de decisão de 27B que supera o Jev no próprio terreno

Publicado 6 de out. de 2026
Cloudflare lança modelo de decisão de 27B que supera o Jev no próprio terreno

A Cloudflare lançou o Clef nos primeiros dias de outubro sob licença Apache 2.0. É um modelo de 27 bilhões de parâmetros construído sobre o Qwen3.8-27B, e não escreve prosa. Ele pontua escolhas.

A categoria é pequena e específica. Um modelo de decisão recebe uma entrada e um conjunto de escolhas de esquema candidatas e então retorna um ranking, em vez de uma frase gerada. O Jev, da Typesafe AI, estabeleceu a abordagem e se tornou o ponto de referência para ela. O Clef chega como o segundo concorrente sério e, pelos números publicados pela Cloudflare, supera o incumbente tanto em precisão quanto em latência.

Como a arquitetura difere

O Clef usa um design apenas de prefill (prefill-only). Ele lê a entrada e pontua as opções de esquema em paralelo, em vez de emitir tokens um a um. Essa única escolha explica a maior parte da diferença de desempenho, porque a parte cara de uma chamada convencional a um modelo de linguagem é o loop de decodificação.

Na BANKING77, um benchmark padrão de classificação de intenções, o Clef alcança 94,20 de macro-F1 contra 79,74 do Jev. A Cloudflare também informa que o Clef-flash, a configuração menor, tem latência mediana de 38,8 milissegundos, o que ela descreve como aproximadamente 13 vezes mais rápido que a linha de base de 524,1 milissegundos do Jev.

A interface importa tanto quanto a pontuação. O Clef é compatível com a API do Jev, então uma equipe já integrada ao Jev pode trocar o endpoint sem reescrever o código de integração. O Clef também aceita entrada multimodal dentro de uma janela de contexto de 64.000 tokens, enquanto o Jev é apenas texto e limitado a 32.000.

O enquadramento da Cloudflare é direto: para roteamento, classificação e seleção estruturada, gerar texto é trabalho desperdiçado. Se a resposta que você precisa é uma entre doze categorias, um modelo que escreve um parágrafo e depois o pós-processa está fazendo algo mais difícil do que a tarefa exige.

Onde isso se situa em relação aos embeddings

Vale separar os modelos de decisão da abordagem mais antiga para o mesmo problema. Equipes fazem roteamento e classificação com embeddings há anos: transformam a entrada em embedding, comparam com exemplos rotulados e escolhem o mais próximo. Isso funciona, e é barato, mas exige um conjunto rotulado para comparar e tem dificuldades quando a decisão depende de instruções e não de similaridade.

Um modelo de decisão recebe um esquema e um conjunto de opções como parte da requisição. Ele pode responder a uma gama mais ampla de perguntas do que uma verificação de similaridade permite: a qual categoria uma mensagem pertence, qual de três ferramentas chamar, para qual modelo rotear e qual de várias políticas se aplica. As instruções ficam na requisição, e não em um índice de exemplos mantido, o que facilita mudar o comportamento sem rotular nada de novo.

O trade-off é que um modelo de decisão ainda é um modelo de linguagem fazendo a pontuação, então ele herda os modos de falha de um. Ele pode errar com alta confiança, e suas pontuações de confiança não são calibradas para uma probabilidade em que uma política de roteamento possa confiar sem testes. O design apenas de prefill elimina o custo de decodificação, mas não elimina o problema de saber quando o modelo está chutando.

A matemática de custo é o que torna a categoria interessante de qualquer forma. Rotear uma requisição por meio de um modelo generativo custa uma geração completa no caminho crítico, muitas vezes várias centenas de milissegundos e algumas centenas de tokens. A Cloudflare reporta o Clef abaixo de 40 milissegundos de mediana na configuração flash. Para um agente que toma várias decisões de roteamento por turno do usuário, essa diferença se acumula, e se acumula justamente na etapa que o usuário realmente sente.

A categoria está se padronizando rápido

O que torna isso mais do que o lançamento de um fornecedor é a velocidade com que o ferramental em torno dos modelos de decisão se adensou.

Em 30 de setembro, o SGLang adicionou rotas nativas /v1/decisions e /v1/systemone, permitindo que modelos de linguagem e de visão atuem como classificadores e pontuadores sem geração token a token. O framework demonstrou o recurso executando o Qwen3.8-27B como modelo de decisão multimodal e relatou ter vencido Pokémon FireRed em uma única tentativa, com latência abaixo de 100 milissegundos.

Poucos dias depois, o llama.cpp adicionou suporte a modelos de decisão por meio de um novo endpoint /v1/systemone, cobrindo modelos abertos como Kev-4B e OpenJev, com lançamento previsto na versão 0.6.0. Modelos pequenos rodam em CPUs, e alguns suportam entradas de imagem para classificação.

A Respan lançou sua própria entrada, o Span-01, um classificador de raciocínio hiperparalelo para detectar injeção de prompt, alucinação e uso indevido de ferramentas em traços de agentes. Ele é treinado com RLAIF e avalia múltiplas definições de comportamento nunca vistas em uma única passagem forward. A Respan o precifica em dois centavos por milhão de tokens de entrada, com uma versão Lite gratuita.

Isso são quatro projetos separados tratando modelos de decisão como uma interface que vale a pena implementar nativamente, em duas semanas. Quando um padrão aparece em um framework de inferência, em um runtime local e na linha de produtos de uma startup ao mesmo tempo, ele deixou de ser uma curiosidade.

Por que isso importa para o roteamento de agentes

As pessoas que tendem a ganhar primeiro são as que constroem agentes que chamam outros modelos. Um agente precisa decidir qual ferramenta usar, para qual modelo rotear, se uma requisição é uma tentativa de injeção e se uma resposta tem fundamento. Hoje, muitas equipes implementam essas etapas pedindo a um modelo grande que responda em JSON e torcendo para o formato se manter.

Um classificador que retorna uma pontuação em dezenas de milissegundos muda o custo dessa decisão. Rotear uma requisição por meio de um modelo de linguagem custa uma geração completa, e custa no caminho crítico. Rotear por meio de um pontuador apenas de prefill custa uma fração disso e termina mais rápido. Se a precisão se sustentar, o efeito prático é que mais do fluxo de controle de um agente pode rodar na velocidade da máquina, e não na velocidade dos tokens.

Uma única barra de vidro fosco brilhando em tom azul-petróleo, pairando logo acima de uma superfície lisa de pedra cinza

O próprio argumento da Cloudflare é sobre economia de infraestrutura. A empresa diz que modelos de pesos abertos agora custam de 15% a 90% menos que equivalentes fechados para a maioria das cargas de produção, e que a era dos pesos abertos correndo atrás acabou. O Clef é apresentado como evidência: um modelo baixável, licenciado sob Apache 2.0, que supera um concorrente proprietário na própria categoria de benchmark do concorrente e pode ser auto-hospedado.

O que verificar antes de acreditar na manchete

Vale manter três ressalvas em mente.

Primeiro, os benchmarks são escolhidos pelo fornecedor. O BANKING77 é um conjunto de dados de intenções real e amplamente usado, mas um único número de macro-F1 não descreve como um modelo se comporta em uma distribuição de produção com classes raras, entradas ambíguas e formulações adversariais. Uma avaliação independente resolveria mais do que um post de lançamento consegue.

Segundo, a compatibilidade com a API do Jev é uma afirmação sobre o formato da requisição, não sobre o comportamento. Um endpoint substituto que retorna uma calibração de confiança diferente ainda pode quebrar uma política de roteamento ajustada em torno do original.

Terceiro, a comparação é medida contra o Jev conforme publicado. A Typesafe AI tem seus próprios lançamentos em andamento, e a distância entre um desafiante e um incumbente raramente permanece fixa por muito tempo.

Nada disso elimina o ponto mais duradouro. Modelos de decisão existem porque roteamento, gating e classificação representam uma grande parte do que a infraestrutura de agentes realmente faz, e fazê-los com um gerador de texto sempre foi um encaixe desajeitado. O Clef, o Span-01 e os novos endpoints no SGLang e no llama.cpp estão convergindo para a mesma ideia: algumas chamadas a modelos deveriam retornar um número, e não uma frase. A questão agora é qual dessas implementações vai acabar por baixo do loop de agente de todo mundo, e por quanto tempo a categoria permanece disputada.

Artigos relacionados