← Torna al blog
Aicirca 7 min di lettura

Cloudflare ha rilasciato un modello decisionale da 27B che batte Jev sul suo stesso terreno

Pubblicato 6 ott 2026
Cloudflare ha rilasciato un modello decisionale da 27B che batte Jev sul suo stesso terreno

Cloudflare ha rilasciato Clef nei primi giorni di ottobre con licenza Apache 2.0. È un modello da 27 miliardi di parametri basato su Qwen3.8-27B, e non scrive prosa. Assegna un punteggio alle scelte.

La categoria è piccola e specifica. Un modello decisionale riceve un input e un insieme di scelte di schema candidate, poi restituisce una classifica invece di una frase generata. Jev di Typesafe AI ha stabilito l'approccio ed è diventato il punto di riferimento. Clef arriva come secondo concorrente serio e, secondo i numeri pubblicati da Cloudflare, batte l'incumbent sia in accuratezza sia in latenza.

In cosa differisce l'architettura

Clef usa un design prefill-only. Legge l'input e assegna un punteggio alle opzioni di schema in parallelo, invece di emettere token uno alla volta. Questa singola scelta spiega gran parte del divario prestazionale, perché la parte costosa di una chiamata convenzionale a un modello linguistico è il ciclo di decodifica.

Su BANKING77, un benchmark standard per la classificazione delle intenzioni, Clef ottiene un macro-F1 di 94,20 contro il 79,74 di Jev. Cloudflare riporta anche che Clef-flash, la configurazione più piccola, ha una latenza mediana di 38,8 millisecondi, che descrive come circa 13 volte più veloce della baseline di 524,1 millisecondi di Jev.

L'interfaccia conta quanto il punteggio. Clef è compatibile con l'API di Jev, quindi un team già integrato con Jev può cambiare l'endpoint senza riscrivere il codice di integrazione. Clef accetta anche input multimodali all'interno di una finestra di contesto di 64.000 token, mentre Jev è solo testuale ed è limitato a 32.000.

La posizione di Cloudflare è netta: per routing, classificazione e selezione strutturata, generare testo è lavoro sprecato. Se la risposta che ti serve è una tra dodici categorie, un modello che scrive un paragrafo e poi lo post-elabora sta facendo qualcosa di più difficile di quanto richieda il compito.

Dove si colloca rispetto agli embedding

Vale la pena distinguere i modelli decisionali dall'approccio più vecchio allo stesso problema. I team instradano e classificano con gli embedding da anni: generano l'embedding dell'input, lo confrontano con esempi etichettati, scelgono il più vicino. Funziona ed è economico, ma richiede un insieme etichettato con cui confrontarsi, e fatica quando la decisione dipende da istruzioni anziché dalla similarità.

Un modello decisionale riceve uno schema e un insieme di opzioni come parte della richiesta. Può rispondere a una gamma più ampia di domande rispetto a quanto consenta un controllo di similarità: a quale categoria appartiene un messaggio, quale di tre strumenti chiamare, a quale modello instradare e quale di diverse policy si applica. Le istruzioni risiedono nella richiesta anziché in un indice di esempi mantenuto, il che rende più facile cambiare comportamento senza rietichettare nulla.

Il compromesso è che un modello decisionale è comunque un modello linguistico che esegue lo scoring, quindi eredita le modalità di errore di un modello linguistico. Può sbagliare con grande sicurezza, e i suoi punteggi di confidenza non sono calibrati su una probabilità di cui una policy di routing possa fidarsi senza test. Il design prefill-only elimina il costo di decodifica, ma non elimina il problema di sapere quando il modello sta tirando a indovinare.

È comunque il calcolo dei costi a rendere interessante la categoria. Instradare una richiesta attraverso un modello generativo costa una generazione completa sul percorso critico, spesso diverse centinaia di millisecondi e qualche centinaio di token. Cloudflare riporta Clef sotto i 40 millisecondi di mediana per la configurazione flash. Per un agente che prende diverse decisioni di routing per turno utente, questa differenza si accumula, e si accumula proprio nel passaggio che gli utenti percepiscono davvero.

La categoria si sta standardizzando rapidamente

Ciò che rende questo qualcosa di più del lancio di un singolo fornitore è la rapidità con cui gli strumenti attorno ai modelli decisionali si sono infittiti.

Il 30 settembre, SGLang ha aggiunto route native /v1/decisions e /v1/systemone, consentendo a modelli linguistici e visivi di agire come classificatori e scorer senza generazione token per token. Il framework ha dimostrato la capacità eseguendo Qwen3.8-27B come modello decisionale multimodale e ha riportato di aver battuto Pokemon FireRed in un solo tentativo con latenza sotto i 100 millisecondi.

Giorni dopo, llama.cpp ha aggiunto il supporto ai modelli decisionali tramite un nuovo endpoint /v1/systemone, coprendo modelli aperti tra cui Kev-4B e OpenJev, con rilascio previsto nella versione 0.6.0. I modelli piccoli girano su CPU, e alcuni supportano input di immagini per la classificazione.

Respan ha lanciato la propria proposta, Span-01, un classificatore di ragionamento iper-parallelo per rilevare prompt injection, allucinazioni e uso improprio degli strumenti nelle trace degli agenti. È addestrato con RLAIF e valuta più definizioni di comportamento mai viste in un singolo forward pass. Respan lo prezza a due centesimi per milione di token in input, con una versione Lite gratuita.

Sono quattro progetti separati che trattano i modelli decisionali come un'interfaccia da implementare nativamente, nell'arco di due settimane. Quando un pattern compare contemporaneamente in un framework di inferenza, in un runtime locale e nella linea di prodotto di una startup, ha smesso di essere una curiosità.

Perché questo conta per il routing degli agenti

Le persone che hanno più da guadagnare per prime sono quelle che costruiscono agenti che chiamano altri modelli. Un agente deve decidere quale strumento usare, a quale modello instradare, se una richiesta è un tentativo di injection e se una risposta è fondata. Oggi molti team implementano questi passaggi chiedendo a un modello di grandi dimensioni di rispondere in JSON e sperando che il formato regga.

Un classificatore che restituisce un punteggio in decine di millisecondi cambia il costo di quella decisione. Instradare una richiesta attraverso un modello linguistico costa una generazione completa, e quel costo ricade sul percorso critico. Instradarla attraverso uno scorer prefill-only costa una frazione di quel costo e finisce prima. Se l'accuratezza regge, l'effetto pratico è che una porzione maggiore del flusso di controllo di un agente può girare a velocità macchina anziché a velocità token.

Una singola barra di vetro smerigliato che brilla di verde acqua, sospesa appena sopra una semplice superficie di pietra grigia

L'argomentazione di Cloudflare riguarda l'economia dell'infrastruttura. L'azienda afferma che i modelli open-weight oggi costano dal 15 al 90 percento in meno rispetto agli equivalenti closed per la maggior parte dei carichi di lavoro in produzione, e che l'era in cui gli open weight inseguivano è finita. Clef viene offerto come prova: un modello scaricabile, con licenza Apache 2.0, che supera un concorrente proprietario nella stessa categoria di benchmark del concorrente e può essere self-hosted.

Cosa verificare prima di credere al titolo

Tre avvertenze meritano di essere tenute a mente.

Primo, i benchmark sono selezionati dal fornitore. BANKING77 è un dataset di intenti reale e ampiamente usato, ma un singolo valore di macro-F1 non descrive come si comporta un modello su una distribuzione di produzione con classi rare, input ambigui e formulazioni adversarial. Una valutazione indipendente chiarirebbe più di quanto possa fare un post di lancio.

Secondo, la compatibilità con l'API di Jev è un'affermazione sulla forma della richiesta, non sul comportamento. Un endpoint drop-in che restituisce una calibrazione della confidenza diversa può comunque rompere una policy di routing tarata sull'originale.

Terzo, il confronto è misurato rispetto a Jev così com'è pubblicato. Typesafe AI ha i propri rilasci in corso, e il divario tra uno sfidante e un incumbent raramente resta fisso a lungo.

Niente di tutto ciò elimina il punto più duraturo. I modelli decisionali esistono perché routing, gating e classificazione rappresentano una gran parte di ciò che l'infrastruttura per agenti fa davvero, e farli con un generatore di testo è sempre stato un adattamento scomodo. Clef, Span-01 e i nuovi endpoint in SGLang e llama.cpp convergono sulla stessa idea: alcune chiamate a un modello dovrebbero restituire un numero anziché una frase. La domanda ora è quale di queste implementazioni finirà sotto il loop degli agenti di tutti gli altri, e per quanto tempo la categoria resterà contesa.

Articoli correlati