← Torna al blog
Aicirca 7 min di lettura

I modelli decisionali stanno silenziosamente sostituendo l'LLM nel loop degli agenti

Pubblicato 3 ott 2026
I modelli decisionali stanno silenziosamente sostituendo l'LLM nel loop degli agenti

Cloudflare ha rilasciato due modelli nei primi giorni di ottobre che non scrivono nulla. Clef e Clef-flash leggono un input più una serie di domande tipizzate e restituiscono una probabilità per ogni risposta consentita. Niente prosa, niente catena di pensiero, niente token generati uno alla volta. Solo una scelta strutturata.

Sembra un passo indietro, finché non si guardano i numeri. Su BANKING77, un benchmark standard per la classificazione delle intenzioni, Clef ottiene un macro-F1 di 94,20 contro il 79,74 di Jev, il modello che ha introdotto la categoria dei modelli decisionali. Clef-flash, la versione più piccola da 9B, arriva a 90,93. Il divario di latenza è ancora più ampio. Clef-flash restituisce una risposta mediana in 38,8 millisecondi; Jev impiega 524,1 millisecondi. Cloudflare afferma che Clef batte Jev su sette dei dieci benchmark decisionali.

Entrambi i modelli sono distribuiti con licenza Apache 2.0 su Hugging Face ed entrambi sono compatibili con l'API di Jev, quindi i team che hanno già costruito attorno a Jev possono passare senza riscrivere le proprie integrazioni. Il thread su Hacker News ha raggiunto 602 punti e più di 200 commenti nel giro di un giorno.

Perché un modello più piccolo può vincere su un compito più ristretto

I modelli decisionali hanno una forma diversa dai chatbot a cui ricorre la maggior parte degli sviluppatori. Un modello linguistico di grandi dimensioni genera testo aperto. Un modello decisionale legge uno stato e un elenco di risposte ammesse, poi assegna un punteggio a ciascuna. La categoria è stata inaugurata da Typesafe AI con Jev, che ha dimostrato che i compiti di routing o di classificazione degli agenti non richiedono un modello generalista da 400B. Richiedono un output limitato, economico e veloce.

Clef di Cloudflare è costruito su Qwen3.8-27B e utilizza un'architettura prefill-only che valuta le scelte dello schema in parallelo invece di generare i token in sequenza. È qui che finisce la latenza. Un modello generalista deve emettere una risposta token dopo token; un modello decisionale deve solo leggere la domanda e pronunciarsi.

C'è anche una differenza di contesto che vale la pena notare. Clef accetta input multimodale entro una finestra di 64k token, coprendo testo, JSON, immagini e video. Jev gestisce solo testo, a 32k. Per un agente che instrada in base a uno screenshot o a un PDF, non è un vantaggio da poco.

La prima obiezione della community era quella giusta

Il rilievo più utile nella discussione su Hacker News non contestava i benchmark. Contestava l'etichetta. «Pesi aperti, non open source», ha scritto un commentatore. I pesi hanno una licenza permissiva, ma i dati di addestramento e la pipeline non sono stati pubblicati, quindi il modello non può essere riprodotto da zero.

Questa distinzione conta per chiunque debba decidere dove eseguirlo. Clef è stato addestrato a partire da un modello Qwen proprietario. I pesi sono liberi da scaricare e ospitare, il che è un risparmio reale, ma non sono verificabili come lo è il software open source. I team con politiche rigorose di revisione della supply chain dovrebbero leggere la licenza e la model card prima di dare per scontato che il tag Apache 2.0 chiuda la questione.

La stessa settimana, Amazon ne ha messo uno nel tuo portatile

Cloudflare non era da sola. Strands Labs di AWS ha pubblicato Strands Decider 2B, un modello decisionale aperto con pesi e script di addestramento, progettato per girare in locale e restituire scelte con punteggio di confidenza in decine o al massimo qualche centinaio di millisecondi. Cloudflare ha anche aggiunto un servizio di fine-tuning RL per i propri modelli decisionali su Workers AI.

Il pattern è un modello piccolo che fa bene un solo compito e gira vicino ai dati. Se puoi controllare una chiamata a uno strumento, verificare che una richiesta sia fondata o decidere se escalare, con un modello da 2B in 40 millisecondi, l'economia di far passare ogni passo di un agente attraverso un modello di frontiera inizia a sembrare uno spreco.

Un piccolo ingranaggio di ottone che si innesta con precisione in un ingranaggio di acciaio scuro molto più grande, sotto una luce direzionale calda

Il paradigma introdotto da Jev, e perché ci è voluto un anno per affermarsi

Jev di Typesafe AI fece un'affermazione facile da liquidare al momento del lancio: la maggior parte di ciò che gli agenti chiedono a un modello non è generazione, è classificazione. Instrada questo ticket, scegli questo strumento, decidi se questa azione richiede un'approvazione. Per questi compiti, un modello che scrive paragrafi fa molto più lavoro di quanto richieda il compito.

Jev ha dimostrato che l'approccio ristretto poteva battere un modello generalista sui suoi stessi benchmark. Quello che non è riuscito a fare è rendere la categoria urgente. Un singolo vendor che vende un solo modello decisionale è una curiosità. Il rilascio da parte di Cloudflare di una versione Apache 2.0 compatibile con l'API di Jev è una situazione diversa, perché ora chiunque può ospitarla, ispezionare la licenza e sostituirla senza riscrivere nulla. Amazon che arriva la stessa settimana con il proprio decider aperto trasforma una curiosità in una categoria.

I tempi coincidono con il modo in cui gli agenti vengono effettivamente costruiti. La prima generazione di framework per agenti instradava ogni passo attraverso un unico modello di grandi dimensioni perché era la soluzione più semplice. Man mano che questi sistemi entrano in produzione, i costi di routing diventano ciò che i team notano. Dividere il loop in un modello linguistico per le parti che richiedono linguaggio e un decider per quelle che non lo richiedono è la soluzione ovvia, e ci è voluto il rilascio aperto di un buon decider per renderla praticabile.

Il lato del fine-tuning

Cloudflare ha anche aggiunto un servizio di fine-tuning RL per i propri modelli decisionali su Workers AI, il che indica dove andrà la categoria in futuro. Un decider generico è utile. Un decider messo a punto sul tuo storico di routing, sulle tue regole di escalation e sulla tua nozione di ambito è più utile, perché impara il confine che conta per il tuo business.

È anche la parte che dovrebbe rendere i team prudenti. Un decider messo a punto codifica le vostre decisioni passate, comprese quelle sbagliate. Se il vostro team approvava rimborsi che avrebbe dovuto escalare, il modello imparerà quel pattern e lo applicherà più velocemente di quanto potrebbe mai fare un umano. La calibrazione taglia in entrambe le direzioni.

Dove si colloca in una pipeline di agenti

Immaginate un agente di supporto che gestisce un rimborso. Prima di poter chiamare lo strumento di rimborso, qualcosa deve rispondere a domande come: questa richiesta rientra nell'ambito, l'account del cliente lo consente, serve un umano. Sono domande decisionali con un insieme fisso di risposte. Un modello decisionale può restituire le probabilità e l'agente agisce in base a una soglia.

Il profilo di costo è il punto centrale. Far passare ognuno di questi controlli attraverso un modello da 400B costa denaro a ogni chiamata e aggiunge centinaia di millisecondi di latenza. Scaricarli su un decider locale da 2B o 9B mantiene il modello di frontiera per le parti che richiedono davvero linguaggio: scrivere la risposta, riassumere un thread lungo, gestire un caso ambiguo. Sia i budget economici sia quelli di latenza si riducono.

C'è un però. Un modello decisionale restituisce una probabilità, e le probabilità possono sbagliare in modo sicuro di sé. Se automatizzate un'approvazione di rimborso su un punteggio di 0,92, avete spostato il rischio dalla formulazione del modello alla vostra soglia. La calibrazione, non l'accuratezza grezza, diventa il numero da tenere d'occhio. Latenza e costo sono facili da misurare; uno 0,9 ben calibrato lo è meno.

Cosa tenere d'occhio in seguito

Il tooling sta già seguendo i modelli. llama.cpp ha aggiunto il supporto per i modelli decisionali, e sia Perplexity sia Hugging Face stanno scommettendo nella stessa direzione. Se la categoria regge, la domanda interessante smette di essere quale modello decisionale vince un benchmark e diventa quali decisioni siete disposti ad affidare a una probabilità.

Per chi costruisce agenti, la mossa pratica è analizzare il loop e individuare i passi che non hanno mai avuto bisogno di testo fluente. Classificazione, routing, selezione degli strumenti e controlli pre-azione sono i candidati abituali. Sono i passi in cui una risposta da 40 millisecondi su un insieme fisso di scelte può sostituire una generazione lenta e costosa. Il resto dell'agente può restare sul modello che già usa.

Articoli correlati