Entscheidungsmodelle ersetzen still und leise das LLM im Agent-Loop

Cloudflare hat in den ersten Oktobertagen zwei Modelle veröffentlicht, die nichts schreiben. Clef und Clef-flash lesen eine Eingabe plus eine Reihe typisierter Fragen und geben für jede zulässige Antwort eine Wahrscheinlichkeit zurück. Keine Prosa, keine Gedankenkette, keine Token, die einzeln generiert werden. Nur eine strukturierte Auswahl.
Das klingt nach einer Verschlechterung, bis man sich die Zahlen ansieht. Bei BANKING77, einem Standard-Benchmark zur Intent-Klassifizierung, erreicht Clef einen Macro-F1 von 94,20 gegenüber 79,74 bei Jev, dem Modell, das die Kategorie der Entscheidungsmodelle eingeführt hat. Clef-flash, die kleinere 9B-Version, schafft 90,93. Die Latenzlücke ist noch größer. Clef-flash liefert eine mediane Antwort in 38,8 Millisekunden; Jev braucht 524,1 Millisekunden. Cloudflare sagt, Clef schlägt Jev bei sieben von zehn Entscheidungs-Benchmarks.
Beide Modelle erscheinen unter Apache 2.0 auf Hugging Face, und beide sind Jev-API-kompatibel, sodass Teams, die bereits auf Jev setzen, wechseln können, ohne ihre Integrationen neu zu schreiben. Der Hacker-News-Thread erreichte innerhalb eines Tages 602 Punkte und mehr als 200 Kommentare.
Warum ein kleineres Modell bei einer engeren Aufgabe gewinnen kann
Entscheidungsmodelle haben eine andere Form als die Chatbots, zu denen die meisten Entwickler greifen. Ein großes Sprachmodell generiert offenen Text. Ein Entscheidungsmodell liest einen Zustand und eine Liste zulässiger Antworten und bewertet dann jede einzelne. Die Kategorie wurde von Typesafe AI mit Jev begründet, das zeigte, dass Agenten-Routing oder Klassifizierungsaufgaben kein 400B-Allzweckmodell brauchen. Sie brauchen begrenzte, günstige, schnelle Ausgaben.
Cloudflares Clef basiert auf Qwen3.8-27B und verwendet eine Prefill-only-Architektur, die Schemaoptionen parallel bewertet, statt Token sequenziell zu generieren. Da geht die Latenz hin. Ein allgemeines Modell muss eine Antwort Token für Token ausgeben; ein Entscheidungsmodell muss nur die Frage lesen und sich festlegen.
Es gibt außerdem einen erwähnenswerten Kontextunterschied. Clef akzeptiert multimodale Eingaben innerhalb eines 64k-Token-Fensters, das Text, JSON, Bilder und Video abdeckt. Jev verarbeitet nur Text, bei 32k. Für einen Agenten, der anhand eines Screenshots oder einer PDF routet, ist das kein kleiner Vorteil.
Der erste Einwand der Community war der richtige
Der nützlichste Widerspruch in der Hacker-News-Diskussion stellte nicht die Benchmarks infrage. Er stellte das Label infrage. „Open Weights, nicht Open Source“, schrieb ein Kommentator. Die Gewichte tragen eine permissive Lizenz, aber die Trainingsdaten und die Pipeline wurden nicht veröffentlicht, sodass das Modell nicht von Grund auf reproduziert werden kann.
Diese Unterscheidung ist wichtig für alle, die entscheiden, wo sie das betreiben. Clef wurde auf Basis eines proprietären Qwen-Ausgangspunkts trainiert. Die Gewichte können frei heruntergeladen und gehostet werden, was eine echte Kostenersparnis ist, aber sie sind nicht so auditierbar wie Open-Source-Software. Teams mit strengen Richtlinien zur Lieferkettenprüfung sollten die Lizenz und die Modellkarte lesen, bevor sie annehmen, das Apache-2.0-Label kläre die Frage.
In derselben Woche brachte Amazon eines auf Ihren Laptop
Cloudflare war nicht allein. AWS' Strands Labs veröffentlichte Strands Decider 2B, ein offenes Entscheidungsmodell mit Gewichten und Trainingsskripten, das lokal ausgeführt werden kann und konfidenzbewertete Auswahlmöglichkeiten in wenigen Dutzend bis zu einigen Hundert Millisekunden zurückgibt. Cloudflare fügte außerdem einen RL-Fine-Tuning-Dienst für seine Entscheidungsmodelle auf Workers AI hinzu.
Das Muster ist ein kleines Modell, das eine Aufgabe gut erledigt und nahe an den Daten läuft. Wenn Sie einen Tool-Aufruf absichern, überprüfen können, ob eine Anfrage fundiert ist, oder entscheiden können, ob eskaliert werden soll, und das mit einem 2B-Modell in 40 Millisekunden, dann beginnen die Kosten, einen Agenten für jeden Schritt durch ein Frontier-Modell zu routen, verschwenderisch auszusehen.

Das Paradigma, das Jev eingeführt hat, und warum es ein Jahr brauchte, um sich durchzusetzen
Jev von Typesafe AI stellte bei seinem Start eine Behauptung auf, die leicht abzutun war: Das meiste, was Agenten ein Modell tun lassen, ist keine Generierung, sondern Klassifizierung. Dieses Ticket routen, dieses Tool auswählen, entscheiden, ob diese Aktion eine Genehmigung braucht. Für diese Aufgaben leistet ein Modell, das Absätze schreibt, weit mehr Arbeit als die Aufgabe erfordert.
Jev bewies, dass der enge Ansatz ein allgemeines Modell in seinen eigenen Benchmarks schlagen konnte. Was es nicht schaffte, war, die Kategorie dringlich erscheinen zu lassen. Ein einzelner Anbieter, der ein Entscheidungsmodell verkauft, ist eine Kuriosität. Dass Cloudflare eine Apache-2.0-Version ausliefert, die mit Jevs API kompatibel ist, ist eine andere Situation, denn jetzt kann jeder sie hosten, die Lizenz prüfen und sie ohne Neuimplementierung austauschen. Dass Amazon in derselben Woche mit einem eigenen offenen Decider auftaucht, macht aus einer Kuriosität eine Kategorie.
Der Zeitpunkt passt dazu, wie Agenten tatsächlich gebaut werden. Die erste Generation von Agenten-Frameworks leitete jeden Schritt durch ein großes Modell, weil das am einfachsten war. Während diese Systeme in die Produktion gehen, werden die Routing-Kosten zu dem, was Teams bemerken. Die Schleife in ein Sprachmodell für die Teile, die Sprache brauchen, und einen Decider für die Teile, die keine brauchen, aufzuteilen, ist die naheliegende Lösung, und es brauchte die offene Veröffentlichung eines guten Deciders, um sie praktikabel zu machen.
Der Fine-Tuning-Aspekt
Cloudflare fügte außerdem einen RL-Fine-Tuning-Dienst für seine Entscheidungsmodelle auf Workers AI hinzu, was zeigt, wohin die Kategorie als Nächstes geht. Ein generischer Decider ist nützlich. Ein Decider, der auf Ihre eigene Routing-Historie, Ihre eigenen Eskalationsregeln und Ihr eigenes Verständnis von Zuständigkeit feinabgestimmt ist, ist nützlicher, weil er die Grenze lernt, die für Ihr Geschäft wichtig ist.
Das ist auch der Teil, der Teams vorsichtig machen sollte. Ein feinabgestimmter Decider kodiert Ihre vergangenen Entscheidungen, einschließlich der schlechten. Wenn Ihr Team früher Rückerstattungen genehmigt hat, die es hätte eskalieren sollen, wird das Modell dieses Muster lernen und es schneller anwenden, als ein Mensch es je könnte. Kalibrierung schneidet in beide Richtungen.
Wo das in eine Agenten-Pipeline passt
Stellen Sie sich einen Support-Agenten vor, der eine Rückerstattung bearbeitet. Bevor er das Rückerstattungs-Tool aufrufen kann, muss etwas Fragen wie diese beantworten: Liegt diese Anfrage im Zuständigkeitsbereich, erlaubt das Kundenkonto dies, braucht das einen Menschen. Das sind Entscheidungsfragen mit einer festen Antwortmenge. Ein Entscheidungsmodell kann die Wahrscheinlichkeiten zurückgeben, und der Agent handelt anhand eines Schwellenwerts.
Das Kostenprofil ist der Punkt. Jede dieser Prüfungen durch ein 400B-Modell zu routen kostet Geld pro Aufruf und fügt Hunderte Millisekunden Latenz hinzu. Sie an einen lokalen 2B- oder 9B-Decider auszulagern, behält das Frontier-Modell für die Teile, die tatsächlich Sprache brauchen: die Antwort schreiben, einen langen Thread zusammenfassen, einen mehrdeutigen Fall bearbeiten. Budgets und Latenzbudgets schrumpfen beide.
Es gibt einen Haken. Ein Entscheidungsmodell gibt eine Wahrscheinlichkeit zurück, und Wahrscheinlichkeiten können auf selbstsichere Weise falsch sein. Wenn Sie eine Rückerstattungsgenehmigung anhand eines Werts von 0,92 automatisieren, haben Sie das Risiko von der Formulierung des Modells auf Ihren Schwellenwert verlagert. Die Kalibrierung, nicht die rohe Genauigkeit, wird zur Zahl, die man im Auge behalten muss. Latenz und Kosten sind leicht zu messen; eine gut kalibrierte 0,9 ist schwieriger.
Was als Nächstes zu beobachten ist
Die Tooling-Landschaft folgt den Modellen bereits. llama.cpp hat Unterstützung für Entscheidungsmodelle hinzugefügt, und Perplexity und Hugging Face setzen beide Wetten in dieselbe Richtung. Wenn die Kategorie Bestand hat, ist die interessante Frage nicht mehr, welches Entscheidungsmodell einen Benchmark gewinnt, sondern welche Entscheidungen Sie einer Wahrscheinlichkeit überlassen wollen.
Für Agenten-Entwickler besteht der praktische Schritt darin, die Schleife zu prüfen und die Schritte zu finden, die nie fließenden Text gebraucht haben. Klassifizierung, Routing, Tool-Auswahl und Prüfungen vor Aktionen sind die üblichen Kandidaten. Das sind die Schritte, bei denen eine 40-Millisekunden-Antwort über eine feste Auswahlmenge eine langsame, teure Generierung ersetzen kann. Der Rest des Agenten kann bei dem Modell bleiben, das er bereits verwendet.
Verwandte Artikel
Ein Halbhumanoid auf Rädern erledigte eine Stunde Wäsche ohne Hilfe
Einzelne Aufgaben können erfolgreich sein, während ein Workflow trotzdem scheitert. Dyna hat die Kennzahl geändert.
LTX 2.5 will deinen blockigen Blender-Entwurf in eine fertige Einstellung verwandeln
Du hast keine Kontrolle darüber, was im Text-zu-Video passiert. Das hier versucht, das zu beheben.
ServiceNow macht aus Agenten-Fehlern Trainingsdaten
Generierung ohne Verifikation ist Rauschen. Die Gates sind das Produkt.
Ein Framework für Sprache und Vision: Horizons offenes 1,6-Milliarden-Modell
Eine Wette darauf, dass die Brücken zwischen Sprache und Vision nie nötig waren.