← Zurück zum Blog
Aica. 7 Min. Lesezeit

Ein Modell, das sich weigert, Sätze zu schreiben, verarbeitet jetzt eine Billion Token pro Tag

Veröffentlicht 5. Okt. 2026
Ein Modell, das sich weigert, Sätze zu schreiben, verarbeitet jetzt eine Billion Token pro Tag

TypeSafe AI lieferte Jev am 15. September 2026 aus und nahm die Warteliste am 27. September offline. Das Versprechen ist so eng gefasst, dass es zunächst wie ein Tippfehler klingt: Jev generiert keinen Text. Man sendet ihm einen Zustand und eine Reihe typisierter Fragen, und es liefert Antworten aus einem Schema zurück, das man im Voraus definiert hat – jede mit einer Wahrscheinlichkeit und einem Konfidenzwert.

Drei Primitive decken ab, was es beantwortet. Choice wählt eine Option aus einer von Ihnen vorgegebenen Liste. Score bewertet die Eingabe anhand geordneter beschreibender Stufen. Noul beantwortet eine Ja-oder-Nein-Frage mit der Wahrscheinlichkeit, dass die Antwort Ja lautet.

Das ist das gesamte Produkt. Kein Chat, keine Absätze, kein Markdown, keine Entschuldigungen dafür, eine KI zu sein.

Warum überhaupt jemand das wollen würde

Diogo Almeida gründete TypeSafe AI und arbeitete zuvor bei OpenAI an den Instruction-Following-Methoden, die das Verhalten von ChatGPT geprägt haben. Er verließ das Unternehmen 2024. Sein Argument ist seitdem konstant: Eine Chat-Oberfläche hat die falsche Form für Software. Code will keinen Satz zurück. Er will einen Wert, auf den er verzweigen kann.

Wer schon einmal ein LLM in ein Produktivsystem eingebunden hat, erkennt den Schmerz, den er beschreibt. Man bittet ein Modell, ein Support-Ticket zu klassifizieren, und bekommt einen freundlichen Absatz zurück, der mit der Klassifizierung beginnt und mit dem Angebot endet, weiterzuhelfen. Dann schreibt man einen Regex. Dann ändert das Modell seine Formatierung, und der Regex bricht. Dann fügt man einen JSON-Modus hinzu, und gelegentlich ist das JSON fehlerhaft. Das Modell war nie der fragile Teil. Die Schnittstelle war es.

Jev umgeht das, indem es die Generierung vollständig entfernt. Es verwendet einen parallelen Sampler statt autoregressiver Token-Generierung, was bedeutet, dass die möglichen Ausgaben vor dem Inferenzlauf enumeriert werden. Schema-Konformität ist nicht länger etwas, auf das man hofft, sondern etwas, das die Architektur garantiert. TypeSafe nennt für die Ende-zu-Ende-Latenz eigene Zahlen zwischen 70 und 500 Millisekunden.

Eine Reihe kleiner Messinghebel in einer mattschwarzen Konsole unter warmem Licht

Das Unternehmen trainierte es mit einer Methode, die es Reinforcement Learning for Calibrated Decisions nennt. Die Betonung liegt auf dem Wort kalibriert. Ein Konfidenzwert ist nur nützlich, wenn 0,85 tatsächlich bedeutet, dass in etwa 85 Prozent der Fälle die Antwort so ausfällt, und die meisten Sprachmodelle sind notorisch optimistisch, was ihre eigenen Antworten angeht. Wenn Ihre Anwendung oberhalb eines Schwellenwerts automatisch handeln und unterhalb davon an einen Menschen eskalieren soll, ist Kalibrierung kein Bonus mehr, sondern das gesamte Design.

Es gibt eine zweite Eigenschaft, die im Produktivbetrieb genauso wichtig ist und leicht übersehen wird. Weil der Ausgaberaum vor dem Aufruf feststeht, liefern zwei Läufe mit demselben Zustand und denselben Fragen dieselbe Antwort. Reproduzierbarkeit ist das, von dem die meisten Teams erst nach einer Incident-Review merken, dass sie es brauchen – wenn jemand fragt, warum das System ein bestimmtes Ticket vor drei Wochen auf eine bestimmte Weise geroutet hat und niemand es rekonstruieren kann. Ein Entscheidungsmodell macht diese Frage beantwortbar.

Die Adoptionskurve wurde schnell seltsam

Vercel fügte Jev am zweiten Tag seinem AI Gateway hinzu und meldete anschließend, es sei das am schnellsten übernommene Modell in der Geschichte des Gateways geworden. Fast 13 Prozent der bezahlten Teams nutzten es innerhalb von 24 Stunden – etwa doppelt so viel wie die GPT-5.6-Familie und mehr als sechsmal so viel wie Fable 5.1. Netlify folgte. LangChain lieferte TypeSafeClassifier-Integrationen mit Modell-Routing und Middleware, die Tool-Aufrufe vor der Ausführung prüft. Innerhalb weniger Tage erschienen fünf unabhängige Elixir-Clients – eine Art Detail, das verrät, dass Entwickler bereits nach genau dieser Form von Sache gesucht hatten.

Die Skalenzahlen sind schwerer zu ignorieren. Almeida sagte dem Wall Street Journal, Jev verarbeite etwa eine Woche nach dem Start rund eine Billion Token pro Tag, und etwa ein Viertel der Fortune-500-Unternehmen nutze es. The Information berichtete, TypeSafe verhandle eine Runde mit einem Zielvolumen von 1 Milliarde US-Dollar oder mehr, wobei einige interessierte Investoren das Unternehmen mit über 10 Milliarden US-Dollar bewerten. Almeida lehnte eine Stellungnahme zum Finanzierungsbericht ab.

Die Kostenstruktur erklärt einen Teil der Anziehungskraft. Der Input kostet 0,042 US-Dollar pro Million Token, der Output ist kostenlos, und das Kontextfenster umfasst 32.000 Token. Verglichen damit, einen Klassifizierungsjob durch ein Frontier-Modell zu leiten, ist die Rechnung nicht mehr knapp.

Wo das Ganze tatsächlich standhält

Die von TypeSafe veröffentlichten Workflow-Evaluierungen setzen Jev bei vier internen Aufgaben auf Augenhöhe mit Modellen der Sonnet-Klasse, was die Genauigkeit angeht, bei einem Bruchteil von Latenz und Kosten – während es hinter der stärksten Frontier-Konfiguration um 6,3 Punkte zurückliegt. Die Leistung unterscheidet sich je nach Aufgabe: 76,0 Prozent bei der Klassifizierung von Kundenservice-Anfragen, 61,8 Prozent bei der Rechnungsverarbeitung.

Das Unternehmen ist außerdem ungewöhnlich direkt dabei, wofür Jev nicht eingesetzt werden sollte. Die Dokumentation warnt davor, es für Arithmetik, Datumsvergleiche oder das Zählen über einen großen, verrauschten Zustand hinweg zu verwenden, und rät Teams, diese Logik in gewöhnlichem Code zu belassen und an eine versionierte Modell-ID statt an einen floatenden Alias zu binden.

Diese Anleitung weist auf die ehrliche Grenze der Kategorie hin. Jev ist ein Klassifikator mit einer viel besseren Schnittstelle und Sprachverständnis auf Kontextebene, und er zielt auf Arbeit, die bereits strukturiert war: ein Ticket an die Buchhaltung oder den technischen Support routen, ein Missbrauchssignal bewerten, den Tool-Aufruf eines Agenten absichern, bevor er downstream Geld ausgibt, Suchergebnisse ranken. An diesen Stellen ersetzt es einen teuren Reranker oder einen prompt-engineerten Frontier-Aufruf, und der Ersatz ist deutlich schneller und günstiger.

Die Konkurrenz kam innerhalb von drei Wochen

Eine Kategorie, die so offensichtlich ist, bleibt nicht ruhig. Cloudflare lieferte am 1. Oktober Clef und Clef-flash aus – zwei offene Entscheidungsmodelle unter Apache 2.0, die auf Qwen 3.8-27B bzw. einem 9B-Backbone aufbauen. Sie akzeptieren dieselbe Anfrageform, ergänzen Vision-Input und ein Kontextfenster von 65.536 Token und kommen mit einem RL-Fine-Tuning-Service. Cloudflares eigene Latenzzahlen setzen Clef-flash bei einem Median von 38,8 Millisekunden an, gegenüber 524,1 Millisekunden bei Jev – eine Differenz, die groß genug ist, um für alles in einem Anfragepfad relevant zu sein. OpenAIs Protokollarbeit und Cloudflares Launch stützten sich beide auf dieselbe Idee, und Clef wurde so entworfen, dass Code, der für Jev geschrieben wurde, weiter funktioniert.

Fastino Labs lieferte GLiDE und GLiNER2.5-Decide im selben Zeitfenster aus. Auch offene Repliken erschienen: Jeff v1.1 fine-tuned Qwen3.5 und Gemma 4 zu Entscheidungsmodellen mit 0,8B und 2B, die auf einer Workstation-GPU in 22 bis 28 Millisekunden antworten. Es gibt einen erwähnenswerten Vorbehalt, den MarkTechPost anbrachte: Fastinos Vergleiche laufen gegen eigene Test-Suites und eine offene Reproduktion von Jev statt gegen TypeSafe gehostetes Modell, sodass herstellerübergreifende Zahlen kein sauberes Ranking sind.

Nichts davon löscht aus, was TypeSafe etabliert hat. Das Unternehmen gab einer Spaltung einen Namen, die sich über ein Jahr lang langsam herausgebildet hatte – zwischen Modellen, die Sprache für Menschen generieren, und Modellen, die Entscheidungen für Software zurückgeben. Sobald die zweite Kategorie eine Anfrageform und einen Preis pro Million Token hat, ist sie keine Forschungskuriosität mehr, sondern wird zur Budgetposition.

Was man damit anfangen sollte

Die praktische Frage für ein Team ist wenig glamourös. Schauen Sie sich an, wofür Sie derzeit ein Frontier-Modell bezahlen, und zählen Sie, wie viele dieser Aufrufe damit enden, dass Code einen einzelnen Wert aus einer Antwort liest, für deren Generierung Sie Token ausgegeben haben. Ticket-Routing, Moderations-Gates, Lead-Scoring, Relevanz-Ranking, Tool-Call-Genehmigung. Jeder davon ist ein Kandidat für eine Verlagerung.

Der Grund zu wechseln hat nichts damit zu tun, dass ein Entscheidungsmodell klüger wäre. Die Schnittstelle hört einfach auf, gegen Sie zu arbeiten. Sie senden einen Zustand, Sie bekommen eine begrenzte Antwort mit einer angehängten kalibrierten Wahrscheinlichkeit zurück, und Ihr Code verzweigt. Unterhalb des Schwellenwerts eskalieren, oberhalb handeln und die Arithmetik im Code lassen, wo sie hingehört.

Es gibt auch ein Kostenargument, und es ist das, das Finanzteams vorbringen werden. Die Ausgabe eines Entscheidungsmodells umfasst ein paar Hundert Bytes statt eines Absatzes, und Output-Token sind der Punkt, an dem Frontier-Preise am meisten wehtun. Ein Routing-Aufruf, der bei 0,042 US-Dollar pro Million Input-Token mit kostenlosem Output Bruchteile eines Cents kostet, verwandelt eine Budgetposition, die eine Rechtfertigung brauchte, in eine, die keine braucht.

Das ist ein kleineres Versprechen als „Reasoning“, und es passt genauer zu dem, was die meisten Produktivsysteme ohnehin schon aus einem Sprachmodell herauszuholen versuchten.

Verwandte Artikel