← Zurück zum Blog
Aica. 7 Min. Lesezeit

Der Engpass ist nicht länger das Modell, sondern der fehlende Workflow-Zustand

Veröffentlicht 7. Okt. 2026
Der Engpass ist nicht länger das Modell, sondern der fehlende Workflow-Zustand

--- title: Der Engpass ist nicht länger das Modell, sondern der fehlende Workflow-Zustand slug: the-bottleneck-is-no-longer-the-model-but-the-missing-workflow-state meta_title: Warum Langhorizont-Agenten Workflow-Zustand brauchen meta_description: Zeroset hat 5,2 Millionen US-Dollar für Nebula eingesammelt, eine Zustandsschicht, mit der Agenten abfragen können, wie ein Unternehmen Genehmigungen und Übergaben tatsächlich weiterleitet. category: ai tags: Zeroset,Nebula,Agenten-Gedächtnis,Workflow-Zustand,Gradient Ventures,Langhorizont-Agenten,Enterprise-KI,Process Mining,LongMemEval,Kontext ---

Eine Pre-Seed-Finanzierung über 5,2 Millionen US-Dollar ist keine große Summe. Die Behauptung, die an Zerosets Runde hängt, verdient mehr Aufmerksamkeit als der Scheck: Was Enterprise-Agenten blockiert, ist nicht die Modellfähigkeit, sondern das Fehlen eines Zustandssystems.

Akshat Kannan verließ Stanford mit 18. William Zhang verließ die University of Texas mit 21. Sie gründeten Zeroset im Januar 2026 aufgrund einer eng gefassten Beobachtung. Frontier-Modelle bewältigen bereits E-Mail-Entwürfe und Flugsuche. Sie stocken, wenn eine Aufgabe erfordert zu wissen, wie ein bestimmtes Unternehmen Genehmigungen, Ausnahmen und Übergaben weiterleitet.

Am 6. Oktober führten Gradient Ventures und 2048 Ventures gemeinsam eine Pre-Seed-Runde über 5,2 Millionen US-Dollar an, mit Beteiligung von Leblon Capital. Das Unternehmen hat fünf Mitarbeiter, und der Zugang bleibt eine geschlossene Research-Preview.

Was Nebula speichert

Nebula verbindet sich mit den Systemen, die ein Workflow bereits nutzt: Microsoft 365, SharePoint, Outlook, Teams, GitHub und Workplace-Messaging. Es behandelt jedes Dokument nicht als isolierten Vektor. Es baut einen hierarchischen Vektor-Graphen mit drei Ebenen auf: semantische Fakten, episodische Ereigniscluster und prozedurale Gewohnheiten.

Vier durchscheinende, mattierte Glaswürfel, zu einem stufenförmigen Turm gestapelt, auf einer hellen Steinoberfläche, weiches Tageslicht fällt hindurch

Der Unterschied zu einem Gedächtnisspeicher liegt darin, was der Agent zurückbekommt. Statt Geschichte zu rekonstruieren, fragt er den aktuellen Zustand eines Workflows ab. Das Unternehmen beschreibt die Rückgabe als typisierten, abfragbaren Zustand mit Herkunftsnachweis: was wahr ist, wann es wahr wurde und warum das System es glaubt.

Die Benchmarks sind früh, aber konkret. Bei LongMemEval erzielte Nebula eine um 20 Prozent höhere Genauigkeit als Mem0, Supermemory und naives RAG, bei einem Median unter 50 Millisekunden und mit weniger Tokens pro Abfrage. Bei den Process-Mining-Datensätzen der BPI Challenge übertraf es alle aufgezeichneten Baselines bei der Vorhersage der nächsten Aktivität um mehr als 10 Prozent, was ein härterer Test als Retrieval ist, weil er fragt, ob das System den nächsten legitimen Schritt antizipieren kann.

Die Token-Anzahl ist ebenso wichtig wie die Genauigkeit. Weniger Tokens pro Abfrage bedeuten, dass ein kleineres Kontextfenster dieselbe Information tragen kann, was die Kosten bei jedem Agenten-Schritt senkt. Bei einem Workflow, der eine Woche läuft, summiert sich dieser Unterschied auf dieselbe Weise wie die Fehler.

Die Ausgangsbeobachtung der Gründer ist die prägnanteste Formulierung des Problems. Frontier-Modelle bewältigen E-Mail-Entwürfe und Flugsuche. Sie stocken, wenn eine Aufgabe erfordert zu wissen, wie ein bestimmtes Unternehmen Genehmigungen, Ausnahmen und Übergaben weiterleitet. In diesem Szenario ist nichts am Modell falsch. Die Information steht einfach nicht im Prompt und kann nicht aus einem öffentlichen Korpus abgerufen werden.

Die Integrationsfläche ist der eigentliche Burggraben

Die Anbindung an Microsoft 365, SharePoint, Outlook, Teams, GitHub und Workplace-Messaging ist wenig glamouröse Arbeit, und sie ist zugleich der am schwersten zu kopierende Teil. Ein Wettbewerber kann ein dreischichtiges Graph-Design in einem Quartal nachbauen. Die berechtigungsbewussten Konnektoren zu reproduzieren, die eine Zustandsschicht konsistent damit halten, was jeder Nutzer sehen darf, dauert viel länger, und Enterprise-Käufer bewerten dies zuerst.

Berechtigungen sind der Teil, den die meisten Gedächtnisprodukte schlecht handhaben. Eine Workflow-Zustandsschicht muss dieselben Zugriffsgrenzen respektieren wie die zugrunde liegenden Systeme, damit ein Agent, der für einen Nutzer handelt, keinen Fakt preisgeben kann, der erst auf einer anderen Ebene der Organisation sichtbar wird. Ein Fehler dabei erzeugt nicht so sehr eine falsche Antwort, sondern eher einen Compliance-Vorfall.

Es erklärt auch, warum das Unternehmen eine geschlossene Research-Preview statt eines Self-Service-Produkts betreibt. Zustandsschichten sind nur so gut wie die Workflows, die sie gesehen haben, und jede neue Kundenintegration bringt Edge Cases in der Routing-Logik ans Licht, die kein Benchmark abdeckt.

Was Käufer vor der Einführung fragen sollten

Drei Fragen trennen eine nützliche Zustandsschicht von einer Demo. Erfasst das System, wann jeder Fakt wahr wurde, und kann es einen Fakt invalidieren, der überholt wurde? Kann es erklären, warum es etwas glaubt, indem es bis zum Quellereignis zurückverfolgt? Erzwingt es dieselben Berechtigungen wie die Systeme, aus denen es liest?

Die Anforderung des Herkunftsnachweises ist diejenige, die tendenziell vage beantwortet wird. Eine Zustandsschicht, die einen Fakt ohne Herkunft zurückgibt, ist funktional ein Cache, und ein veralteter Cache in einem autonomen Agenten ist schlimmer als gar kein Gedächtnis, weil der Agent mit Zuversicht darauf handeln wird.

Persistenz ist die Frage zweiter Ordnung. Kontinuierlicher Zustand über Tage oder Wochen ist das gesamte Wertversprechen, und so viel abgeleitetes organisatorisches Wissen zu speichern, löst eine Data-Governance-Diskussion über Aufbewahrung, Löschung und regionale Speicherung aus.

Warum veralteter Zustand sich aufschaukelt

Der Fehlermodus, den das Unternehmen benennt, ist der Grund, warum die Kategorie existiert. Ein veralteter Fakt oder eine widersprüchliche Anweisung verursacht nicht einen einzelnen Fehler. Er wird zum Ausgangszustand für den nächsten Schritt, was zu sich aufschaukelnder Nacharbeit, zusätzlichen Tool-Aufrufen und menschlichem Eingreifen führt.

Die Kumulation ist es, was es teuer macht. Eine einzelne falsche Aktion ist behebbar. Eine falsche Annahme, die sich durch einen zwanzigstufigen Prozess hält, korrumpiert jeden Schritt danach, und wenn es jemand bemerkt, muss die Arbeit von einem früheren Checkpoint aus wiederholt werden. Agenten, die stundenlang unbeaufsichtigt laufen, verschlimmern dies, weil niemand die Drift beobachtet.

Konversationelle Gedächtnissysteme rufen ähnliche Chunks ab. Wenn der abgerufene Fakt drei Wochen alt ist und der Workflow sich weiterentwickelt hat, argumentiert der Agent aus einer Welt, die nicht mehr existiert, und nichts in der Antwort markiert die Diskrepanz. Retrieval-Ähnlichkeit und faktische Aktualität sind unterschiedliche Eigenschaften, und ein Vektorspeicher optimiert auf die erste.

Nebulas dreischichtiger Graph ist ein Versuch, dem Agenten eine Möglichkeit zu geben, sie auseinanderzuhalten. Semantische Fakten beschreiben, was wahr ist. Episodische Ereigniscluster beschreiben, was geschah. Prozedurale Gewohnheiten beschreiben, wie die Organisation Dinge üblicherweise erledigt. Der Herkunftsnachweis ist das Element, das es auditierbar macht: der Fakt, wann er wahr wurde und warum das System ihn glaubt.

Wo das einzuordnen ist

Mem0 und Zep besetzen die angrenzende Kategorie der Gedächtnisinfrastruktur. Zerosets Wette ist, dass Langhorizont-Enterprise-Agenten Prozesszustand statt konversationelles Gedächtnis brauchen, und der Unterschied ist wichtig für alles, was sich über Tage oder Wochen über Systemgrenzen hinweg erstreckt: Schadenbearbeitung, Release-Genehmigungen, mehrstufige Beschaffung.

Diese Prozesse teilen eine Struktur. Sie umfassen Übergaben zwischen Menschen und Systemen, Ausnahmen, die ungeschriebenen Regeln folgen, und Genehmigungen, die davon abhängen, wer verfügbar ist. Nichts davon lebt in einem Dokument. Es lebt in der Praxis, weshalb es schwer darzustellen war.

Process Mining ist der nächstliegende Stand der Technik, und es ist bezeichnend, dass Zeroset gegen Process-Mining-Datensätze benchmarkt. Dieses Feld verbrachte zwei Jahrzehnte damit, zu rekonstruieren, wie Arbeit tatsächlich aus Ereignisprotokollen fließt. Dasselbe in Echtzeit zu tun, sodass ein Agent es mitten in der Aufgabe abfragen kann, ist eine vernünftige Weiterentwicklung.

Die veröffentlichte These von Gradient argumentiert dasselbe. Consumer-Agenten waren erfolgreich, weil sie auf dem öffentlichen Web trainiert wurden. Enterprise-Agenten fehlt weiterhin eine Repräsentation davon, wie Arbeit tatsächlich innerhalb einer privaten Organisation fließt.

Was sich ändert, wenn es funktioniert

Zwei Dinge. Agenten-Harnesses liefern nicht länger immer größere Kontextfenster aus, um fehlende Struktur zu kompensieren, weil das Problem nie die Fenstergröße war. Und Unternehmen können das Betriebsmodell ihrer eigenen Workflows innerhalb ihrer eigenen Grenze behalten, statt zu hoffen, dass ein allgemeines Modell es irgendwann ableitet.

Die zweite Konsequenz ist die strategischere. Eine Workflow-Repräsentation, die innerhalb der Grenze eines Unternehmens lebt, ist ein Vermögenswert, den das Unternehmen besitzt. Eine von einem allgemeinen Modell abgeleitete ist eine Fähigkeit, die es mietet. Für regulierte Branchen entscheidet dieser Unterschied, ob ein Agent überhaupt eingesetzt werden kann.

Es gibt ein Wettbewerbsrisiko, das benannt werden sollte. Wenn ein großer Plattformanbieter entscheidet, dass Prozesszustand in seine Suite gehört, steht ein Fünf-Personen-Startup vor einem Distributionsproblem, unabhängig davon, wie gut die Zustandsschicht ist. Gradients Beteiligung hilft, und Distribution ist nichts, was eine 5,2-Millionen-Dollar-Runde löst.

Die Zahlen sind heute klein: fünf Mitarbeiter, zwei öffentliche Benchmarks, eine geschlossene Preview. Die Behauptung ist größer, und sie ist testbar. Wenn Enterprise-Automatisierung die Fähigkeitsphase hinter sich gelassen hat, geht es in der nächsten Wettbewerbsrunde darum, wer weiß, was die Arbeit tatsächlich ist.

Verwandte Artikel