← Retour au blog
AiEnviron 10 min de lecture

Le goulot d'étranglement n'est plus le modèle, mais l'état manquant du workflow

Publié le 7 oct. 2026
Le goulot d'étranglement n'est plus le modèle, mais l'état manquant du workflow

--- title: Le goulot d'étranglement n'est plus le modèle, mais l'état manquant du workflow slug: the-bottleneck-is-no-longer-the-model-but-the-missing-workflow-state meta_title: Pourquoi les agents à long horizon ont besoin de l'état du workflow meta_description: Zeroset a levé 5,2 millions de dollars pour Nebula, une couche d'état qui permet aux agents d'interroger la façon dont une entreprise achemine réellement les approbations et les passations. category: ai tags: Zeroset,Nebula,mémoire d'agent,état de workflow,Gradient Ventures,agents à long horizon,IA d'entreprise,exploration de processus,LongMemEval,contexte ---

Un pré-amorçage de 5,2 millions de dollars n'est pas un montant élevé. L'affirmation attachée à celle de Zeroset mérite plus d'attention que le chèque : ce qui bloque les agents d'entreprise n'est pas la capacité du modèle, mais l'absence d'un système d'état.

Akshat Kannan a quitté Stanford à 18 ans. William Zhang a quitté l'Université du Texas à 21 ans. Ils ont fondé Zeroset en janvier 2026 autour d'une observation précise. Les modèles de pointe gèrent déjà les brouillons d'e-mails et les recherches de vols. Ils calent lorsqu'une tâche exige de savoir comment une entreprise spécifique achemine les approbations, les exceptions et les passations.

Le 6 octobre, Gradient Ventures et 2048 Ventures ont co-dirigé un pré-amorçage de 5,2 millions de dollars, avec la participation de Leblon Capital. L'entreprise compte cinq personnes, et l'accès reste une préversion de recherche fermée.

Ce que Nebula stocke

Nebula se connecte aux systèmes qu'un workflow utilise déjà : Microsoft 365, SharePoint, Outlook, Teams, GitHub et la messagerie professionnelle. Il ne traite pas chaque document comme un vecteur isolé. Il construit un graphe vectoriel hiérarchique à trois couches : les faits sémantiques, les clusters d'événements épisodiques et les habitudes procédurales.

Quatre cubes de verre dépoli translucides empilés en tour étagée sur une surface de pierre pâle, lumière douce du jour qui les traverse

La distinction avec un stockage de mémoire réside dans ce que l'agent récupère. Plutôt que de reconstruire l'historique, il interroge l'état actuel d'un workflow. L'entreprise décrit le résultat comme un état typé et interrogeable avec traçabilité : ce qui est vrai, quand cela est devenu vrai, et pourquoi le système le croit.

Les benchmarks sont précoces mais spécifiques. Sur LongMemEval, Nebula a obtenu une précision supérieure de 20 % à celle de Mem0, de Supermemory et du RAG naïf, avec une médiane inférieure à 50 millisecondes et moins de tokens par requête. Sur les jeux de données d'exploration de processus du BPI Challenge, il a dépassé toutes les références enregistrées pour la prédiction de l'activité suivante de plus de 10 %, ce qui est un test plus difficile que la récupération, car il demande si le système peut anticiper la prochaine étape légitime.

Le nombre de tokens compte autant que la précision. Moins de tokens par requête signifie qu'une fenêtre de contexte plus petite peut transporter la même information, ce qui réduit le coût à chaque tour de l'agent. Pour un workflow qui dure une semaine, cette différence s'accumule de la même manière que les erreurs.

L'observation initiale des fondateurs est l'énoncé le plus précis du problème. Les modèles de pointe gèrent les brouillons d'e-mails et les recherches de vols. Ils calent lorsqu'une tâche exige de savoir comment une entreprise spécifique achemine les approbations, les exceptions et les passations. Rien ne cloche dans le modèle dans ce scénario. L'information n'est simplement pas dans le prompt et ne peut pas être récupérée dans un corpus public.

La surface d'intégration est le véritable rempart

Se connecter à Microsoft 365, SharePoint, Outlook, Teams, GitHub et à la messagerie professionnelle est un travail peu glamour, et c'est aussi la partie la plus difficile à copier. Un concurrent peut reproduire une conception de graphe à trois couches en un trimestre. Reproduire les connecteurs sensibles aux permissions qui maintiennent une couche d'état cohérente avec ce que chaque utilisateur est autorisé à voir prend bien plus de temps, et les acheteurs d'entreprise l'évaluent en premier.

Les permissions sont la partie que la plupart des produits de mémoire gèrent mal. Une couche d'état de workflow doit respecter les mêmes limites d'accès que les systèmes sous-jacents, afin qu'un agent agissant pour un utilisateur ne puisse pas faire apparaître un fait qui ne devient visible qu'à un autre niveau de l'organisation. Se tromper sur ce point ne produit pas tant une mauvaise réponse qu'un incident de conformité.

Cela explique aussi pourquoi l'entreprise mène une préversion de recherche fermée plutôt qu'un produit en libre-service. Les couches d'état ne valent que par les workflows qu'elles ont vus, et chaque nouvelle intégration client fait apparaître des cas limites dans la logique d'acheminement qu'aucun benchmark ne couvre.

Ce que les acheteurs doivent demander avant d'adopter

Trois questions distinguent une couche d'état utile d'une démo. Le système enregistre-t-il quand chaque fait est devenu vrai, et peut-il invalider un fait qui a été remplacé ? Peut-il expliquer pourquoi il croit quelque chose, en remontant à l'événement source ? Applique-t-il les mêmes permissions que les systèmes depuis lesquels il lit ?

L'exigence de traçabilité est celle à laquelle on répond souvent vaguement. Une couche d'état qui renvoie un fait sans provenance est fonctionnellement un cache, et un cache obsolète à l'intérieur d'un agent autonome est pire que pas de mémoire du tout, car l'agent agira dessus avec confiance.

La persistance est la question de second ordre. Un état continu sur des jours ou des semaines constitue toute la proposition de valeur, et stocker autant de connaissances organisationnelles dérivées soulève une conversation sur la gouvernance des données concernant la conservation, la suppression et la résidence régionale.

Pourquoi un état obsolète s'accumule

Le mode de défaillance que l'entreprise nomme est la raison d'être de cette catégorie. Un fait obsolète ou une instruction contradictoire ne cause pas une seule erreur. Il devient l'état de départ du tour suivant, produisant un retravail cumulatif, des appels d'outils supplémentaires et une intervention humaine.

L'accumulation est ce qui le rend coûteux. Une seule action erronée est récupérable. Une hypothèse erronée qui persiste tout au long d'un processus en vingt étapes corrompt chaque étape suivante, et le temps que quelqu'un s'en aperçoive, le travail doit être refait à partir d'un point de contrôle antérieur. Les agents qui fonctionnent sans surveillance pendant des heures aggravent la situation, car personne ne surveille la dérive.

Les systèmes de mémoire conversationnelle récupèrent des fragments similaires. Si le fait récupéré a trois semaines et que le workflow a évolué, l'agent raisonne à partir d'un monde qui n'existe plus, et rien dans la réponse ne signale la discordance. La similarité de récupération et l'actualité factuelle sont des propriétés différentes, et un stockage vectoriel optimise la première.

Le graphe à trois couches de Nebula est une tentative de donner à l'agent un moyen de les distinguer. Les faits sémantiques décrivent ce qui est vrai. Les clusters d'événements épisodiques décrivent ce qui s'est passé. Les habitudes procédurales décrivent comment l'organisation fait habituellement les choses. La traçabilité est l'élément qui le rend auditable : le fait, quand il est devenu vrai, et pourquoi le système le croit.

Où cela s'inscrit

Mem0 et Zep occupent la catégorie adjacente de l'infrastructure de mémoire. Le pari de Zeroset est que les agents d'entreprise à long horizon ont besoin d'un état de processus plutôt que d'une mémoire conversationnelle, et la distinction compte pour tout ce qui s'étend sur des jours ou des semaines à travers les frontières des systèmes : traitement des sinistres, approbations de versions, achats en plusieurs étapes.

Ces processus partagent une structure. Ils impliquent des passations entre personnes et systèmes, des exceptions qui suivent des règles non écrites, et des approbations qui dépendent de qui est disponible. Rien de tout cela ne vit dans un document. Cela vit dans la pratique, ce qui explique pourquoi il a été difficile de le représenter.

L'exploration de processus est l'antériorité la plus proche, et il est révélateur que Zeroset se compare à des jeux de données d'exploration de processus. Ce domaine a passé deux décennies à reconstruire la manière dont le travail circule réellement à partir de journaux d'événements. Faire la même chose en temps réel, pour qu'un agent puisse l'interroger en cours de tâche, est une évolution raisonnable.

La thèse publiée de Gradient avance le même argument. Les agents grand public ont réussi parce qu'ils ont été entraînés sur le web public. Les agents d'entreprise manquent encore d'une représentation de la manière dont le travail circule réellement au sein d'une organisation privée.

Ce qui change si cela fonctionne

Deux choses. Les harnais d'agents cessent de fournir des fenêtres de contexte toujours plus grandes pour compenser une structure manquante, car le problème n'a jamais été la taille de la fenêtre. Et les entreprises peuvent garder le modèle opérationnel de leurs propres workflows à l'intérieur de leur propre périmètre, plutôt que d'espérer qu'un modèle général finisse par l'inférer.

La seconde conséquence est la plus stratégique. Une représentation de workflow qui vit à l'intérieur du périmètre d'une entreprise est un actif que l'entreprise possède. Celle inférée par un modèle général est une capacité qu'elle loue. Pour les industries réglementées, cette différence décide si un agent peut être déployé ou non.

Il existe un risque concurrentiel qu'il faut nommer. Si un grand fournisseur de plateforme décide que l'état de processus appartient à sa suite, une startup de cinq personnes fait face à un problème de distribution, quelle que soit la qualité de la couche d'état. L'implication de Gradient aide, et la distribution n'est pas quelque chose qu'un tour de 5,2 millions de dollars résout.

Les chiffres actuels sont modestes : cinq personnes, deux benchmarks publics, une préversion fermée. L'affirmation est plus large, et elle est testable. Si l'automatisation d'entreprise a dépassé le stade de la capacité, le prochain cycle de concurrence porte sur qui sait ce qu'est réellement le travail.

Articles associés