Salesforce dote ses agents d'un runtime qui tourne pendant des semaines

Salesforce a annoncé le 5 octobre un nouveau portefeuille d'agents Agentforce à Dubaï et Riyad, et la plupart des articles se sont concentrés sur la liste. Casey gère le service client sur la voix, les SMS, WhatsApp et le chat web. Paige résout les demandes informatiques et RH. Carter aide les acheteurs à comparer des produits et à finaliser leur achat dans le chat. Piper qualifie les prospects entrants. Marshall orchestre les processus back-office et tient un registre d'audit. Fin exécute des workflows complexes d'expérience client. Hunter travaille sur les ventes sortantes, de la recherche à la prise de contact.
La liste est la partie la moins intéressante. Ce qui se trouve en dessous est un nouveau runtime à long horizon qui permet à un agent de poursuivre un objectif sur plusieurs jours et semaines plutôt que de s'arrêter à la fin d'une seule interaction.
C'est une catégorie de produit différente de celle que l'IA d'entreprise vendait jusqu'ici.
La différence entre répondre et accomplir
Un assistant conversationnel résout une question et termine son tour. Un agent sur un runtime à long horizon prend une instruction, la transforme en objectif mesurable, élabore un plan, puis travaille à l'atteindre tout en décidant quelles tâches accomplir, de quels outils il a besoin et où il doit s'arrêter pour faire intervenir un humain.
L'exemple de Salesforce est un vendeur qui demande à Hunter de sauver les affaires à risque avant la fin du trimestre. Hunter convertit cela en un plan et commence à l'exécuter, en s'arrêtant pour obtenir l'approbation du vendeur à des points définis.

Trois mécanismes rendent cela possible. La mémoire préserve le contexte et la progression entre les sessions, de sorte qu'un agent qui reprend le travail le lundi sait ce qu'il a fait le vendredi. L'exécution durable maintient un plan en cours et permet à un agent de reprendre ou de s'ajuster lorsque les circonstances changent. Le pilotage dynamique adapte le comportement en fonction des retours d'un utilisateur individuel.
C'est ce troisième point qui rend la conception intéressante. Un agent qui tourne pendant des semaines accumule un grand nombre de décisions, et la plupart seront erronées de façon mineure. Si le seul canal de retour est une correction qui réinitialise le plan, l'agent n'est pas durable. Le pilotage implique que l'agent ajuste son comportement en cours de route plutôt que de redémarrer.
Le problème de gouvernance passe au premier plan
Plus un agent tourne sans surveillance, plus la question de la responsabilité compte.
La réponse de Salesforce est à deux niveaux. Les humains restent impliqués partout où une approbation ou un jugement est requis, ce qui constitue le garde-fou classique. En dessous, Agent Script, un langage open source pour le comportement des agents, permet à une entreprise de combiner le raisonnement de l'IA avec des règles déterministes. L'objectif est un contrôle granulaire sur la manière dont un agent parvient à une décision, afin que les parties qui doivent suivre une politique puissent être écrites comme une politique plutôt qu'apprises.
Tout s'exécute à l'intérieur des autorisations et règles métier existantes du client, et chaque agent porte le nom que l'entreprise lui donne. La présentation vise à faire de l'agent une extension de la marque, ce qui est un argument marketing qui fait office de conformité.
Le registre d'audit compte aussi ici. Marshall est décrit comme en fournissant un pour chaque action. Pour un processus qui s'étend sur des semaines et touche plusieurs systèmes, une piste d'audit est le seul moyen pour un superviseur humain de passer en revue ce qui s'est passé sans rejouer toute l'exécution.
Les preuves que Salesforce met en avant
L'entreprise rapporte plus de 7 milliards d'unités de travail agentiques sur Agentforce et Slack, dont 3,2 milliards au cours du dernier trimestre. Des clients spécifiques sont nommés : Perk, où 60 % du pipeline commercial est désormais construit par son agent de prospection ; Autism Queensland, où 70 % des demandes administratives sont résolues par Paige ; Hibbett AI, qui a été mis en service en six semaines et gère désormais 90 % des parcours d'achat essentiels.
Hibbett est le chiffre sur lequel il faut s'attarder. Un déploiement retail qui atteint 90 % de couverture des parcours d'achat en six semaines est une affirmation sur la vitesse de configuration, et la vitesse de configuration est là où les projets d'agents d'entreprise ont historiquement échoué. La plupart s'enlisent dans l'intégration, pas dans la capacité.
Les clients nommés sont aussi choisis pour faire passer un message sur l'acheteur. Une métrique de génération de pipeline parle à un responsable commercial. Une métrique de demandes administratives parle à un acheteur du secteur public ou de la santé. Les études de cas constituent la segmentation.
Connecté au système de référence, qui constitue la véritable barrière défensive
Les agents s'exécutent sur Customer 360, ce qui signifie qu'ils opèrent avec le contexte client, les données et les processus métier qu'une entreprise possède déjà dans Salesforce.
C'est un avantage de distribution déguisé en détail technique. Un concurrent peut construire un agent qui fait de la recherche de prospection. En construire un qui connaît déjà l'historique du compte, les opportunités ouvertes et les tickets de support est une proposition différente, et elle n'est pas accessible à un fournisseur qui ne dispose pas des enregistrements sous-jacents.
Le compromis est celui que l'on connaît. Les gains liés à la proximité avec le système de référence s'accompagnent d'une dépendance à son égard, et une entreprise qui fait tourner ses agents commerciaux sur Agentforce a rendu son choix de CRM plus coûteux à inverser.
En quoi cela diffère des autres agents toujours actifs
Salesforce n'est pas la seule entreprise à livrer des agents qui fonctionnent sans prompt.
Les Dots d'OpenAI fonctionnent en continu en arrière-plan pour atteindre des objectifs définis par l'utilisateur, connectés à des milliers d'applications, chaque agent tournant sur son propre ordinateur cloud privé. L'agent Muse de Meta adopte une position similaire. L'idée commune est que l'agent porte un objectif plutôt que de répondre à une question.
La différence dans la version de Salesforce est la surface de départ. Dots commence par un objectif et un ensemble d'applications connectées. Agentforce commence par une fiche client, un cas, une opportunité ou une commande, parce qu'il est lié à Customer 360. Cela réduit ce sur quoi l'agent peut travailler et approfondit ce qu'il sait à ce sujet.
Pour les entreprises, la version étroite est souvent la plus utile. Un agent général qui peut toucher à tout est plus difficile à autoriser qu'un agent spécifique qui travaille à l'intérieur d'un système que l'entreprise gouverne déjà. Le modèle de permissions est hérité plutôt qu'inventé.
La question tarifaire sous-jacente à la persistance
Un agent qui garde un plan ouvert pendant un mois coûte de l'argent d'une manière que ne fait pas un modèle requête-réponse.
Le stockage de l'état du plan, la mémoire entre les sessions, la surveillance d'un agent censé alerter lorsqu'il a besoin d'une approbation, et les appels au modèle eux-mêmes s'accumulent pour un workflow qui peut ou non produire un résultat. Le coût d'un assistant conversationnel se mesure par échange. Le coût d'un agent toujours actif se mesure par unité de temps et par unité de travail. Ces deux chiffres ne concordent pas, c'est pourquoi les clients nommés comptent plus que la liste de fonctionnalités. Perk, Autism Queensland et Hibbett décrivent tous des résultats qu'une équipe finance peut déjà chiffrer : pipeline généré, demandes administratives résolues, parcours d'achat traités. Un agent qui remplace un coût connu est facile à justifier. Un agent qui crée une nouvelle catégorie de coût ne l'est pas.
Ce qu'il faut surveiller
Trois choses détermineront si le runtime à long horizon est un produit ou une démo.
La première est le comportement en cas d'échec sur la durée. Un plan qui dérive sur deux mois est plus difficile à diagnostiquer qu'un plan qui échoue en une session, et Salesforce n'a pas décrit ce qui se passe lorsqu'un agent poursuit un objectif qu'il aurait dû abandonner des semaines plus tôt.
La deuxième est de savoir si Agent Script est adopté en dehors de Salesforce. Un langage open source pour le comportement des agents n'est utile qu'à un client qui reste sur la plateforme. S'il est portable, il devient un standard. Sinon, ce n'est qu'un format de configuration.
La troisième est le prix de la persistance. Un agent qui garde un plan ouvert pendant un mois consomme du stockage, de la mémoire et de la surveillance, et rien de tout cela n'apparaît dans une comparaison par token. L'économie unitaire d'un agent toujours actif n'est pas celle d'un modèle requête-réponse, et Salesforce n'a pas publié lequel des deux il facture.
Le positionnement de l'entreprise, selon lequel ces agents sont jugés sur le travail qu'ils accomplissent plutôt que sur les questions auxquelles ils répondent, fixe une barre plus élevée que celle à laquelle le secteur a été tenu. Cela rend aussi la mesure facile : soit les affaires à risque ont été conclues, soit elles ne l'ont pas été.
Articles associés
Cohere impose un plafond strict aux dépenses autorisées d'un agent d'entreprise
Un agent qui fonctionne sans surveillance est un agent qui peut faire grimper une facture sans surveillance. North 2 intègre le budget au produit.
Alibaba publie en open source un modèle qui découpe une image plate en calques modifiables
L'inpainting remplit un trou. Un modèle par calques copie ce qu'on ne lui a pas demandé de toucher, ce qui est une garantie différente.
Adobe a intégré l’édition générative à Lightroom, et les photographes ont raison de s’inquiéter
Un outil qui côtoie les curseurs encourage à croire qu’il s’agit d’un réglage de routine. Il réécrit la photographie.
JetBrains installe un orchestrateur d'agents dans chaque IDE qu'il publie
JetBrains ne rivalise pas sur la qualité des modèles. Elle se bat pour la couche où les agents sont lancés et examinés.