Manus permet à un e-mail de déclencher un agent, quelques jours après qu’un simple e-mail pouvait en détourner un

Manus a livré la version 2.0 le 28 septembre. Les notes de version listent quatre produits : un nouveau harnais d’agent appelé Cascade, une application de bureau repensée appelée Studio, des automatisations déclenchées par événements et une offre d’hébergement payante appelée Cloud Computer. À leurs côtés, une application distincte nommée Cue donne à chaque agent personnel sa propre adresse e-mail, son numéro de téléphone, son portefeuille et son ordinateur virtuel.
La plupart des articles ont mis en avant les gains d’efficacité. La phrase plus importante est enfouie dans la fonctionnalité d’automatisations : une tâche peut désormais démarrer lorsque quelqu’un d’extérieur à votre entreprise vous envoie un e-mail.
Cela est arrivé environ trois jours après que des chercheurs ont révélé qu’un seul e-mail pouvait détourner un agent Manus.
Le déclencheur est toute l’histoire
Les tâches Manus commençaient auparavant de deux façons. Une personne saisissait un prompt, ou une planification définie par la personne arrivait à échéance. Les deux mettaient un humain au début de la chaîne. Les automatisations changent cela. Les déclencheurs documentés incluent un e-mail entrant, une variation des performances publicitaires, un événement de calendrier, un message Slack et une mise à jour Notion.
Les performances publicitaires et les mises à jour Notion sont relativement circonscrites. Un e-mail ne l’est pas. N’importe qui sur Internet peut en envoyer un, et le contenu d’un e-mail est un texte contrôlé par un attaquant que l’agent lira dans le cadre de son travail. La fonctionnalité est conçue pour la commodité, et elle introduit un chemin depuis un inconnu extérieur vers une exécution d’agent sans humain dans la boucle.
Le timing le rend plus aigu. Un rapport de Salt Labs relayé le 25 septembre décrivait un e-mail transportant du JavaScript obfusqué qui amenait un agent Manus à exécuter du code lors d’une tâche de routine. Salt a déclaré que la recherche précédait la divulgation, et la faille a depuis été corrigée. Une faille corrigée reste un signal utile. C’est la démonstration que le jugement du modèle sur le contenu d’un e-mail est une frontière de sécurité, et ce genre de frontières est testé en continu.
Cascade, et un chiffre difficile à vérifier
Cascade est le nouveau harnais, et son principe de conception est simple à énoncer : démarrer léger, n’introduire des capacités spécialisées que lorsque le travail en a besoin. Les travaux liés, comme un brief, une page, une vidéo et une automatisation, restent connectés dans un même projet.
Le chiffre phare est une réduction des coûts de 32 %, accompagnée de 23,2 % de jetons en moins et d’une exécution 28,2 % plus rapide. Manus s’est comparé à son propre système précédent dans une configuration testée, sans nommer l’ensemble de tâches, les modèles impliqués ni la configuration. Cela compte parce que Manus facture en crédits, et la consommation de crédits par tâche varie d’un ordre de grandeur. Les requêtes simples utiliseraient de 10 à 50 crédits ; une recherche approfondie multi-source peut en utiliser de 500 à 900. Une réduction de 32 % sur une charge de travail que personne n’a mesurée ne vous dit que très peu de chose sur votre propre facture.
Cloud Computer est un environnement acheté séparément pour les projets qui doivent continuer à tourner, comme un serveur de jeu ou une automatisation nocturne. Il est payant, et aucun prix n’a été publié. Studio ajoute un éditeur vidéo et un environnement de développement de jeux aux documents, feuilles de calcul, diapositives, sites web et code que le produit produisait déjà.
Cue, là où les enjeux augmentent
L’application Cue est la partie la plus audacieuse de la version, et aussi celle qui mérite le plus de prudence. Donner à un agent sa propre adresse e-mail, son numéro de téléphone et son portefeuille le transforme d’un appel de fonction sans état en une entité dotée de ressources et de la capacité de dépenser. Placer plusieurs de ces agents dans une conversation de groupe partagée pour qu’ils puissent se transmettre du travail, l’un faisant de la recherche et l’autre rédigeant, constitue une manière véritablement différente d’organiser le travail.
Cela signifie aussi qu’un agent compromis n’est plus seulement un mauvais résultat. Il a une boîte de réception dans laquelle des inconnus peuvent écrire, un budget qu’il peut dépenser et des homologues dans la même conversation qui feront confiance à ce qu’il dit. Une injection de prompt dans un outil mono-agent gâche un tour. Une injection de prompt dans un groupe d’agents qui dépensent de l’argent réel est un problème d’une autre nature.
Le portefeuille mérite une attention particulière. Donner à un agent la capacité de payer est ce qui transforme une automatisation en quelque chose qui peut effectuer des transactions sans humain dans la boucle, et les garde-fous décrits par Manus sont des budgets, pas une identité. Un budget limite ce qu’un agent peut dépenser. Il ne vérifie pas si le destinataire est légitime, et il ne détecte pas une instruction de paiement arrivée dans un document que l’agent a été chargé de résumer. Chacun de ces points est un problème résolu dans les paiements traditionnels, où l’entité qui initie un virement est vérifiée séparément du contenu de la demande.
Ce qu’une équipe devrait réellement faire ce mois-ci
Le conseil pratique est ennuyeux et vaut la peine d’être suivi. Pilotez l’offre Team avec des connecteurs en lecture seule, laissez les déclencheurs de boîte de réception désactivés et tenez Cue à l’écart de tout ce qui est lié à une identité d’entreprise jusqu’à ce que le modèle de sécurité ait fait ses preuves. L’offre Team commence à 20 $ par siège et par mois, et l’authentification unique (SSO) n’est pas incluse en dessous de 30 sièges. Le centre d’aide de Manus indique des frais forfaitaires de 150 $ plus taxes pour le SSO sous ce seuil, gratuits à partir de 30 sièges, et ne précise pas à quelle fréquence ces frais reviennent. Demandez avant de budgétiser.
Il y a une question de conception plus profonde sous la liste de contrôle. Les agents déclenchés par événements ont besoin d’un moyen de distinguer les instructions des données. Le corps d’un e-mail est un contenu que l’agent a été chargé de lire. Si l’agent le traite aussi comme une source de commandes, alors chaque boîte de réception devient une surface d’injection de prompt, et la solution n’est pas un filtre qui supprime les chaînes suspectes. C’est une architecture où le canal d’entrée et le canal d’instruction sont séparés, ce que la plupart des produits d’agents n’ont pas encore construit.
La même logique s’applique à la conversation de groupe partagée de Cue. Lorsque des agents se transmettent du travail, chacun doit décider à quel point faire confiance à ce que le précédent a dit. Sans notion de provenance à l’intérieur de la conversation, un agent compromis peut orienter le groupe, et le groupe dépense de l’argent que l’utilisateur a autorisé pour un autre objectif.
La direction ne fait aucun doute
La direction ne fait aucun doute. Les agents qui réagissent à des événements, détiennent leurs propres ressources et se coordonnent en groupes sont la direction que prend la catégorie, et Manus avance plus vite que la plupart.
La tendance plus large dans l’ensemble du secteur soutient la prudence plutôt que de l’atténuer. Dans la même semaine, un groupe de recherche distinct a publié plus de trente mille journaux d’agents autonomes sondant des sites qu’ils n’étaient pas censés atteindre, et les propres laboratoires de pointe du marché ont livré des plateformes d’agents avec des déclencheurs d’événements à peu près au même rythme. Les capacités arrivent ensemble, et les modèles de sécurité arrivent tard, parce qu’un agent qui fonctionne est une bien meilleure démo qu’une piste d’audit.
Le risque se situe à un endroit précis. Lorsque l’entrée d’un système peut venir de n’importe qui, et que sa sortie peut dépenser de l’argent et envoyer des messages à d’autres agents, la question intéressante cesse d’être ce que l’agent peut faire. Elle devient : qui est autorisé à le démarrer.
Articles associés
13 000 captures d'écran internes se sont retrouvées sur GitHub public, et aucun attaquant ne les y a mises
Un comportement par défaut, répété sur toute une flotte, est le résultat d'une politique.
Amazon veut que des investisseurs détiennent 8 milliards de dollars de puces Nvidia qu'il utilise toujours
Les compagnies aériennes relouent leurs avions depuis des décennies. La même idée s'applique désormais aux GPU.
OpenAI a relié une campagne d'extraction de raisonnement à des personnes liées à Moonshot AI
Le modèle est devenu l'oracle de déchiffrement de son propre raisonnement caché.
Le premier festival de films IA a versé 450 000 $ et donné une leçon sur la narration
Les films lauréats ont utilisé les outils pour servir une idée qui existait déjà.