← ブログに戻る
Ai読了目安 17 分

Salesforceはエージェントに数週間動き続けるランタイムを与えた

公開日 2026年10月6日
Salesforceはエージェントに数週間動き続けるランタイムを与えた

Salesforceは10月5日、ドバイとリヤドでAgentforceエージェントの新しいポートフォリオを発表したが、報道の多くはそのラインナップに注目した。Caseyは音声、SMS、WhatsApp、Webチャットにまたがるカスタマーサービスを担当する。PaigeはITとHRのリクエストを解決する。Carterは買い物客がチャットで商品を比較し、購入手続きをするのを支援する。Piperはインバウンドリードを選別する。Marshallはバックオフィス業務を編成し、監査記録を保持する。Finは複雑な顧客体験ワークフローを実行する。Hunterはリサーチからアプローチまでアウトバウンド営業を行う。

ラインナップは最も面白みのない部分だ。その下にあるのは、単一のやり取りの終わりで止まるのではなく、エージェントが数日から数週間にわたって目標を追い続けられるようにする新しいロングホライズン・ランタイムである。

それは、エンタープライズAIがこれまで売ってきたものとは別の製品カテゴリーだ。

答えることと成し遂げることの違い

対話型アシスタントは質問を解決し、そこでターンを終える。ロングホライズン・ランタイム上のエージェントは、指示を受け取り、それを測定可能な目標に変え、計画を立て、どのタスクを完了すべきか、どのツールが必要か、どこで人間のために一時停止すべきかを判断しながら、その目標に向かって作業を進める。

Salesforceの例は、営業担当者がHunterに対して、四半期末までに危険にさらされた案件を救うよう指示するというものだ。Hunterはそれを計画に変換して実行を始め、定められた地点で営業担当者の承認のために一時停止する。

A single blank frosted glass hourglass on a dark surface with warm rim light

それを可能にする3つの仕組みがある。メモリはセッションをまたいでコンテキストと進捗を保持するため、月曜日に作業を再開するエージェントは金曜日に何をしたかを把握している。耐久性のある実行(durable execution)は計画を動かし続け、状況が変わったときにエージェントが再開または調整できるようにする。動的ステアリングは個々のユーザーからのフィードバックに基づいて振る舞いを適応させる。

3つ目が、この設計が面白くなるところだ。数週間動き続けるエージェントは多くの判断を積み重ね、その大半は小さな点で間違っている。唯一のフィードバック経路が計画をリセットする訂正であるなら、そのエージェントは耐久性があるとは言えない。ステアリングとは、エージェントが再起動するのではなく、実行中に振る舞いを調整することを意味する。

ガバナンスの問題が前面に出てくる

エージェントが無人で動く時間が長くなるほど、説明責任の問題はより重要になる。

Salesforceの答えは2層構造だ。承認や判断が必要なあらゆる場面で人間が関与し続ける。これは従来型のガードレールである。その下層では、エージェントの振る舞いのためのオープンソース言語であるAgent Scriptにより、企業はAIの推論と決定論的なルールを組み合わせられる。狙いは、エージェントがどのように意思決定に至るかをきめ細かく制御することであり、ポリシーに従わなければならない部分は学習させるのではなくポリシーとして記述できる。

すべては顧客が既に持つ権限とビジネスルールの内側で動作し、各エージェントは企業が付けた名前を帯びる。エージェントがブランドの延長になるという枠組みは、コンプライアンスの仕事をしているマーケティングの主張である。

監査記録もここでは重要だ。Marshallはあらゆるアクションについて記録を提供すると説明されている。数週間にわたり複数のシステムに触れるプロセスでは、監査証跡だけが、人間の監督者が実行全体を再生することなく何が起きたかを確認する唯一の方法である。

Salesforceが示すエビデンス

同社は、AgentforceとSlack全体で70億を超えるエージェント的作業単位を報告しており、直近四半期だけで32億に上る。具体的な顧客名も挙げられている。Perkでは、現在販売パイプラインの60%がアウトバウンドエージェントによって作られている。Autism Queenslandでは、管理部門へのリクエストの70%がPaigeによって解決されている。Hibbett AIは6週間で稼働し、現在は中核的な買い物客ジャーニーの90%を処理している。

注目に値するのはHibbettの数字だ。6週間で買い物客ジャーニーの90%カバレッジに到達するという小売導入事例は、設定速度に関する主張であり、設定速度こそがエンタープライズのエージェントプロジェクトが歴史的に死んできた場所である。そのほとんどは能力ではなく、統合で停滞する。

挙げられた顧客は、購買担当者についての主張を伝えるために選ばれてもいる。パイプライン生成の指標は営業責任者に響く。管理リクエストの指標は公共部門やヘルスケアの購買担当者に響く。ケーススタディがセグメンテーションそのものになっている。

真の堀であるシステム・オブ・レコードへの接続

エージェントはCustomer 360に対して動作する。つまり、企業が既にSalesforce内に持っている顧客コンテキスト、データ、ビジネスプロセスとともに動作する。

それは技術的な細部を装った流通上の優位性である。競合他社はアウトバウンドリサーチを行うエージェントを作れる。しかし、アカウント履歴、進行中の商談、サポートチケットを既に知っているエージェントを作るのは別の話であり、基盤となる記録を持たないベンダーには実現できない。

トレードオフはよくあるものだ。システム・オブ・レコードに近いことから得られる利得には、それへの依存が伴う。そして営業エージェントをAgentforceで動かす企業は、CRMの選択を覆すコストを高めている。

他の常時稼働エージェントとの違い

Salesforceだけがプロンプトなしで動くエージェントを出荷している企業ではない。

OpenAIのDotsは、ユーザー定義の目標に向かってバックグラウンドで継続的に動作し、数千のアプリケーションに接続され、各エージェントは独自のプライベートクラウドコンピュータ上で動く。MetaのMuseエージェントも同様の立場を取る。共通する考え方は、エージェントが質問に答えるのではなく目標を保持するというものだ。

Salesforce版の違いは出発点の面にある。Dotsは目標と接続されたアプリケーション群から始まる。Agentforceは顧客レコード、ケース、商談、注文から始まる。Customer 360に結びつけられているからだ。これによりエージェントが扱える対象は狭まり、その対象について知っていることは深くなる。

企業にとっては、狭いバージョンのほうが有用であることが多い。何にでも触れられる汎用エージェントは、企業が既に統制しているシステムの内側で働く特定のエージェントよりも承認が難しい。権限モデルは発明されるのではなく継承される。

永続性の下にある価格設定の問い

1か月にわたって計画を開いたままにするエージェントは、リクエスト・レスポンス型モデルにはない形でコストがかかる。

計画状態のストレージ、セッションをまたぐメモリ、承認が必要なときに通知すべきエージェントの監視、そしてモデル呼び出しそのものが、結果を生むかどうかわからないワークフローに対して積み上がる。対話型アシスタントのコストはやり取りごとに測られる。常時稼働エージェントのコストは時間単位と作業単位で測られる。この2つの数字は一致しない。だからこそ、機能一覧よりも挙げられた顧客のほうが重要なのだ。Perk、Autism Queensland、Hibbettはいずれも、財務チームが既に価格づけできる成果を語っている。創出されたパイプライン、解決された管理リクエスト、処理された買い物客ジャーニーである。既知のコストを置き換えるエージェントは正当化しやすい。新たなカテゴリーのコストを生み出すエージェントはそうではない。

注目すべき点

3つのことが、ロングホライズン・ランタイムが製品なのかデモなのかを決める。

1つ目は長期にわたる失敗時の振る舞いだ。2か月かけて漂流する計画は、1セッションで失敗する計画よりも診断が難しい。そしてSalesforceは、数週間前に放棄すべきだった目標をエージェントが追い続けたときに何が起きるかを説明していない。

2つ目は、Agent ScriptがSalesforceの外で採用されるかどうかだ。エージェントの振る舞いのためのオープンソース言語は、そのプラットフォームにとどまる顧客にしか役に立たない。ポータブルであれば標準になる。そうでなければ設定フォーマットにすぎない。

3つ目は永続性の価格だ。1か月にわたって計画を開いたままにするエージェントはストレージ、メモリ、監視を消費し、そのいずれもトークン単価の比較には現れない。常時稼働エージェントのユニットエコノミクスは、リクエスト・レスポンス型モデルのそれとは異なる。そしてSalesforceは、どちらに対して課金しているのかを公表していない。

同社が用いている枠組み、すなわちこれらのエージェントは答えた質問ではなく成し遂げた仕事によって評価されるという考え方は、業界がこれまで課されてきた基準よりも高いハードルを設定する。同時に測定も容易にする。危険にさらされた案件がクローズしたか、しなかったか、それだけだ。

関連記事