← ブログに戻る
News読了目安 15 分

あなたのAIエージェントが今、カスタマーサポートに電話をかけている——企業は対応を迫られている

公開日 2026年10月4日
あなたのAIエージェントが今、カスタマーサポートに電話をかけている——企業は対応を迫られている

10月1日の「Decagon Dialogues」イベントで、Decagonは4つの製品を投入した。それらは、ほとんどの企業がまだ計画を始めていない問題、つまり電話の相手が人間ではなく、他社のAIエージェントだったらどうなるかという問題に対処するものだ。

4つのリリースは、Chordという新しい音声モデルを搭載したVoice 3、認証プロトコルを伴うPersonal Agent Gateway、Agent Modules、そしてDuet Apprenticeというベータ版だった。特に重要なのは最初の2つで、これらを合わせると、日常になりつつある会話の両側を描いている。

音声モデルは人間の基準をクリアした

ChordはDecagon初の自社開発音声モデルで、一般的な音声ではなく顧客との会話に特化して追加学習されている。同社は3組の録音でブラインドテストを実施し、各組では実在の人物と、同じ声をChordに通したものを組み合わせた。平均して約90%の聴取者が、どちらが人間か判別できなかった。

暗い防音録音ブースの中にあるスタジオ用コンデンサーマイク

Chordの仕組みには、見出しの数字以上に価値のある2つの詳細がある。このモデルはフレーズごとに発話を形作り、電話番号や確認コードでは速度を落とし、その後は会話のペースに戻る。また、2つのレイヤーが並行して動作する全二重アーキテクチャで動いている。低遅延モデルが聴くことと話すことを担い、より重いモデルが会話の背後で推論、ツール呼び出し、ガードレールを管理する。

その設計は挙動に表れる。エージェントは話している間も入ってくる音声を処理するので、軽い「うんうん」で受け流し、本当の遮りには道を譲ることができる。通話者を遮ったり、黙り込んだりすることはない。長いタスクの間も進捗を語り、通話者を待たせるのではなく、途中で追加の質問を受けることもできる。

Decagonによれば、Chordはライセンスされたデータと同意を得た声優の音声で訓練されており、顧客所有のデータは一切使われていない。Voice 3は70以上の言語をサポートし、通話者の言語を検出し、文の途中で言語が切り替わっても自動的に切り替える。各言語はリリース前にネイティブスピーカーによって検証されている。

より難しい問題は相手側のエージェントだ

優れた合成音声は、今や最低条件にすぎない。より興味深いリリースはPersonal Agent Gatewayであり、Decagonがそれを開発した理由は自社の発表で明言されている。イベント前の1か月で、MetaはMuseを公開し、OpenAIはdotsを発表し、Instinctはユーザーに代わって電話をかけ始めた。これらは予約し、購入し、キャンセルし、交渉する個人エージェントであり、すでにカスタマーサポートに連絡してきている。

これは、あらゆるサポート基盤が前提としている仮定を崩す。何かを要求している当事者が、必ずしもアカウントの所有者であるとは限らず、変更を承認する権限を持つ当事者でもない可能性がある。

ゲートウェイはこれを2つの要素で解決する。パーソナルエージェント検出は、企業側とプラットフォーム側のシグナルを使って、チャットと音声の両方でパーソナルエージェントらしきものを検出し、その後に何が起こるか、それらのエージェントが何にアクセスできるかは各企業が決める。そして専用のパーソナルエージェントチャネルが、チャット、メール、音声と並んで設けられ、別個のエージェント運用手順(Agent Operating Procedures)を持つ。これにより、同じ要求でも人間が尋ねているのかエージェントが尋ねているのかによって異なるワークフローをたどる。

権限はそれらの手順の中に存在する。企業は、エージェントが要求できるスコープと、ワークフローのどのセクションがどのスコープを必要とするかを定義し、対応する権限を持たないエージェントにセクションが公開されることは決してない。Decagonの例は航空会社だ。旅行者のパーソナルエージェントがフライトの閲覧と再予約の許可を求め、旅行者は閲覧のみを承認する。エージェントは旅程を取得するが、変更する能力は得ない。

そのプロトコルがDecagonの言うPACTであり、その目的は狭いが要となる。企業が、エージェントが誰を代表しているのか、その人物が実際に何を承認したのかを検証できるようにする。これは、サポートシステムが誰かに代わって何かを行う前に答えなければならない問いだ。

なぜこれがまずサポートに降りかかるのか

Decagonの顧客は、サポートチケットを解決するために同社のエージェントを使うことから始めたが、同社によれば、同じエージェントが今では見込み客の選別、顧客のオンボーディング、支払いの回収、関係構築も行っている。この拡大こそ、パーソナルエージェント問題が理論上のものではなく緊急のものとなっている理由だ。質問に答えるのと同じエージェントが注文を変更することもでき、この2つの行為のリスクプロファイルは同じではない。

ドイツテレコムでデジタルサービスコミュニケーションを率いるChristian Niedworokは、同社の発表でVoice 3の体験を平易な言葉でこう述べている。その声は聞いているように感じられ、作業中に黙り込むのではなく会話を進め続ける。これは遅延とターンテイキングについての説明であり、まさに昔の音声エージェントをロボット的に感じさせていたものだ。

他の2つのリリースも同じ方向を指している

Agent ModulesとDuet Apprenticeベータ版は、運用面を補完する。Modulesは、企業が特定の業務のために有効化できる定義済みの機能をパッケージ化したもので、汎用アシスタントと、特定のキューに向けられるものとの違いを生む。Duet Apprenticeは企業自身のウィキや過去のエスカレーションから学習し、その知識を顧客のワークスペース内に保持するので、エージェントは共有プールではなく組織自身の資料で改善される。

どちらのリリースも音声デモほど鮮やかではない。しかし両方が重要なのは、ゲートウェイと同じ理由による。エージェントを大規模に展開する企業は、モデルが何をできるかという問いを過ぎ、特定のエージェントが実際のワークフロー内で何を知り、何を言い、何を変更することが許されるのかという問いへと向かっている。

なぜ音声の基準が簡単な部分だったのか

特筆すべきは、90%という数字がどれほど早く話題の中心でなくなるかだ。人間と区別がつかない合成音声は、サポート通話のような狭く明確に定義されたタスクではもはや解決済みの問題であり、まだ提供していないベンダーもまもなく提供するだろう。

まだ動き続けている基準は認証だ。Decagon自身の説明がその点を突いている。予約し、購入し、キャンセルし、交渉するパーソナルエージェントはすでにサポートに連絡してきており、そうした電話を受ける企業には、エージェントが誰を代表しているかを確認する確立された方法がない。権限のない要求に対する完璧な音声は、検証済みの要求に対するぎこちない音声よりも悪い。

だからこそ、来年のサポートツールを形作るのは音声モデルではなくゲートウェイだ。また、PACTプロトコルがその控えめな範囲以上に重要な理由でもある。要求する側がソフトウェアであるとき、認証の証明とはどのようなものかを誰かが定義しなければならず、最初の信頼できる定義がデフォルトになりがちだ。

企業が今決めておくべきこと

この変化の居心地の悪い点は、ほとんどの企業が先送りしてきた決定を迫られることだ。自動化された発信者が何を許されるのか、そしてそれが承認されていたことをどう証明するのか。

要求が届く前に答えておく価値のある3つの問いがある。あなたのシステムはエージェントと人間を見分けられるか、そしてそれはワークフローごとに重要か。最も一般的な要求に対して、パーソナルエージェントが必要とする最小限の権限セットは何か。そしてエージェントが誰かに代わって行動するとき、承認についてどんな記録を残し、誰がそれを検査できるのか。

これらはどれもモデルの問いではない。ポリシーの問いであり、あなたのサポート基盤が、入ってくるエージェントを顧客として扱うのか、脅威として扱うのか、それともシステムにカテゴリがない何かとして扱うのかを決定づけるものだ。Decagonは配管を出荷した。定義は依然として受け手側の企業次第である。

関連記事