エンタープライズAIが実際に成果を上げる場所:鉄鋼メーカーと航空会社

今月、2つのケーススタディが登場した。両者を合わせると、ベンダーの基調講演を1年分聞くよりも、エンタープライズAIについて多くを語っている。1つは、数百の専門エージェントを導入した鉄鋼メーカー。もう1つは、契約レビュー時間を半減させた航空会社だ。どちらも、サイドバーで質問に答える汎用アシスタントではなかった。
製鉄所における300のエージェント
Google Cloudによると、タタ・スチールは9か月で300を超える専門AIエージェントを導入した。それらは設備保全、情報アクセス、顧客対応の迅速化を担っている。この文で効いているのは「専門」という言葉だ。これは幅広い権限を与えられた1つのエージェントではない。それぞれが特定の業務に紐づいた、300の狭い範囲のエージェントだった。
これは、ほとんどのベンダーが売り込むアーキテクチャとは異なる。何でもできる汎用エージェントは、デモは簡単だが信頼するのは難しい。それぞれが1つのことを行うエージェント群は、構築は面倒だが、はるかに統制しやすい。範囲がタスクによって定義されるからだ。どれか1つが問題を起こしたとき、それがどのプロセスに属し、何に触れることを許可されるべきだったかがわかる。
保守の側面は、それ自体で注目に値する。設備保全は、産業AIが最も明確に成果を出す領域だ。データがすでに存在し、故障モードは高コストであり、稼働率の10%改善は金額で測定できるからだ。地味な仕事であり、まさに予算審査を生き残る種類の仕事である。
数日から数時間になった契約レビュー
セブパシフィックは、ChatGPT Enterpriseの導入により、法務契約レビュー時間がおよそ半減したと報告した。プロジェクト受付の所要時間は5日から約1日に短縮され、エンジニアリングのリファレンス検索は10~15分から10秒未満に短縮された。ユーザー調査では、86%がAIが日々の業務の3分の1以上を支援していると回答した。
注目すべきは契約の数字だ。法務レビューは、実際のリスクがあり、入力が定義され、出力が明確なタスクである。また、ボトルネックが読むことであり、読むことは言語モデルが本当に得意とすることでもある。航空会社は弁護士を自動化したのではない。人が何百回も見てきた条項を探して文書にざっと目を通す部分を取り除いたのだ。それはツールの購入ではなく、ワークフローの変更である。
両事例に共通するパターン
どちらのケーススタディも、人間よりもうまく推論できるモデルの話ではない。どちらも、定義されたプロセスの特定のステップにモデルを挿入し、その前後を測定できるようにした話である。タタ・スチールは、どの保守判断が速くなったかを知っている。セブパシフィックは、受付プロセスにかつて何日かかっていたかを知っている。
ベンダーが気にすべき数字は調査データにある。シンガポールのエンタープライズAI成熟度指数では、エージェント型AIの導入率が前年の22%から51%に上昇した一方、それを中心にエンドツーエンドのワークフローを再設計した企業はわずか10%だった。Capgeminiの調査でも同様のギャップが見つかっており、ほとんどの組織は依然として検討中かパイロットを実施している段階だ。
つまり市場は、ワークフローを変えずにAIをワークフローに接続した企業であふれている。彼らは古いプロセスにモデルを後付けし、それを変革と呼んだ。ここで取り上げた2つのケーススタディは別のことを行った。だからこそ、報告に値する数字を生み出したのだ。
専門化がエージェントを統制可能にする
1つの広範なエージェントよりも、狭い範囲のエージェント群を好むガバナンス上の理由があり、それは明言する価値がある。固定された範囲を持つエージェントは監査しやすい。何にアクセスできるべきかがわかり、実際に何にアクセスしたかをログに記録でき、その差は短いリストになる。広範な権限を持つエージェントは、タスクごとに範囲が変わるため、同じ監査が研究プロジェクトになってしまう。
タタ・スチールの300のエージェントは、まさにこのように専門化されている。この選択は二重に報われる。エンジニアリングが容易になり、承認しなければならない人々に対して導入を正当化できる。各エージェントは個別に検討でき、1つの障害が他の299を見直すことを要求しない。
同じ原則が、なぜ多くのエンタープライズエージェントプログラムが行き詰まるかを説明する。汎用エージェントはデモで有望に見え、幅広い業務範囲に対して試験導入され、その後、その範囲全体で正しい動作がどのようなものかを誰も説明できないという事実に突き当たる。範囲を狭めることは後退のように感じられるが、通常はプロジェクトを存続可能にするステップである。
隠れた要件:比較対象となるベースライン
どちらのケーススタディも数字を生み出しているが、それは偶然ではない。稼働率の10%向上や5日から1日への短縮を測定するには、以前の状態が必要だ。ベースラインを省いた組織は、結果ではなく逸話で終わる。だから多くのAIプログラムが熱意を報告しても、インパクトを報告するのに苦労するのだ。
この規律は導入前に始まる。プロセスを選び、現在どれくらい時間がかかり、いくらコストがかかるかを記録し、それから1つのステップを変えて再度測定する。官僚的に聞こえるが、それが予算を正当化できるプログラムとできないプログラムの違いである。セブパシフィックが契約レビュー時間を半減したと言えるのは、以前の状態を誰かが書き留めていたからだ。
同じくらい重要でありながら、取られることが少ない第2の測定項目がある。エラー率だ。時間を半減させてミスを倍にするエージェントは、何も改善していない。コストをプロセスの前半から後半へ移しただけである。信頼に耐えるケーススタディは、ミスが高くつくポイントで人間が依然として出力を確認し、測定された改善がレビューではなく読むことを取り除くことから生まれているものである。
このギャップが来年に意味すること
成果を出している組織は、プロセスを選び、測定し、モデルが実際に得意なことを中心に再構築した組織である。パイロットで足踏みしている組織は、アクセスを購入し、導入が自然に進むのを待った組織である。アクセスは決して難しい部分ではなかった。再設計が難しいのだ。
鉄鋼メーカーと航空会社には、見落としがちな共通点もある。どちらも、責任を伴う意思決定ポイントに人間を残した。保守エージェントが警告を出し、人間が判断する。契約エージェントが草案を作成して強調表示し、弁護士が承認する。AIが取り除いたのは読み取りであり、判断ではない。
そのような分業は、後から見れば当たり前のことだ。それはまた、数字を生み出すAIプログラムと、スライドを生み出すAIプログラムを分けるものでもある。プロセスを選び、人が情報を読んだり動かしたりしているステップを見つけ、そのステップを自動化し、何が変わったかを測定する。レシピは単純だ。それを実行するのは、シートを購入するより難しい。だから多くの組織がシートを購入し、それを戦略と呼ぶのである。