アシスタントがオフィスを回すとき:Gemini、エージェント、そして新しいワークフロー層

10月の第2週、Google Cloudは「仕事のためのエージェント」と称するものを発表した。売り文句は、より賢いチャットボットではない。Gmail、Drive、Docs、Sheets、Calendar、そして接続された業務アプリケーションをまたいでタスクを調整し、専門的なスキルと永続的なコンテキストを使って、質問に答えるだけでなく多段階の作業を完了させるシステムだ。
あまり注目されなかった細部こそが、最も重要な点だ。このエージェントは、Google自身のモデルとAnthropicのClaudeモデルをまたいでオーケストレーションできる。つまりGoogleは、自社が持たないモデルも含めて、どのモデルがどの仕事を担うかを決める層として自らを売り込んでいるのだ。
エージェントはオフィスで実際に何をするのか
有用なエージェントは、声が良くなった検索ボックスではない。スレッドを読み、添付ファイルを見つけ、正しいタブを更新し、適切なトーンで返信を下書きし、会議室を予約する。一つひとつの手順は小さい。価値は、人が4つのウィンドウ間で内容をコピーすることなく、それらを順番に実行することから生まれる。
だからこそ、エンタープライズ向けアシスタントは同じ形に収束しつつある。Googleのエージェントは自社の生産性スイートをまたいで調整する。MicrosoftはCopilotを同じ席に押し込もうとしてきた。OpenAIは独自のデスクトップとブラウザ環境を備えたエージェントを構築しており、Anthropicはコーディングとコンピュータ操作に焦点を当てたエージェントを販売している。競争はもはや、どのモデルが最も優れた段落を書くかではない。どのシステムがワークフローを完了する信頼を得られるかだ。

なぜオーケストレーション層が重要なのか
長年、最も優れたモデルを持つ者がエンタープライズを制するという前提があった。その前提は弱まりつつある。モデルの能力は十分に収束し、調達チームはどのフロンティアモデルが数ポイント先んじているかを気にしなくなり、どのベンダーが、仕事がすでに存在するシステムにエージェントを配線できるかを気にするようになった。
もしそうなら、持続可能なポジションはオーケストレーション層、つまりリクエストを手順に分解し、各手順を適したモデルに振り分け、結果を組み立てる部分だ。生産性スイートを保有していることはここで大きな優位になる。エージェントがすでにコンテキストと、行動するための権限を持っているからだ。この層を握ることは、Googleが一部の作業をClaudeに回しても平気な理由でもある。層が製品なら、その下のモデルは交換可能な入力になる。
利便性とともにやってくるガバナンスの問題
メールを読み、文書を編集し、会議をスケジュールできるエージェントには、今日ほとんどのIT部門が運用しているアクセス制御よりはるかに複雑な権限モデルが必要だ。これがこの機能の正直なコストであり、導入が停滞する場所でもある。
Microsoftは同じリスクに対して別のアプローチを取っている。AIエージェントをPC自体に載せ、エージェントがマシン上で到達できる範囲を制限するよう設計された実行コンテナを用意している。エージェントをローカルで動かすことは、利便性の一部と引き換えに、触れる範囲により厳しい境界を手に入れることだ。Googleのアプローチは、データがすでに存在するクラウドとスイートに依存する。どちらも、エンタープライズの購買担当者が何よりも先に尋ねる問いに答えようとする試みだ。このものは一体どこまで入り込めるのか。
規制当局も同じ隙間を狙っている。10月8日、英国の情報コミッショナー事務局(ICO)は、10社のAI開発者からデータ保護の改善へのコミットメントを得たと報告し、エージェント型AIのリスクに関する証拠提供の呼びかけを開始した。その枠組みは示唆に富む。ソフトウェアがユーザーに代わって行動するとき、同意、ログ、責任に関する問いは、もはや一社だけの問題ではなくなる。
権限問題の実際
エージェントが仕事をこなすために必要なアクセスリストを思い浮かべてほしい。スレッドを読むにはメールへのアクセスが必要だ。添付ファイルを見つけるにはファイルへのアクセスが必要だ。シートを更新するにはその文書への編集権限が必要だ。会議室を予約するにはカレンダーへの書き込みアクセスが必要だ。個々の権限は妥当だ。しかし合わせると、人が見られるものの大半を見て、その多くを変更できる実体を描くことになる。従来のアクセス制御は、マシンの速度で自ら行動する何かのために設計されたものではなかった。
だからこそ、標準化団体から届くガイダンスは今の形をしている。エージェントを低信頼の非人間IDとして扱うことは、監査ログを書こうとするまでは官僚的に聞こえる。一晩で100のアクションを実行したエージェントには、何に触れたかの記録、資格情報を迅速に失効させる手段、そしてどのアクションに人の承認が必要かのルールが必要だ。ほとんどの組織は、すでに本番環境でエージェントを動かしているところでさえ、その3つのどれも備えていない。
居心地の悪い現実は、ここでは利便性と統制が逆方向に引っ張り合うということだ。エージェントが到達できるシステムが増えるほど、より有用になり、ミスがもたらす損害も大きくなる。そのトレードオフを解決する巧妙な設定は存在しない。あるのは、特定のワークフローが実際にどれだけのアクセスを正当化するかについて、エージェントを解き放つ前に、後ではなく下す判断だけだ。
オーケストレーションがもたらすもの、そしてそのコスト
オーケストレーション層の利点は本物だ。各手順を適切なモデルに振り分けることで、定型作業は安く、判断が必要な作業は利用可能な最強のモデルで実行できる。また、かつては別々だったツールの上に単一のインターフェースを置くことも意味し、これが人の午後を節約する部分だ。
コストは新しい種類のベンダー依存だ。仕事の流れ方を決める層が1社のプロバイダーにあるなら、そのプロバイダーがどのモデルをいくらで使うかを決める。Googleが一部の作業をClaudeに回すのは、選択についてのいい話だ。同時に、その選択がいつ適用されるかをGoogleが決めているということでもある。システムを買い手にとって柔軟にする同じ構造が、買い手をルーティングルールを握る者に依存させる。
スイートベンダーが、自社製品と少数のパートナーの範囲でしか完全には機能しないエージェントを売り込むとき、それは覚えておく価値がある。相互運用性は約束するのは簡単で検証するのは難しく、まず試すべきものだ。
チームが実際にすべきこと
これらのエージェントから価値を得ているチームは、あらゆる場所で有効化したチームではない。狭く反復的なワークフローを選び、エージェントに必要最小限のアクセスを与え、すべてのアクションをレビュー用に記録したチームだ。失敗が安く済むところから始めよう。要約の下書きは低リスクだ。ベンダーへの支払いはそうではない。
早いうちに身につける価値のある習慣が3つある。どのエージェントが存在し、それぞれが何に触れられるかの生きたインベントリを保つこと。数は誰の予想よりも速く増えるからだ。短命の資格情報を使い、漏洩したり悪用されたエージェントが永遠に行動できないようにすること。そして、金銭を動かす、契約を変更する、社外の誰かに連絡するいかなるアクションの前にも、人による承認ステップを置くこと。
どれも華やかではない。しかしそれが、1年間役立つエージェントと、1日だけヘッドラインを作るエージェントの違いでもある。
次の段階の形
フロンティア競争は、最も高性能なモデルをリリースすることから、セキュリティ、コスト、規制審査を生き残るシステムを出荷することへ移った。Googleはワークフロー統合に優位性があると賭けている。Microsoftはローカル実行に賭けている。OpenAIは検証可能な推論に賭けている。Anthropicは安全性が重要な導入に賭けている。
どの賭けが実を結ぶにせよ、買い手の問いは変わった。もはや「あなたのモデルはどれほど賢いのか」ではない。「それが何をしたか見えるか、できることを制限できるか、毎日動かす余裕があるか」だ。それはより地味な問いであり、来年もまだインストールされているアシスタントを決めるのは、その問いなのだ。
関連記事
Decagon の PACT プロトコルは「同意」を標準にしようとしている
Decagon は、個人エージェントの身元と、顧客が与えた権限を検証するプロトコルをオープンソース化した。地味な配管だが、エージェント経済が機能するかを決める。
AI「再会」ブーム:まだどう感じるべきか決めきれない中国の議論
AI の追悼動画が亡くなった著名人を中国の画面に連れ戻し、数十万の「いいね」を集めた。そして反発が来た。争点は「同意」だった。
Apple はオープンなマルチモーダルモデルを公開し、ほとんど誰にも知らせなかった
研究優先のこのリリースは主流の視野を静かにすり抜けたが、細粒度の視覚グラウンディングは Apple の AI スタックの行き先を語っている。
OpenCut と「オープンソース版 CapCut」の瞬間
無料で MIT ライセンスの動画編集アプリが GitHub のトレンドを上り続け、ロードマップには AI エージェント向けの MCP サーバーが含まれる。AI メディアを囲む道具がモデルに追いつきつつある。