サブエージェント経済:安価なモデルこそがエージェントの本命である理由

10月初旬で最も影響の大きいAIリリースは、最も安価なものだった。10月7日、AnthropicはClaude Haiku 5.5を投入し、平均実行コストが前世代のHaikuより約75パーセント低いと述べた。10万トークン未満のリクエストでは、API価格は約90パーセント下落し、入力100万トークンあたり10セント、出力100万トークンあたり50セントになった。Anthropicはまた、Sonnet 5.5のキャッシュ読み取り価格を半額にした。
安価なモデルは軽視されがちだ。価格の話に見えて、能力の話には見えない。だがこのリリースで興味深いのは価格ではない。Haiku 5.5が何のためにあるのか、だ。
小型モデルは大人になった
小型モデルに対する昔の批判は、単純なタスクには十分だが実務には使えない、というものだった。その差は急速に縮まった。コーディング評価のTerminal-Benchで、Haiku 4.5はゼロだった。Haiku 5.5は39.2パーセントを記録した。コンピュータをインターフェース経由で操作することを試すOSWorldでは、15.7パーセントから72.4パーセントへ上がり、同種のGPT-6 Lunaの48.9パーセントを上回った。
Anthropicはまた、Haikuにこのラインで初めて調整可能な推論エフォートを与え、lowからmaxまでの5段階を用意した。これにより開発者は、効果のあるところに計算資源を割き、不要なところでは省ける。小さな機能だが、何かを継続的に動かすコストには大きな影響がある。

サブエージェントという位置づけ
このリリースでとくに強調すべきはポジショニングだ。Anthropicは、Haiku 5.5がより大きなOpus 5.5とSonnet 5.5のサブエージェントとして機能できると述べた。平たく言えば、フラッグシップモデルが計画を立てて判断し、Haikuが実行を担う。文書の整理、コンピュータの操作、データの処理だ。
これは実質的なアーキテクチャの転換であり、コストの議論の枠組みを変える。呼び出し1回あたりが安いというだけではない。高価な計画呼び出し1回が、今や多数の安価な実行呼び出しに展開できるのだ。以前は各ステップごとにフラッグシップモデルを動かしていたエージェントが、難しい部分にはフラッグシップを、それ以外のすべてにはHaikuを使える。高価な呼び出しがそもそも何回発生するかが変わるため、請求額はトークン単価の割引以上に下がりうる。
Anthropicの競合も別の角度から同じ形に収束しつつある。10月1日に投入されたGoogleのGemini 4 Argonは、コーディング、リサーチ、金融、法務の業務を狙い、大規模なレビュー向けに最大100万トークンの出力をサポートする。OpenAIの中位モデルは地歩を保つため値下げを続けている。打ち出し方は異なるが、根底にある賭けは共通だ。仕事とは1つのモデルが1つの問いに答えることではない。多数の呼び出しを編成することであり、その編成者には安価な手足が要る。
なぜボトルネックが移動したのか
その切迫感を説明する数字がある。この分野を追うアナリストは、世界の日次アクティブエージェント数を2026年に約7,900万と見積もり、前年の約2,900万から増加、2030年には数十億規模に達すると予測する。正確な数字はともかく、方向は明らかだ。エージェントはデモから本番へ移行しており、本番エージェントを止めるのは、モデルが馬鹿すぎることよりも、十分な回数動かすとコストがかかりすぎることだ。
だからこそ業界はオーケストレーション層について語り始めた。リクエストをステップに分解し、各ステップを適切なモデルに振り分け、結果を組み立てる部分だ。基盤モデルが安くなると、この層の価値は下がるどころか上がる。安価なモデルをどこで使うかを決めるのがこの層だからだ。
チェーンは実際にどう仕事を分割するか
サブエージェントに関する抽象的な話は、具体的な仕事を想定すると分かりやすくなる。ある市場を調査してブリーフィングを作るようエージェントに頼んだとしよう。フラッグシップモデルがリクエストを読み、何を探すかを決め、ステップを計画する。次に小型モデルが面倒な作業をこなす。ページを巡回し、数値を抽出し、表を整形し、情報源の重複を排除し、各主張に出典があるか確認する。最後にフラッグシップが戻ってきて、統合文を書き、草稿が十分かどうかを判断する。両端に高価な呼び出しが1回ずつ、中間に多数の安価な呼び出しがある。
このパターンはタスクをまたいで繰り返される。大量で曖昧さの少ないものは安価なモデルの候補だ。フォームの入力、ログの読み取り、サポートチケットの分類、文書がテンプレートに一致するかの確認など。次に何をすべきかの判断が必要なものはフラッグシップに残る。境界は固定ではなく、現在の興味深いエンジニアリング作業は、ワークフローごとにその線をどこに引くかを見極めることだ。
Anthropicの調整可能な推論エフォートはここにぴったり合う。軽い扱いで済むタスクはlowで動かし、より注意が必要なものはモデルを切り替えずに引き上げられる。実際には、同じ安価なモデルが素早い分類と慎重なレビューの両方を担えるということで、チームが管理すべき可動部品の数を減らせる。
値下げが製品にもたらす変化
実行が安くなると、作る価値のある製品が変わる。受信メッセージごとにエージェントを走らせる機能は、1回の実行に実際のコストがかかる時代には意味がなかった。実行が1セントの何分の一かで済むなら意味がある。その結果、1年間は技術的には可能でも経済的に不可能だった機能の波が来る。常時稼働のモニター、項目ごとのエンリッチメント、サンプルではなくすべての成果物を確認するバックグラウンドレビュアーなどだ。
そこには罠があり、陥りやすい。実行が安いと、チームはそれを測定しなくなる。1日1,000回の安価な呼び出しを走らせるワークフローは、1回あたりでは無害に見えても、リトライ、失敗、高価なモデルへのエスカレーションを含めると、月の請求額が驚くほど膨らみうる。重要な数字は、完了したタスクのコストであり、1回の呼び出しのコストではない。
小型モデルのベンチマーク問題
小型モデルはベンチマークで良くなっており、ベンチマークこそ改善を過大に読むのが最もたやすい場所だ。コンピュータ操作テストの見出しのスコアは、モデルが既知のインターフェース操作の手順をなぞれることを示す。だが、いつ止めるべきか、いつ助けを求めるべきか、タスクが静かに失敗したのはいつか、といったことについてはほとんど語らない。安価なエージェントが本番で失敗するのはそうした挙動であり、採点が難しい。
実用的な防御策は地味だ。安価なサブエージェントには狭い仕事と、完了の明確な定義、推測する代わりにエスカレーションする手段を与える。そして、重要ないくつかを任せる前に、1週間エッジケースでの挙動を観察する。自分のタスクの限界を知っている安価なモデルは、即興で何とかする賢いモデルより役に立つ。
正直な留保
自信満々に間違える安価なモデルは、高価なモデルより悪く、エージェントチェーンはそのリスクを増幅する。ステップが増えるたびに、誤りが入り込んで伝播する場所が増える。トークン単価は、安価なモデルが曖昧な指示を人間と同じように扱えたかどうかについては何も語らない。
また、埋まっていないガバナンスの隙間もある。9月下旬のNISTとCISAのガイダンスは、エージェントを信頼度の低い非人間アイデンティティとして扱い、短命な資格情報、保守されたインベントリ、リスクの高い操作に対する人間の承認を求めている。大半の組織にはインベントリも承認フローもない。実行が安くなると、多くのエージェントを走らせるのは容易になり、何個走っているかを知るのは難しくなる。
開発者にとっての意味
今身につけるべき有用な習慣は、既定で最大のモデルに手を伸ばすのをやめることだ。タスクを計画と実行に分け、判断が必要なところにフラッグシップを使い、残りは小型モデルに振り分ける。1回の呼び出しではなく、チェーン全体を測る。
Haiku 5.5が話題なのは安いからではない。かつて高価なモデルを必要としていたエージェントの部位を担えるほど、安価なティアがついに十分良くなったからだ。
関連記事
Decagon の PACT プロトコルは「同意」を標準にしようとしている
Decagon は、個人エージェントの身元と、顧客が与えた権限を検証するプロトコルをオープンソース化した。地味な配管だが、エージェント経済が機能するかを決める。
AI「再会」ブーム:まだどう感じるべきか決めきれない中国の議論
AI の追悼動画が亡くなった著名人を中国の画面に連れ戻し、数十万の「いいね」を集めた。そして反発が来た。争点は「同意」だった。
Apple はオープンなマルチモーダルモデルを公開し、ほとんど誰にも知らせなかった
研究優先のこのリリースは主流の視野を静かにすり抜けたが、細粒度の視覚グラウンディングは Apple の AI スタックの行き先を語っている。
OpenCut と「オープンソース版 CapCut」の瞬間
無料で MIT ライセンスの動画編集アプリが GitHub のトレンドを上り続け、ロードマップには AI エージェント向けの MCP サーバーが含まれる。AI メディアを囲む道具がモデルに追いつきつつある。