← ブログに戻る
Ai読了目安 14 分

EmbeddingGemma 2、写真・音声・動画検索をスマートフォン上で実現

公開日 2026年10月11日
EmbeddingGemma 2、写真・音声・動画検索をスマートフォン上で実現

10月6日、Google DeepMindはEmbeddingGemma 2を公開しました。テキスト、コード、画像、音声、動画をすべて一つの共有数学空間に配置する、7億4,000万パラメータのモデルです。重要な数字はサイズではありません。これほど小さいモデルがスマートフォンで動作するという点です。つまり、自分のメディアに対する検索を、何もデバイスから出さずに実行できます。

埋め込み(エンベディング)は、人々が毎日使う多くのものの背後にある、静かな仕組みです。埋め込みモデルはコンテンツを数値のリストに変換し、類似したものが互いに近くに配置されるようにします。検索エンジンが「水漏れする蛇口を直すには」と「滴る蛇口を修理する」がほぼ同じ話題だと判断できるのは、このおかげです。レコメンデーションシステムが次に何を見せるか決める仕組みでもあります。これまで、画像・音声・動画をまたいでこれをうまく行うには、通常、データをサーバーに送り、往復のコストを払う必要がありました。

すべてのための一つの空間

EmbeddingGemma 2を興味深くしているのは「共有」という言葉です。多くのモデルは一つのモダリティをうまく扱います。テキストはこちら、画像はあちら、という具合です。共有空間とは、単一のモデルが文と写真、写真と音声の断片、あるいは動画フレームと文章による説明を比較できることを意味します。Googleが挙げている実用的な例は、ボイスメモで検索して特定の動画クリップを見つけることです。覚えている内容を音声で説明すると、システムが一致する映像を見つけます。

この種のクロスモーダル検索は、クラウドサービスでは以前から存在していました。新しいのはサイズです。7億4,000万パラメータなら、スマートフォンに収まるほど小さく、プライバシーの方程式が変わります。検索がローカルで動けば、写真、音声、動画はデバイスから一切出ません。検索可能にするためだけに個人メディアをクラウドサービスにアップロードすることにためらいを感じていた人にとって、これは判断を変える要素です。

4つのメディアタイル(テキスト、写真、音声波形、動画)が一つの光る点に収束する

なぜオンデバイスは小さな戦いに勝ち続けるのか

ここには、一つのモデルを超えたパターンがあります。この1年、小型で高性能なモデルの絶え間ない流れが、かつてデータセンターを必要としたタスクを、人々がすでに所有するデバイスへと移してきました。Google自身のGemmaシリーズもこの方向を推し進めており、他のラボも特定の業務に合わせた小型モデルで続いています。魅力はプライバシーだけではありません。遅延、オフラインでの可用性、コストです。スマートフォンで動く検索は即座に答え、飛行機の中でも機能します。

この変化は、誰が構築できるかも変えます。機能がクラウドにある場合、開発者はそれを利用するためにアカウント、予算、ネットワークを必要とします。デバイス上で動く場合、開発者が必要とするのはモデルファイルと少しの工夫です。以前は扱いにくかったある種の製品が可能になります。一切外部に通信しない個人向け写真整理ツール、電波がなくても動く現場向けツール、音声と画像をローカルでインデックス化するノートアプリなどです。どれも派手ではありませんが、それぞれが同じ静かな進歩に依存しています。つまり、スマートフォンに収まるほど小さいモデルが、実際の作業を任せられるほど十分に良くなったのです。

開発者にとって、これは特定の扉を開きます。マシンから一切出ない検索拡張生成(RAG)です。RAGとは、モデルに自分の文書を使って質問へ答えさせる手法で、通常は関連する箇所を最初に見つけるために埋め込みモデルに依存します。その埋め込みステップがローカルで動けば、ローカルアシスタントはネットワーク呼び出しなしで自分のファイルやメディアについての質問に答えられます。規制産業や、機密素材を扱う人にとって、それは許可されるツールとそうでないツールの違いです。

無視すべきでないトレードオフ

小さいモデルは大きいモデルではなく、その差は難しいケースでの精度に現れます。はるかに多くのパラメータを持つホスト型埋め込みモデルは、一般的に、特に雑然とした、曖昧な、あるいは珍しいコンテンツで、より良い結果を検索します。アプリケーションがほぼ毎回トップ結果を正しく返すことに依存しているなら、スマートフォンで動く7億4,000万パラメータのモデルでは不十分かもしれません。導入を決める前に、実際のデータでテストすべきです。

第二の限界は、モデルがやらないことです。EmbeddingGemma 2は検索と整理のツールであり、生成器ではありません。画像や動画を作ることはできません。すでに持っているものを見つける手助けをするだけです。業界の関心が生成に固定されているとき、この区別は重要です。なぜなら、地味な検索・取得レイヤーこそが、生成機能をそもそも使えるものにしていることが多いからです。

実用的な制約もあります。大規模な個人ライブラリのインデックス化にはストレージとエネルギーが必要で、スマートフォンはどちらも無限ではありません。740MモデルはAIモデルとしては小さく、スマホアプリとしては大きいため、開発者はいつ実行するか、どれだけインデックスするかに注意深くある必要があります。どれも致命的な問題ではありません。機能が即時だと感じられるか、バッテリーを消耗すると感じられるかを決める細部です。

多言語性にも触れておく価値があります。多くの言語と多くのメディアタイプをカバーする共有空間は、ライブラリが多様であるほど価値が高まります。3か国の写真、2言語のボイスメモ、さらに別の言語の文書を持つ人にとって、クロスモーダル検索の恩恵は、整然とした単一言語のコレクションを持つ人よりはるかに大きいです。グローバル製品にとって、そこが肝心です。個人にとっては、最も整理されたフォルダで機能する機能と、人々が実際にものを保存する雑然とした現実で機能する機能の違いです。

これが今後の道筋について語ること

このリリースを読む最も有用な方法は、マルチモーダルAIが向かう先を示す印として見ることです。生成は見出しを取りますが、日常体験を形作るモデルは、しばしば整理し、取得し、つなぐ小型のモデルです。覚えていることを説明するだけで、自分の写真、音声、動画を検索でき、何もアップロードしなくてよいモデルは、控えめに聞こえて広い射程を持つ能力です。

それはまた、生成だけでは埋められないギャップを埋めます。生成機能は製品の半分にすぎず、もう半分は変更したいものを見つけることです。何千枚もの写真をスクロールして一枚を探したことがある人なら、そのギャップを感じたはずです。共有埋め込み空間は、不可能な検索を一文に変えます。説明すれば、一致する項目が浮かび上がります。それは紙の上では小さな便利さ、実際には大きな便利さです。なぜなら、ライブラリを所有することと、それを利用できることの違いだからです。

このパターンが続くなら、来年はさらに多くのタスクがデバイス上に戻ってくるでしょう。そのそれぞれが、現在サーバーを必要とするもののうち、さらに少し多くを、オフラインで、手の中で、自分の条件で動くものへと移します。EmbeddingGemma 2はその方向への一歩であり、静かな一歩です。静かなものこそ、しばしば定着します。

関連記事