Googleは「ローカルで物事を見つけ出す」という課題を、スマホに収まる小さなモデルへと作り上げた。同社が最新に発表したEmbeddingGemma2は、自社初のネイティブ・マルチモーダルのオープンソース埋め込みモデルで、パラメータ規模は740Mながら、テキスト、コード、画像、動画、音声を一括して同じ意味空間へマッピングし、クロスモーダル検索を初めてエッジ側でここまで軽く動かせるようにした。
最も分かりやすい売りは小型であることとオフライン対応できることだ。完全なマルチモーダルモデルのメモリ使用量は600MB未満で、スマホ、ノートPC、ブラウザ内で直接実行でき、全過程でいかなるコンテンツもクラウドへアップロードする必要がない――写真アルバムも、録音も、動画も、すべて自分のデバイス上に留まったまま検索され、プライバシーという関門は自然に守られる。コンテキストウィンドウは8Kで前世代の4倍に拡大し、より長い資料を取り込んでからマッチングできる。対応言語も100以上に広がり、言語をまたいでの検索ももはや障害ではない。
性能面では、Googleは画像・動画・コードといった検索タスクにおいて、同クラスのオープンソース競合を明確に上回ると主張している。さらに嬉しいのはモジュール設計だ:使わない部分は必要に応じてロードでき、インデックスサイズも圧縮可能で、節約できるのは容量も計算資源も同様だ。実際のユースケースでは、できることが非常に具体的だ――ローカルの写真アルバムから意味ベースで特定の写真やメディアを探し出す、長い動画内の特定のシーンに直接飛ぶ、あちこちに散らばるファイルをオフラインで検索する、あるいはローカルのコードベース内で意図ベースに関数やコード片を検索する。その際、リポジトリをリモートサービスへプッシュして検索する必要もない。
マルチモーダル埋め込みモデルがスマホに入るほど小さく、しかも誰もが改変できるほどオープンになったとき、AI検索の重心は「データをクラウドに預ける」から静かに「能力をデバイスの中に置く」へと移りつつある。Googleのこの一手は、エッジ側でのプライバシー重視の検索に突破口を開いた。