Google、テキスト・画像・音声・動画に対応するオープンな埋め込みモデル「EmbeddingGemma 2」をリリース
Googleによると、740Mパラメータのこのモデルは複数の種類のメディアを1つの共有ベクトル空間に配置し、スマートフォン上で動作するよう設計されており、Apache 2.0ライセンスで公開されている。
ポイント
- 1EmbeddingGemma 2は、テキスト、コード、画像、音声、動画を1つの共有埋め込み空間にマッピングする。
- 2パラメータ数は740Mで、Gemma 4をベースに構築され、Apache 2.0ライセンスでリリースされている。
- 3テキストのみの利用には約270Mのパラメータで足り、ビジョンエンコーダーと音声エンコーダーはオプションである。
- 4Googleは、量子化後のPixel 11 Proでテキストのみの利用時に約191MBのアクティブRAMを使用すると報告している。
- 5コンテキストウィンドウは従来の4倍に拡大し、GoogleによるとMTEB Codeのスコアは68.76から78.68に向上した。
記事全文
Googleは、昨年発表したテキスト専用の埋め込みモデルの後継となるEmbeddingGemma 2をリリースした。埋め込みモデルはコンテンツをベクトルと呼ばれる数値の列に変換し、ソフトウェアがキーワードの一致ではなく意味に基づいて関連する項目を見つけられるようにする。新バージョンはテキストに加えてコード、画像、動画、音声を扱い、それらすべてを1つの共有空間にマッピングするため、例えばテキストのクエリから一致する音声クリップや動画内の特定の場面を見つけ出すことができる。この発表はGoogle DeepMindのリサーチエンジニア2名が執筆した。
Googleによると、このモデルは740Mのパラメータを持ち、Gemma 4のアーキテクチャをベースに構築され、同社のGemini Embeddingモデルと同じ技術を活用している。モジュール式で、テキストのみの利用には約270Mのパラメータで済み、完全なマルチモーダル対応のためにビジョンエンコーダー(170M)と音声エンコーダー(300M)を追加できる。モデルが一度に受け取れる入力量であるコンテキストウィンドウは初代の4倍に拡大しており、Googleは1回の入力で最大5.5分の音声、29枚の画像、または58の動画フレームを扱えるとしている。
Googleによると、量子化を行えばテキスト専用の重みはPixel 11 Proで約191MBのアクティブメモリを必要とし、完全なマルチモーダルモデルでは約567MBとなる。出力にはMatryoshka Representation Learningが用いられており、開発者はベクトルを768次元から512、256、または128次元に短縮できる。同社によると、これによりストレージを最大6分の1に削減できるという。ベンチマークでは、GoogleはMTEB Codeと音声ベンチマークのMAEBにおいて、パラメータ数10億未満のマルチモーダル埋め込みモデルの中でトップのスコアを記録したと報告している。MTEB Codeのスコアは68.76から78.68に向上した一方、テキスト性能は初代と同水準を維持しているとされる。これらはGoogle自身の数値であり、全結果はモデルカードに掲載されている。
重みはHugging FaceとKaggleで公開されており、オンデバイス利用向けに調整されたバージョンがHugging FaceのLiteRT Communityで提供されている。Gemini Enterprise Agent Platform Model Gardenでの提供は近日予定とされている。Googleは、transformers、sentence-transformers、MLX、vLLM、llama.cpp、Ollama、LMStudioなどのツールでのサポートに加え、ファインチューニング向けのUnslothのガイダンスや、ベクトル保存用のQdrantを挙げている。また、メディアライブラリの検索や動画内の場面検索を行うGoogle AI Edge Galleryのデモアプリも紹介している。
このモデルはGemma 4と同じテキスト分割コンポーネントと音声エンコーダーを使用しているため、Googleによると両者は1つのパイプライン内で並行して動作させることができ、合計のメモリ使用量も小さく抑えられる。例えば、デバイス上でオフラインで動作する検索拡張生成(RAG)システムの構築に利用できる。同社によると、初代EmbeddingGemmaのダウンロード数は20M回を超え、開発者はオンデバイス検索ツールやプライバシーを重視したRAGパイプラインに活用してきたという。
なぜ重要か
埋め込みモデルは、セマンティック検索や検索拡張生成(RAG)を支える検索レイヤーである。複数のメディアの種類に対応し、スマートフォンのメモリに収まる小型のオープンモデルがあれば、開発者は個人の写真、録音、ファイルをサーバーに送信することなく、そうした検索機能を構築できる。またApache 2.0ライセンスは商用利用を認めている。品質に関する数値は、現時点ではGoogleからのものしかない。
経緯
· 公開
トピック#Google#Gemma#埋め込み#オンデバイスAI#オープンモデル
出典
この記事は以下の情報源に基づいています。全体の文脈は各情報源をご覧ください。


