GoogleがEmbeddingGemma 2を公開、テキスト・画像・音声・動画を単一モデルで検索可能に

GoogleがEmbeddingGemma 2を公開、テキスト・画像・音声・動画を単一モデルで検索可能に

Googleは、Gemma 4アーキテクチャを基盤とするオープンなマルチモーダル埋め込みモデルEmbeddingGemma 2を発表した。7億4000万パラメータで、テキスト・画像・音声・動画を統一された埋め込み空間にマッピングし、オンデバイス推論に最適化。量子化によりGoogle Pixel 11 Proでテキストのみ約191MB、フルマルチモーダルでも約567MBのRAMで動作する。コード性能はMTEB Codeで9.92ポイント向上し、8Kトークンのコンテキストウィンドウで最大5.5分の音声や29枚の画像を処理できる。Apache 2.0ライセンスで提供され、プライバシーを保ちながらオフラインでのクロスモーダル検索やRAGを実現する。

音声メモから特定のビデオクリップを見つけたり、テキストクエリで何時間もの音声録音を検索したりできる。すべて単一のネイティブマルチモーダルモデルで処理される。
  1. simonw

    EmbeddingGemma 2がApache 2.0ライセンスの下にあるのは本当にありがたい。

    特に埋め込みモデルに関しては、クローズドでプロプライエタリな、ホスト型専用モデルを使うのは理にかなっているとは思わない。

    埋め込みモデルのほとんどの用途は、何千、時には何百万もの埋め込みベクトルを計算し、後で比較するために保存しておくことだ。

    もしあなたのモデルがプロプライエタリなら、ベンダーはいつかそのモデルの提供を止めると決める可能性が高い。より良いモデルに置き換えるだろうが、保存済みの何百万もの既存ベクトルを再計算するために、あなたは依然として金を払わなければならない。

    (2024年4月にOpenAIは「これらの新しいモデルでコンテンツを再埋め込みするユーザーの金銭的コストを負担する」と申し出た - https://openai.com/index/gpt-4-api-general-availability/ - だが、それをすべてのプロバイダーに期待できるとは思わない。)

    注目すべきは、私はモデルを自分でホストしたいわけではないということだ。むしろ、プロバイダーにホスト型モデルの対価を払いつつ、もし彼らがホスティングを止めても、オープンウェイト版を自分で動かせる、あるいはそれを代行してくれる別のベンダーを見つけられる、と分かっている状態のほうがはるかにいい。

  2. Nautman

    これがテキストと画像を使った「Jev」的なタスクに使えるというのも、とても素晴らしい。

    https://developers.google.com/edge/mediapipe/solutions/decis...

  3. aabhay

    従来のオンデバイス埋め込みモデルとは異なり、これはMatFormersではなくMRLで訓練されているように見える。つまり、残念ながら低次元の埋め込みと一緒にモデルの重みを縮小することはできない。おそらく、マルチモーダル向けのMatFormersのやり方について、まだ良い研究がないのだろう?

この日のほかの記事

2026-10-06