EmbeddingGemma 2:端侧多模态嵌入新标杆

Google DeepMind 发布了 EmbeddingGemma 2,这是一款专为端侧设备打造的多模态嵌入模型。它基于 Gemma 4 架构,仅用 7.4 亿参数即可统一处理文本、代码、图像、音频和视频。相比前代,它在 MTEB Code 基准上提升了近 10 分,并支持 8K 上下文窗口。通过 Matryoshka Representation Learning 技术,开发者可将向量维度动态压缩,实现高达 6 倍的存储节省。在 Google Pixel 11 Pro 上,全模态模型仅需约 567MB 内存即可运行,让本地 RAG 和离线多模态搜索成为现实。
它可以帮助用户从语音备忘录中查找特定的视频片段,或根据文本查询搜索数小时的音频录音,所有操作均由单一原生多模态模型完成。