EmbeddingGemma 2 unifica texto, imagen, audio y video en un solo modelo de 740 millones de parámetros

Google DeepMind lanza EmbeddingGemma 2, un modelo de embeddings multimodal nativo que asigna combinaciones de texto, imágenes, audio y video a un espacio vectorial compartido. Con 740 millones de parámetros y licencia Apache 2.0, está optimizado para inferencia en dispositivo: en un Pixel 11 Pro consume ~191 MB de RAM para texto y ~567 MB para el modelo completo. Mejora un 9.92% en código y permite truncar vectores de 768 a 128 dimensiones, reduciendo el almacenamiento hasta 6x.
Puede ayudar a encontrar un clip de video específico a partir de una nota de voz, o buscar en horas de grabaciones de audio basándose en una consulta de texto, todo procesado por un único modelo nativamente multimodal.
- simonw
Realmente aprecio que EmbeddingGemma 2 esté bajo la licencia Apache 2.0.
Para los modelos de embedding en particular, no creo que tenga sentido usar un modelo cerrado, propietario y solo alojado.
La mayoría de las aplicaciones de los modelos de embedding implican calcular miles o incluso millones de vectores de embedding y almacenarlos para compararlos después.
Si tu modelo es propietario, es probable que el proveedor algún día decida dejar de ofrecer ese modelo. Tendrán un modelo mejor para reemplazarlo, pero aún así tendrás que pagar para recalcular esos millones de vectores existentes almacenados.
(En abril de 2024 OpenAI ofreció "cubrir el costo financiero de que los usuarios vuelvan a incrustar contenido con estos nuevos modelos" - https://openai.com/index/gpt-4-api-general-availability/ - pero no creo que eso sea algo con lo que podamos contar de todos los proveedores).
Cabe destacar que no quiero alojar el modelo yo mismo. Preferiría pagarle a un proveedor por un modelo alojado sabiendo que, si alguna vez dejan de alojarlo, puedo ejecutar yo mismo la versión de pesos abiertos, o encontrar otro proveedor que pueda hacerlo por mí.
- Nautman
También es muy interesante que esto se pueda usar para tareas tipo "Jev" con texto e imagen.
https://developers.google.com/edge/mediapipe/solutions/decis...
- aabhay
Ten en cuenta que, a diferencia de los modelos de embedding en dispositivo anteriores, este parece estar entrenado con MRL, no con MatFormers, lo que significa que, lamentablemente, no puedes reducir los pesos del modelo junto con los embeddings de menor dimensión. ¿Probablemente todavía no hay buenas investigaciones sobre cómo hacer MatFormers para multimodal?