Google выпустила EmbeddingGemma 2 — мультимодальную модель, которая ищет видео по голосовой заметке

Google представила EmbeddingGemma 2 — открытую мультимодальную модель на 740 млн параметров, которая объединяет текст, код, изображения, видео и аудио в едином векторном пространстве. Она работает на устройстве: на Pixel 11 Pro требует около 191 МБ оперативной памяти для текста и 567 МБ для полной мультимодальной версии. Контекстное окно в 8K токенов позволяет обрабатывать до 5,5 минут аудио или 58 видеокадров. Модель распространяется под лицензией Apache 2.0, а качество на коде выросло почти на 10 пунктов.
Она может помочь найти конкретный видеоклип по голосовой заметке или искать по часам аудиозаписей с помощью текстового запроса — и всё это обрабатывается одной нативно мультимодальной моделью.
- simonw
Мне очень нравится, что EmbeddingGemma 2 распространяется под лицензией Apache 2.0.
Для эмбеддинг-моделей, в частности, я не считаю разумным использовать закрытую, проприетарную модель, доступную только через хостинг.
Большинство применений эмбеддинг-моделей связано с вычислением тысяч или даже миллионов векторов эмбеддингов и их сохранением для последующего сравнения.
Если ваша модель проприетарна, поставщик, скорее всего, когда-нибудь решит прекратить её предоставлять. У них будет лучшая модель на замену, но вам всё равно придётся платить за пересчёт этих миллионов уже сохранённых векторов.
(В апреле 2024 года OpenAI предложила «покрыть финансовые затраты пользователей на повторное создание эмбеддингов контента с помощью этих новых моделей» — https://openai.com/index/gpt-4-api-general-availability/ — но я не думаю, что на это можно полагаться от каждого провайдера.)
Примечательно, что я не хочу хостить модель сам. Я гораздо охотнее заплачу провайдеру за хостинговую модель, зная, что если они когда-нибудь прекратят её хостить, я смогу запустить версию с открытыми весами сам — или найти другого поставщика, который сделает это для меня.
- Nautman
Также очень здорово, что это можно использовать для задач типа «Jev» с текстом и изображениями.
https://developers.google.com/edge/mediapipe/solutions/decis...
- aabhay
Обратите внимание, что в отличие от предыдущих моделей эмбеддингов для устройств, эта, похоже, обучена с MRL, а не с MatFormers, а значит, вы, к сожалению, не сможете уменьшить веса модели вместе с эмбеддингами меньшей размерности. Вероятно, пока нет хороших исследований о том, как делать MatFormers для мультимодальности?