Google, 7억4천만 파라미터 EmbeddingGemma 2로 온디바이스 멀티모달 임베딩 시장 공략

Google, 7억4천만 파라미터 EmbeddingGemma 2로 온디바이스 멀티모달 임베딩 시장 공략

Google이 EmbeddingGemma 2를 Apache 2.0 라이선스로 공개했다. 7억4천만 파라미터의 이 모델은 텍스트, 이미지, 오디오, 비디오를 하나의 임베딩 공간에 매핑하며, 270M 파라미터의 텍스트 전용 모드부터 300M 오디오 인코더까지 모듈식으로 구성된다. Matryoshka Representation Learning을 통해 벡터 차원을 768에서 128까지 줄여 최대 6배 저장 공간을 절약하고, 8K 토큰 컨텍스트로 5.5분 오디오나 29개 이미지를 처리한다. 코드 성능은 MTEB Code에서 9.92점 향상됐다.

음성 메모에서 특정 비디오 클립을 찾거나, 텍스트 쿼리로 몇 시간 분량의 오디오 녹음을 검색할 수 있으며, 이 모든 것이 단일 네이티브 멀티모달 모델에 의해 처리됩니다.
  1. simonw

    EmbeddingGemma 2가 Apache 2.0 라이선스라는 점이 정말 마음에 듭니다.

    특히 임베딩 모델의 경우, 폐쇄적이고 독점적인 호스팅 전용 모델을 사용하는 것은 합리적이지 않다고 생각합니다.

    임베딩 모델의 대부분의 응용 사례는 수천 또는 수백만 개의 임베딩 벡터를 계산하고 나중에 비교하기 위해 저장하는 것을 포함합니다.

    모델이 독점적이라면, 공급업체는 언젠가 그 모델 제공을 중단하기로 결정할 가능성이 높습니다. 더 나은 모델로 대체하겠지만, 저장된 수백만 개의 기존 벡터를 다시 계산하는 비용은 여전히 지불해야 합니다.

    (2024년 4월에 OpenAI는 "이 새로운 모델로 콘텐츠를 다시 임베딩하는 사용자의 재정적 비용을 부담하겠다"고 제안했습니다 - https://openai.com/index/gpt-4-api-general-availability/ - 하지만 모든 제공업체가 그렇게 해줄 것이라고 믿을 수는 없다고 봅니다.)

    특히, 저는 모델을 직접 호스팅하고 싶지 않습니다. 호스팅 모델에 대해 제공업체에 비용을 지불하되, 그들이 호스팅을 중단하면 오픈 가중치 버전을 직접 실행하거나, 그렇게 해줄 다른 공급업체를 찾을 수 있다는 것을 알고 있는 편이 훨씬 낫습니다.

  2. Nautman

    이것이 텍스트와 이미지로 "Jev" 같은 작업에 사용될 수 있다는 점도 매우 멋집니다.

    https://developers.google.com/edge/mediapipe/solutions/decis...

  3. aabhay

    이전 온디바이스 임베딩 모델과 달리, 이 모델은 MatFormers가 아닌 MRL로 훈련된 것으로 보입니다. 따라서 저차원 임베딩과 함께 모델 가중치를 축소할 수는 없습니다. 아마도 멀티모달을 위한 MatFormers를 구현하는 방법에 대한 좋은 연구가 아직 없는 것 같습니다.

이 날의 다른 글

2026-10-06