구글 딥마인드는 텍스트, 코드, 이미지, 비디오, 오디오를 공유된 768차원 벡터 공간에 임베딩하는 Gemma 4 아키텍처 기반의 오픈소스 멀티모달 임베딩 모델인 EmbeddingGemma 2를 출시했습니다. 이 모델은 모듈식 설계를 채택해 텍스트 전용 또는 비전-오디오 변형 등 더 작은 버전으로 구성할 수 있으며, 740M 파라미터와 8K 토큰 컨텍스트 윈도우를 지원합니다.

  • EmbeddingGemma 2는 MTEB Code v1에서 78.68, MAEB(오디오)에서 49.39를 기록하며 1B 미만 멀티모달 임베더 중 선도적인 점수를 달성했습니다.
  • 이 모델은 온디바이스 배포에 최적화되어 있으며, Pixel 11 Pro에서 텍스트 전용 가중치는 약 191MB, 전체 멀티모달 모델은 567MB의 RAM을 필요로 합니다.
  • Matryoshka Representation Learning을 활용하여 벡터를 512, 256, 또는 128차원으로 잘라낼 수 있어 성능 손실을 최소화하면서 저장 요구사항을 크게 줄입니다.
  • 가중치는 Apache 2.0 라이선스 하에 Hugging Face와 Kaggle에서 제공되며, Ollama, llama.cpp, LiteRT 및 기타 프레임워크를 지원합니다.

이 출시는 개발자가 클라우드에 데이터를 전송하지 않고도 장치에서 직접 임베딩을 실행할 수 있게 함으로써 프라이버시 중심의 검색 증강 생성(RAG)과 로컬 검색 기능을 가능하게 합니다.