MarkTechPost수정일

Google DeepMind, Gemma 4 기반의 740M 오픈 멀티모달 임베딩 모델 EmbeddingGemma 2 공개

Google DeepMind의 EmbeddingGemma 2는 5가지 입력 유형을 하나의 768차원 공간에 매핑하며 오늘 Apache 2.0 라이선스로 공개됩니다. Google DeepMind Releases EmbeddingGemma 2, a 740M Open Multimodal Embedding Model Built on Gemma 4라는 글은 MarkTechPost 에 처음…

Google DeepMind이 공개했습니다 EmbeddingGemma 2, 텍스트, 코드, 이미지, 비디오 및 오디오를 하나의 768차원 공간에 임베딩하는 오픈 모델입니다. 740M 파라미터, 8K 토큰 컨텍스트 윈도우 및 Apache 2.0 라이선스를 갖추고 있습니다. 온디바이스 검색, 분류 및 프라이버시 우선 RAG를 목표로 합니다. 이 글에서는 다음을 분석, 비교하고 소개합니다 EmbeddingGemma 2 해당 공간에 들어맞습니다.

오늘 바로 배포 가능한가요? 네. 가중치가 다음에서 라이브로 제공됩니다 Hugging Face 그리고 Kaggle, ~와 함께 Ollama, llama.cpp GGUF 및 LiteRT 빌드를 지금 이용할 수 있습니다.

임베딩 모델이 하는 일

임베딩 모델은 콘텐츠를 의미를 담은 숫자 벡터로 변환합니다. 유사한 항목들은 서로 가까운 위치에 배치되기 때문에 검색과 비교가 쉽습니다. RAG 파이프라인에서 이러한 벡터를 사용하면 LLM이 학습되지 않은 최신 정보를 검색할 수 있습니다. 임베딩을 로컬에서 생성하면 데이터를 기기에 보관하고, 지연 시간을 줄이며, 오프라인에서도 작동합니다.

모든 모달리티를 위한 하나의 벡터 공간

EmbeddingGemma 2는 Gemma 4 아키텍처를 기반으로 구축되었습니다. 텍스트 쿼리로 사진을 검색할 수 있습니다. 음성 메모로 비디오 클립을 검색할 수 있습니다. 텍스트, 이미지, 데모 비디오가 함께 담긴 제품 목록과 같은 교차 입력은 단일 임베딩을 생성합니다.

설계는 모듈 방식입니다. 세 부분으로 구성되어 있습니다:

  • 텍스트와 코드 백본: 270M parameters (transformer 130M plus embedder 140M)
  • 비전 인코더: 170M parameters, optional
  • 오디오 인코더: 300M parameters, optional

개발자는 필요한 것만 로드하면 됩니다: 텍스트만은 270M, 텍스트와 비전은 440M, 텍스트와 오디오는 570M, 모두 포함하면 740M입니다. 모든 구성은 하나의 벡터 공간을 공유합니다. 텍스트 전용 구성으로 임베딩된 쿼리는 전체 모델로 임베딩된 문서와 매칭될 수 있습니다.

컨텍스트 윈도우는 8,192 토큰으로, 버전 1보다 4배 큽니다. 이는 약 29장의 이미지, 58개의 비디오 프레임 또는 5.5분 분량의 오디오에 해당합니다.

벤치마크

Google 연구팀은 1B 미만 멀티모달 임베더 중 MTEB Code와 MAEB에서 최고 점수를 기록했다고 보고했습니다. 768 차원에서의 전체 정밀도 결과는 다음과 같습니다:

벤치마크EmbeddingGemma 2EmbeddingGemma 1
MTEB multilingual v261.3661.15
MTEB Code v178.6868.76
MIEB lite (image)64.64n/a
MMEB v2 overall59.01n/a
MSEB retrieval (sound)69.54n/a
MAEB (audio)49.39n/a

출처: EmbeddingGemma 2 모델 카드

코드 검색은 9.92점 향상되어 약 14%에 해당합니다. 다국어 텍스트 품질은 안정적으로 유지됩니다. 더 큰 모델들은 여전히 일부 보드에서 앞서 있습니다. Qwen3-VL-Embedding-2B 자체 MMEB-V2 실행에서 73.2를 보고했으며, 약 2.7배의 파라미터를 가지고 오디오는 지원하지 않습니다.

휴대폰과 노트북을 위해 설계됨

Pixel 11 Pro에서 양자화를 적용하면 텍스트 전용 가중치에 필요한 활성 RAM은 약 191MB입니다. 전체 멀티모달 모델은 약 567MB가 필요합니다. 양자화 인식 훈련(quantization-aware training)은 가중치를 INT4 및 INT8로 압축합니다. Google AI Edge 팀 은 70토큰의 비전 예산을 사용하여 MacBook M5 Pro GPU에서 이미지당 37.3 ms를 측정했습니다.

Matryoshka Representation Learning(MRL)을 사용하면 개발자가 벡터를 512, 256 또는 128 차원으로 잘라낼 수 있습니다. 768에서 128 차원으로 줄이면 저장 공간이 최대 6배 절감됩니다. 256 차원에서 MTEB multilingual은 61.36에서 60.41로 소폭 하락하는 데 그칩니다. 128 차원에서는 MMEB가 45.65로 떨어지므로, Google은 128d를 주로 텍스트 전용 작업에 사용할 것을 권장합니다.

인터랙티브 설명

EmbeddingGemma 2 vs. 가장 가까운 경쟁 모델

특징EmbeddingGemma 2EmbeddingGemma 1Qwen3-VL-Embedding-2BLCO-Embedding-Omni-3BGemini Embedding 2
개발사Google DeepMindGoogle DeepMindAlibaba QwenLCO-Embedding (연구)Google
파라미터740M (텍스트 전용 270M)308M2B3B 백본 (HF에는 5B로 표기)미공개
텍스트 / 코드예예예예예
이미지예아니요예예예
비디오예아니요예예예
오디오예아니요아니요예예
출력 차원 (MRL)768 (512, 256, 128)768 (128까지 축소 가능)최대 2048 (64에서 2048까지)언급 없음3072 (128에서 3072까지)
컨텍스트8,192 토큰2K 토큰32K 토큰언급 없음8,192 토큰
언어100+100+30+언급 없음100+
라이선스 / 접근Apache 2.0, 공개 가중치공개 가중치 (Gemma 약관)Apache 2.0, 공개 가중치Apache 2.0, 오픈 웨이트유료 API 전용
기기 내 RAM 사용량 게시텍스트 ~191MB, 전체 ~567MB200MB 미만게시되지 않음게시되지 않음클라우드 전용
소스모델 카드문서HF 카드HF 카드API 문서

실행 방법

다음에서 실행 가능: sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT 및 MediaPipe. Qdrant 는 벡터 저장소를 다루며, Unsloth 는 파인튜닝을 다룹니다. NPU 가속을 지원하는 Android용 ML Kit 지원은 몇 주 안에 제공될 예정입니다.

코드 복사
pip install -U "sentence-transformers[image,audio,video]" transformers

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))

Ollama에서 다음을 실행하세요 ollama pull embeddinggemma-2. 태그는 270m (378MB)부터 740m (1.3GB)까지 다양합니다. 데모는 Google AI Edge Gallery에 있습니다. 자세한 내용은 개발자 가이드 를 참조하세요.

핵심 요약

  • 한 740M 오픈 모델이 텍스트, 코드, 이미지, 비디오, 오디오를 공유된 768차원 공간에 임베딩합니다.
  • 모듈형 인코더는 270M(텍스트)에서 740M(완전한 멀티모달)까지 규모를 확장합니다.
  • 코드 검색은 MTEB Code에서 68.76에서 78.68로 도약했습니다.
  • 양자화를 적용하면 Pixel 11 Pro에서 약 191MB에서 567MB의 RAM으로 실행됩니다.

FAQ

  • EmbeddingGemma 2는 상업적으로 사용할 수 있나요? 네. Apache 2.0 라이선스로 배포됩니다.
  • EmbeddingGemma 2는 얼마나 많은 메모리가 필요한가요? Google는 텍스트 전용 사용 시 활성 RAM이 약 191MB, 정량화(quantized)된 전체 멀티모달 사용 시 567MB라고 Pixel 11 Pro 기준으로 보고합니다.


다음을 확인해 보세요 HF의 모델 가중치 그리고 기술 세부 사항. 이 프로젝트의 연구자에게 모든 공은 돌아갑니다. 또한 언제든지 저희를 트위터 에서 팔로우하고, 저희의 150k+ML SubReddit 에 가입하고 저희 뉴스레터를 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하고 계신가요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.

[Sponsored] 웹은 대부분의 에이전트가 갖추지 못한 단 하나의 API입니다. 데이터베이스, 캘린더, 저장소에는 API가 있습니다. 하지만 열린 웹에는 대체로 없습니다. TinyFish MCP 서버 는 모든 MCP 클라이언트에 네 가지 도구를 제공합니다: TinySearch, TinyFetch(JavaScript를 포함한 전체 페이지를 마크다운으로 제공), 로그인과 폼을 위한 TinyBrowser, 그리고 다단계 작업을 위한 TinyAgent입니다. Search와 Fetch는 무료입니다.

이 글 Google DeepMind, Gemma 4 기반의 740M 오픈 멀티모달 임베딩 모델 EmbeddingGemma 2 공개 는 먼저 다음에 게시되었습니다: MarkTechPost.

원문 출처

MarkTechPost

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요