Google DeepMind이 공개했습니다 EmbeddingGemma 2, 텍스트, 코드, 이미지, 비디오 및 오디오를 하나의 768차원 공간에 임베딩하는 오픈 모델입니다. 740M 파라미터, 8K 토큰 컨텍스트 윈도우 및 Apache 2.0 라이선스를 갖추고 있습니다. 온디바이스 검색, 분류 및 프라이버시 우선 RAG를 목표로 합니다. 이 글에서는 다음을 분석, 비교하고 소개합니다 EmbeddingGemma 2 해당 공간에 들어맞습니다.
오늘 바로 배포 가능한가요? 네. 가중치가 다음에서 라이브로 제공됩니다 Hugging Face 그리고 Kaggle, ~와 함께 Ollama, llama.cpp GGUF 및 LiteRT 빌드를 지금 이용할 수 있습니다.
임베딩 모델이 하는 일
임베딩 모델은 콘텐츠를 의미를 담은 숫자 벡터로 변환합니다. 유사한 항목들은 서로 가까운 위치에 배치되기 때문에 검색과 비교가 쉽습니다. RAG 파이프라인에서 이러한 벡터를 사용하면 LLM이 학습되지 않은 최신 정보를 검색할 수 있습니다. 임베딩을 로컬에서 생성하면 데이터를 기기에 보관하고, 지연 시간을 줄이며, 오프라인에서도 작동합니다.
모든 모달리티를 위한 하나의 벡터 공간
EmbeddingGemma 2는 Gemma 4 아키텍처를 기반으로 구축되었습니다. 텍스트 쿼리로 사진을 검색할 수 있습니다. 음성 메모로 비디오 클립을 검색할 수 있습니다. 텍스트, 이미지, 데모 비디오가 함께 담긴 제품 목록과 같은 교차 입력은 단일 임베딩을 생성합니다.
설계는 모듈 방식입니다. 세 부분으로 구성되어 있습니다:
- 텍스트와 코드 백본: 270M parameters (transformer 130M plus embedder 140M)
- 비전 인코더: 170M parameters, optional
- 오디오 인코더: 300M parameters, optional
개발자는 필요한 것만 로드하면 됩니다: 텍스트만은 270M, 텍스트와 비전은 440M, 텍스트와 오디오는 570M, 모두 포함하면 740M입니다. 모든 구성은 하나의 벡터 공간을 공유합니다. 텍스트 전용 구성으로 임베딩된 쿼리는 전체 모델로 임베딩된 문서와 매칭될 수 있습니다.
컨텍스트 윈도우는 8,192 토큰으로, 버전 1보다 4배 큽니다. 이는 약 29장의 이미지, 58개의 비디오 프레임 또는 5.5분 분량의 오디오에 해당합니다.
벤치마크
Google 연구팀은 1B 미만 멀티모달 임베더 중 MTEB Code와 MAEB에서 최고 점수를 기록했다고 보고했습니다. 768 차원에서의 전체 정밀도 결과는 다음과 같습니다:
| 벤치마크 | EmbeddingGemma 2 | EmbeddingGemma 1 |
|---|---|---|
| MTEB multilingual v2 | 61.36 | 61.15 |
| MTEB Code v1 | 78.68 | 68.76 |
| MIEB lite (image) | 64.64 | n/a |
| MMEB v2 overall | 59.01 | n/a |
| MSEB retrieval (sound) | 69.54 | n/a |
| MAEB (audio) | 49.39 | n/a |
코드 검색은 9.92점 향상되어 약 14%에 해당합니다. 다국어 텍스트 품질은 안정적으로 유지됩니다. 더 큰 모델들은 여전히 일부 보드에서 앞서 있습니다. Qwen3-VL-Embedding-2B 자체 MMEB-V2 실행에서 73.2를 보고했으며, 약 2.7배의 파라미터를 가지고 오디오는 지원하지 않습니다.
휴대폰과 노트북을 위해 설계됨
Pixel 11 Pro에서 양자화를 적용하면 텍스트 전용 가중치에 필요한 활성 RAM은 약 191MB입니다. 전체 멀티모달 모델은 약 567MB가 필요합니다. 양자화 인식 훈련(quantization-aware training)은 가중치를 INT4 및 INT8로 압축합니다. Google AI Edge 팀 은 70토큰의 비전 예산을 사용하여 MacBook M5 Pro GPU에서 이미지당 37.3 ms를 측정했습니다.
Matryoshka Representation Learning(MRL)을 사용하면 개발자가 벡터를 512, 256 또는 128 차원으로 잘라낼 수 있습니다. 768에서 128 차원으로 줄이면 저장 공간이 최대 6배 절감됩니다. 256 차원에서 MTEB multilingual은 61.36에서 60.41로 소폭 하락하는 데 그칩니다. 128 차원에서는 MMEB가 45.65로 떨어지므로, Google은 128d를 주로 텍스트 전용 작업에 사용할 것을 권장합니다.
인터랙티브 설명
EmbeddingGemma 2 vs. 가장 가까운 경쟁 모델
| 특징 | EmbeddingGemma 2 | EmbeddingGemma 1 | Qwen3-VL-Embedding-2B | LCO-Embedding-Omni-3B | Gemini Embedding 2 |
|---|---|---|---|---|---|
| 개발사 | Google DeepMind | Google DeepMind | Alibaba Qwen | LCO-Embedding (연구) | |
| 파라미터 | 740M (텍스트 전용 270M) | 308M | 2B | 3B 백본 (HF에는 5B로 표기) | 미공개 |
| 텍스트 / 코드 | 예 | 예 | 예 | 예 | 예 |
| 이미지 | 예 | 아니요 | 예 | 예 | 예 |
| 비디오 | 예 | 아니요 | 예 | 예 | 예 |
| 오디오 | 예 | 아니요 | 아니요 | 예 | 예 |
| 출력 차원 (MRL) | 768 (512, 256, 128) | 768 (128까지 축소 가능) | 최대 2048 (64에서 2048까지) | 언급 없음 | 3072 (128에서 3072까지) |
| 컨텍스트 | 8,192 토큰 | 2K 토큰 | 32K 토큰 | 언급 없음 | 8,192 토큰 |
| 언어 | 100+ | 100+ | 30+ | 언급 없음 | 100+ |
| 라이선스 / 접근 | Apache 2.0, 공개 가중치 | 공개 가중치 (Gemma 약관) | Apache 2.0, 공개 가중치 | Apache 2.0, 오픈 웨이트 | 유료 API 전용 |
| 기기 내 RAM 사용량 게시 | 텍스트 ~191MB, 전체 ~567MB | 200MB 미만 | 게시되지 않음 | 게시되지 않음 | 클라우드 전용 |
| 소스 | 모델 카드 | 문서 | HF 카드 | HF 카드 | API 문서 |
실행 방법
다음에서 실행 가능: sentence-transformers v6.1.0+, Transformers, vLLM, SGLang, MLX, llama.cpp, Ollama, LM Studio, LiteRT 및 MediaPipe. Qdrant 는 벡터 저장소를 다루며, Unsloth 는 파인튜닝을 다룹니다. NPU 가속을 지원하는 Android용 ML Kit 지원은 몇 주 안에 제공될 예정입니다.
코드 복사pip install -U "sentence-transformers[image,audio,video]" transformers
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("google/embeddinggemma-2")
q = model.encode("What causes the northern lights?", prompt_name="SearchQuery")
d = model.encode("Charged particles from the sun.", prompt_name="Document")
print(model.similarity(q, d))
Ollama에서 다음을 실행하세요 ollama pull embeddinggemma-2. 태그는 270m (378MB)부터 740m (1.3GB)까지 다양합니다. 데모는 Google AI Edge Gallery에 있습니다. 자세한 내용은 개발자 가이드 를 참조하세요.
핵심 요약
- 한 740M 오픈 모델이 텍스트, 코드, 이미지, 비디오, 오디오를 공유된 768차원 공간에 임베딩합니다.
- 모듈형 인코더는 270M(텍스트)에서 740M(완전한 멀티모달)까지 규모를 확장합니다.
- 코드 검색은 MTEB Code에서 68.76에서 78.68로 도약했습니다.
- 양자화를 적용하면 Pixel 11 Pro에서 약 191MB에서 567MB의 RAM으로 실행됩니다.
FAQ
- EmbeddingGemma 2는 상업적으로 사용할 수 있나요? 네. Apache 2.0 라이선스로 배포됩니다.
- EmbeddingGemma 2는 얼마나 많은 메모리가 필요한가요? Google는 텍스트 전용 사용 시 활성 RAM이 약 191MB, 정량화(quantized)된 전체 멀티모달 사용 시 567MB라고 Pixel 11 Pro 기준으로 보고합니다.
다음을 확인해 보세요 HF의 모델 가중치 그리고 기술 세부 사항. 이 프로젝트의 연구자에게 모든 공은 돌아갑니다. 또한 언제든지 저희를 트위터 에서 팔로우하고, 저희의 150k+ML SubReddit 에 가입하고 저희 뉴스레터를 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하고 계신가요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.
이 글 Google DeepMind, Gemma 4 기반의 740M 오픈 멀티모달 임베딩 모델 EmbeddingGemma 2 공개 는 먼저 다음에 게시되었습니다: MarkTechPost.