Perplexity는 다음을 공개했습니다 pplx-embed-v2-late, ColBERT 스타일의 멀티모달 임베딩 모델 2종입니다. 2가지 크기로 제공됩니다: 빠르고 저렴한 쿼리를 위한 0.6B와 최대 품질을 위한 9B. 두 모델 모두 텍스트, 이미지, 렌더링된 PDF 페이지를 검색하며, 하나의 임베딩 공간을 공유합니다.
배포 가능한가요? 네, 직접 호스팅하는 경우 가능합니다. 두 모델 모두 MIT 라이선스로 Hugging Face 에 올라와 있습니다. 호스팅된 Perplexity API 엔드포인트는 계획되어 있지만 아직 공개되지 않았습니다.
TL;DR
장점
- 0.6B 모델은 이미지에 대해 약 340M의 활성 파라미터를 사용하며 8B급 경쟁 모델에 근접한 성능을 보입니다.
- 9B 인덱스를 0.6B 쿼리로 검색할 수 있어, 0.6B 쿼리 비용으로 텍스트에서 9B 품질 격차의 약 절반을 회복합니다.
- 128차원 토큰 벡터는 2,048~4,096차원의 경쟁 모델보다 16배~32배 좁습니다.
- MIT 라이선스이며 상업적 사용이 허용됩니다.
단점
- 토큰당 1개의 벡터를 저장하므로 인덱스 크기가 문서 길이에 비례해 증가합니다.
- ViDoRe v3 이미지 검색에서는 1위가 아닙니다; Tencent의 EVIE가 더 높은 점수를 기록합니다.
- 단일 입력에서 텍스트와 이미지를 혼합할 수 없습니다.
- 모든 점수는 자체 보고이며, 기술 보고서는 아직 공개되지 않았습니다.
모델 크기 및 실행 환경
| 지표 | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| 전체 파라미터 | 594M | 9B (Hugging Face는 8B로 표기) |
| 활성 파라미터 | 텍스트 약 240M, 이미지 340M | 7.4B |
| 베이스 모델 | Qwen3.5-0.8B, 12개 텍스트 레이어로 프루닝됨 | Qwen3.5 |
| 출력 | 토큰당 128 dims | 토큰당 128 dims |
| 메모리 내 가중치 (bf16, 우리의 추정치) | 약 1.2 GB | ~16에서 18 GB |
| 대상 기기 | 노트북, 엣지 디바이스 또는 소형 GPU | 데이터센터용 또는 대용량 메모리 GPU |
| Perplexity가 제안하는 역할 | 실시간 쿼리 인코더, 100% 로컬 | 문서 색인 구축하기 |
Perplexity는 0.6B 모델을 엣지 기기에서도 실행할 수 있는 경량 쿼리 인코더로 설계했습니다. 두 모델 카드 CUDA GPU 사용량을 보여줍니다. 이들은 다음이 필요합니다: sentence-transformers >= 6.0.0 그리고 transformers >= 5.4.0. 메모리 수치는 파라미터당 2바이트, 가중치만 기준으로 한 우리의 추정치입니다. 공개된 체크포인트는 F32로 저장되어 다운로드 크기가 두 배가 됩니다.
성능 평가: 최고 및 최악 점수
아래의 모든 수치는 Perplexity의 것입니다. 공지:
| 벤치마크 | 0.6B | 9B | 현재 상황 |
|---|---|---|---|
| MADQA (에이전틱 PDF QA, 정확도) | 90.1% | 92.4% (최고) | Mixedbread의 리트리버(88.9%)를 앞지르며, Mixedbread Agentic Search(93.4%)에는 뒤처짐 |
| 도메인 특화 텍스트 (72개 작업, nDCG@10) | 78.0% | 81.3% | 9B는 테스트된 모든 모델을 1.6pp 앞서며, 0.6B는 gemini-embedding-2보다 0.3pp 뒤처립니다 |
| Q2D-Web (Recall@1000) | 73.6% | 74.8% | 둘 모두 이전 최고 기록인 69.3%를 넘어섰습니다 |
| ViDoRe v3 이미지 (nDCG@10) | 62.3% | 65.2% | 0.6B는 nemotron-colembed-v2-8b와 1.2pp 이내이며; EVIE가 선두입니다 |
| ViDoRe v3 마크다운 (nDCG@10) | 61.2% (최저) | 64.7% | 둘 다 테스트된 모든 외부 모델을 능가 |
| BrowseComp+ (정확도) | 제공되지 않음 | 64.0% (가장 낮음) | 그래도 다음 ColBERT 모델보다 4.9pp 높음 |
가장 강한 결과: 9B 모델이 기록한 MADQA 92.4%. 가장 큰 격차는 BrowseComp+에서 나타났으며, 최고의 dense 모델보다 8.7pp 높습니다.
가장 약한 결과: 0.6B 모델의 ViDoRe v3 Markdown 61.2%. 그래도 해당 벤치마크에서 2위 점수입니다. 진짜 약점은 이미지 검색입니다: Gemini Embedding 2가 MIRACL-Vision에서 9B 모델을 이겼고 PPLX-Q2I에서는 2pp 차이로 앞섭니다.
크기 혼합: 9B 인덱스를 0.6B 모델로 쿼리했을 때 ViDoRe v3 이미지 검색에서 63.5%를 기록했습니다. 양쪽 모두 0.6B를 사용했을 때의 62.3%보다 높으며, 쿼리 비용은 동일합니다.
작동 방식
Dense 모델은 문서를 1개의 벡터로 압축합니다. pplx-embed-v2-late는 대신 모든 토큰마다 128차원 벡터를 유지합니다. MaxSim으로 점수를 매깁니다: 각 쿼리 토큰이 가장 잘 맞는 문서 토큰을 찾고, 그 최댓값들을 합산합니다. 페이지는 이미지로 인코딩되므로 OCR 단계가 필요하지 않습니다. Perplexity는 두 모델 모두 18B teacher에서 다음과 같이 distillation했습니다: LEAF스타일 토큰 수준 학습. 바로 이 학습이 공유 공간을 만들어냅니다.
최적 활용 사례
- 가장 잘 맞는 용도는 PDF, 슬라이드, 스캔한 보고서에 대한 시각적 문서 검색입니다.
- 저지연 검색: 클라우드에서는 9B로 인덱싱하고, 온디바이스에서는 0.6B로 쿼리합니다.
- 대규모 PDF 또는 웹 컬렉션에 대한 Agentic RAG.
인터랙티브 설명
비교
| 특성 | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| 크기 | 0.6B, 9B | ~8.8B | 0.8B, 2B open | 공개되지 않음 |
| 벡터 폭 | 토큰당 128 | 토큰당 4,096 | 토큰당 2,048 (small) | 128~3,072, 벡터 1개 |
| 입력 | 텍스트, 이미지, 페이지 렌더링 | 텍스트 쿼리, 페이지 이미지 | 텍스트, 페이지 이미지 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 실행 환경 | 내 GPU; 에지에서 0.6B | NVIDIA A100/H100, Linux | CUDA GPU (Ampere+) | Google API |
| 크기 전용 공유 공간 | 예 | 언급 없음 | 언급 없음 | 해당 없음 |
| 라이선스 | MIT | CC-BY-NC-4.0 | Apache 2.0 (소형) | 독점 |
핵심 요약
- 0.6B 모델은 에지 기기에 적합하며, 9B 모델은 인덱싱 시점 품질을 위해 만들어졌습니다.
- 최고 점수: MADQA에서 92.4%. 최저: ViDoRe v3 Markdown에서 61.2%.
- 9B 인덱스에 대한 0.6B 쿼리가 양쪽 모두 0.6B를 사용한 경우를 능가했습니다.
- 저장 공간 증가와 자체 보고된 점수가 주요 한계점입니다.
다음을 확인해 보세요: HF의 모델 가중치 그리고 기술 세부 정보. 이 프로젝트의 모든 공로는 해당 연구자에게 돌아갑니다. 또한 저희를 Twitter 에서 팔로우하고 150k+ML SubReddit 에 가입하고 저희 뉴스레터를 구독하는 것도 잊지 마세요. 잠깐! 텔레그램을 사용하고 계신가요? 이제 텔레그램에서도 저희와 함께하실 수 있습니다.
다음 글 Perplexity AI, MADQA에서 92.4%를 기록한 0.6B 엣지 모델과 9B 모델 pplx-embed-v2-late 공개 는 최초 게시된 곳은 MarkTechPost.