Perplexityがリリースしたのは pplx-embed-v2-lateで、ColBERTスタイルのマルチモーダル埋め込みモデルのペアです。2つのサイズで提供されます。高速かつ低コストなクエリ向けの0.6Bと、最高品質向けの9Bです。両モデルはテキスト、画像、レンダリングされたPDFページを検索でき、同一の埋め込み空間を共有します。
デプロイ可能か? はい、自分でホストする場合には。両モデルはMITライセンスで Hugging Face で公開されています。ホスト型の Perplexity API エンドポイントは計画中ですが、まだ稼働していません。
TL;DR
長所
- 0.6Bモデルは画像に対して約340Mのアクティブパラメータを使用し、8Bクラスのライバルに肉薄します。
- 9Bのインデックスを0.6Bのクエリで検索でき、0.6Bのクエリコストのままで、テキストにおける9Bとの品質差の約半分を回収できます。
- 128次元のトークンベクトルは、2,048〜4,096次元のライバルに比べて16倍から32倍も狭いものです。
- MITライセンスで、商用利用も許可されています。
短所
- トークンごとに1ベクトルを保存するため、インデックスサイズは文書の長さに応じて増大します。
- ViDoRe v3の画像検索では1位ではありません。TencentのEVIEの方が高いスコアを記録しています。
- 1つの入力でテキストと画像を混在させることはできません。
- すべてのスコアは自己申告であり、技術レポートはまだ公開されていません。
モデルサイズと動作環境
| 指標 | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| 総パラメータ数 | 594M | 9B(Hugging Faceでは8Bと記載) |
| アクティブパラメータ数 | テキスト約240M、画像340M | 7.4B |
| ベースモデル | Qwen3.5-0.8B を 12 テキスト層にプルーニングしたもの | Qwen3.5 |
| 出力 | トークンあたり 128 dims | トークンあたり 128 dims |
| メモリ上の重み(bf16、当社の推定) | 約1.2 GB | 約16~18GB |
| 想定されるマシン | ラップトップ、エッジデバイス、または小型GPU | データセンター用またはハイメモリGPU |
| Perplexityが提案する役割 | ライブクエリエンコーダー、100%ローカル | ドキュメントインデックスの構築 |
Perplexityは、0.6Bモデルをエッジデバイスでも実行できる軽量なクエリエンコーダとして設計しました。両方 モデルカード CUDA GPUの使用状況を表示します。これらが必要です sentence-transformers >= 6.0.0 および transformers >= 5.4.0。メモリ数値は、重みのみを対象にパラメータあたり2バイトで計算した当方の推定値です。公開されているチェックポイントはF32で保存されており、ダウンロードサイズが2倍になります。
パフォーマンス評価:最高スコアと最低スコア
以下の数値はすべてPerplexityのものです お知らせ:
| ベンチマーク | 0.6B | 9B | 現状 |
|---|---|---|---|
| MADQA(エージェント型PDF QA、精度) | 90.1% | 92.4%(最高) | Mixedbreadのリトリーバー(88.9%)を上回り、Mixedbread Agentic Search(93.4%)には及ばない |
| ドメイン固有テキスト(72タスク、nDCG@10) | 78.0% | 81.3% | 9Bはテストされた全モデルを1.6pp上回り首位、0.6Bはgemini-embedding-2に0.3pp及ばない |
| Q2D-Web (Recall@1000) | 73.6% | 74.8% | どちらも従来の最高値である69.3%を上回りました |
| ViDoRe v3 画像(nDCG@10) | 62.3% | 65.2% | 0.6B は nemotron-colembed-v2-8b の 1.2pp 以内にあり、EVIE が首位です |
| ViDoRe v3 Markdown (nDCG@10) | 61.2%(最悪) | 64.7% | 両者ともテストされたすべての外部モデルを上回った |
| BrowseComp+ (正解率) | 非公開 | 64.0%(最低) | それでも次点のColBERTモデルを4.9ポイント上回る |
最も強い結果: 9Bモデルが達成したMADQAでの92.4%。最大の差はBrowseComp+で、最高のdenseモデルを8.7ポイント上回っています。
最も弱い結果: 0.6BモデルによるViDoRe v3 Markdownでの61.2%。それでもこのベンチマークで2位のスコアです。画像検索が本当の弱点です。Gemini Embedding 2はMIRACL-Visionで9Bモデルを、PPLX-Q2Iでは2ポイント上回っています。
サイズの混在: 0.6Bモデルでクエリした9Bインデックスは、ViDoRe v3画像検索で63.5%を記録しました。同じクエリコストで、両側とも0.6Bの場合の62.3%を上回ります。
仕組み
Denseモデルは文書を1つのベクトルに圧縮します。pplx-embed-v2-lateは代わりに、すべてのトークンについて128次元のベクトルを保持します。スコアリングにはMaxSimを使用します。各クエリトークンが最良の文書トークンを見つけ、それらの最大値を合計します。ページは画像としてエンコードされるため、OCR工程は不要です。Perplexityは、18Bの教師モデルから LEAF式のトークンレベル学習を用いて両モデルを蒸留しました。この学習こそが共有空間を生み出しています。
最適なユースケース
- 最も適しているのは、PDF、スライド、スキャンしたレポートに対する視覚的文書検索です。
- 低レイテンシ検索: クラウド上で9Bのインデックスを作成し、デバイス上で0.6Bによりクエリします。
- 大規模なPDFやウェブコレクションに対するエージェンティックRAG。
インタラクティブ解説
他モデルとの比較
| 機能 | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| サイズ | 0.6B、9B | 約8.8B | 0.8B、2Bがオープン | 非公開 |
| ベクトル幅 | トークンごとに128 | トークンごとに4,096 | トークンごとに2,048(small) | 128〜3,072、1ベクトル |
| 入力 | テキスト、画像、ページレンダリング | テキストクエリ、ページ画像 | テキスト、ページ画像 | テキスト、画像、動画、音声、PDF |
| 動作環境 | お使いのGPU; エッジ向け0.6B | NVIDIA A100/H100、Linux | CUDA GPU(Ampere以降) | Google API |
| サイズ間でスペースを共有 | はい | 明記なし | 明記なし | 該当なし |
| ライセンス | MIT | CC-BY-NC-4.0 | Apache 2.0(小型モデル) | プロプライエタリ |
主なポイント
- 0.6Bモデルはエッジデバイスに収まり、9Bモデルはインデックス作成時の品質向けに構築されています。
- 最高スコア:MADQAで92.4%。最低スコア:ViDoRe v3 Markdownで61.2%。
- インデックス側に9Bを使った0.6Bのクエリは、両側とも0.6Bの場合を上回りました。
- ストレージの増加と自己申告によるスコアが主な懸念点です。
ぜひご覧ください: HF上のモデルウェイト および 技術詳細。本プロジェクトの研究者に全ての功績があります。また、私たちの Twitter のフォロー、 150k+ML SubReddit への参加、および ニュースレターの購読もお忘れなく。お待ちください!Telegramをご利用ですか? 現在、Telegramでも参加できるようになりました。
この投稿 Perplexity AI、MADQAで92.4%のスコアを達成した0.6Bエッジモデルと9Bモデル「pplx-embed-v2-late」をリリース は最初に MarkTechPost.