MarkTechPost

Perplexity AI、pplx-embed-v2-lateをリリース:エッジ向け0.6BモデルとMADQAで92.4%を記録した9Bモデル

Perplexityのpplx-embed-v2-lateは2つのサイズで提供されます。エッジデバイス上で動作するよう設計された0.6Bモデルと、高品質なインデックス構築向けの9Bモデルです。最高スコアはMADQAで92.4%、最低はViDoRe v3 Markdownで61.2%です。どちらもMITライセンスで、セルフホスト可能です。この投稿「Perplexity AI Releases pplx-embed-v2-late: A…

Perplexityがリリースしたのは pplx-embed-v2-lateで、ColBERTスタイルのマルチモーダル埋め込みモデルのペアです。2つのサイズで提供されます。高速かつ低コストなクエリ向けの0.6Bと、最高品質向けの9Bです。両モデルはテキスト、画像、レンダリングされたPDFページを検索でき、同一の埋め込み空間を共有します。

デプロイ可能か? はい、自分でホストする場合には。両モデルはMITライセンスで Hugging Face で公開されています。ホスト型の Perplexity API エンドポイントは計画中ですが、まだ稼働していません。

TL;DR

長所

  • 0.6Bモデルは画像に対して約340Mのアクティブパラメータを使用し、8Bクラスのライバルに肉薄します。
  • 9Bのインデックスを0.6Bのクエリで検索でき、0.6Bのクエリコストのままで、テキストにおける9Bとの品質差の約半分を回収できます。
  • 128次元のトークンベクトルは、2,048〜4,096次元のライバルに比べて16倍から32倍も狭いものです。
  • MITライセンスで、商用利用も許可されています。

短所

  • トークンごとに1ベクトルを保存するため、インデックスサイズは文書の長さに応じて増大します。
  • ViDoRe v3の画像検索では1位ではありません。TencentのEVIEの方が高いスコアを記録しています。
  • 1つの入力でテキストと画像を混在させることはできません。
  • すべてのスコアは自己申告であり、技術レポートはまだ公開されていません。

モデルサイズと動作環境

指標pplx-embed-v2-late-0.6bpplx-embed-v2-late-9b
総パラメータ数594M9B(Hugging Faceでは8Bと記載)
アクティブパラメータ数テキスト約240M、画像340M7.4B
ベースモデルQwen3.5-0.8B を 12 テキスト層にプルーニングしたものQwen3.5
出力トークンあたり 128 dimsトークンあたり 128 dims
メモリ上の重み(bf16、当社の推定)約1.2 GB約16~18GB
想定されるマシンラップトップ、エッジデバイス、または小型GPUデータセンター用またはハイメモリGPU
Perplexityが提案する役割ライブクエリエンコーダー、100%ローカルドキュメントインデックスの構築

Perplexityは、0.6Bモデルをエッジデバイスでも実行できる軽量なクエリエンコーダとして設計しました。両方 モデルカード CUDA GPUの使用状況を表示します。これらが必要です sentence-transformers >= 6.0.0 および transformers >= 5.4.0。メモリ数値は、重みのみを対象にパラメータあたり2バイトで計算した当方の推定値です。公開されているチェックポイントはF32で保存されており、ダウンロードサイズが2倍になります。

パフォーマンス評価:最高スコアと最低スコア

以下の数値はすべてPerplexityのものです お知らせ:

ベンチマーク0.6B9B現状
MADQA(エージェント型PDF QA、精度)90.1%92.4%(最高)Mixedbreadのリトリーバー(88.9%)を上回り、Mixedbread Agentic Search(93.4%)には及ばない
ドメイン固有テキスト(72タスク、nDCG@10)78.0%81.3%9Bはテストされた全モデルを1.6pp上回り首位、0.6Bはgemini-embedding-2に0.3pp及ばない
Q2D-Web (Recall@1000)73.6%74.8%どちらも従来の最高値である69.3%を上回りました
ViDoRe v3 画像(nDCG@10)62.3%65.2%0.6B は nemotron-colembed-v2-8b の 1.2pp 以内にあり、EVIE が首位です
ViDoRe v3 Markdown (nDCG@10)61.2%(最悪)64.7%両者ともテストされたすべての外部モデルを上回った
BrowseComp+ (正解率)非公開64.0%(最低)それでも次点のColBERTモデルを4.9ポイント上回る

最も強い結果: 9Bモデルが達成したMADQAでの92.4%。最大の差はBrowseComp+で、最高のdenseモデルを8.7ポイント上回っています。

最も弱い結果: 0.6BモデルによるViDoRe v3 Markdownでの61.2%。それでもこのベンチマークで2位のスコアです。画像検索が本当の弱点です。Gemini Embedding 2はMIRACL-Visionで9Bモデルを、PPLX-Q2Iでは2ポイント上回っています。

サイズの混在: 0.6Bモデルでクエリした9Bインデックスは、ViDoRe v3画像検索で63.5%を記録しました。同じクエリコストで、両側とも0.6Bの場合の62.3%を上回ります。

仕組み

Denseモデルは文書を1つのベクトルに圧縮します。pplx-embed-v2-lateは代わりに、すべてのトークンについて128次元のベクトルを保持します。スコアリングにはMaxSimを使用します。各クエリトークンが最良の文書トークンを見つけ、それらの最大値を合計します。ページは画像としてエンコードされるため、OCR工程は不要です。Perplexityは、18Bの教師モデルから LEAF式のトークンレベル学習を用いて両モデルを蒸留しました。この学習こそが共有空間を生み出しています。

最適なユースケース

  • 最も適しているのは、PDF、スライド、スキャンしたレポートに対する視覚的文書検索です。
  • 低レイテンシ検索: クラウド上で9Bのインデックスを作成し、デバイス上で0.6Bによりクエリします。
  • 大規模なPDFやウェブコレクションに対するエージェンティックRAG。

インタラクティブ解説

他モデルとの比較

機能pplx-embed-v2-lateNVIDIA nemotron-colembed-vl-8b-v2TopK topk-embed-v1Google Gemini Embedding 2
サイズ0.6B、9B約8.8B0.8B、2Bがオープン非公開
ベクトル幅トークンごとに128トークンごとに4,096トークンごとに2,048(small)128〜3,072、1ベクトル
入力テキスト、画像、ページレンダリングテキストクエリ、ページ画像テキスト、ページ画像テキスト、画像、動画、音声、PDF
動作環境お使いのGPU; エッジ向け0.6BNVIDIA A100/H100、LinuxCUDA GPU(Ampere以降)Google API
サイズ間でスペースを共有はい明記なし明記なし該当なし
ライセンスMITCC-BY-NC-4.0Apache 2.0(小型モデル)プロプライエタリ

主なポイント

  • 0.6Bモデルはエッジデバイスに収まり、9Bモデルはインデックス作成時の品質向けに構築されています。
  • 最高スコア:MADQAで92.4%。最低スコア:ViDoRe v3 Markdownで61.2%。
  • インデックス側に9Bを使った0.6Bのクエリは、両側とも0.6Bの場合を上回りました。
  • ストレージの増加と自己申告によるスコアが主な懸念点です。


ぜひご覧ください: HF上のモデルウェイト および 技術詳細。本プロジェクトの研究者に全ての功績があります。また、私たちの Twitter のフォロー、 150k+ML SubReddit への参加、および ニュースレターの購読もお忘れなく。お待ちください!Telegramをご利用ですか? 現在、Telegramでも参加できるようになりました。

[スポンサー] ウェブは、ほとんどのエージェントに欠けている唯一のAPIです。データベース、カレンダー、リポジトリにはAPIがあります。しかしオープンウェブにはほとんどありません。 TinyFish MCPサーバー は、あらゆるMCPクライアントに4つのツールを提供します。TinySearch、TinyFetch(JavaScriptを含む完全なページをマークダウンで取得)、ログインやフォーム操作のためのTinyBrowser、複数ステップのジョブ向けのTinyAgentです。Search と Fetch は無料です。

この投稿 Perplexity AI、MADQAで92.4%のスコアを達成した0.6Bエッジモデルと9Bモデル「pplx-embed-v2-late」をリリース は最初に MarkTechPost.

原文の出典

MarkTechPost

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください