Perplexity hat veröffentlicht pplx-embed-v2-late, ein Paar multimodaler Embedding-Modelle im ColBERT-Stil. Sie kommen in 2 Größen: 0.6B für schnelle, günstige Abfragen und 9B für maximale Qualität. Beide Modelle rufen Text, Bilder und gerenderte PDF-Seiten ab, und sie teilen sich einen Einbettungsraum.
Ist es einsetzbar? Ja, wenn Sie es selbst hosten. Beide Modelle sind auf Hugging Face unter der MIT-Lizenz verfügbar. Ein gehosteter Perplexity API -Endpunkt ist geplant, aber nicht live.
TL;DR
Das Beste
- Das 0.6B-Modell verwendet etwa 340M aktive Parameter für Bilder und liegt nahe an 8B-Konkurrenten.
- Ein 9B-Index kann mit 0.6B-Abfragen durchsucht werden und holt etwa die Hälfte des 9B-Qualitätsabstands bei Text zu 0.6B-Abfragekosten zurück.
- Seine 128-dim Token-Vektoren sind 16x bis 32x schmaler als die von Konkurrenten mit 2,048 bis 4,096 Dims.
- MIT-Lizenz, mit erlaubter kommerzieller Nutzung.
Das Schlechteste
- Es speichert 1 Vektor pro Token, daher wächst die Indexgröße mit der Dokumentlänge.
- Es ist nicht #1 bei der ViDoRe v3-Bildrecherche; Tencents EVIE erzielt höhere Werte.
- Eine einzelne Eingabe kann Text und Bilder nicht mischen.
- Alle Ergebnisse sind selbst berichtet, und der technische Bericht ist noch nicht erschienen.
Modellgröße und worauf es läuft
| Metriken | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| Parameter insgesamt | 594M | 9B (Hugging Face listet 8B) |
| Aktive Parameter | ~240M Text, 340M Bild | 7.4B |
| Basismodell | Qwen3.5-0.8B, beschnitten auf 12 Textschichten | Qwen3.5 |
| Ausgabe | 128 Dimensionen pro Token | 128 Dimensionen pro Token |
| Gewichte im Speicher (bf16, unsere Schätzung) | ~1,2 GB | ~16 bis 18 GB |
| Vorgesehene Maschine | Laptop, Edge-Gerät oder kleine GPU | Datacenter oder GPU mit hohem Speicher |
| Von Perplexity vorgeschlagene Rolle | Live-Query-Encoder, 100 % lokal | Aufbau des Dokumentindex |
Perplexity hat das 0.6B-Modell als leichten Query-Encoder entworfen, der auch auf Edge-Geräten laufen kann. Beide Modellkarten zeigen die Nutzung einer CUDA-GPU. Sie benötigen sentence-transformers >= 6.0.0 und transformers >= 5.4.0. Die Speicherangaben sind unsere Schätzung bei 2 Bytes pro Parameter, nur für die Gewichte. Die veröffentlichten Checkpoints sind in F32 gespeichert, was die Downloadgröße verdoppelt.
Wie gut es abschneidet: Beste und schlechteste Ergebnisse
Alle Zahlen unten stammen aus Perplexitys Ankündigung:
| Benchmark | 0.6B | 9B | Einordnung |
|---|---|---|---|
| MADQA (agentische PDF-QA, Genauigkeit) | 90.1% | 92.4 % (bester Wert) | Übertrifft Mixedbreads Retriever (88.9 %); liegt hinter Mixedbread Agentic Search (93.4 %) |
| Domänenspezifischer Text (72 Aufgaben, nDCG@10) | 78.0% | 81.3% | 9B führt alle getesteten Modelle mit 1.6pp an; 0.6B liegt 0.3pp hinter gemini-embedding-2 |
| Q2D-Web (Recall@1000) | 73.6% | 74.8% | Beide übertreffen den bisherigen Bestwert von 69.3 % |
| ViDoRe v3 Bild (nDCG@10) | 62.3% | 65.2% | 0.6B liegt innerhalb von 1.2pp an nemotron-colembed-v2-8b heran; EVIE führt |
| ViDoRe v3 Markdown (nDCG@10) | 61.2 % (schlechtester Wert) | 64.7% | Beide übertrafen jedes getestete externe Modell |
| BrowseComp+ (Genauigkeit) | Nicht angegeben | 64.0 % (niedrigster Wert) | Trotzdem 4.9 Prozentpunkte über dem nächstbesten ColBERT-Modell |
Das stärkste Ergebnis: 92.4% auf MADQA, aufgestellt vom 9B-Modell. Der größte Vorsprung liegt auf BrowseComp+, bei 8.7pp über dem besten dichten Modell.
Das schwächste Ergebnis: 61.2% auf ViDoRe v3 Markdown, vom 0.6B-Modell. Es ist trotzdem immer noch das 2.-beste Ergebnis auf diesem Benchmark. Die echte Lücke ist die Bildersuche: Gemini Embedding 2 schlägt das 9B-Modell auf MIRACL-Vision und um 2pp auf PPLX-Q2I.
Mischung der Größen: ein 9B-Index, abgefragt vom 0.6B-Modell, erzielte 63.5% auf ViDoRe v3 Bildabfrage. Das schlägt 62.3% mit 0.6B auf beiden Seiten, bei denselben Abfragekosten.
Wie es funktioniert
Dense-Modelle komprimieren ein Dokument in 1 Vektor. pplx-embed-v2-late stattdessen behält für jedes Token einen 128-dimensionalen Vektor bei. Es bewertet mit MaxSim: jedes Abfrage-Token findet sein bestes Dokument-Token, und diese Maxima werden summiert. Seiten werden als Bilder kodiert, daher ist kein OCR-Schritt nötig. Perplexity destillierte beide Modelle von einem 18B-Lehrer mittels LEAF-artigem Token-Level-Training. Dieses Training erzeugt den gemeinsamen Raum.
Beste Anwendungsfälle
- Am besten geeignet ist die visuelle Dokumentensuche über PDFs, Folien und gescannte Berichte.
- Suche mit geringer Latenz: Index in der Cloud mit 9B, dann Abfrage auf dem Gerät mit 0.6B.
- Agentic RAG über große PDF- oder Web-Sammlungen.
Interaktiver Erklärer
Der Vergleich
| Merkmal | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| Größe | 0.6B, 9B | ~8.8B | 0.8B, 2B open | Nicht offengelegt |
| Vektorbreite | 128 pro Token | 4,096 pro Token | 2,048 pro Token (small) | 128 bis 3,072, 1 Vektor |
| Eingaben | Text, Bilder, gerenderte Seiten | Textabfragen, Seitenbilder | Text, Seitenbilder | Text, Bild, Video, Audio, PDF |
| Läuft auf | Deine GPU; 0.6B am Edge | NVIDIA A100/H100, Linux | CUDA-GPU (Ampere+) | Google API |
| Gemeinsam genutzter Speicherplatz über Größen hinweg | Ja | Nicht angegeben | Nicht angegeben | Nicht anwendbar |
| Lizenz | MIT | CC-BY-NC-4.0 | Apache 2.0 (klein) | Proprietär |
Wichtigste Erkenntnisse
- Das 0.6B-Modell passt auf Edge-Geräte; das 9B-Modell wurde für Qualität zur Indexierungszeit entwickelt.
- Bestes Ergebnis: 92.4 % auf MADQA. Schwächstes: 61.2 % auf ViDoRe v3 Markdown.
- 0.6B-Abfragen über einen 9B-Index schlagen 0.6B auf beiden Seiten.
- Speicherplatzwachstum und selbst berichtete Werte sind die wichtigsten Einschränkungen.
Schauen Sie sich die Modellgewichte auf HF und die Technischen Detailsan. Alles Verdienst gebührt dem Forscher dieses Projekts. Folgen Sie uns außerdem gerne auf Twitter und vergessen Sie nicht, unserem 150k+ML SubReddit beizutreten und unseren Newsletterzu abonnieren. Moment! Sind Sie auf Telegram? jetzt können Sie uns auch auf Telegram beitreten.
Der Beitrag Perplexity AI veröffentlicht pplx-embed-v2-late: Ein 0,6B-Edge-Modell und ein 9B-Modell mit 92,4 % auf MADQA erschien zuerst auf MarkTechPost.