Perplexity a publié pplx-embed-v2-late, une paire de modèles d'embedding multimodaux de type ColBERT. Ils se déclinent en 2 tailles : 0.6B pour des requêtes rapides et économiques, et 9B pour une qualité maximale. Les deux modèles récupèrent du texte, des images et des pages PDF rendues, et ils partagent un même espace d'embedding.
Est-il déployable ? Oui, si vous l'hébergez vous-même. Les deux modèles sont disponibles sur Hugging Face sous licence MIT. Un point de terminaison Perplexity API hébergé est prévu mais pas encore disponible.
TL;DR
Le meilleur
- Le modèle de 0.6B utilise environ 340M de paramètres actifs pour les images et reste proche des rivaux de 8B.
- Un index de 9B peut être interrogé avec des requêtes de 0.6B, récupérant environ la moitié de l'écart de qualité entre 9B et 0.6B sur le texte, au coût de requête de 0.6B.
- Ses vecteurs de tokens de 128 dimensions sont 16 à 32 fois plus étroits que ceux des rivaux, qui font 2,048 à 4,096 dimensions.
- Licence MIT, avec usage commercial autorisé.
Le pire
- Il stocke 1 vecteur par token, donc la taille de l'index croît avec la longueur des documents.
- Il n'est pas n°1 sur la récupération d'images de ViDoRe v3 ; EVIE de Tencent obtient un score supérieur.
- Une seule entrée ne peut pas mélanger texte et images.
- Tous les scores sont auto-déclarés, et le rapport technique n'est pas encore publié.
Taille des modèles et matériel d'exécution
| Métriques | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| Paramètres totaux | 594M | 9B (Hugging Face indique 8B) |
| Paramètres actifs | ~240M texte, 340M image | 7.4B |
| Modèle de base | Qwen3.5-0.8B, élagué à 12 couches de texte | Qwen3.5 |
| Sortie | 128 dims par token | 128 dims par token |
| Poids en mémoire (bf16, notre estimation) | ~1.2 Go | ~16 à 18 Go |
| Machine prévue | Ordinateur portable, appareil en périphérie ou petit GPU | Datacenter ou GPU à mémoire élevée |
| Le rôle suggéré par Perplexity | Encodeur de requêtes en direct, 100 % local | Construction de l'index du document |
Perplexity a conçu le modèle 0.6B comme un encodeur de requêtes léger capable de fonctionner également sur des appareils en périphérieue. Les deux fiches modèles montrer l'utilisation des GPU CUDA. Ils doivent sentence-transformers >= 6.0.0 et transformers >= 5.4.0. Les chiffres de mémoire sont notre estimation à 2 octets par paramètre, pour les poids uniquement. Les checkpoints publiés sont stockés en F32, ce qui double la taille du téléchargement.
Performances : meilleurs et pires scores
Tous les chiffres ci-dessous proviennent de Perplexity annonce:
| Analyse comparative | 0.6 Md | 9B | Où cela en est |
|---|---|---|---|
| MADQA (QA agentique sur PDF, précision) | 90.1% | 92,4 % (meilleur) | Bat le retriever de Mixedbread (88.9 %) ; reste derrière Mixedbread Agentic Search (93.4 %) |
| Texte spécifique à un domaine (72 tâches, nDCG@10) | 78.0% | 81.3% | Le modèle 9B devance tous les modèles testés de 1,6pp ; le 0,6B est à 0,3pp derrière gemini-embedding-2 |
| Q2D-Web (Rappel@1000) | 73.6% | 74.8% | Tous deux ont dépassé le précédent record de 69.3% |
| Image ViDoRe v3 (nDCG@10) | 62.3% | 65.2% | 0.6B est à moins de 1,2pp de nemotron-colembed-v2-8b ; EVIE mène |
| ViDoRe v3 Markdown (nDCG@10) | 61.2% (le plus mauvais) | 64.7% | Tous deux surpassent chaque modèle externe testé |
| BrowseComp+ (précision) | Non communiqué | 64.0% (le plus bas) | Encore 4.9 points de pourcentage au-dessus du prochain modèle ColBERT |
Le meilleur résultat : 92,4 % sur MADQA, établi par le modèle 9B. L'écart le plus important est sur BrowseComp+, à 8,7 points au-dessus du meilleur modèle dense.
Le résultat le plus faible : 61,2 % sur ViDoRe v3 Markdown, réalisé par le modèle 0.6B. C'est tout de même le 2e meilleur score sur ce benchmark. La recherche d'images est le véritable écart : Gemini Embedding 2 bat le modèle 9B sur MIRACL-Vision et de 2 points sur PPLX-Q2I.
Le mélange des tailles : un index 9B interrogé par le modèle 0.6B a obtenu 63,5 % sur la récupération d'images ViDoRe v3. Cela bat 62,3 % avec 0.6B des deux côtés, au même coût de requête.
Fonctionnement
Les modèles denses compressent un document en 1 vecteur. pplx-embed-v2-late conserve à la place un vecteur de 128 dimensions pour chaque token. Il calcule le score avec MaxSim : chaque token de requête trouve son meilleur token de document, et ces maxima sont additionnés. Les pages sont encodées sous forme d'images, donc aucune étape d'OCR n'est nécessaire. Perplexity a distillé les deux modèles à partir d'un enseignant de 18B en utilisant un entraînement LEAFau niveau des tokens. C'est cet entraînement qui crée l'espace partagé.
Meilleurs cas d'usage
- Le meilleur usage est la recherche visuelle de documents sur des PDF, des diapositives et des rapports numérisés.
- Recherche à faible latence : indexer dans le cloud avec 9B, puis interroger sur l'appareil avec 0.6B.
- RAG agentique sur de grandes collections de PDF ou du web.
Explication interactive
Comparaison
| Caractéristique | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| Taille | 0.6B, 9B | ~8.8B | 0.8B, 2B open | Non divulguée |
| Largeur des vecteurs | 128 par token | 4,096 par token | 2,048 par token (petit) | 128 à 3,072, 1 vecteur |
| Entrées | Texte, images, rendus de page | Requêtes textuelles, images de page | Texte, images de page | Texte, image, vidéo, audio, PDF |
| Fonctionne sur | Votre GPU ; 0.6B en périphérie | NVIDIA A100/H100, Linux | GPU CUDA (Ampere+) | API Google |
| Espace partagé entre les tailles | Oui | Non précisé | Non précisé | Non applicable |
| Licence | MIT | CC-BY-NC-4.0 | Apache 2.0 (petit) | Propriétaire |
Points clés à retenir
- Le modèle 0.6B convient aux appareils en périphérie ; le modèle 9B est conçu pour la qualité au moment de l'indexation.
- Meilleur score : 92.4 % sur MADQA. Plus faible : 61.2 % sur ViDoRe v3 Markdown.
- Des requêtes 0.6B sur un index 9B surpassent 0.6B des deux côtés.
- La croissance du stockage et les scores auto-déclarés sont les principales réserves.
Découvrez les poids du modèle sur HF et les détails techniques. Tout le mérite revient au chercheur de ce projet. N'hésitez pas également à nous suivre sur Twitter et n'oubliez pas de rejoindre notre 150k+ML SubReddit et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur Telegram ? vous pouvez désormais nous rejoindre également sur Telegram.
L'article Perplexity AI lance pplx-embed-v2-late : un modèle Edge de 0,6B et un modèle de 9B obtenant un score de 92,4 % sur MADQA est apparu en premier sur MarkTechPost.