MarkTechPost

Perplexity AI sort pplx-embed-v2-late : un modèle Edge de 0.6B et un modèle de 9B obtenant 92.4% sur MADQA

pplx-embed-v2-late de Perplexity se décline en 2 tailles : un modèle de 0.6B conçu pour fonctionner sur des appareils edge, et un modèle de 9B pour construire des index de haute qualité. Son meilleur score est de 92.4%…

Perplexity a publié pplx-embed-v2-late, une paire de modèles d'embedding multimodaux de type ColBERT. Ils se déclinent en 2 tailles : 0.6B pour des requêtes rapides et économiques, et 9B pour une qualité maximale. Les deux modèles récupèrent du texte, des images et des pages PDF rendues, et ils partagent un même espace d'embedding.

Est-il déployable ? Oui, si vous l'hébergez vous-même. Les deux modèles sont disponibles sur Hugging Face sous licence MIT. Un point de terminaison Perplexity API hébergé est prévu mais pas encore disponible.

TL;DR

Le meilleur

  • Le modèle de 0.6B utilise environ 340M de paramètres actifs pour les images et reste proche des rivaux de 8B.
  • Un index de 9B peut être interrogé avec des requêtes de 0.6B, récupérant environ la moitié de l'écart de qualité entre 9B et 0.6B sur le texte, au coût de requête de 0.6B.
  • Ses vecteurs de tokens de 128 dimensions sont 16 à 32 fois plus étroits que ceux des rivaux, qui font 2,048 à 4,096 dimensions.
  • Licence MIT, avec usage commercial autorisé.

Le pire

  • Il stocke 1 vecteur par token, donc la taille de l'index croît avec la longueur des documents.
  • Il n'est pas n°1 sur la récupération d'images de ViDoRe v3 ; EVIE de Tencent obtient un score supérieur.
  • Une seule entrée ne peut pas mélanger texte et images.
  • Tous les scores sont auto-déclarés, et le rapport technique n'est pas encore publié.

Taille des modèles et matériel d'exécution

Métriquespplx-embed-v2-late-0.6bpplx-embed-v2-late-9b
Paramètres totaux594M9B (Hugging Face indique 8B)
Paramètres actifs~240M texte, 340M image7.4B
Modèle de baseQwen3.5-0.8B, élagué à 12 couches de texteQwen3.5
Sortie128 dims par token128 dims par token
Poids en mémoire (bf16, notre estimation)~1.2 Go~16 à 18 Go
Machine prévueOrdinateur portable, appareil en périphérie ou petit GPUDatacenter ou GPU à mémoire élevée
Le rôle suggéré par PerplexityEncodeur de requêtes en direct, 100 % localConstruction de l'index du document

Perplexity a conçu le modèle 0.6B comme un encodeur de requêtes léger capable de fonctionner également sur des appareils en périphérieue. Les deux fiches modèles montrer l'utilisation des GPU CUDA. Ils doivent sentence-transformers >= 6.0.0 et transformers >= 5.4.0. Les chiffres de mémoire sont notre estimation à 2 octets par paramètre, pour les poids uniquement. Les checkpoints publiés sont stockés en F32, ce qui double la taille du téléchargement.

Performances : meilleurs et pires scores

Tous les chiffres ci-dessous proviennent de Perplexity annonce:

Analyse comparative0.6 Md9BOù cela en est
MADQA (QA agentique sur PDF, précision)90.1%92,4 % (meilleur)Bat le retriever de Mixedbread (88.9 %) ; reste derrière Mixedbread Agentic Search (93.4 %)
Texte spécifique à un domaine (72 tâches, nDCG@10)78.0%81.3%Le modèle 9B devance tous les modèles testés de 1,6pp ; le 0,6B est à 0,3pp derrière gemini-embedding-2
Q2D-Web (Rappel@1000)73.6%74.8%Tous deux ont dépassé le précédent record de 69.3%
Image ViDoRe v3 (nDCG@10)62.3%65.2%0.6B est à moins de 1,2pp de nemotron-colembed-v2-8b ; EVIE mène
ViDoRe v3 Markdown (nDCG@10)61.2% (le plus mauvais)64.7%Tous deux surpassent chaque modèle externe testé
BrowseComp+ (précision)Non communiqué64.0% (le plus bas)Encore 4.9 points de pourcentage au-dessus du prochain modèle ColBERT

Le meilleur résultat : 92,4 % sur MADQA, établi par le modèle 9B. L'écart le plus important est sur BrowseComp+, à 8,7 points au-dessus du meilleur modèle dense.

Le résultat le plus faible : 61,2 % sur ViDoRe v3 Markdown, réalisé par le modèle 0.6B. C'est tout de même le 2e meilleur score sur ce benchmark. La recherche d'images est le véritable écart : Gemini Embedding 2 bat le modèle 9B sur MIRACL-Vision et de 2 points sur PPLX-Q2I.

Le mélange des tailles : un index 9B interrogé par le modèle 0.6B a obtenu 63,5 % sur la récupération d'images ViDoRe v3. Cela bat 62,3 % avec 0.6B des deux côtés, au même coût de requête.

Fonctionnement

Les modèles denses compressent un document en 1 vecteur. pplx-embed-v2-late conserve à la place un vecteur de 128 dimensions pour chaque token. Il calcule le score avec MaxSim : chaque token de requête trouve son meilleur token de document, et ces maxima sont additionnés. Les pages sont encodées sous forme d'images, donc aucune étape d'OCR n'est nécessaire. Perplexity a distillé les deux modèles à partir d'un enseignant de 18B en utilisant un entraînement LEAFau niveau des tokens. C'est cet entraînement qui crée l'espace partagé.

Meilleurs cas d'usage

  • Le meilleur usage est la recherche visuelle de documents sur des PDF, des diapositives et des rapports numérisés.
  • Recherche à faible latence : indexer dans le cloud avec 9B, puis interroger sur l'appareil avec 0.6B.
  • RAG agentique sur de grandes collections de PDF ou du web.

Explication interactive

Comparaison

Caractéristiquepplx-embed-v2-lateNVIDIA nemotron-colembed-vl-8b-v2TopK topk-embed-v1Google Gemini Embedding 2
Taille0.6B, 9B~8.8B0.8B, 2B openNon divulguée
Largeur des vecteurs128 par token4,096 par token2,048 par token (petit)128 à 3,072, 1 vecteur
EntréesTexte, images, rendus de pageRequêtes textuelles, images de pageTexte, images de pageTexte, image, vidéo, audio, PDF
Fonctionne surVotre GPU ; 0.6B en périphérieNVIDIA A100/H100, LinuxGPU CUDA (Ampere+)API Google
Espace partagé entre les taillesOuiNon préciséNon préciséNon applicable
LicenceMITCC-BY-NC-4.0Apache 2.0 (petit)Propriétaire

Points clés à retenir

  • Le modèle 0.6B convient aux appareils en périphérie ; le modèle 9B est conçu pour la qualité au moment de l'indexation.
  • Meilleur score : 92.4 % sur MADQA. Plus faible : 61.2 % sur ViDoRe v3 Markdown.
  • Des requêtes 0.6B sur un index 9B surpassent 0.6B des deux côtés.
  • La croissance du stockage et les scores auto-déclarés sont les principales réserves.


Découvrez les poids du modèle sur HF et les détails techniques. Tout le mérite revient au chercheur de ce projet. N'hésitez pas également à nous suivre sur Twitter et n'oubliez pas de rejoindre notre 150k+ML SubReddit et de vous abonner à notre Newsletter. Attendez ! êtes-vous sur Telegram ? vous pouvez désormais nous rejoindre également sur Telegram.

[Sponsorisé] Le web est la seule API qui manque à la plupart des agents. Les bases de données, les calendriers et les dépôts ont des API. Le web ouvert, lui, n'en a pour ainsi dire pas. Le serveur MCP de TinyFish offre à tout client MCP quatre outils : TinySearch, TinyFetch (des pages complètes en markdown, JavaScript inclus), TinyBrowser pour les connexions et formulaires, et TinyAgent pour les tâches en plusieurs étapes. Search et Fetch sont gratuits.

L'article Perplexity AI lance pplx-embed-v2-late : un modèle Edge de 0,6B et un modèle de 9B obtenant un score de 92,4 % sur MADQA est apparu en premier sur MarkTechPost.

Source originale

MarkTechPost

À propos du contenu

La publication originale et les droits appartiennent à la source.

Traduction automatique · Consultez l’original