MarkTechPost

Perplexity AI lanza pplx-embed-v2-late: un modelo edge de 0.6B y un modelo de 9B con una puntuación del 92.4% en MADQA

pplx-embed-v2-late de Perplexity llega en 2 tamaños: un modelo de 0.6B diseñado para ejecutarse en dispositivos edge y un modelo de 9B para construir índices de alta calidad. Su mejor puntuación es 92.4% en MADQA, y la…

Perplexity ha lanzado pplx-embed-v2-late, un par de modelos de embedding multimodales al estilo ColBERT. Vienen en 2 tamaños: 0.6B para consultas rápidas y baratas y 9B para máxima calidad. Ambos modelos recuperan texto, imágenes y páginas PDF renderizadas, y comparten un único espacio de embeddings.

¿Es desplegable? Sí, si lo alojas tú mismo. Ambos modelos están en Hugging Face bajo la licencia MIT. Un endpoint alojado de la Perplexity API está previsto pero no está disponible todavía.

TL;DR

Lo mejor

  • El modelo de 0.6B usa unos 340M de parámetros activos para imágenes y se mantiene cerca de rivales de 8B.
  • Un índice de 9B puede consultarse con consultas de 0.6B, recuperando aproximadamente la mitad de la brecha de calidad del 9B en texto al costo de consulta de 0.6B.
  • Sus vectores de tokens de 128 dimensiones son de 16x a 32x más estrechos que los de rivales con 2,048 a 4,096 dimensiones.
  • Licencia MIT, con uso comercial permitido.

Lo peor

  • Almacena 1 vector por token, por lo que el tamaño del índice crece con la longitud del documento.
  • No es el número 1 en recuperación de imágenes de ViDoRe v3; EVIE de Tencent obtiene puntuaciones más altas.
  • Una única entrada no puede mezclar texto e imágenes.
  • Todas las puntuaciones son autoinformadas, y el informe técnico aún no se ha publicado.

Tamaño del modelo y en qué se ejecuta

Métricaspplx-embed-v2-late-0.6bpplx-embed-v2-late-9b
Parámetros totales594M9B (Hugging Face lista 8B)
Parámetros activos~240M texto, 340M imagen7.4B
Modelo baseQwen3.5-0.8B, podado a 12 capas de textoQwen3.5
Salida128 dims por token128 dims por token
Pesos en memoria (bf16, nuestra estimación)~1.2 GB~16 a 18 GB
Máquina previstaPortátil, dispositivo perimetral o GPU pequeñaGPU para centro de datos o alta memoria
El papel sugerido por PerplexityCodificador de consultas en vivo, 100% localConstrucción del índice de documentos

Perplexity diseñó el modelo de 0.6B como un codificador de consultas ligero que también puede ejecutarse en dispositivos de borde. Ambos fichas de modelo mostrar el uso de GPU CUDA. Necesitan sentence-transformers >= 6.0.0 y transformers >= 5.4.0. Las cifras de memoria son nuestra estimación a 2 bytes por parámetro, solo para los pesos. Los checkpoints publicados están almacenados en F32, lo que duplica el tamaño de la descarga.

Rendimiento: Mejores y Peores Puntuaciones

Todos los números a continuación provienen de Perplexity. anuncio:

Referencia0.6B9BCuál es la situación
MADQA (agentic PDF QA, accuracy)90.1%92.4% (el mejor)Supera al retriever de Mixedbread (88.9%); queda por detrás de Mixedbread Agentic Search (93.4%)
Texto específico de dominio (72 tareas, nDCG@10)78.0%81.3%9B lidera todos los modelos probados por 1,6pp; 0,6B está 0,3pp por detrás de gemini-embedding-2
Q2D-Web (Recall@1000)73.6%74.8%Ambos superaron el récord anterior del 69.3%
ViDoRe v3 imagen (nDCG@10)62.3%65.2%0.6B está dentro de 1.2pp de nemotron-colembed-v2-8b; EVIE lidera
ViDoRe v3 Markdown (nDCG@10)61.2% (el peor)64.7%Ambos superaron a todos los modelos externos probados
BrowseComp+ (precisión)No se proporciona64.0% (el más bajo)Aun así 4.9 pp por encima del siguiente modelo ColBERT

El resultado más fuerte: 92.4% en MADQA, logrado por el modelo de 9B. El mayor margen está en BrowseComp+, con 8.7pp sobre el mejor modelo denso.

El resultado más débil: 61.2% en ViDoRe v3 Markdown, del modelo de 0.6B. Aun así es la 2ª mejor puntuación en ese benchmark. La búsqueda de imágenes es la verdadera brecha: Gemini Embedding 2 supera al modelo de 9B en MIRACL-Vision y por 2pp en PPLX-Q2I.

Mezcla de tamaños: un índice de 9B consultado por el modelo de 0.6B obtuvo 63.5% en la recuperación de imágenes de ViDoRe v3. Eso supera el 62.3% con 0.6B en ambos lados, al mismo costo de consulta.

Cómo funciona

Los modelos densos comprimen un documento en 1 vector. pplx-embed-v2-late en cambio mantiene un vector de 128 dimensiones para cada token. Puntúa con MaxSim: cada token de la consulta encuentra su mejor token del documento, y esos máximos se suman. Las páginas se codifican como imágenes, por lo que no se necesita ningún paso de OCR. Perplexity destiló ambos modelos desde un profesor de 18B usando LEAFun entrenamiento a nivel de token estilo. Ese entrenamiento es lo que crea el espacio compartido.

Mejores casos de uso

  • El mejor encaje es la búsqueda visual de documentos en PDFs, diapositivas e informes escaneados.
  • Búsqueda de baja latencia: indexa en la nube con 9B, y luego consulta en el dispositivo con 0.6B.
  • RAG agéntico sobre grandes colecciones de PDFs o web.

Explicador interactivo

Cómo se compara

Característicapplx-embed-v2-lateNVIDIA nemotron-colembed-vl-8b-v2TopK topk-embed-v1Google Gemini Embedding 2
Tamaño0.6B, 9B~8.8B0.8B, 2B openNo revelado
Ancho del vector128 por token4,096 por token2,048 por token (small)128 a 3,072, 1 vector
EntradasTexto, imágenes, renders de páginasConsultas de texto, imágenes de páginasTexto, imágenes de páginasTexto, imagen, video, audio, PDF
Funciona enTu GPU; 0.6B en el bordeNVIDIA A100/H100, LinuxGPU con CUDA (Ampere+)API de Google
Espacio compartido entre tamañosSíNo indicadoNo indicadoNo aplicable
LicenciaMITCC-BY-NC-4.0Apache 2.0 (pequeño)Propietaria

Conclusiones clave

  • El modelo 0.6B cabe en dispositivos de borde; el modelo 9B está diseñado para la calidad en el momento de indexación.
  • Mejor puntuación: 92.4% en MADQA. La más débil: 61.2% en ViDoRe v3 Markdown.
  • Consultas de 0.6B sobre un índice de 9B superan a 0.6B en ambos lados.
  • El crecimiento del almacenamiento y las puntuaciones autoinformadas son las principales advertencias.


Echa un vistazo al Pesos del modelo en HF y Detalles técnicos. Todo el mérito es del investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro 150k+ML SubReddit y suscribirte a nuestro boletín. ¡Espera! ¿estás en telegram? ahora también puedes unirte a nosotros en telegram.

[Patrocinado] La web es la única API que le falta a la mayoría de los agentes. Las bases de datos, los calendarios y los repositorios tienen APIs. La web abierta, en su mayoría, no. El servidor MCP de TinyFish proporciona a cualquier cliente MCP cuatro herramientas: TinySearch, TinyFetch (páginas completas en markdown, con JavaScript incluido), TinyBrowser para inicios de sesión y formularios, y TinyAgent para tareas de varios pasos. Search y Fetch son gratuitas.

La entrada Perplexity AI lanza pplx-embed-v2-late: un modelo edge de 0.6B y un modelo de 9B que obtiene un 92.4% en MADQA apareció primero en MarkTechPost.

Fuente original

MarkTechPost

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original