Perplexity ha lanzado pplx-embed-v2-late, un par de modelos de embedding multimodales al estilo ColBERT. Vienen en 2 tamaños: 0.6B para consultas rápidas y baratas y 9B para máxima calidad. Ambos modelos recuperan texto, imágenes y páginas PDF renderizadas, y comparten un único espacio de embeddings.
¿Es desplegable? Sí, si lo alojas tú mismo. Ambos modelos están en Hugging Face bajo la licencia MIT. Un endpoint alojado de la Perplexity API está previsto pero no está disponible todavía.
TL;DR
Lo mejor
- El modelo de 0.6B usa unos 340M de parámetros activos para imágenes y se mantiene cerca de rivales de 8B.
- Un índice de 9B puede consultarse con consultas de 0.6B, recuperando aproximadamente la mitad de la brecha de calidad del 9B en texto al costo de consulta de 0.6B.
- Sus vectores de tokens de 128 dimensiones son de 16x a 32x más estrechos que los de rivales con 2,048 a 4,096 dimensiones.
- Licencia MIT, con uso comercial permitido.
Lo peor
- Almacena 1 vector por token, por lo que el tamaño del índice crece con la longitud del documento.
- No es el número 1 en recuperación de imágenes de ViDoRe v3; EVIE de Tencent obtiene puntuaciones más altas.
- Una única entrada no puede mezclar texto e imágenes.
- Todas las puntuaciones son autoinformadas, y el informe técnico aún no se ha publicado.
Tamaño del modelo y en qué se ejecuta
| Métricas | pplx-embed-v2-late-0.6b | pplx-embed-v2-late-9b |
|---|---|---|
| Parámetros totales | 594M | 9B (Hugging Face lista 8B) |
| Parámetros activos | ~240M texto, 340M imagen | 7.4B |
| Modelo base | Qwen3.5-0.8B, podado a 12 capas de texto | Qwen3.5 |
| Salida | 128 dims por token | 128 dims por token |
| Pesos en memoria (bf16, nuestra estimación) | ~1.2 GB | ~16 a 18 GB |
| Máquina prevista | Portátil, dispositivo perimetral o GPU pequeña | GPU para centro de datos o alta memoria |
| El papel sugerido por Perplexity | Codificador de consultas en vivo, 100% local | Construcción del índice de documentos |
Perplexity diseñó el modelo de 0.6B como un codificador de consultas ligero que también puede ejecutarse en dispositivos de borde. Ambos fichas de modelo mostrar el uso de GPU CUDA. Necesitan sentence-transformers >= 6.0.0 y transformers >= 5.4.0. Las cifras de memoria son nuestra estimación a 2 bytes por parámetro, solo para los pesos. Los checkpoints publicados están almacenados en F32, lo que duplica el tamaño de la descarga.
Rendimiento: Mejores y Peores Puntuaciones
Todos los números a continuación provienen de Perplexity. anuncio:
| Referencia | 0.6B | 9B | Cuál es la situación |
|---|---|---|---|
| MADQA (agentic PDF QA, accuracy) | 90.1% | 92.4% (el mejor) | Supera al retriever de Mixedbread (88.9%); queda por detrás de Mixedbread Agentic Search (93.4%) |
| Texto específico de dominio (72 tareas, nDCG@10) | 78.0% | 81.3% | 9B lidera todos los modelos probados por 1,6pp; 0,6B está 0,3pp por detrás de gemini-embedding-2 |
| Q2D-Web (Recall@1000) | 73.6% | 74.8% | Ambos superaron el récord anterior del 69.3% |
| ViDoRe v3 imagen (nDCG@10) | 62.3% | 65.2% | 0.6B está dentro de 1.2pp de nemotron-colembed-v2-8b; EVIE lidera |
| ViDoRe v3 Markdown (nDCG@10) | 61.2% (el peor) | 64.7% | Ambos superaron a todos los modelos externos probados |
| BrowseComp+ (precisión) | No se proporciona | 64.0% (el más bajo) | Aun así 4.9 pp por encima del siguiente modelo ColBERT |
El resultado más fuerte: 92.4% en MADQA, logrado por el modelo de 9B. El mayor margen está en BrowseComp+, con 8.7pp sobre el mejor modelo denso.
El resultado más débil: 61.2% en ViDoRe v3 Markdown, del modelo de 0.6B. Aun así es la 2ª mejor puntuación en ese benchmark. La búsqueda de imágenes es la verdadera brecha: Gemini Embedding 2 supera al modelo de 9B en MIRACL-Vision y por 2pp en PPLX-Q2I.
Mezcla de tamaños: un índice de 9B consultado por el modelo de 0.6B obtuvo 63.5% en la recuperación de imágenes de ViDoRe v3. Eso supera el 62.3% con 0.6B en ambos lados, al mismo costo de consulta.
Cómo funciona
Los modelos densos comprimen un documento en 1 vector. pplx-embed-v2-late en cambio mantiene un vector de 128 dimensiones para cada token. Puntúa con MaxSim: cada token de la consulta encuentra su mejor token del documento, y esos máximos se suman. Las páginas se codifican como imágenes, por lo que no se necesita ningún paso de OCR. Perplexity destiló ambos modelos desde un profesor de 18B usando LEAFun entrenamiento a nivel de token estilo. Ese entrenamiento es lo que crea el espacio compartido.
Mejores casos de uso
- El mejor encaje es la búsqueda visual de documentos en PDFs, diapositivas e informes escaneados.
- Búsqueda de baja latencia: indexa en la nube con 9B, y luego consulta en el dispositivo con 0.6B.
- RAG agéntico sobre grandes colecciones de PDFs o web.
Explicador interactivo
Cómo se compara
| Característica | pplx-embed-v2-late | NVIDIA nemotron-colembed-vl-8b-v2 | TopK topk-embed-v1 | Google Gemini Embedding 2 |
|---|---|---|---|---|
| Tamaño | 0.6B, 9B | ~8.8B | 0.8B, 2B open | No revelado |
| Ancho del vector | 128 por token | 4,096 por token | 2,048 por token (small) | 128 a 3,072, 1 vector |
| Entradas | Texto, imágenes, renders de páginas | Consultas de texto, imágenes de páginas | Texto, imágenes de páginas | Texto, imagen, video, audio, PDF |
| Funciona en | Tu GPU; 0.6B en el borde | NVIDIA A100/H100, Linux | GPU con CUDA (Ampere+) | API de Google |
| Espacio compartido entre tamaños | Sí | No indicado | No indicado | No aplicable |
| Licencia | MIT | CC-BY-NC-4.0 | Apache 2.0 (pequeño) | Propietaria |
Conclusiones clave
- El modelo 0.6B cabe en dispositivos de borde; el modelo 9B está diseñado para la calidad en el momento de indexación.
- Mejor puntuación: 92.4% en MADQA. La más débil: 61.2% en ViDoRe v3 Markdown.
- Consultas de 0.6B sobre un índice de 9B superan a 0.6B en ambos lados.
- El crecimiento del almacenamiento y las puntuaciones autoinformadas son las principales advertencias.
Echa un vistazo al Pesos del modelo en HF y Detalles técnicos. Todo el mérito es del investigador de este proyecto. Además, no dudes en seguirnos en Twitter y no olvides unirte a nuestro 150k+ML SubReddit y suscribirte a nuestro boletín. ¡Espera! ¿estás en telegram? ahora también puedes unirte a nosotros en telegram.
La entrada Perplexity AI lanza pplx-embed-v2-late: un modelo edge de 0.6B y un modelo de 9B que obtiene un 92.4% en MADQA apareció primero en MarkTechPost.