Perplexity AI lance pplx-embed-v2-late : un modèle de 0,6 milliard de paramètres pour l'edge et un modèle de 9 milliards à 92,4 % sur MADQA
Perplexity a publié pplx-embed-v2-late, une paire de modèles d'embedding multimodaux de type ColBERT, disponibles en deux tailles : 0,6 milliard de paramètres pour des requêtes rapides et peu coûteuses, et 9 milliards pour une qualité maximale. Les deux récupèrent du texte, des images et des pages PDF rendues, dans un espace d'embedding commun. Le petit modèle compte 594 millions de paramètres au total, dont environ 240 millions actifs pour le texte et 340 millions pour les images. Il est dérivé de Qwen3.5-0.8B, élagué à 12 couches de texte. Le grand modèle mobilise 7,4 milliards de paramètres actifs (Hugging Face en indique 8 milliards au total). Chaque jeton produit un vecteur de 128 dimensions, et le score repose sur MaxSim : chaque jeton de la requête cherche son meilleur voisin dans le document, puis ces maxima sont additionnés. Les pages étant encodées comme des images, aucun OCR n'est nécessaire. Selon les chiffres publiés par Perplexity, le 9B atteint 92,4 % sur MADQA (questions-réponses agentiques sur PDF), contre 90,1 % pour le 0,6B, et dépasse le retriever de Mixedbread (88,9 %) tout en restant sous Mixedbread Agentic Search (93,4 %). Sur 72 tâches textuelles spécialisées, il obtient 81,3 % de nDCG@10, soit 1,6 point de plus que tous les modèles testés. Sur BrowseComp+, il atteint 64,0 %, 4,9 points au-dessus du meilleur autre modèle ColBERT. Les poids sont publiés sous licence MIT, usage commercial autorisé, tandis qu'un point d'accès API hébergé est annoncé mais pas encore disponible.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'intérêt tient d'abord à l'architecture asymétrique. Un index construit avec le 9B peut être interrogé par le 0,6B, qui tourne localement sur un portable ou un appareil embarqué : sur ViDoRe v3 en recherche d'images, cette combinaison obtient 63,5 %, contre 62,3 % avec le 0,6B des deux côtés, pour le même coût à la requête. Ses vecteurs de 128 dimensions sont 16 à 32 fois plus étroits que ceux de concurrents à 2 048 ou 4 096 dimensions, ce qui allège le stockage par jeton. Les cas d'usage visés sont la recherche visuelle dans des PDF, des présentations et des rapports numérisés, ainsi que le RAG agentique sur de grandes collections. Les limites sont nettes : un vecteur par jeton fait croître la taille de l'index avec la longueur des documents, une même entrée ne peut pas mêler texte et images, et le modèle n'est pas premier sur ViDoRe v3 en images, où EVIE de Tencent fait mieux. Gemini Embedding 2 de Google le devance aussi sur MIRACL-Vision et de 2 points sur PPLX-Q2I.
Cette sortie s'inscrit dans la montée des approches à interaction tardive, qui conservent une représentation fine par jeton au lieu de comprimer un document en un seul vecteur, et dans la course à la recherche multimodale sans OCR face à NVIDIA (nemotron-colembed), TopK, Mixedbread, Tencent et Google. Perplexity a distillé les deux modèles à partir d'un enseignant de 18 milliards de paramètres, avec un entraînement au niveau des jetons de type LEAF, qui crée l'espace partagé. Les besoins logiciels sont sentence-transformers 6.0.0 et transformers 5.4.0 au minimum, avec un usage GPU CUDA documenté. Les poids sont stockés en F32, ce qui double le téléchargement, pour environ 1,2 Go en bf16 pour le 0,6B et 16 à 18 Go pour le 9B. Tous les scores sont auto-déclarés et le rapport technique n'est pas encore publié : des évaluations indépendantes seront nécessaires pour confirmer ces résultats.
Pas d\'impact direct sur la France/UE