Aller au contenu principal
LLMs · Opinion ·

Cohere lance Embed 5 : comparaison avec Voyage 4 Large, Gemini Embedding 2 et OpenAI

Cohere a lancé Embed 5, une nouvelle famille de modèles d'embedding destinée à la recherche en entreprise, au RAG et à la récupération d'information par des agents. Elle comprend deux niveaux : Embed 5 Pro, orienté qualité maximale, et Embed 5 Fast, pensé pour la latence et le coût sur le chemin de requête en direct. Les deux acceptent du texte, des images et des entrées fusionnant texte et image. Ils couvrent plus de 100 langues et lisent jusqu'à 128 000 tokens. Les identifiants d'API sont embed-v5.0-pro et embed-v5.0-fast. Les vecteurs sortent en 2048 dimensions par défaut, ou en 1536, 1024, 768, 512 et 256, au format float, int8 ou binaire. Pro coûte 0,12 dollar par million de tokens de texte, Fast 0,08 dollar, et les images 0,40 dollar sur les deux. Les modèles sont disponibles sur l'API Cohere et Model Vault, Microsoft Foundry et Amazon SageMaker, avec un déploiement en VPC privé ou sur site via vLLM. Sur ViDoRe V3, Pro obtient 85,8, soit 8,8 points de plus qu'Embed 4, contre 84,5 pour Fast, 83,7 pour Voyage 4 Large, 83,2 pour Gemini Embedding 2 et 75,5 pour text-embedding-3-large d'OpenAI.

3 min de lecturePertinence 59

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Le choix de conception central est que Pro et Fast partagent le même espace d'embedding : on peut indexer avec l'un et interroger avec l'autre, à condition d'utiliser la même dimension de sortie. Sur 40 jeux de données de développement, un index Pro interrogé avec Fast atteint 98,4 par rapport à la référence Pro plus Pro fixée à 100, contre 96,6 pour une configuration entièrement Fast. Cela compte pour les agents, qui peuvent lancer des dizaines de recherches par tâche, ce qui fait s'accumuler la latence. Cohere indique que Fast traite 377,3 documents par seconde, contre 159,7 pour Pro. Le coût de stockage baisse aussi nettement grâce à l'apprentissage de représentations Matryoshka et aux sorties à précision réduite : un vecteur float32 de 2048 dimensions occupe 8 Ko, un vecteur int8 de 1024 dimensions 1 Ko, un vecteur binaire de 256 dimensions 32 octets. Sur 100 millions de segments, le stockage brut passe d'environ 819 Go à 3,2 Go. La finance est le point fort : Pro est premier sur FinanceBench (80,1), FinQA (90,0) et ViDoRe V3 Finance (85,0), et Fast est deuxième sur ces trois tests. L'intégration directe d'images de pages ou de métadonnées fusionnées aide pour les documents numérisés, présentations, schémas et graphiques, où l'extraction de texte perd de l'information.

Ces résultats sont toutefois à nuancer. La plupart proviennent de RCP-nDCG@10, une métrique nouvelle de Cohere qui réordonne un ensemble fixe de candidats et mesure donc davantage la qualité du reranking que la récupération de premier niveau. Le code d'évaluation est publié, mais aucune réplication indépendante n'existe encore. Le multilingue est contrasté : Pro mène sur la moyenne des langues européennes avec 77, mais Gemini Embedding 2 le dépasse sur 9 des 10 autres langues dans les propres tableaux de Cohere, dont le japonais, l'arabe, l'hindi et le télougou. Cohere recommande l'indexation avec Pro et l'interrogation avec Fast, ainsi que le format int8 en 1024 dimensions, qui offrirait une qualité proche de la pleine précision. Face à Voyage, Google et OpenAI, le marché des embeddings se joue désormais sur la multimodalité, le coût de stockage et la latence des agents, et non plus seulement sur la précision brute.

Impact France / UEChamp produit par Le Fil IA

Les modèles multilingues d'Embed 5 mènent sur la moyenne des langues européennes et peuvent être déployés en VPC privé ou sur site, ce qui facilite la conformité des entreprises européennes.

À lire ensuite

01Microsoft lance Fara1.5 (4B/9B/27B), des agents de navigation qui surpassent OpenAI Operator et Gemini 2.5 Computer Use49MarkTechPostLLMs 02« OpenAI lance GPT-Live et GPT-Live-1 mini, des modèles vocaux full-duplex qui délèguent le raisonnement complexe à GPT-5.5 »48MarkTechPostLLMs 03Google lance Gemini 3.7 Flash pour le code et les agents, avec 50% de reduction au lancement48VentureBeat AILLMs 
Dossier · OpenAISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.