Aller au contenu principal
L'IA multimodale de NVIDIA (NeMo Retriever, LanceDB) affine la recherche documentaire
OutilsMarkTechPost · 2 min de lecture

L'IA multimodale de NVIDIA (NeMo Retriever, LanceDB) affine la recherche documentaire

Source originale ↗·

NVIDIA a publié un tutoriel détaillant la construction d'un pipeline complet de RAG (retrieval-augmented génération) multimodal reposant sur NeMo Retriever, sa boîte à outils de récupération d'information. La démonstration s'appuie sur un environnement Python 3.12 et débute par une extraction de texte hors ligne, réalisée avec la bibliothèque PDFium, sans GPU ni clé API, à partir d'un document PDF de test contenant du texte, des tableaux, des graphiques et des infographies. Le pipeline est ensuite enrichi avec des points de terminaison hébergés NVIDIA NIM, notamment les modèles nemotron-page-éléments-v3, nemotron-ocr-v1, nemotron-table-structure-v1 et nemotron-graphic-éléments-v1, chargés de détecter les éléments de page et d'extraire tableaux, graphiques et infographies. Le contenu traité est ensuite converti en vecteurs denses via le modèle d'embedding llama-nemotron-embed-1b-v2, puis stocké dans LanceDB, une base de données vectorielle open source. La dernière étape combine récupération dense, reranking vision-langage avec le modèle llama-nemotron-rerank-vl-1b-v2, recherche filtrée par métadonnées, génération de réponses ancrées avec citations intégrées via un modèle de la famille Llama 3.3 Nemotron, et une évaluation de type recall-at-k pour mesurer la qualité de la récupération.

Cette démonstration illustre une limite bien connue des systèmes RAG classiques, qui traitent surtout du texte brut et échouent souvent face à des documents professionnels réels, riches en tableaux financiers, graphiques techniques ou infographies. En combinant des modèles de vision par ordinateur spécialisés avec des grands modèles de langage, ce pipeline permet d'extraire une information exploitable depuis des mises en page complexes, puis de générer des réponses vérifiables grâce aux citations intégrées, ce qui limite le risque d'hallucination. L'enjeu concerne directement les entreprises qui doivent interroger de larges corpus de documents hétérogènes, rapports financiers, contrats juridiques, études techniques, où l'information cruciale se trouve souvent hors du texte courant.

Ce tutoriel s'inscrit dans la stratégie plus large de NVIDIA autour des NIM, des microservices d'inférence hébergés que les développeurs peuvent appeler via API sans gérer d'infrastructure GPU, un axe central de la plateforme NeMo destinée à la construction d'applications d'IA générative sur mesure. Il reflète aussi une tendance de fond dans l'écosystème du RAG, où la récupération purement textuelle cède la place à des approches multimodales combinant OCR, structuration de tableaux et reranking par modèles vision-langage. NVIDIA se positionne ainsi face à des acteurs comme LangChain, LlamaIndex ou Cohere, qui proposent également des briques de reranking et de récupération, dans un marché où la capacité à traiter fidèlement des documents d'entreprise complexes devient un critère de choix déterminant pour les équipes techniques.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

L'IA multimodale appliquée à la recherche d'images aériennes à grande échelle
1AWS ML Blog 

L'IA multimodale appliquée à la recherche d'images aériennes à grande échelle

Vexcel, l'un des plus grands fournisseurs mondiaux d'imagerie aérienne, opère une flotte d'avions dédiés qui collecte des données haute résolution dans plus de 45 pays et territoires. Son catalogue comprend des orthomosaïques, des vues obliques à 360 degrés et des modèles d'élévation représentant des milliards de pixels. En partenariat avec le AWS Generative AI Innovation Center (GenAIIC), l'entreprise a développé une architecture de recherche sémantique reposant sur des embeddings multimodaux, la génération automatique de légendes par un grand modèle de langage, et une recherche vectorielle via Amazon Bedrock et Amazon OpenSearch Serverless. L'objectif : permettre à un utilisateur d'interroger cette immense bibliothèque d'images en langage naturel, sans entraîner de modèle de vision par ordinateur pour chaque nouveau cas d'usage. Les tests ont montré qu'Amazon Nova Multimodal Embeddings obtenait les meilleurs scores F1 sur l'ensemble des requêtes de référence évaluées. Ce système a depuis évolué en Vexcel Intelligence, un produit actuellement en phase de prévisualisation. L'enjeu est considérable pour tous les secteurs qui s'appuient sur des données géospatiales : assurance, immobilier, administration publique, infrastructures et agriculture. Jusqu'ici, localiser des piscines dans un quartier résidentiel, cartographier des panneaux solaires à l'échelle d'une ville ou détecter des graffitis sur des entrepôts obligeait soit à examiner manuellement chaque tuile d'image, soit à entraîner un modèle de vision dédié pour chaque question, avec les données étiquetées, le temps d'ingénierie et les cycles de ré-entraînement que cela implique. La recherche sémantique par vecteurs supprime cette étape : une requête en langage naturel produit des résultats en quelques secondes, sans redévelopper de pipeline spécifique pour chaque nouveau besoin client. C'est un changement de paradigme opérationnel qui compresse des semaines de travail en une simple interrogation. La recherche géospatiale pose des défis structurels absents de la recherche d'images classique : une même zone est représentée par plusieurs vues simultanées (nadir, oblique nord, est, sud, ouest), et les requêtes portent sur des objets physiques ancrés dans l'espace réel plutôt que sur des photographies isolées. Vexcel avait exploré trois approches préalables avant ce partenariat, dont un pipeline d'embeddings multimodaux tuilés avec légendes LLM qui montrait des résultats prometteurs mais soulevait des questions clés sur le choix du modèle, la fusion des vues multiples et la réelle valeur ajoutée des légendes textuelles. L'équipe a construit une méthodologie d'évaluation ancrée dans les données OpenStreetMap pour comparer quatre variables : modèle d'embedding, stratégie de fusion, approche de légendage et méthode de recherche. Vexcel Intelligence, désormais en prévisualisation, concrétise ces travaux et transforme des décennies de collecte aérienne en une base de connaissance interrogeable à la demande.

UELes assureurs, collectivités et acteurs de l'immobilier européens utilisant des données géospatiales aériennes pourraient adopter Vexcel Intelligence pour remplacer des pipelines de vision par ordinateur coûteux par une simple recherche en langage naturel.

OutilsOutil
1 source
L’ère de l’IA redéfinit la recherche Google et le référencement
2Le Big Data 

L’ère de l’IA redéfinit la recherche Google et le référencement

La domination du référencement naturel (SEO) tel qu'on le connaît depuis vingt ans est remise en cause par l'essor des moteurs de recherche basés sur l'intelligence artificielle. Avec des outils comme ChatGPT ou Claude, les internautes posent désormais une question et obtiennent une réponse directe, sans cliquer sur aucun lien. Dans ce nouveau paradigme, la priorité n'est plus d'apparaître en tête des résultats Google, mais d'être la source que l'IA choisit de citer. L'enjeu économique est considérable. Selon une étude de McKinsey, la moitié des consommateurs utilisent déjà des moteurs de recherche alimentés par l'IA, et d'ici 2028, ces outils pourraient influencer près de 750 milliards de dollars d'achats à l'échelle mondiale. Pour les entreprises, les anciennes recettes du SEO, optimisation des mots-clés, stratégie de liens, perdent progressivement de leur efficacité, et une refonte complète de leur présence en ligne s'impose. D'après le Wall Street Journal, les IA favorisent les contenus bien structurés, utiles et riches en contexte : formats FAQ, listes, résumés concis et descriptions détaillées. Mais contrairement à Google, les systèmes d'IA n'explicitent pas leurs critères de sélection, et ceux-ci évoluent à un rythme bien plus soutenu, certaines estimations évoquent des mises à jour toutes les quelques semaines. La complexité s'accroît encore du fait que chaque plateforme a ses propres préférences : Gemini accorde plus de place aux contenus YouTube, tandis que d'autres outils s'appuient davantage sur les forums et discussions en ligne comme Reddit ou Quora. Ce nouvel écosystème comporte aussi des risques de manipulation. Des services dits de GEO (Generative Engine Optimization) ont déjà émergé, notamment en Chine, où des plateformes comme Taobao et JD.com proposeraient aux marques des outils pour influencer leur visibilité dans les réponses générées par l'IA, voire pour nuire à des concurrents. Un marché gris qui illustre les tensions croissantes entre innovation, transparence et éthique commerciale à l'ère de l'IA générative.

UELes entreprises françaises et européennes avec une présence en ligne doivent adapter leur stratégie de référencement pour maintenir leur visibilité face aux IA génératives qui court-circuitent les moteurs de recherche traditionnels.

OutilsOutil
1 source
Nemotron 3 : affinement des modèles NVIDIA avec la personnalisation serverless d'Amazon SageMaker AI
3AWS ML Blog 

Nemotron 3 : affinement des modèles NVIDIA avec la personnalisation serverless d'Amazon SageMaker AI

Amazon vient d'annoncer l'intégration de la personnalisation de modèles serverless pour les modèles NVIDIA Nemotron 3 au sein d'Amazon SageMaker AI. Deux versions sont concernées: Nemotron 3 Nano, qui compte 30 milliards de paramètres au total dont 3 milliards actifs, et Nemotron 3 Super, plus imposant avec 120 milliards de paramètres au total dont 12 milliards actifs. Les entreprises peuvent désormais affiner ces modèles open-weight via trois techniques disponibles sans avoir à provisionner ni gérer la moindre infrastructure: le fine-tuning supervisé classique (SFT), l'apprentissage par renforcement avec récompenses vérifiables (RLVR), et l'apprentissage par renforcement avec retour d'IA (RLAIF). Nemotron 3 repose sur une architecture hybride combinant Mamba et Transformer sous forme de mélange d'experts (MoE), capable de gérer des contextes allant jusqu'à un million de tokens. Elle entrelace trois types de couches complémentaires: des couches Mamba-2 pour un traitement séquentiel rapide en temps linéaire, des couches d'attention Transformer pour un rappel associatif précis, et des couches de mélange d'experts latent qui compressent les tokens avant de les router vers des experts spécialisés. Résultat, seule une fraction des paramètres totaux est activée à chaque passage, comme les 12 milliards sur 120 pour la version Super, ce qui garantit un débit élevé à moindre coût de calcul. Pour les entreprises, affiner un modèle sur leurs propres données ne relève plus seulement de l'optimisation technique: cela revient à créer une propriété intellectuelle propriétaire, encodant leur savoir-faire, leur vocabulaire métier et leur ton de marque directement dans l'architecture du modèle. Cette approche permet souvent à des modèles plus petits et ouverts d'égaler, voire de dépasser, les performances de modèles propriétaires bien plus volumineux, tout en gardant les données sensibles dans une infrastructure privée et sécurisée. Pour les charges de travail à fort volume impliquant plusieurs agents, comme le codage ou le triage de cybersécurité, ce type d'avantage devient un facteur de compétitivité difficile à répliquer avec des modèles génériques du marché. Les deux modèles ont été entraînés via NeMo Gym, un système d'apprentissage par renforcement multi-environnements qui les aligne sur des tâches agentiques réelles en plusieurs étapes, couvrant le codage, le raisonnement et l'analyse de contextes longs. Nemotron 3 Nano affiche un débit quatre fois supérieur à son prédécesseur Nemotron 2 Nano, le rendant particulièrement adapté aux charges de travail multi-agents à fort volume où coût et latence sont critiques. Nemotron 3 Super, de son côté, cible les applications multi-agents complexes comme le développement logiciel, misant sur une capacité de raisonnement accrue tout en conservant une efficacité de calcul élevée.

UELes entreprises européennes utilisant Amazon SageMaker AI pourront accéder a cette nouvelle capacité de personnalisation serverless, sans impact réglementaire ou sectoriel direct sur la France ou l'UE.

💬 Nemotron 3 Super fait tourner 12 milliards de paramètres actifs sur 120 et bat des modèles bien plus gros, c'est la confirmation qu'on n'a plus besoin de mastodontes pour du raisonnement agentique sérieux. Ce qui change vraiment, c'est le fine-tuning serverless : plus de cluster GPU à gérer, tu balances tes données et Amazon fait le reste. Reste que la vraie valeur, ce n'est plus le modèle en lui-même, c'est ce que t'y injectes, ton vocabulaire métier, ton ton de marque, tes données propriétaires. Pour du codage ou du triage cyber à gros volume, ça devient un avantage concurrentiel qu'un modèle générique ne rattrapera pas.

OutilsActu
1 source
Amazon Nova Multimodal Embeddings au service de l'intelligence industrielle
4AWS ML Blog 

Amazon Nova Multimodal Embeddings au service de l'intelligence industrielle

Amazon a présenté Nova Multimodal Embeddings, un modèle disponible sur sa plateforme Bedrock capable de traiter simultanément du texte, des images et des pages de documents en les projetant dans un espace vectoriel commun. Concrètement, une requête textuelle peut désormais retrouver un schéma d'ingénierie, et inversement, une image peut servir de requête pour récupérer une spécification écrite, les deux modalités partagent le même système de coordonnées mathématiques. Pour démontrer l'intérêt du système, les ingénieurs d'Amazon ont construit un pipeline de recherche documentaire appliqué à des documents d'ingénierie aérospatiale, en l'évaluant sur 26 requêtes types et en comparant les résultats avec une pipeline classique basée uniquement sur du texte. Le modèle propose quatre niveaux de dimensions d'embedding configurables : 256, 384, 1 024 et 3 072, avec un mode spécifique appelé DOCUMENT_IMAGE conçu pour les pages à contenu mixte. L'enjeu est particulièrement critique pour les secteurs industriels comme l'aérospatial, l'automobile ou la fabrication lourde, où les documents techniques mêlent systématiquement du texte à des courbes de fatigue, des diagrammes CAO, des photographies d'inspection ou des cartographies thermiques. Un système de recherche purement textuel, même assisté d'OCR, rate ces informations visuelles : il peut mal interpréter les annotations sur un schéma en coupe, ignorer les relations spatiales dans un diagramme, ou rater une valeur de couple encodée graphiquement dans un plan d'ingénierie plutôt qu'écrite dans un paragraphe. Avec les embeddings multimodaux, le modèle traite l'image directement et génère un vecteur dans le même espace que le texte, ce qui permet, par exemple, de retrouver la section d'un schéma de turbopompe en posant simplement une question en langage naturel sur le type de roulements utilisés. Cette approche s'inscrit dans une compétition plus large entre les fournisseurs cloud pour dominer l'infrastructure des systèmes RAG (retrieval-augmented generation) d'entreprise. Amazon positionne Nova Multimodal Embeddings comme une brique native de Bedrock, couplée à Amazon S3 Vectors pour le stockage et la recherche de proximité, ce qui réduit la friction d'intégration pour les équipes déjà dans l'écosystème AWS. La capacité à unifier texte et image dans un même index vectoriel répond à un blocage réel pour les industries à forte documentation technique, où une fraction significative de la connaissance métier est piégée dans des visuels non interrogeables. Les prochaines étapes naturelles concerneront la prise en charge de vidéos et de documents multi-pages complexes, ainsi que l'extension à d'autres secteurs comme la médecine ou le droit, où les mêmes limites de l'OCR s'appliquent.

UELes secteurs industriels européens à forte documentation technique, aérospatial, automobile, fabrication lourde, peuvent directement exploiter cet outil via AWS Bedrock pour améliorer leurs systèmes RAG sur des archives mixtes texte-image, sans impact réglementaire direct sur la France ou l'UE.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic