Aller au contenu principal
AMES : Recherche multimodale approximative en entreprise par extraction à interaction tardive
OutilsApple Machine Learning · 1 min de lecture

AMES : Recherche multimodale approximative en entreprise par extraction à interaction tardive

Source originale ↗·

AMES (Approximate Multimodal Enterprise Search) marque une avancée significative dans le domaine de la recherche d'information en entreprise : cette nouvelle architecture unifiée permet d'interroger simultanément des textes, des images et des vidéos au sein d'un même moteur de recherche, sans nécessiter de refonte technique majeure des systèmes existants.

L'enjeu est considérable pour les organisations qui gèrent des volumes croissants de contenus hétérogènes. Jusqu'ici, la recherche multimodale exigeait généralement des pipelines distincts selon la nature du contenu, un pour le texte, un autre pour les images, etc. AMES brise cette logique en proposant une architecture agnostique du backend, compatible avec les infrastructures de recherche d'entreprise déjà en place, ce qui réduit drastiquement le coût et la complexité de déploiement.

Au cœur du système, une approche dite d'interaction tardive (late interaction) : les tokens textuels, les patches d'image et les frames vidéo sont encodés dans un espace de représentation partagé via des encodeurs multi-vecteurs. La récupération inter-modalités s'effectue sans logique spécifique à chaque modalité. Le pipeline repose sur deux étapes : une recherche ANN (Approximate Nearest Neighbor) parallèle au niveau token, suivie d'une phase de reclassement fin, garantissant ainsi précision et passage à l'échelle en environnement de production.

Cette approche s'inscrit dans la tendance de fond des systèmes RAG (Retrieval-Augmented Generation) multimodaux, où la qualité de la récupération conditionne directement la pertinence des réponses générées par les LLM. En rendant l'interaction tardive accessible sans redesign architectural, AMES pourrait accélérer l'adoption de la recherche multimodale dans les entreprises qui hésitaient encore à franchir le pas.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

L'écart de contexte de l'IA en entreprise : un problème de confiance, pas de recherche d'information
1VentureBeat AI 

L'écart de contexte de l'IA en entreprise : un problème de confiance, pas de recherche d'information

Le paysage de l'infrastructure RAG (retrieval-augmented generation) en entreprise traverse une crise de confiance, selon une étude menée par VentureBeat Pulse Research auprès de 101 entreprises en juin 2026. Cette enquête révèle que 57% des organisations ont constaté, au cours des six derniers mois, que leurs agents IA produisaient des réponses confiantes mais erronées, directement liées à un contexte métier manquant ou incohérent, et plus de la moitié d'entre elles ont vécu ce problème à plusieurs reprises. La récupération d'informations (retrieval) constitue déjà la principale source de contexte pour 38% des entreprises interrogées, davantage que toute autre approche. Fait notable, les outils de récupération natifs des grands fournisseurs, comme le file search d'OpenAI (40%) et Vertex AI Search de Google (38%), devancent désormais toutes les bases de données vectorielles spécialisées qui ont pourtant défini cette catégorie technologique. Une majorité de 58% des entreprises construisent déjà, ou ont déjà mis en place, une couche sémantique gouvernée censée résoudre ce problème, mais pour la plupart, cette infrastructure n'est pas encore opérationnelle en production. Ce décalage, que les auteurs de l'étude nomment le "context gap", a des répercussions concrètes sur la fiabilité des systèmes d'IA déployés en entreprise. Quand les agents conversationnels s'appuient sur des données de récupération incomplètes ou incohérentes, ils continuent de répondre avec la même assurance apparente, ce qui rend leurs erreurs particulièrement dangereuses car elles passent pour des faits vérifiés. Pour les équipes techniques et les décideurs, cela signifie que la sophistication apparente d'un agent IA ne garantit en rien la fiabilité de ses réponses, et que la gouvernance des données devient aussi critique que la performance du modèle lui-même. L'étude révèle aussi un paradoxe stratégique: alors que 34% des entreprises anticipent une domination du retrieval hybride d'ici fin 2026, une pluralité de 36% affirme vouloir conserver des outils autonomes best-of-breed plutôt que de tout centraliser chez un seul fournisseur, et 57% prévoient de changer ou d'ajouter un fournisseur dans l'année à venir. Cette tension entre les préférences déclarées et les usages réels illustre les enjeux plus larges qui traversent actuellement le secteur de l'IA d'entreprise. Les organisations achètent massivement des solutions natives proposées par les grands fournisseurs de modèles, tout en revendiquant un attachement à l'indépendance technologique, un signe que le marché n'a pas encore tranché entre commodité et contrôle. L'échantillon de l'étude, concentré sur les entreprises de taille moyenne (entre 101 et 1000 salariés pour 62% des répondants), avec une forte proportion de décideurs (46% ont l'autorité finale d'achat), donne une lecture directionnelle plutôt qu'une mesure précise du marché. Le secteur technologique domine l'échantillon (20%), suivi par la santé (11%). Reste à voir si les entreprises parviendront à combler ce fossé de confiance avant que la dépendance croissante aux agents IA ne transforme ces erreurs silencieuses en incidents coûteux.

OutilsActu
1 source
L'IA multimodale appliquée à la recherche d'images aériennes à grande échelle
2AWS ML Blog 

L'IA multimodale appliquée à la recherche d'images aériennes à grande échelle

Vexcel, l'un des plus grands fournisseurs mondiaux d'imagerie aérienne, opère une flotte d'avions dédiés qui collecte des données haute résolution dans plus de 45 pays et territoires. Son catalogue comprend des orthomosaïques, des vues obliques à 360 degrés et des modèles d'élévation représentant des milliards de pixels. En partenariat avec le AWS Generative AI Innovation Center (GenAIIC), l'entreprise a développé une architecture de recherche sémantique reposant sur des embeddings multimodaux, la génération automatique de légendes par un grand modèle de langage, et une recherche vectorielle via Amazon Bedrock et Amazon OpenSearch Serverless. L'objectif : permettre à un utilisateur d'interroger cette immense bibliothèque d'images en langage naturel, sans entraîner de modèle de vision par ordinateur pour chaque nouveau cas d'usage. Les tests ont montré qu'Amazon Nova Multimodal Embeddings obtenait les meilleurs scores F1 sur l'ensemble des requêtes de référence évaluées. Ce système a depuis évolué en Vexcel Intelligence, un produit actuellement en phase de prévisualisation. L'enjeu est considérable pour tous les secteurs qui s'appuient sur des données géospatiales : assurance, immobilier, administration publique, infrastructures et agriculture. Jusqu'ici, localiser des piscines dans un quartier résidentiel, cartographier des panneaux solaires à l'échelle d'une ville ou détecter des graffitis sur des entrepôts obligeait soit à examiner manuellement chaque tuile d'image, soit à entraîner un modèle de vision dédié pour chaque question, avec les données étiquetées, le temps d'ingénierie et les cycles de ré-entraînement que cela implique. La recherche sémantique par vecteurs supprime cette étape : une requête en langage naturel produit des résultats en quelques secondes, sans redévelopper de pipeline spécifique pour chaque nouveau besoin client. C'est un changement de paradigme opérationnel qui compresse des semaines de travail en une simple interrogation. La recherche géospatiale pose des défis structurels absents de la recherche d'images classique : une même zone est représentée par plusieurs vues simultanées (nadir, oblique nord, est, sud, ouest), et les requêtes portent sur des objets physiques ancrés dans l'espace réel plutôt que sur des photographies isolées. Vexcel avait exploré trois approches préalables avant ce partenariat, dont un pipeline d'embeddings multimodaux tuilés avec légendes LLM qui montrait des résultats prometteurs mais soulevait des questions clés sur le choix du modèle, la fusion des vues multiples et la réelle valeur ajoutée des légendes textuelles. L'équipe a construit une méthodologie d'évaluation ancrée dans les données OpenStreetMap pour comparer quatre variables : modèle d'embedding, stratégie de fusion, approche de légendage et méthode de recherche. Vexcel Intelligence, désormais en prévisualisation, concrétise ces travaux et transforme des décennies de collecte aérienne en une base de connaissance interrogeable à la demande.

UELes assureurs, collectivités et acteurs de l'immobilier européens utilisant des données géospatiales aériennes pourraient adopter Vexcel Intelligence pour remplacer des pipelines de vision par ordinateur coûteux par une simple recherche en langage naturel.

OutilsOutil
1 source
Mistral lance OCR 4, un outil d'extraction documentaire taillé pour l'IA en entreprise
3VentureBeat AI 

Mistral lance OCR 4, un outil d'extraction documentaire taillé pour l'IA en entreprise

Mistral AI a lancé mardi OCR 4, sa quatrième génération de technologie de reconnaissance optique de caractères en à peine quinze mois. Ce modèle de traitement documentaire dépasse la simple extraction de texte brut : il retourne une représentation structurée complète de chaque document, avec des boîtes de délimitation précises pour chaque bloc, une classification par type de contenu (titre, tableau, équation, signature) et des scores de confiance mot par mot. Le modèle supporte 170 langues, accepte les formats PDF, DOC, PPT et OpenDocument, et peut être déployé en conteneur autonome sur l'infrastructure interne d'une organisation. Il est disponible immédiatement via l'API Mistral, Document AI dans Mistral Studio, Amazon SageMaker et Microsoft Foundry, avec une intégration Snowflake annoncée prochainement. La tarification débute à 4 dollars pour 1 000 pages, ramenée à 2 dollars via l'API batch. Lors d'évaluations humaines indépendantes, les annotateurs ont préféré les sorties d'OCR 4 dans 72 % des cas face aux solutions concurrentes. Le changement central d'OCR 4 est architectural. Plutôt que de produire un flux plat de texte extrait, le modèle génère une carte sémantique du document : chaque bloc est localisé, typé et scoré. Cette traçabilité répond à une friction majeure des équipes qui construisent des pipelines RAG (retrieval-augmented generation) ou des workflows de conformité, où la question "d'où vient ce chiffre, sur quelle page ?" exige une réponse auditable. La classification des blocs permet en outre d'orienter automatiquement un tableau vers un pipeline de données structurées, un titre vers un découpage sémantique, ou une signature vers un workflow de caviardage. Packager ces sorties directement dans le modèle OCR supprime une couche d'analyse de mise en page que les équipes devaient jusqu'ici construire et maintenir séparément. Les scores de confiance permettent quant à eux de router programmatiquement les extractions incertaines vers des relecteurs humains, sans qu'une personne n'ait à vérifier chaque page de chaque document. Ce lancement intervient dans un contexte particulièrement porteur pour Mistral. La startup française, dont la proposition de souveraineté numérique européenne n'a jamais été aussi commercialement pertinente, cible explicitement les entreprises des secteurs réglementés, finance, santé, juridique, qui ne peuvent pas faire transiter leurs documents sensibles par des API cloud sous juridiction américaine. La capacité de déploiement on-premise en conteneur unique est le principal levier de différenciation face à des acteurs comme Google Document AI ou AWS Textract. Pour les développeurs, l'enjeu est aussi économique : dans les systèmes de production, l'OCR n'est que la première étape d'un pipeline plus large, et la reconstruction manuelle de la structure documentaire consomme souvent plus de temps d'ingénierie que la logique IA en aval. OCR 4 vise à éliminer cette étape, et si le modèle tient ses promesses, les gains se mesurent autant en heures d'ingénierie économisées qu'en coût d'extraction.

UEMistral AI, startup française, propose un déploiement on-premise en conteneur qui offre aux entreprises européennes des secteurs réglementés (finance, santé, juridique) une alternative souveraine aux solutions cloud sous juridiction américaine.

OutilsOutil
1 source
Mindstone permet à ses agents IA d'entreprise de sélectionner automatiquement le bon modèle par tâche, via Rebel
4VentureBeat AI 

Mindstone permet à ses agents IA d'entreprise de sélectionner automatiquement le bon modèle par tâche, via Rebel

Mindstone, une startup londonnienne spécialisée dans la transformation par l'IA, a officiellement lancé cette semaine Rebel, un système d'exploitation agentique local qui ambitionne de simplifier radicalement l'orchestration d'agents IA en entreprise. Disponible sur macOS (Intel et Apple Silicon) et Windows, avec Linux en développement, Rebel adopte une licence "Fair Source" permettant aux équipes de moins de 100 utilisateurs de l'utiliser gratuitement, tandis que les organisations plus grandes devront souscrire à une licence entreprise. La société a levé 5 millions de dollars auprès d'investisseurs privés dont Pearson Ventures, Moonfire Ventures et Zanichelli Venture. Sa particularité principale réside dans une architecture locale reposant entièrement sur des fichiers markdown : toute la mémoire des agents, leurs instructions, leurs prompts et leur hiérarchie de tâches sont stockés en fichiers texte simples, contrairement aux frameworks concurrents comme LangGraph, CrewAI ou AutoGPT qui exigent des bases de données cloud et une infrastructure de gestion d'état complexe. Ce choix architectural n'est pas qu'une question de simplicité : il adresse des enjeux concrets de coût, de confidentialité et de souveraineté des données. En évitant les formats lourds comme Word ou PDF, dont les métadonnées consomment inutilement la fenêtre de contexte des modèles, Rebel optimise chaque appel API. Les entreprises gardent leurs instructions, automatisations et mémoire d'agent en local, échappant ainsi à l'enfermement propriétaire d'un éditeur SaaS. L'autre atout central est l'orchestration multi-modèles : Rebel découpe une tâche en sous-tâches et route chacune vers le modèle le plus adapté, en basculant dynamiquement entre modèles locaux et cloud selon la sensibilité des données traitées. Le système propose également des "Skills" (procédures multi-étapes réutilisables), des "Operators" (configurations comportementales pour un contexte donné, comme analyser un pitch deck du point de vue d'un investisseur) et des "Automations" (tâches planifiées en arrière-plan pour scanner des messages, préparer des réponses ou anticiper du travail avant qu'un employé n'ouvre l'application). La montée en puissance des plateformes d'orchestration d'agents reflète une évolution profonde dans la manière dont les entreprises déploient l'IA : on passe de chatbots isolés à des systèmes capables d'agir de façon autonome sur des emails, calendriers, documents et flux de travail internes. Dans cet écosystème en plein essor, Mindstone mise sur la mémoire partagée comme différenciateur stratégique. "La mémoire partagée est la chose la plus puissante que vous puissiez faire avec une IA dédiée aux travailleurs du savoir", affirme Greg Detre, directeur technique de l'entreprise, ajoutant que cela donne à une organisation "la sensation d'être un super-organisme qui devient de plus en plus intelligent". Face aux frameworks destinés aux développeurs, Rebel cible les équipes métier et opérationnelles, un segment encore largement sous-équipé malgré l'explosion de l'offre en IA agentique.

UEL'architecture locale de Rebel, stockant mémoire et données d'agents en fichiers texte sans cloud tiers, s'aligne avec les exigences RGPD, ce qui facilite son adoption par les entreprises européennes soucieuses de souveraineté des données.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic