Aller au contenu principal
Visual Salamandra: repousser les limites de la compréhension multimodale
RechercheHuggingFace Blog · 1 min de lecture

Visual Salamandra: repousser les limites de la compréhension multimodale

Source originale ↗·

Titre: Visual Salamandra - Étendant les Limites de la Compréhension Multimodale

Résumé: Le projet Visual Salamandra explore une nouvelle approche pour comprendre simultanément des informations visuelles et auditives, visant à améliorer les systèmes d'IA dans la reconnaissance et le traitement de données multimodales, notamment en utilisant des modèles neuronaux pour intégrer ces informations.

Impact France/UE

Visual Salamandra développe un modèle neuronal innovant qui pourrait remanier la gestion des données multimodales en France, influençant des secteurs comme la cybersécurité et la surveillance, tout en respectant les exigences du RGPD et de l'AI Act grâce à une approche conçue pour la confidentialité et l'éthique.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Microsoft dévoile Phi-4-Raisonnement-Vision-15B : un modèle multimodal compact pour la compréhension des mathématiques, des sciences et des interfaces utilisateur
1MarkTechPost 

Microsoft dévoile Phi-4-Raisonnement-Vision-15B : un modèle multimodal compact pour la compréhension des mathématiques, des sciences et des interfaces utilisateur

Microsoft a publié Phi-4-reasoning-vision-15B, un modèle multimodal de 15 milliards de paramètres pour comprendre des tâches d'image et de texte nécessitant à la fois la perception et le raisonnement sélectif. Il s'agit d'un modèle compact équilibrant la qualité de raisonnement, l'efficacité computationnelle et les besoins en données d'entraînement, avec une force particulière en raisonnement scientifique et mathématique, et en compréhension des interfaces utilisateur. Ce modèle combine la base de langage Phi-4-Reasoning avec l'encodeur visuel SigLIP-2, utilisant une architecture de fusion intermédiaire, préservant ainsi une forte raisonnement transmodal tout en maintenant des coûts d'entraînement et d'inférence gérables. Microsoft a opté pour un modèle plus petit pour réduire les latences et les coûts de déploiement, entraîné sur 200 milliards de jetons multimodaux, comparativement aux plus d'1 billions de jetons utilisés pour des modèles multimodaux récents. Une autre caractéristique est l'adoption d'un raisonnement mixte, permettant au modèle de passer entre deux modes, plutôt que d'imposer le raisonnement pour toutes les tâches.

RechercheOutil
1 source
Les modèles d'apprentissage de la compréhension vidéo égocentrique récompensés pour leur conscience temporelle
2Apple Machine Learning 

Les modèles d'apprentissage de la compréhension vidéo égocentrique récompensés pour leur conscience temporelle

Traduction et synthèse en français, sans titres, respectant les consignes : Des chercheurs proposent une nouvelle méthode baptisée Temporal Global Policy Optimization (TGPO), conçue pour corriger un défaut récurrent des grands modèles multimodaux (MLLM) : leur incapacité à raisonner correctement sur l'ordre et l'évolution des événements dans une vidéo, en particulier dans les contenus filmés à la première personne (vidéo égocentrique, comme celle de caméras portées). Selon les auteurs, ce problème vient de la façon dont ces modèles sont entraînés : les objectifs d'apprentissage classiques ne récompensent pas explicitement le raisonnement temporel et poussent plutôt les modèles à s'appuyer sur des raccourcis purement spatiaux, image par image, sans réelle compréhension de la chronologie des faits. TGPO s'appuie sur l'apprentissage par renforcement avec récompenses vérifiables (RLVR), une approche qui guide l'entraînement du modèle en validant explicitement la justesse de son raisonnement plutôt qu'en se contentant d'un résultat final. Cette avancée pourrait avoir un impact concret sur toutes les applications qui dépendent d'une compréhension fine du déroulement temporel d'une scène filmée en vue subjective : assistants intelligents pour lunettes connectées, robots capables de suivre une séquence d'actions, ou encore outils d'analyse vidéo pour la formation et la sécurité. Un modèle qui perçoit correctement l'enchaînement des événements devient nettement plus fiable pour répondre à des questions du type "que s'est-il passé avant" ou "dans quel ordre les actions ont eu lieu", un besoin critique dans les usages du monde réel où la vidéo égocentrique se généralise. Ce travail s'inscrit dans une tendance plus large de la recherche en IA, qui cherche à dépasser les limites des modèles multimodaux entraînés uniquement sur des indices visuels statiques. L'apprentissage par renforcement avec récompenses vérifiables gagne du terrain comme alternative aux méthodes d'entraînement traditionnelles, notamment pour les tâches de raisonnement complexe. À mesure que les caméras portées et les dispositifs de réalité augmentée se démocratisent, la capacité des modèles à interpréter le temps qui passe, et pas seulement l'espace visible, devient un enjeu central pour les prochaines générations d'assistants IA visuels. --- Note : le texte source fourni est tronqué (l'abstract s'arrête en milieu de phrase, sans détails sur les jeux de données, benchmarks ou résultats chiffrés obtenus par TGPO). Le résumé ci-dessus reste donc fidèle aux seules informations disponibles, si tu as l'article complet, je peux l'enrichir avec les chiffres et résultats manquants.

RecherchePaper
1 source
EgoDyn-Bench : évaluation de la compréhension du mouvement ego-centré dans les modèles de vision pour la conduite autonome
3arXiv cs.RO 

EgoDyn-Bench : évaluation de la compréhension du mouvement ego-centré dans les modèles de vision pour la conduite autonome

Des chercheurs ont publié EgoDyn-Bench, un nouveau banc d'essai conçu pour mesurer la compréhension du mouvement propre du véhicule, appelé ego-motion, par les modèles de fondation en conduite autonome. L'étude, soumise sur arXiv fin avril 2026, s'appuie sur une évaluation empirique à grande échelle couvrant plus de 20 modèles : des systèmes propriétaires comme les grands modèles multimodaux en boîte noire, des modèles open-source de tailles variées, et des agents d'action-langage spécialisés dans la conduite. Le protocole utilise un oracle déterministe pour convertir les données cinématiques continues du véhicule en concepts de mouvement discrets, permettant de dissocier la logique physique interne du modèle de sa perception visuelle brute. Le résultat central est frappant : les auteurs identifient ce qu'ils appellent un « goulot d'étranglement perceptif ». Si les modèles testés démontrent une certaine capacité à raisonner sur les concepts physiques de base, ils échouent systématiquement à les ancrer dans les observations visuelles réelles. Pire, ces systèmes sont régulièrement surpassés par des méthodes géométriques classiques non apprises, pourtant bien plus simples. Cette défaillance persiste quelle que soit la taille du modèle et même après un entraînement spécialisé sur des données de conduite, ce qui pointe vers un déficit structurel dans la façon dont les architectures actuelles couplent vision et raisonnement physique. L'analyse révèle une dissociation fonctionnelle préoccupante entre vision et langage : la logique d'ego-motion est dérivée presque exclusivement du canal linguistique, tandis que les observations visuelles n'apportent qu'un signal négligeable. Lorsque les chercheurs fournissent explicitement des encodages de trajectoire aux modèles, la cohérence physique se rétablit significativement, confirmant que le problème n'est pas une absence de connaissance physique, mais une incapacité à la connecter au flux visuel. Ce constat soulève des questions sérieuses pour l'industrie de la conduite autonome, où des acteurs comme Waymo, Tesla ou Mobileye investissent massivement dans des approches fondées sur ces mêmes modèles. EgoDyn-Bench propose un cadre de diagnostic standardisé et une piste concrète vers des systèmes d'IA incarnée physiquement cohérents.

RecherchePaper
1 source
4MarkTechPost 

Alibaba lance VimRAG, un framework RAG multimodal avec graphe de mémoire pour les grands contextes visuels

Les chercheurs du Tongyi Lab d'Alibaba Group ont publié VimRAG, un nouveau cadre de travail conçu pour résoudre les limitations des systèmes de Retrieval-Augmented Generation (RAG) face aux données visuelles. Là où les approches classiques accumulent un historique linéaire croissant ou compriment les observations passées en résumés textuels, VimRAG modélise le raisonnement sous forme de graphe orienté acyclique dynamique. Chaque nœud du graphe encode une sous-requête décomposée, un résumé textuel concis, et une banque de tokens visuels extraits des documents ou vidéos récupérés. Le système a été évalué avec le modèle Qwen3-VL-30B sur un corpus vidéo, et trois études préliminaires ont guidé l'architecture finale. La méthode de mémoire visuelle sémantique sélective développée atteint 58,2 % de précision sur les tâches images et 43,7 % sur les tâches vidéo, en n'utilisant que 2 700 tokens en moyenne, contre 15 800 pour les approches retenant l'intégralité des tokens visuels bruts. Ces résultats sont significatifs car ils s'attaquent à deux problèmes fondamentaux qui paralysaient les agents RAG multimodaux jusqu'ici. Le premier est la "cécité d'état" : les agents qui résument itérativement leurs observations perdent la trace des requêtes déjà effectuées, ce qui les conduit à répéter les mêmes recherches dans des scénarios de raisonnement multi-étapes. Le second est le rapport signal/bruit : stocker les tokens visuels bruts noie l'information pertinente dans une masse de données inutiles. Le graphe de mémoire de VimRAG résout les deux problèmes simultanément, réduisant les actions de recherche redondantes tout en conservant les détails fins nécessaires à la vérification des réponses, une capacité critique pour des applications comme l'analyse de documents techniques ou la compréhension de vidéos longues. Le développement de VimRAG s'inscrit dans une course mondiale à la maîtrise du raisonnement multimodal, où les acteurs majeurs, OpenAI avec GPT-4o, Google avec Gemini, et Meta avec ses modèles Llama Vision, cherchent tous à aller au-delà de la simple compréhension d'images isolées vers un raisonnement complexe sur des corpus visuels massifs. Alibaba positionne ici Tongyi Lab comme un contributeur de premier plan à la recherche fondamentale en IA, après la sortie remarquée de la série Qwen3. La troisième composante de VimRAG porte sur l'entraînement par renforcement : les chercheurs ont montré qu'environ 80 % des étapes dans les trajectoires positives standard contiennent du bruit qui fausse les gradients d'apprentissage, et que supprimer les étapes redondantes des trajectoires négatives restaure entièrement les performances. L'article complet est disponible sur arXiv (2602.12735).

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic