Aller au contenu principal
RobotiqueLe Big Data · 2 min de lecture

Cosmos 3 Edge : cette IA de NVIDIA apprend aux robots à comprendre le monde en temps réel

Source originale ↗·

NVIDIA a dévoilé le 20 juillet 2026 Cosmos 3 Edge, un nouveau modèle d'IA physique conçu pour équiper les robots, les véhicules autonomes et les systèmes de vision intelligente. Contrairement aux modèles classiques qui se contentent d'identifier des objets sur une image fixe, ce « world model » suit l'évolution d'une scène dans le temps, relie les objets entre eux, observe leurs déplacements et anticipe les effets de chaque action. Le modèle embarque 4 milliards de paramètres, épaulés par un moteur de raisonnement basé sur Nemotron doté de 2 milliards de paramètres supplémentaires, chargé d'analyser l'information avant de produire une réponse ou de déclencher une action. Sa particularité tient surtout à son mode d'exécution : au lieu de dépendre d'un serveur distant, Cosmos 3 Edge tourne directement sur l'appareil, qu'il s'agisse des plateformes NVIDIA Jetson, des GPU GeForce RTX, des cartes RTX PRO ou des systèmes DGX. Le modèle est d'ores et déjà disponible sur Hugging Face, accompagné de scripts permettant aux développeurs de l'adapter à leurs propres projets.

Ce fonctionnement local change concrètement la donne pour les usages où chaque milliseconde compte. En traitant les données sur place plutôt qu'en les envoyant vers le cloud, Cosmos 3 Edge réduit fortement la latence des décisions et permet aux machines de continuer à fonctionner même quand la connexion réseau est instable ou absente. Pour des robots industriels, des entrepôts automatisés, des hôpitaux ou des infrastructures urbaines équipées de caméras intelligentes, ce gain de réactivité peut se traduire par une différence tangible en matière de sécurité et d'efficacité. Un véhicule autonome peut ainsi mieux anticiper le comportement des piétons ou des autres voitures, tandis qu'un bras robotique en usine peut ajuster son geste en temps réel sans attendre de retour d'un serveur distant. Cette autonomie locale répond aussi à une préoccupation industrielle plus large autour de la confidentialité des données, puisque rien ne transite vers l'extérieur.

L'architecture de Cosmos 3 Edge repose sur deux moteurs qui travaillent en permanence de concert. Le premier traite les images et le texte pour comprendre une situation et raisonner sur celle-ci, tandis que le second analyse images, sons et actions afin de simuler différents scénarios et de générer les mouvements à exécuter. Le modèle peut ainsi imaginer les conséquences d'une action avant qu'elle ne survienne, mais aussi déduire rétrospectivement quelle action a provoqué un changement observé. Autre choix structurant, NVIDIA traduit les mouvements de bras robotiques, de caméras ou de véhicules dans une représentation commune, ce qui facilite l'adaptation du modèle à des usages très différents sans repartir de zéro à chaque fois. Cette sortie s'inscrit dans la stratégie de NVIDIA de s'imposer comme fournisseur de référence de l'IA physique, un marché où robotique industrielle et conduite autonome convergent de plus en plus vers les mêmes briques technologiques.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1Le Big Data 

Unitree : cette IA apprend aux robots humanoïdes à gérer seuls les tâches du quotidien

Il y a environ 40 mètres d'écart entre le titre du poste et le sujet réel : c'est un article, pas une tâche de code. Je le résume directement. Unitree a dévoilé un nouveau modèle d'intelligence artificielle baptisé UnifoLM-OminiA-0.3, destiné à ses robots humanoïdes. Contrairement à l'approche classique qui consiste à entraîner un robot pour chaque tâche spécifique, ce modèle unique gère simultanément de nombreux scénarios différents. Il combine en temps réel plusieurs sources d'information : l'analyse visuelle via les caméras, la compréhension des commandes vocales et l'interprétation de l'environnement. Unitree qualifie cette approche d'interaction « omni-modale », c'est-à-dire une intelligence capable de traiter plusieurs types de données à la fois pour prendre la meilleure décision possible. Une vidéo de démonstration d'environ deux minutes illustre ces capacités : le robot identifie un coussin mal placé et le repositionne, récupère une boîte de médicaments précise en tenant compte de sa couleur et de son emplacement, range des vêtements dans une panière, place des assiettes dans un lave-vaisselle, et contrôle un lit médicalisé tout en s'arrêtant immédiatement sur commande vocale. Ce qui distingue cette annonce des précédentes démonstrations robotiques, ce n'est pas la nature des tâches elles-mêmes, déjà réalisées par d'autres machines en environnement contrôlé, mais la capacité du modèle à enchaîner plusieurs opérations en comprenant le contexte global, sans reprogrammation entre chaque étape. Un robot équipé de ce système ne se contente plus de chercher un objet à saisir : il identifie ses caractéristiques précises, planifie son geste, puis ajuste sa trajectoire si un obstacle survient en cours de route. Pour l'industrie de la robotique domestique et de service, cette avancée représente un pas vers des machines réellement utilisables au quotidien, capables de s'adapter à des environnements changeants plutôt que de répéter des séquences figées apprises à l'avance. Unitree met également en avant la robustesse de son système, censé maintenir une exécution stable même lorsqu'un élément extérieur perturbe le robot en pleine action. Cette annonce s'inscrit dans une course plus large que se livrent les fabricants de robots humanoïdes pour doter leurs machines d'une véritable autonomie décisionnelle, un enjeu central pour transformer des prototypes spectaculaires en produits réellement déployables chez les particuliers ou en entreprise. Unitree, fabricant chinois déjà reconnu pour ses robots quadrupèdes et humanoïdes à prix relativement accessibles, cherche ainsi à se distinguer sur le terrain de l'intelligence embarquée plutôt que sur la seule mécanique. L'enjeu des mois à venir sera de vérifier si ces capacités tiennent leurs promesses hors des vidéos de démonstration, dans des environnements domestiques réels bien plus imprévisibles, avec des objets, des obstacles et des demandes humaines qui ne suivent aucun script préétabli.

RobotiqueActu
1 source
Cosmos 3 : Nvidia lance l’IA qui comprend (enfin) la vraie vie
2Le Big Data 

Cosmos 3 : Nvidia lance l’IA qui comprend (enfin) la vraie vie

Nvidia a présenté Cosmos 3 lors du GTC de Taipei le 1er juin 2026, en parallèle de son robot humanoïde Isaac GROOT. Il s'agit du premier omnimodèle entièrement open source dédié à l'IA physique, disponible en deux variantes dès le lancement : une version "Super" de 32 milliards de paramètres, optimisée pour la précision dans des tâches comme la robotique et la conduite autonome, et une version "Nano" de 8 milliards de paramètres, conçue pour des inférences rapides. Une troisième déclinaison "Edge", utilisable directement sur des appareils locaux sans connexion cloud, est annoncée prochainement. Le modèle a été entraîné sur un corpus colossal de 20 000 milliards de tokens incluant près d'un milliard d'images, 400 millions de vidéos réelles et générées, des données audio ambiantes, du texte, ainsi que des traces d'actions captées sur des humains et des robots. Parmi les premiers partenaires industriels figurent Agile Robots, Black Forest Labs et Runway. Ce qui distingue Cosmos 3 des générateurs vidéo ou des modèles multimodaux classiques, c'est sa capacité native à comprendre et produire des actions, et pas seulement des représentations visuelles. Le système peut générer des données concrètes comme les angles d'articulations d'un robot, des trajectoires ou des positions de pinces mécaniques, directement exploitables pour entraîner des machines à interagir avec le monde physique. Ming-Yu Liu, vice-président du Cosmos Lab chez Nvidia, a insisté sur ce point : modéliser les mouvements des machines, et non seulement l'apparence des environnements, est la clé des systèmes autonomes réellement opérationnels. Autre avantage majeur : Cosmos peut simuler des scénarios rares ou dangereux, comme des collisions robotiques ou des incidents routiers atypiques, qui sont coûteux et risqués à reproduire en conditions réelles. Nvidia affirme que des tâches d'entraînement qui demandaient auparavant plusieurs mois pourraient désormais être réalisées en quelques jours. La publication de Cosmos 3 en open source s'inscrit dans la stratégie de Nvidia de construire un écosystème ouvert autour de l'IA physique, dans la lignée de sa famille de modèles Nemotron. En rendant le modèle librement adaptable, l'entreprise cherche à accélérer l'adoption industrielle tout en captant les retours du terrain pour orienter ses futures versions. Ce lancement intervient dans un contexte de compétition intense autour des fondations logicielles de la robotique et des véhicules autonomes, secteurs dans lesquels Google, Tesla et plusieurs startups chinoises investissent massivement. En positionnant Cosmos comme l'infrastructure commune de l'IA physique, Nvidia tente de reproduire dans le monde des machines intelligentes le rôle dominant que CUDA joue depuis vingt ans dans le calcul GPU.

UELes laboratoires et entreprises européens de robotique et de conduite autonome peuvent désormais exploiter un modèle de fondation open source de référence pour l'IA physique, réduisant les coûts d'entraînement et la dépendance au cloud.

💬 C'est la comparaison avec CUDA qui dit tout : Nvidia ne veut pas vendre des GPU pour la robotique, il veut être l'infrastructure qu'on ne peut plus éviter. Cosmos 3 en open source, c'est le même coup que PyTorch, tu ouvres pour capter l'écosystème avant de le monétiser. Reste à voir si les labos européens ont vraiment les ressources pour en tirer parti.

RobotiqueActu
1 source
3MarkTechPost 

NVIDIA lance Cosmos 3 Edge, un modèle de monde ouvert à 4 milliards de paramètres capable de raisonner et de générer des actions robotiques en local

NVIDIA a dévoilé Cosmos 3 Edge, un modèle du monde open source de 4 milliards de paramètres conçu pour fonctionner directement sur des appareils embarqués, sans connexion à un centre de données. Il permet aux robots et aux agents de vision par IA de comprendre leur environnement, de raisonner en temps réel et de générer des actions robotiques en local. Ce modèle complète la famille Cosmos 3, dont les deux premières déclinaisons, Cosmos 3 Nano (16 milliards de paramètres) et Cosmos 3 Super (64 milliards), avaient été lancées le 31 mai 2026 lors de la GTC Taipei. Edge en constitue le troisième et plus petit palier, environ seize fois plus compact que Super. L'objectif est précis : offrir des performances proches de celles d'un centre de données à des machines aux ressources mémoire limitées, comme celles utilisées dans les usines, les entrepôts ou les hôpitaux. Sur le plan technique, Cosmos 3 repose sur une architecture Mixture-of-Transformers à deux tours : une tour autorégressive dédiée au traitement du texte et de la vision pour la compréhension et le raisonnement, et une tour de diffusion qui gère vision, audio et tokens d'action pour la prédiction, la génération et la simulation. Les deux tours partagent des couches d'attention multimodale tout en conservant des couches de normalisation distinctes. Cosmos 3 Edge s'appuie sur un transformeur dense de 2 milliards de paramètres pour son module de raisonnement, compatible avec les conventions de messages de Qwen3-VL. Cette avancée répond à un besoin concret de l'industrie robotique : déployer une intelligence capable de raisonner sur le monde physique directement sur des systèmes contraints en mémoire et en calcul, sans dépendre du cloud. Pour un bras robotique, une simple reconnaissance visuelle d'un objet ne suffit pas : il faut aussi suivre sa position, anticiper le mouvement du préhenseur et prévoir ce qui se produit au contact. En unifiant ces capacités dans un modèle compact, NVIDIA facilite l'intégration de l'IA embarquée dans des secteurs où la latence, la confidentialité des données et l'autonomie énergétique sont critiques, comme la logistique, la santé ou la production industrielle. Le modèle introduit une représentation d'action commune à plusieurs types de systèmes physiques, sous forme de vecteurs géométriques compacts capturant translation, rotation et état de manipulation, avec des dimensions variant selon le cas d'usage, de 9 pour une caméra ou un véhicule autonome jusqu'à 29 pour un robot humanoïde. En mode politique, Cosmos 3 Edge peut prédire une action à partir d'un état donné ou, inversement, déduire l'action à l'origine d'un changement visuel observé. NVIDIA a également publié Cosmos 3 Edge Policy (DROID), une politique de manipulation robotique entraînée sur le jeu de données DROID pour des tâches de préhension et de dépôt, illustrant la volonté de l'entreprise de rapprocher modélisation du monde et contrôle robotique concret.

UELes entreprises europeennes de logistique, sante et industrie pourraient exploiter ce modele open source pour deployer de l'IA embarquee sans dependre du cloud, mais aucun acteur ou reglementation francais/europeen n'est directement concerne.

RobotiqueActu
1 source
NVIDIA lance Cosmos 3 : un modèle de fondation à deux tours mêlant raisonnement physique, génération de mondes et d'actions
4MarkTechPost 

NVIDIA lance Cosmos 3 : un modèle de fondation à deux tours mêlant raisonnement physique, génération de mondes et d'actions

NVIDIA a publié Cosmos 3, une nouvelle famille de modèles d'IA fondationnels conçus pour les systèmes d'IA physique, robots, véhicules autonomes et systèmes de surveillance industrielle. La particularité de cette version réside dans son architecture dite Mixture-of-Transformers (MoT) à deux tours, qui réunit pour la première fois dans un seul modèle trois capacités jusqu'ici séparées : le raisonnement physique, la génération de monde (vidéo, images, son) et la génération d'actions. NVIDIA a publié en open source les poids, scripts d'entraînement, outils de déploiement et jeux de données. Deux échelles sont disponibles au lancement : Cosmos3-Nano (16 milliards de paramètres, basé sur Qwen3-VL 8B) pour l'inférence sur GPU workstation comme la RTX PRO 6000, et Cosmos3-Super (64 milliards de paramètres, basé sur Qwen3-VL 32B) pour les datacenters équipés de GPU Hopper ou Blackwell. Des variantes spécialisées accompagnent cette sortie, dont Super Text2Image, Super Image2Video et Nano-Policy-DROID. L'unification de ces trois capacités dans un seul modèle représente un changement structurel pour les équipes qui développent des systèmes robotiques ou de conduite autonome. Jusqu'ici, il fallait orchestrer plusieurs modèles distincts, un pour percevoir, un pour prédire, un pour agir, ce qui multipliait la complexité d'intégration et les points de défaillance. Cosmos 3 propose un flux cohérent : la tour "reasoner" (un VLM autorégressif qui comprend images, vidéos et texte) conditionne la tour "generator" (diffusion pour la vidéo et les actions), l'information circulant dans un seul sens. Les équipes de robotique temps réel peuvent faire tourner le Nano sur du matériel de terrain, tandis que les équipes de R&D génèrent des données synthétiques à grande échelle avec le Super. Sur les benchmarks, Cosmos 3 domine VANTAGE-Bench et le leaderboard TAR (Traffic Anomaly Reasoning) dans leurs catégories respectives. Cette sortie s'inscrit dans la stratégie d'NVIDIA visant à s'imposer comme infrastructure logicielle de l'IA physique, au-delà de la simple vente de GPU. Les versions précédentes de Cosmos fragmentaient les capacités ; Cosmos 3 consolide l'approche autour d'un socle commun initialisé depuis les poids Qwen3-VL de l'écosystème open source. Le modèle gère nativement des entrées texte, image, vidéo et tableaux d'actions JSON, et produit des sorties allant jusqu'à 720p à 24 FPS avec son stéréo AAC 48 kHz, pour une durée maximale d'environ 12,5 secondes. Il supporte une gamme d'embodiments robotiques (caméra, véhicule, bras simple ou double, humanoïde), chacun avec des dimensions d'action fixes. Face à la montée en puissance de Google DeepMind, Boston Dynamics et des startups robotiques chinoises, NVIDIA mise sur l'open source et la verticalisation logicielle pour ancrer son écosystème dans les prochaines années de déploiement d'IA physique.

UELes équipes européennes de robotique et de véhicules autonomes peuvent accéder gratuitement à un modèle de fondation unifié pour l'IA physique, réduisant la complexité d'intégration et les coûts de R&D pour les industriels actifs dans l'automatisation et la mobilité autonome.

💬 Orchestrer trois modèles séparés pour percevoir, prédire et agir, c'était le quotidien douloureux des équipes robotique, et Cosmos 3 règle ça proprement. L'open source complet, poids + scripts + datasets, c'est pas de la comm, NVIDIA construit une base logicielle sur laquelle personne ne pourra se passer d'eux dans 3 ans. Reste à voir si le Nano tient en conditions réelles, parce que sur les benchmarks c'est toujours plus joli qu'en prod.

RobotiqueOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic