Aller au contenu principal
OpenAI dévoile son nouveau modèle GPT-5.4, un pas de géant vers des agents autonomes
RobotiqueThe Verge AI · 1 min de lecture

OpenAI dévoile son nouveau modèle GPT-5.4, un pas de géant vers des agents autonomes

Source originale ↗·

OpenAI a lancé GPT-5.4, une nouvelle version de son modèle d'IA intégrant des progrès en raisonnement, codage et travail professionnel avec des feuilles de calcul, des documents et des présentations. C'est le premier modèle d'OpenAI capable de fonctionner directement sur un ordinateur pour accomplir des tâches dans diverses applications. Ce modèle marque une avancée significative vers l'avenir des agents autonomes que les sociétés d'IA visent à créer.

Faits clés: - Nouveau modèle: GPT-5.4 - Avancées: Raisonnement, codage, travail avec des feuilles de calcul, documents, présentations - Capacités inédites: Fonctionnement direct sur un ordinateur pour accomplir des tâches - Contexte: Progression vers l'utilisation généralisée d'agents autonomes basés sur l'IA pour effectuer des tâches complexes en ligne et dans des logiciels.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Le nouveau modèle de Google rend les cerveaux robotiques un peu plus intelligents
1The Information AI 

Le nouveau modèle de Google rend les cerveaux robotiques un peu plus intelligents

Google DeepMind a publié cette semaine Gemini Robotics-ER-1.6, un nouveau modèle de vision et de langage conçu pour aider les robots à interpréter leur environnement. Pour illustrer ses capacités, Boston Dynamics, qui dispose d'un accord pour intégrer Gemini dans ses robots humanoïdes, a publié une vidéo de ses robots quadrupèdes utilisant le modèle pour lire un thermomètre lors d'une inspection dans une installation industrielle. Selon les benchmarks internes de Google, les gains restent modestes sur un seul flux caméra : le modèle n'améliore que marginalement la capacité du robot à détecter la fin d'une tâche par rapport aux versions précédentes. En revanche, les performances progressent nettement lorsque le robot exploite plusieurs flux caméra simultanément. C'est précisément là que réside l'enjeu pratique : la majorité des environnements robotiques industriels, qu'il s'agisse d'usines ou d'entrepôts, s'appuient sur plusieurs points de vue combinés, comme une caméra en hauteur et une caméra fixée sur le bras du robot. Le système doit être capable de fusionner ces perspectives pour construire une compréhension cohérente de ce qu'il accomplit et savoir quand la tâche est terminée. Ce lancement s'inscrit dans une course intense entre les grands laboratoires d'IA pour doter les robots d'une intelligence de perception plus robuste. Google DeepMind et Boston Dynamics ont formalisé leur partenariat autour de Gemini pour les robots humanoïdes, signalant une convergence entre les modèles de fondation et la robotique physique. Si les progrès annoncés restent incrémentaux, l'amélioration sur les configurations multi-caméras est directement applicable aux déploiements industriels existants, ce qui pourrait accélérer l'adoption de robots autonomes dans des environnements de travail réels. Les prochaines versions du modèle seront à surveiller pour évaluer si ces gains se traduisent en performances significatives sur des tâches complexes en conditions réelles.

RobotiqueActu
1 source
Kakao Mobility dévoile sa feuille de route pour la conduite autonome de niveau 4
2AI News 

Kakao Mobility dévoile sa feuille de route pour la conduite autonome de niveau 4

Kakao Mobility, la filiale mobilité du groupe sud-coréen Kakao, a présenté sa feuille de route pour le développement en interne de technologies de conduite autonome de niveau 4. Kim Jin-kyu, vice-président et directeur de la division Physical AI de l'entreprise, a détaillé ce plan lors du World IT Show 2026, organisé au centre de conférences COEX de Séoul, un événement réunissant 460 entreprises et organisations issues de 17 pays. La stratégie repose sur trois piliers technologiques : des modèles de machine learning capables de gérer la perception, la prise de décision et le contrôle du véhicule sans intervention humaine ; des architectures de véhicules avec systèmes redondants garantissant la continuité des fonctions critiques en cas de défaillance d'un composant ; et une plateforme de validation combinant simulations virtuelles et données de conduite réelle. En parallèle, Kakao Mobility développe un outil de visualisation 3D appelé Autonomous Vehicle Visualizer, qui retransmet en temps réel le champ de vision du véhicule aux passagers, ainsi qu'un centre de contrôle opérationnel 24h/24 et un système de détection d'anomalies basé sur des modèles vision-langage pour permettre une intervention à distance en cas d'urgence. La conduite autonome de niveau 4, telle que définie par la National Highway Traffic Safety Administration américaine, désigne des systèmes capables d'assurer l'intégralité de la conduite dans des zones de service délimitées sans que les passagers n'aient à surveiller la route ni reprendre le contrôle. Atteindre ce seuil représente un enjeu industriel majeur : c'est à ce stade que les services de taxi sans conducteur deviennent commercialement viables à grande échelle. Pour Kakao Mobility, qui opère déjà un service de véhicules autonomes en soirée dans le quartier de Gangnam à Séoul, cette feuille de route vise à transformer son infrastructure de mobilité existante en fondation pour des services entièrement autonomes, et à renforcer la compétitivité locale de la Corée du Sud face aux acteurs mondiaux du secteur. Le gouvernement sud-coréen a d'ailleurs positionné le World IT Show 2026 comme un signal fort de sa transition vers une économie d'IA physique, où l'intelligence artificielle s'intègre directement aux infrastructures industrielles et urbaines. Dans ce contexte, Kakao Mobility entend ne pas rester un utilisateur de technologies développées ailleurs : l'entreprise prévoit de partager avec des startups, fabricants et partenaires industriels ses jeux de données de conduite autonome à grande échelle, ses cartes haute définition et ses API de plateforme pour le covoiturage et la dispatch. Cette stratégie d'écosystème ouvert cherche à éviter que chaque acteur du secteur reconstruise seul l'infrastructure de base, tout en positionnant Kakao comme orchestrateur central du marché autonome coréen.

RobotiqueActu
1 source
Le directeur de la robotique de Nvidia : les agents IA vont provoquer un moment ChatGPT pour la robotique
3The Information AI 

Le directeur de la robotique de Nvidia : les agents IA vont provoquer un moment ChatGPT pour la robotique

Nvidia mise sur les agents IA pour déclencher une révolution dans la robotique comparable à l'émergence de ChatGPT. C'est le pari affiché par Deepu Talla, vice-président en charge de la robotique et de l'edge AI chez le géant des semi-conducteurs, lors de la conférence annuelle GTC à San Jose, en Californie. Pour Talla, la convergence entre agents IA et robotique physique est inévitable : les systèmes agentiques sont d'abord conçus pour le monde numérique, mais leur extension au monde physique ne représente qu'une étape supplémentaire. Cette vision pourrait transformer en profondeur l'industrie robotique, en abaissant drastiquement les barrières à l'entrée pour déployer et piloter des flottes de machines autonomes. Selon Deepu Talla, un seul agent IA pourrait coordonner une flotte entière de robots : il décomposerait un objectif global en tâches spécifiques, puis les distribuerait aux différents robots concernés. Plus significatif encore, cette approche agentique simplifierait et accélérerait l'intégration de nouveaux robots dans un système existant, avec la même fluidité qu'un utilisateur qui s'inscrit sur ChatGPT pour la première fois. Nvidia positionne ainsi ses travaux en robotique comme le prolongement naturel de son infrastructure pour l'IA générative, capitalisant sur l'élan autour des agents autonomes pour conquérir un marché industriel à fort potentiel.

RobotiqueActu
1 source
JoyAI-RA 0.1 : un modèle de base pour l'autonomie robotique
4arXiv cs.RO 

JoyAI-RA 0.1 : un modèle de base pour l'autonomie robotique

Des chercheurs ont publié le 28 avril 2026 sur arXiv un nouveau modèle de fondation baptisé JoyAI-RA 0.1, conçu pour doter les robots d'une autonomie généralisable dans des environnements réels et variés. Ce modèle de type vision-langage-action (VLA) s'appuie sur un cadre d'entraînement multi-sources et multi-niveaux inédit : il combine des données issues du web, des vidéos en vue subjective de manipulations humaines à grande échelle, des trajectoires générées par simulation, et des données collectées sur de vrais robots. Selon les résultats présentés, JoyAI-RA surpasse les méthodes les plus avancées sur des benchmarks en simulation comme en environnement réel, particulièrement sur des tâches variées nécessitant une capacité de généralisation. L'enjeu central de ce travail est la généralisation inter-robots, un problème récurrent dans le domaine : les modèles entraînés sur un type de robot peinent à s'adapter à d'autres architectures mécaniques ou capteurs différents. JoyAI-RA propose une unification explicite des espaces d'action, ce qui lui permet de transférer efficacement des comportements appris depuis des vidéos de manipulation humaine vers le contrôle robotique. Ce pont entre geste humain et mouvement machine est particulièrement prometteur pour réduire les coûts de collecte de données et accélérer le déploiement de robots polyvalents dans des contextes industriels, logistiques ou domestiques. La robotique autonome bute depuis des années sur deux obstacles structurels : la faible diversité des jeux de données disponibles et l'impossibilité de réutiliser des comportements appris d'un robot à l'autre. JoyAI-RA s'inscrit dans une tendance de fond qui voit émerger des modèles de fondation généralistes pour la robotique, à l'image de RT-2 de Google DeepMind ou d'OpenVLA. La particularité de cette approche réside dans l'intégration massive de vidéos de manipulation humaine comme source de supervision implicite, une stratégie qui contourne partiellement la rareté des données robotiques annotées. La publication en version 0.1 suggère que l'équipe, vraisemblablement liée à l'écosystème chinois au vu du nom JoyAI, entend faire évoluer ce modèle rapidement.

RobotiqueOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic