Aller au contenu principal

Actualités IA — page 135

7 619 articles au fil, du plus récent au plus ancien.

Le déploiement de l’IA dans le domaine juridique révolutionne ce secteur
2681Le Big Data 

Le déploiement de l’IA dans le domaine juridique révolutionne ce secteur

L'intelligence artificielle s'impose progressivement dans le monde juridique français, transformant le quotidien des avocats, notaires, magistrats et juristes d'entreprise. Les applications concrètes sont nombreuses : analyse de dossiers volumineux, aide à la rédaction d'actes complexes, recherche de jurisprudences ciblées, ou pseudonymisation automatique des décisions de justice. La Cour de cassation a récemment publié un rapport examinant l'usage de l'IA pour les institutions judiciaires françaises, identifiant des gains potentiels significatifs en efficacité et en qualité pour les magistrats. Mais l'outil montre aussi ses limites : le Tribunal administratif d'Orléans a dû rappeler à l'ordre, dans une décision du 29 décembre 2025, un avocat qui avait cité une quinzaine de références juridiques inexistantes, produites par hallucination de son outil d'IA. L'impact dépasse les seuls prétoires. Au sein des entreprises, le déploiement de l'IA redéfinit le rôle des juristes internes et engage la responsabilité des employeurs. Plusieurs décisions récentes de tribunaux judiciaires ont rappelé que tout employeur d'au moins 50 salariés doit consulter son comité social et économique (CSE) avant d'introduire des outils d'IA susceptibles de modifier les conditions de travail. Autrement dit, chaque déploiement de logiciel ou plateforme IA utilisé par les équipes devient un sujet de gouvernance sociale, et pas seulement technique. Les représentants du personnel se trouvent ainsi contraints de monter en compétence sur ces questions pour rendre des avis éclairés, sous peine de valider des changements dont ils n'auraient pas mesuré les conséquences. Ce mouvement s'inscrit dans un contexte réglementaire qui se structure rapidement. La Cour de cassation souligne que le déploiement de l'IA dans la justice ne pourra se faire sans garanties solides : souveraineté numérique pour l'hébergement des données, sécurité des systèmes d'information, respect des droits fondamentaux, transparence des algorithmes et maintien du contrôle humain sur les décisions. Ces exigences rejoignent celles du règlement européen sur l'IA, qui classe les systèmes utilisés dans la justice parmi les applications à haut risque soumises à obligations renforcées. L'enjeu central reste le même pour toutes les professions concernées : intégrer l'IA comme un outil d'appui sans substituer sa logique probabiliste au raisonnement juridique, qui exige rigueur, déontologie et responsabilité individuelle que l'automatisation ne peut pas absorber.

SociétéReglementation
1 source
Meta lance Business Agent pour automatiser les ventes et le support client
2682Le Big Data 

Meta lance Business Agent pour automatiser les ventes et le support client

Meta a annoncé le 3 juin 2026 le lancement de Business Agent, un assistant conversationnel alimenté par l'intelligence artificielle conçu pour automatiser les ventes, le support client et certaines tâches opérationnelles sur WhatsApp, Messenger et Instagram. Le groupe déploie également une infrastructure associée, baptisée plateforme Meta Business Agent, qui permet aux entreprises de créer et personnaliser leurs propres agents IA connectés à des outils tiers comme Shopify, Zendesk ou Shopee. Dès le lancement, plus d'un million d'entreprises ont accès à ce dispositif via les canaux de messagerie de Meta. Le déploiement commence gratuitement, avec des formules payantes annoncées pour les prochains mois, adaptées à différentes tailles de structures, des PME aux grands groupes. Avec plus d'un milliard de conversations quotidiennes entre entreprises et consommateurs sur ses plateformes, Meta transforme ces échanges en interfaces commerciales actives. Business Agent peut répondre aux demandes clients, recommander des produits, qualifier des prospects, prendre des rendez-vous et conclure des ventes, tout en s'adaptant à la langue et au ton propre à chaque marque. Contrairement aux chatbots traditionnels limités à des scénarios fixes, cet agent suit une logique d'exécution multi-tâches au sein d'une même conversation, avec la possibilité pour les entreprises de définir à quel moment un collaborateur humain doit reprendre la main. En interne, l'outil génère également des résumés des conversations manquées et des analyses des interactions récentes, réduisant la charge opérationnelle liée aux échanges répétitifs. Cette offensive s'inscrit dans une course accélérée entre les grandes plateformes technologiques pour monétiser leurs audiences via des agents IA. Meta, fort d'une base d'utilisateurs sans équivalent sur la messagerie mondiale, cherche à convertir cette présence en infrastructure commerciale incontournable pour les entreprises. La plateforme concurrence directement des solutions comme Google Business Messages ou les intégrations Salesforce Einstein, en misant sur la simplicité de déploiement et l'ubiquité de WhatsApp, dominant dans de nombreux marchés hors États-Unis. À terme, Meta prévoit d'étendre les capacités de Business Agent à la veille concurrentielle, aux études de marché, à la gestion d'agenda et à l'analyse de données produits, positionnant progressivement cet outil comme un assistant stratégique complet pour les équipes commerciales et marketing.

OutilsOutil
1 source
Miso Labs publie MisoTTS : un modèle de synthèse vocale expressif de 8 milliards de paramètres en open weights
2683MarkTechPost 

Miso Labs publie MisoTTS : un modèle de synthèse vocale expressif de 8 milliards de paramètres en open weights

Miso Labs a publié le 3 juin 2026 MisoTTS, un modèle de synthèse vocale open-weights de 8 milliards de paramètres capable de générer une parole expressive à partir de texte et de contexte audio. Construit sur une architecture de type Llama 3.2, le modèle s'inspire du système CSM de Sesame et repose sur une technique de quantification vectorielle résiduelle (RVQ) pour représenter les sons. Contrairement aux transformeurs classiques qui travaillent avec un vocabulaire discret fixe, MisoTTS émet pour chaque token audio un vecteur de 32 indices issus de codebooks de 2048 entrées chacun, ce qui lui permet d'atteindre théoriquement environ 10^105 tokens adressables sans augmenter le nombre de paramètres. L'architecture se divise en deux composants : un backbone de 7,7 milliards de paramètres responsable de la prédiction temporelle, et un décodeur de 300 millions de paramètres qui raffine les indices de codebook restants. Miso Labs revendique une latence de 110 millisecondes, contre 300 ms pour Sesame et 700 ms pour ElevenLabs. Le modèle est publié sous une licence MIT modifiée. Ce lancement est notable pour deux raisons techniques distinctes. La première est la résolution du problème de vocabulaire : la parole humaine varie en hauteur, rythme, accentuation, émotion et accent, ce qui la rend difficile à capturer avec un vocabulaire de tokens classique sans gonfler massivement la taille du modèle. La RVQ contourne cette limite en empilant des raffinements successifs plutôt qu'en élargissant un seul vocabulaire plat. La seconde avancée concerne le conditionnement : la plupart des systèmes TTS existants ne prennent en entrée que du texte. MisoTTS conditionne aussi le modèle sur l'audio de l'interlocuteur, lui permettant de répondre au ton de la conversation plutôt que de produire une voix uniforme. Miso Labs soutient que c'est précisément cette absence de prise en compte du contexte émotionnel qui cause l'effet de vallée de l'étrange dans les TTS actuels. Le modèle s'inscrit dans une dynamique d'ouverture accélérée dans le secteur des modèles audio. Après Sesame, dont l'architecture CSM a directement inspiré MisoTTS, plusieurs laboratoires cherchent à rendre la synthèse vocale expressive accessible localement, en dehors des API propriétaires. Le déploiement local est d'ailleurs l'un des arguments commerciaux de Miso Labs, qui met en avant la confidentialité des données audio. Des limites demeurent : le modèle fonctionne uniquement en mode half-duplex, sans gestion du tour de parole, nécessite un GPU CUDA performant, et l'accès API annoncé n'est pas encore disponible. Les affirmations sur la latence et la qualité n'ont pas encore été vérifiées par des tiers indépendants, ce qui laisse ouvertes les questions sur les performances réelles en production.

CréationOpinion
1 source
Projet Solara : Microsoft veut remplacer la bonne vieille informatique par des agents IA
2684Next INpact 

Projet Solara : Microsoft veut remplacer la bonne vieille informatique par des agents IA

Microsoft a dévoilé le projet Solara lors de sa conférence BUILD, une plateforme ambitieuse visant à faire des agents IA le nouveau paradigme central de l'informatique. Steven Bathiche, directeur de l'Applied Sciences Group chez Microsoft, a présenté ce système comme une infrastructure "de la puce au cloud" capable de faire tourner plusieurs agents spécialisés en parallèle. Pour matérialiser cette vision, Microsoft a conçu deux prototypes en collaboration avec ses partenaires Qualcomm et MediaTek : un badge connecté équipé d'un écran tactile, d'un microphone, d'une caméra, d'une connexion 5G et d'un lecteur d'empreintes digitales, ainsi qu'un terminal de bureau compact, évoquant un radio-réveil ou un écran connecté de cuisine, conçu pour rester en permanence accessible à côté d'un PC et pouvant se transformer en poste Windows 365 lorsqu'il est branché à un moniteur externe. L'enjeu est considérable pour Microsoft : la société parie que l'interaction utilisateur va fondamentalement basculer des applications traditionnelles vers des agents capables d'interpréter des intentions et de coordonner logiciels et services en arrière-plan, sans qu'aucune interface graphique classique ne soit nécessaire. Ce faisant, Microsoft se positionne pour contrôler la couche d'abstraction qui remplacera ses propres produits historiques, Windows, Office, dont la pertinence s'érode dans ce scénario. L'entreprise tente ainsi de ne pas se retrouver dans la position de Kodak face au numérique : elle préfère cannibaliser elle-même son modèle plutôt que de le laisser faire par ses concurrents. Ce virage s'inscrit dans une course industrielle plus large où plusieurs acteurs cherchent à définir l'appareil post-smartphone. OpenAI et le designer Jony Ive travaillent eux aussi sur un dispositif centré sur l'IA, qui pourrait selon l'analyste Ming-Chi Kuo ressembler à un smartphone classique. Le risque pour Microsoft reste que ses prototypes Solara ressemblent à des réinventions de catégories déjà existantes : un badge qui rappelle un smartphone miniature, un terminal de bureau qui n'est pas sans évoquer un Google Nest Hub ou un Amazon Echo Show. L'histoire de l'informatique, du métavers aux Google Glass, montre que les ruptures de paradigme annoncées avec fracas peinent souvent à convaincre le grand public, qui finit par revenir au smartphone. La pertinence de Solara dépendra moins de la qualité des prototypes que de la capacité des agents IA à tenir leurs promesses d'autonomie et de fiabilité dans des usages quotidiens réels.

OutilsOpinion
1 source
Google lance Dreambeans, cette appli IA crée des petites histoires basées sur votre vie
2685Le Big Data 

Google lance Dreambeans, cette appli IA crée des petites histoires basées sur votre vie

Google a lancé le 3 juin 2026 Dreambeans, une application mobile expérimentale développée par Google Labs qui génère chaque matin entre 10 et 14 histoires personnalisées à partir des données de l'utilisateur. Pendant la nuit, l'application analyse le contenu de Gmail, Google Agenda, Google Photos, YouTube et l'historique de recherche pour produire des récits illustrés par intelligence artificielle. Ces histoires peuvent prendre la forme d'une recommandation de café détectée dans les recherches récentes, d'informations liées à un voyage planifié dans l'agenda, ou d'idées inspirées des vidéos regardées sur YouTube. Certains récits vont jusqu'à proposer une action concrète, comme réserver une place pour un événement. Les illustrations sont générées grâce au modèle Nano Banana 2 de Google, et peuvent intégrer les visages de l'utilisateur ou de ses proches en s'appuyant sur le regroupement facial de Google Photos. Pour l'instant, l'application est réservée aux abonnés Google AI Ultra résidant aux États-Unis et âgés d'au moins 18 ans. L'application incarne une philosophie délibérément opposée au modèle dominant des réseaux sociaux : au lieu d'un flux infini conçu pour maximiser le temps passé sur l'écran, Dreambeans propose une poignée d'histoires quotidiennes puis encourage l'utilisateur à reprendre sa journée. Cette approche pourrait résonner auprès d'utilisateurs de plus en plus critiques envers les mécaniques addictives des plateformes classiques. En pratique, l'impact reste cependant très circonscrit : l'accès est conditionné à un abonnement Google AI Ultra facturé 100 dollars par mois, soit l'offre la plus coûteuse de Google, ce qui réduit considérablement le nombre d'utilisateurs potentiels à court terme. Google reconnaît par ailleurs que l'application reste un projet expérimental, avec des recommandations parfois peu pertinentes et des visuels qui peuvent s'avérer inexacts. Dreambeans s'inscrit dans la stratégie plus large de Google autour de ce qu'il appelle l'"intelligence personnelle", soit la capacité à croiser les données des différents services Google pour offrir une expérience hyper-contextualisée. L'application arrive dans un moment où les géants technologiques cherchent à valoriser leurs écosystèmes fermés face à la concurrence de nouveaux entrants en IA. La question de la vie privée est centrale : Google indique que les utilisateurs contrôlent quels services sont connectés à Dreambeans et peuvent effacer leurs données à tout moment, et que les paramètres de l'appli n'influencent pas Gemini ni le mode IA de Google. Un système de retour d'expérience est intégré pour affiner les résultats. La prochaine étape sera de déterminer si ce positionnement, intime, limité, et payant, séduira au-delà du cercle des early adopters fortunés, ou si Google élargira progressivement l'accès à d'autres marchés.

OutilsOutil
1 source
DeepSeek viserait une levée de fonds de 7 milliards de dollars avec Tencent et CATL
2686Le Big Data 

DeepSeek viserait une levée de fonds de 7 milliards de dollars avec Tencent et CATL

DeepSeek, la startup d'intelligence artificielle chinoise fondée par Liang Wenfeng, prépare sa première levée de fonds externe d'un montant de 50 milliards de yuans, soit environ 7,4 milliards de dollars. L'opération, révélée par Reuters et CNBC début juin 2026, impliquerait un cercle restreint de moins de dix investisseurs stratégiques. Tencent envisagerait d'y injecter 10 milliards de yuans, tandis que CATL, le géant mondial des batteries pour véhicules électriques, apporterait 5 milliards de yuans. Le fonds national chinois dédié à l'IA, le groupe de jeux vidéo NetEase et le e-commerçant JD.com seraient également en discussions avancées. Liang Wenfeng aurait lui-même engagé près de 20 milliards de yuans de fonds personnels dans l'entreprise à ce stade. Si l'accord est finalisé dans les prochaines semaines, il valoriserait DeepSeek entre 52 et 59 milliards de dollars, ce qui en ferait l'une des plus importantes levées de fonds jamais réalisées par une entreprise d'IA en Chine. Cette opération consacre la montée en puissance d'un acteur qui a bousculé les certitudes du secteur. Début 2025, les modèles R1 et V3 de DeepSeek avaient stupéfait la Silicon Valley en affichant des performances comparables aux meilleurs modèles occidentaux à une fraction du coût annoncé, remettant en cause l'hypothèse d'un retard structurel de la Chine dans la course à l'IA générative. Avec ces nouveaux capitaux, DeepSeek pourra accélérer le développement de modèles de prochaine génération et investir dans les infrastructures massives nécessaires à leur entraînement, deux postes de dépenses qui conditionnent directement la compétitivité à long terme dans ce domaine. La composition du tour de table révèle une logique industrielle qui dépasse la simple valorisation financière. Tencent, dont le modèle maison Hunyuan accuse du retard face à Alibaba et ByteDance, chercherait à accéder aux technologies de pointe de DeepSeek pour renforcer sa position dans l'IA. L'entrée de CATL est encore plus révélatrice : ce champion des batteries se repositionne sur les infrastructures énergétiques pour centres de données, un segment en explosion sous l'effet de la demande en puissance de calcul liée à l'IA. La convergence entre un leader des modèles, un géant du numérique et un spécialiste mondial de l'énergie illustre la stratégie chinoise de construction d'une chaîne de valeur intégrée de l'IA, des algorithmes aux ressources électriques qui les alimentent, alors que Pékin intensifie ses efforts pour sécuriser son autonomie technologique face aux restrictions américaines sur les semi-conducteurs.

BusinessOpinion
1 source
Miso Labs lance Miso One : la nouvelle référence open source de la synthèse vocale ?
2687Le Big Data 

Miso Labs lance Miso One : la nouvelle référence open source de la synthèse vocale ?

Miso Labs a lancé le 3 juin 2026 Miso One, un modèle de synthèse vocale open source de 8 milliards de paramètres conçu pour la génération vocale conversationnelle. Contrairement aux systèmes classiques de lecture de texte, Miso One vise à produire des échanges naturels dont le ton et le rythme s'adaptent au contexte. Sa caractéristique technique la plus frappante est sa latence annoncée de 110 millisecondes, soit moins que le temps de réaction humain moyen en conversation, estimé à 160 millisecondes. Le modèle propose également le clonage vocal à partir d'un extrait audio d'une dizaine de secondes, une fonctionnalité désormais courante dans le secteur mais rare dans les solutions ouvertes. Miso Labs a publié les poids du modèle dès son lancement, permettant aux développeurs de l'héberger eux-mêmes, de l'adapter ou de l'intégrer directement dans leurs applications. L'enjeu principal de ce lancement est de proposer une alternative crédible et souveraine aux API vocales propriétaires qui dominent le marché, comme celles d'ElevenLabs ou d'OpenAI. La possibilité d'héberger le modèle en local intéresse particulièrement les organisations traitant des données sensibles : secteur médical, financier ou administrations publiques, pour qui confier des données audio à des tiers représente un risque juridique et réglementaire réel. Sur le plan de l'expérience utilisateur, réduire la latence sous le seuil de perception humaine pourrait effacer l'une des dernières frictions qui trahissent encore les assistants vocaux, le silence artificiel entre question et réponse. Les premiers retours de testeurs publiés en ligne sont enthousiastes, certains affirmant avoir fait passer des voix générées pour des enregistrements humains auprès de proches. La synthèse vocale expressive est devenue un champ de bataille technologique majeur, tirée par l'essor des agents conversationnels et des interfaces vocales embarquées. Miso Labs s'inscrit dans un mouvement plus large de modèles open source qui cherchent à contester la domination des grandes plateformes américaines en rendant des capacités avancées accessibles sans abonnement ni dépendance à une API fermée. Cela dit, plusieurs zones d'ombre subsistent à ce stade : l'entreprise n'a pas publié la méthodologie précise derrière sa mesure de latence à 110 millisecondes, ni les conditions matérielles dans lesquelles ce chiffre a été obtenu. Aucune évaluation indépendante n'est encore venue valider les performances revendiquées en matière d'expressivité. Comme souvent dans l'industrie de l'IA, les annonces précèdent les benchmarks tiers, et Miso One devra passer l'épreuve des tests communautaires pour confirmer ses promesses.

CréationOpinion
1 source
OpenJarvis : un framework local pour agents IA personnels avec outils, mémoire et apprentissage
2688MarkTechPost 

OpenJarvis : un framework local pour agents IA personnels avec outils, mémoire et apprentissage

Des chercheurs de l'Université Stanford et de Lambda Labs ont publié en mai 2026 OpenJarvis, un framework open-source conçu pour faire tourner des agents IA personnels entièrement en local, sans recours au cloud. Disponible sur GitHub avec déjà plus de 5 400 étoiles, le projet s'appuie sur onze modèles locaux issus de quatre familles (Qwen3.5, Gemma4, Nemotron, Granite) et supporte des moteurs d'inférence variés comme Ollama, vLLM ou llama.cpp. Les performances mesurées sur 508 tâches réparties en huit benchmarks montrent que les modèles configurés via OpenJarvis se situent à seulement 3,2 points de pourcentage en dessous des meilleurs modèles cloud, Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, tout en affichant une latence quatre fois plus faible et un coût marginal par requête environ 800 fois inférieur. Ce résultat change concrètement l'équation pour les développeurs et les entreprises qui cherchent à déployer des agents IA sans dépendre d'APIs tierces. OpenJarvis décompose un système d'IA personnelle en cinq primitives indépendantes et interchangeables, le modèle, le moteur d'inférence, la logique d'agent, les outils et la mémoire, puis l'optimiseur d'apprentissage, toutes configurables via un unique fichier TOML appelé "spec". Cette architecture permet à un même comportement d'agent de fonctionner sur un Mac Mini M4 comme sur une station de travail NVIDIA DGX Spark, sans réécrire les prompts. L'installation tient en une seule commande et prend environ trois minutes sur une connexion correcte. La contribution la plus originale du projet réside dans la "LLM-guided spec search", une méthode d'optimisation hybride locale-cloud : un modèle frontier agit comme enseignant au moment de la configuration, en analysant les traces d'exécution, diagnostiquant les échecs et proposant des modifications coordonnées sur l'ensemble des primitives. Une modification n'est acceptée que si elle améliore les cas défaillants sans provoquer de régressions ailleurs, avec une tolérance par défaut de 1%. Une fois optimisé, le système tourne entièrement en local sans aucun appel cloud. À 100 requêtes par jour, le coût amorti de cet enseignant descend sous 0,001 dollar par requête au bout de six mois. Cette approche multi-primitive récupère 13 à 32 points de pourcentage de l'écart cloud-local, contre seulement 5 points pour les optimiseurs de prompts classiques, à un coût d'optimisation 7 à 11 fois inférieur aux méthodes antérieures comme DSPy ou LoRA. Le projet s'inscrit dans un contexte où les modèles locaux gèrent déjà 88,7% des requêtes conversationnelles courantes selon une étude antérieure de la même équipe, et où l'efficacité des modèles embarqués a progressé de 5,3 fois entre 2023 et 2025.

OutilsOutil
1 source
Microsoft veut rendre les utilisateurs accros à son agent IA Scout
2689Next INpact 

Microsoft veut rendre les utilisateurs accros à son agent IA Scout

Microsoft a présenté Scout lors de sa conférence Build 2026, un agent IA autonome et permanent conçu pour s'intégrer profondément dans l'écosystème Microsoft 365. Contrairement à Copilot, qui répond à des sollicitations ponctuelles, Scout agit de manière proactive : il surveille Teams, Outlook, OneDrive, SharePoint, le calendrier et les e-mails pour anticiper les besoins de l'utilisateur. Concrètement, il peut repérer des réunions importantes, organiser automatiquement des rendez-vous, bloquer des créneaux dans l'agenda pour boucler un projet, préparer des documents avant une réunion ou signaler qu'une décision traîne et risque de faire déraper un planning. Scout possède aussi sa propre identité traçable : toutes ses actions sont journalisées et les opérations critiques nécessitent une validation humaine. Selon des documents internes publiés par 404media, plus de 1 000 employés Microsoft l'utilisent déjà, dont le PDG Satya Nadella. L'agent est pour l'instant en aperçu privé, mais le document interne révèle qu'il s'est imposé comme "l'un des outils internes les plus demandés chez Microsoft, sans annonce officielle, sans marketing". Cette approche représente un changement de paradigme dans l'usage professionnel de l'IA. Là où Copilot restait un assistant réactif, Scout ambitionne de devenir un collaborateur permanent qui apprend les habitudes de travail, identifie les projets prioritaires et anticipe les tâches récurrentes. Pour les entreprises clientes de Microsoft 365, cela signifie un agent qui réduit la charge cognitive des équipes en automatisant la coordination et la gestion du temps, deux des principaux goulots d'étranglement dans les organisations. L'enjeu commercial est considérable : Microsoft a investi des milliards dans ses infrastructures IA et cherche à transformer cet investissement en adoption massive au sein des entreprises. Ce qui rend le lancement de Scout particulièrement significatif, c'est la technologie qui le propulse : OpenClaw, une bibliothèque open source devenue une référence dans le monde des agents autonomes capables de manipuler des applications, des fichiers et des services en continu. Ironie du calendrier, Microsoft avertissait encore en février 2026 des risques de sécurité liés à OpenClaw, jugeant la technologie trop risquée pour les environnements d'entreprise en raison de ses privilèges étendus. L'éditeur a depuis changé de position et s'engage désormais à contribuer directement au projet, affirmant qu'il va "ajouter la sécurité, la gouvernance et l'intégration Microsoft 365" à la base existante. Ce revirement contraste avec l'approche de Meta, qui développe sa propre alternative propriétaire baptisée Hatch depuis qu'OpenAI a recruté Peter Steinberger, le créateur d'OpenClaw. Microsoft choisit l'intégration là où Meta choisit la bifurcation, un pari qui pourrait s'avérer décisif dans la course aux agents d'entreprise.

OutilsOutil
1 source
OpenAI va fusionner Codex et ChatGPT… et la super app va (peut-être) arriver aujourd’hui
2690Le Big Data 

OpenAI va fusionner Codex et ChatGPT… et la super app va (peut-être) arriver aujourd’hui

OpenAI a confirmé son intention de fusionner Codex et ChatGPT au sein d'une plateforme unique, selon des déclarations faites début juin 2026. Alexander Embiricos, responsable des produits entreprise chez OpenAI, a reconnu publiquement que le maintien de deux applications distinctes n'avait plus de sens. La société a annoncé que l'intégration de Codex dans ChatGPT interviendrait dans les prochaines semaines, sans préciser de date exacte ni les modalités techniques de cette fusion. Le 3 juin, OpenAI a publié sur X un message cryptique, "Il est temps de s'envoler", interprété par de nombreux observateurs comme une annonce imminente liée à Codex. Un signe avant-coureur existe déjà côté mobile : l'application ChatGPT sur iPhone peut désormais accéder à une instance de Codex installée sur Mac, laissant présager une intégration plus profonde à venir sur les autres plateformes. Cette convergence aurait des conséquences directes pour les développeurs et les entreprises qui utilisent aujourd'hui les deux outils séparément. L'objectif affiché par OpenAI est simple : l'utilisateur ne devrait plus avoir à choisir quelle application est la mieux adaptée à sa tâche. Un assistant de codage avancé et un modèle de conversation généraliste dans un seul environnement réduirait la friction, simplifierait les workflows et renforcerait la position d'OpenAI face à des concurrents qui proposent déjà des expériences plus unifiées. Pour les entreprises abonnées aux offres OpenAI, cela pourrait aussi signifier une rationalisation des licences et une meilleure cohérence entre les différents usages professionnels de l'IA. Codex, lancé par OpenAI comme agent de codage autonome capable de lire des dépôts GitHub, d'écrire et tester du code de manière indépendante, avait été déployé comme produit à part entière en mai 2025. Son existence séparée de ChatGPT reflétait une stratégie de segmentation par cas d'usage, aujourd'hui remise en question à mesure que les modèles de langage deviennent plus polyvalents. Anthropic suit une approche similaire avec Claude, où toutes les capacités, qu'il s'agisse d'analyse, de code ou de conversation, sont centralisées dans une seule interface. Si OpenAI opte pour une fusion complète, la question du nom reste ouverte : certains utilisateurs proposent "Chatex" ou "CodeGPT", sans qu'OpenAI n'ait tranché. Il reste également incertain si Codex survivra comme application autonome ou sera entièrement absorbé dans ChatGPT, une décision qui pourrait influencer l'adoption par les développeurs habitués à l'environnement actuel.

OutilsOutil
1 source
Prompt vidéo IA, la méthode simple pour obtenir un rendu pro
2691Le Big Data 

Prompt vidéo IA, la méthode simple pour obtenir un rendu pro

La maîtrise du prompt vidéo IA s'impose progressivement comme une compétence professionnelle à part entière dans l'écosystème de la création numérique. Les générateurs de vidéo par intelligence artificielle, parmi lesquels Seedance figure parmi les outils mis en avant, transforment des descriptions textuelles en séquences animées, à condition que ces descriptions soient suffisamment précises. Le principe de fonctionnement repose sur une réalité mathématique : les réseaux de neurones traduisent chaque terme du prompt en coordonnées tridimensionnelles, ce qui signifie que le choix des verbes d'action détermine directement la vitesse et le réalisme de l'animation produite. Un sujet principal clairement défini, un environnement décrit avec des éléments tangibles, et des indications d'éclairage précises, lumière dorée, ombres portées douces, heure de la journée, constituent les marqueurs d'une requête bien construite. L'enjeu dépasse le simple confort d'utilisation : un prompt mal formulé pousse le modèle à combler les zones d'imprécision par des éléments générés aléatoirement, ce qui se traduit concrètement par des erreurs d'anatomie, des déformations visuelles et une incohérence globale dans la séquence. À l'inverse, une description rigoureuse réduit drastiquement ces artefacts et permet de stabiliser l'arrière-plan tout au long de l'animation. Pour les créateurs de contenu qui produisent à volume, que ce soit pour les réseaux sociaux, la publicité ou la communication d'entreprise, cette précision technique représente un gain de temps direct et une réduction des itérations coûteuses. La qualité graphique finale dépend moins de la puissance de l'outil que de la qualité de l'instruction qui lui est donnée. Cette évolution s'inscrit dans un contexte de démocratisation rapide de la vidéo générée par IA, où la barrière d'entrée technique s'abaisse mais où l'écart entre un résultat amateur et un résultat professionnel se déplace vers la capacité à formuler des instructions pertinentes. Les grandes plateformes de génération vidéo, Sora d'OpenAI, Runway, Kling, et des acteurs plus récents comme Seedance, se multiplient et se différencient essentiellement par leurs capacités de traitement sémantique. Dans ce marché en consolidation, la compétence de rédaction de prompts tend à devenir un métier à part entière, parfois désigné sous le terme de "prompt engineering" dans les équipes créatives. La prochaine étape pour l'industrie sera probablement d'intégrer des assistants de rédaction de prompts directement dans les interfaces, réduisant encore davantage la courbe d'apprentissage pour les non-initiés.

CréationTuto
1 source
L’Europe veut désormais construire la technologie qu’elle régule
2692FrenchWeb 

L’Europe veut désormais construire la technologie qu’elle régule

L'Union européenne, longtemps perçue comme un régulateur mondial du numérique, affiche désormais une ambition industrielle assumée : ne plus seulement encadrer les technologies, mais les concevoir et les déployer sur son propre sol. Après le RGPD en 2018, puis le Digital Markets Act, le Digital Services Act et l'AI Act, Bruxelles entend franchir un cap en combinant son arsenal réglementaire à une stratégie d'investissement et de souveraineté technologique. Ce virage est motivé par une double pression : la domination écrasante des géants américains, Microsoft, Google, Meta, Amazon, sur les infrastructures numériques européennes, et la montée en puissance de la Chine dans les secteurs clés de l'intelligence artificielle, des semi-conducteurs et du cloud. Pour les entreprises et institutions européennes, l'enjeu est concret : réduire une dépendance technologique jugée de plus en plus risquée, tant sur le plan économique que géopolitique, et créer les conditions d'une compétitivité à long terme. Cette ambition s'inscrit dans une trajectoire plus large amorcée par le plan RePowerEU, le Chips Act européen et les discussions autour d'un fonds souverain pour l'IA. Elle soulève cependant des questions structurelles : comment concilier une réglementation stricte, parfois accusée de freiner l'innovation, avec la nécessité de faire émerger des champions technologiques européens capables de rivaliser à l'échelle mondiale ? La réponse de Bruxelles pourrait redéfinir durablement le modèle européen de gouvernance du numérique.

RégulationReglementation
1 source
La commission européenne passe d’une politique numérique à une politique industrielle de l’IA
2693FrenchWeb 

La commission européenne passe d’une politique numérique à une politique industrielle de l’IA

La Commission européenne a publié le 3 juin une feuille de route sur la digitalisation et l'intelligence artificielle dans le secteur de l'énergie, marquant un tournant stratégique dans l'approche de Bruxelles vis-à-vis de l'IA. Ce document officialise un glissement de paradigme : l'Europe ne traite plus l'intelligence artificielle uniquement comme un enjeu réglementaire ou numérique, mais comme une question de politique industrielle à part entière, au même titre que l'acier ou l'automobile. Ce repositionnement a des implications concrètes pour l'ensemble de la filière technologique et énergétique européenne. En reconnaissant que la compétition mondiale sur l'IA se joue désormais sur les réseaux électriques, les capacités de production d'énergie, les infrastructures de données et les chaînes d'approvisionnement industrielles, la Commission ouvre la voie à des investissements publics ciblés et à une coordination entre États membres sur des ressources longtemps considérées comme relevant de politiques nationales distinctes. Ce virage intervient dans un contexte de pression croissante sur l'Europe, qui observe avec inquiétude l'accélération des États-Unis et de la Chine dans la course aux infrastructures IA. Les data centers, particulièrement énergivores, sont devenus un enjeu de souveraineté : leur déploiement massif nécessite des garanties d'approvisionnement électrique que peu de pays européens peuvent assurer seuls. La feuille de route de la Commission pourrait ainsi préfigurer une mutualisation des capacités énergétiques au service de l'ambition technologique européenne, un chantier dont les contours restent encore à préciser.

RégulationReglementation
1 source
HapTile : un jeu de données vision-tactile-langage-action pour l'apprentissage par imitation en contact riche
2694arXiv cs.RO 

HapTile : un jeu de données vision-tactile-langage-action pour l'apprentissage par imitation en contact riche

Une équipe de recherche a publié sur arXiv (2606.04825) HapTile, un jeu de données visuotactile destiné à l'apprentissage par imitation sur des tâches de manipulation à fort contact. Le dataset capture les interactions physiques à deux niveaux simultanément : des capteurs tactiles installés en bout d'effecteur sur les doigts du robot, et un retour haptique transmis en temps réel à l'opérateur humain lors de la télé-opération. Les tâches couvertes incluent le saisissement, le pliage de tissu, l'appui sur des boutons, l'empilement d'objets et d'autres activités courantes. Chaque séquence est associée à une instruction en langage naturel qui conditionne la politique de contrôle sur l'objectif de manipulation, avec des observations visuotactiles synchronisées et les trajectoires d'action correspondantes. Les chercheurs publient également un benchmarking avec deux modèles de base pour évaluer l'apport concret du signal tactile sur la qualité des politiques apprises. Ce travail s'attaque à un verrou bien identifié du domaine : la quasi-totalité des datasets VLA (Vision-Language-Action) existants sont purement visuels, ce qui limite les performances des politiques sur des tâches nécessitant un contrôle fin de la force ou du contact. Introduire le retour haptique côté opérateur lors de la collecte de données est particulièrement notable, les études antérieures ont montré que la qualité des démonstrations se dégrade sans ce retour, générant des trajectoires moins stables et moins reproductibles. HapTile tente de combler cette lacune en combinant dans un seul dataset la diversité des tâches, le conditionnement par le langage, les trajectoires d'action et la perception tactile, une combinaison jusqu'ici absente dans la littérature selon les auteurs. Reste à vérifier si l'amélioration mesurée sur les deux baselines se généralise à des architectures plus récentes comme Pi-0 ou OpenVLA. Ce preprint s'inscrit dans un courant de recherche actif autour de la perception multimoale pour la manipulation dextère, portée notamment par des labos comme le CMU Robotics Institute, MIT CSAIL et des groupes européens comme le LASA à l'EPFL. Du côté industriel, Apptronik, Figure et 1X investissent dans des mains instrumentées, mais les datasets publics à retour haptique restent rares. Le projet est reproductible sur un système robotique standard avec des capteurs tactiles de conception custom, ce qui peut faciliter l'adoption par d'autres équipes. Le dataset et les détails techniques sont accessibles sur haptile-dataset.github.io ; aucune timeline de publication formelle ni partenariat industriel n'est annoncé à ce stade.

RechercheOpinion
1 source
VISTA : adaptation des données UMI fondée sur la vision et validée par la physique pour l'entraînement de modèles VLA
2695arXiv cs.RO 

VISTA : adaptation des données UMI fondée sur la vision et validée par la physique pour l'entraînement de modèles VLA

Une équipe de chercheurs publie VISTA (Vision-grounded and Physics-Validated Adaptation), un framework visant à entraîner des modèles Vision-Language-Action (VLA) à partir de données collectées via l'Universal Manipulation Interface (UMI). L'UMI permet une collecte robotique à grande échelle sans téléopération hardware-spécifique, mais son exploitation pour les VLA bute sur deux incompatibilités identifiées par les auteurs : les caméras fisheye montées au poignet génèrent une distorsion radiale sévère, hors distribution pour les modèles de vision pré-entraînés ; et les trajectoires humaines enregistrées violent fréquemment les limites cinématiques du robot ou dépassent la bande passante du contrôleur, enseignant ainsi des actions physiquement irréalisables. VISTA répond avec trois composants : UMI-VQA, un premier dataset VQA à grande échelle conçu spécifiquement pour les vues fisheye au poignet ; un pipeline de validation physique scorant chaque trajectoire sur la continuité, le risque d'auto-collision et la fidélité d'exécution ; et une recette d'entraînement en deux étapes combinant ancrage vision-langage et prédiction d'actions. Le modèle, les données et le pipeline sont publiés en open source sous forme de preprint arXiv. L'enjeu est directement opérationnel : les VLA actuels souffrent d'un écart persistant entre démonstration et déploiement réel. VISTA apporte une réponse méthodologique en filtrant les trajectoires défectueuses avant l'entraînement, plutôt qu'en espérant que le modèle les absorbe. Les auteurs montrent que les scores de validation physique sont fortement prédictifs du succès en déploiement, ce qui plaide pour une approche data-quality-first plutôt que data-volume-first, un argument qui contredit la logique dominante du secteur. En simulation et sur des tâches réelles de manipulation, VISTA surpasse des baselines solides incluant π0.5 (Physical Intelligence), LingBot-VLA et Wall-X. Pour un intégrateur ou un décideur industriel, cela valide une voie vers des pipelines de collecte scalables via UMI, compatibles avec les VLA modernes, sans recourir à un hardware propriétaire coûteux. L'UMI avait été conçu initialement pour découpler la collecte de données du hardware robotique spécifique, mais son intégration aux VLA restait largement non documentée à grande échelle. Physical Intelligence a popularisé l'approche VLA avec π0 et π0.5 ; Figure AI, 1X et Apptronik misent sur des architectures concurrentes. VISTA s'attaque à un goulot d'étranglement rarement traité en publication : la qualité intrinsèque des données d'entraînement avant qu'elles n'entrent dans le pipeline. En libérant pipeline de validation, dataset UMI-VQA et modèle pré-entraîné, les auteurs positionnent VISTA comme un outil d'infrastructure pour la communauté robotique cherchant à industrialiser la collecte et le filtrage de données manipulation, en amont des choix d'architecture VLA.

RechercheOpinion
1 source
M3imic : apprentissage d'un contrôleur corps entier polyvalent pour l'imitation multimodale de mouvements
2696arXiv cs.RO 

M3imic : apprentissage d'un contrôleur corps entier polyvalent pour l'imitation multimodale de mouvements

Des chercheurs de Renforce Dynamics ont publié le 5 juin 2026 sur arXiv un article présentant M3imic (Multi-Modal Mimic), un contrôleur corps entier destiné aux robots humanoïdes. L'objectif : unifier dans une seule politique d'apprentissage par renforcement trois types de références de mouvement jusqu'ici traités séparément, les trajectoires articulaires du robot (angles de joints), les trajectoires de pose humaine capturées par motion capture, et les poses d'effecteurs terminaux (end-effector poses). Le système exploite des encodeurs spécialisés par modalité pour projeter ces données hétérogènes dans un espace latent commun, puis entraîne une politique unique à grande échelle en simulation. Les expériences sont conduites sur le robot humanoïde Unitree G1 : en simulation, la politique atteint un taux de succès maximal de 98,42 % sur un jeu de test non vu, et un transfert sim-to-réel est démontré sans réentraînement spécifique à chaque modalité. Le code source est disponible publiquement sur GitHub. Le problème que M3imic cherche à résoudre est structurel : les contrôleurs corps entier existants traitent la locomotion et la manipulation comme deux domaines distincts, avec des formats de données incompatibles, des vecteurs denses d'angles articulaires d'un côté, des poses 6-DOF d'effecteurs creuses de l'autre. Forcer une seule politique à ingérer ces deux représentations sans architecture dédiée dégrade les performances. M3imic propose une solution architecturale rather than une solution de données : un espace latent partagé avec encodeurs par modalité, ce qui permet à une même politique de piloter aussi bien la marche que la manipulation sans compromis de performance. Pour les intégrateurs et équipes robotiques, cela réduit potentiellement le coût de développement en éliminant le besoin de pipelines parallèles par type de tâche. Le robot cible, le Unitree G1, est un humanoïde commercialisé depuis 2024 à environ 16 000 dollars, devenu une plateforme de référence pour la recherche en locomotion et loco-manipulation grâce à son accessibilité. Renforce Dynamics est un laboratoire ou startup dont M3imic constitue l'une des premières publications publiques. Dans le paysage concurrent, les approches comparables incluent les travaux de Berkeley Humanoid (Pi-0 de Physical Intelligence), les contrôleurs corps entier de CMU et ETH Zurich, et les politiques VLA de Figure AI, tous confrontés au même défi du sim-to-real gap sur tâches mixtes locomotion-manipulation. M3imic se positionne explicitement sur l'unification multimodale plutôt que sur la performance brute d'une seule tâche. Les prochaines étapes naturelles seraient des déploiements en environnement non structuré et une évaluation sur des humanoïdes à plus haute cinématique (plus de DOF, payload supérieur).

RobotiqueOpinion
1 source
3DThinkVLA : doter les modèles VLA de représentations 3D latentes par co-entraînement guidé par raisonnement 3D
2697arXiv cs.RO 

3DThinkVLA : doter les modèles VLA de représentations 3D latentes par co-entraînement guidé par raisonnement 3D

Des chercheurs ont publié le 4 juin 2026 sur arXiv (2506.04436) un framework dénommé 3DThinkVLA, conçu pour doter les modèles vision-language-action (VLA) d'un raisonnement spatial 3D implicite lors de la prédiction d'actions robotiques, sans recours à des capteurs de profondeur ni à la génération de texte à l'inférence. Le système articule trois composants opérant dans l'espace latent : un module de perception géométrique 3D qui aligne les features visuelles intermédiaires avec un modèle fondationnel 3D, un module de distillation de raisonnement en ligne utilisant un "reasoning anchor token" partagé, et un mécanisme d'intégration d'actions spatialement augmenté. À l'entraînement, le modèle apprend à raisonner spatialement depuis des prompts enseignants explicites ; au déploiement, seuls des adaptateurs légers sont conservés, le modèle fondationnel 3D et la branche enseignante étant élagués. Les auteurs déclarent des performances état-de-l'art sur les benchmarks LIBERO, LIBERO-PLUS et SimplerEnv, ainsi que sur des tâches de manipulation réelles. L'apport principal est de découpler la perception géométrique 3D du raisonnement spatial de haut niveau pour les injecter à différents niveaux hiérarchiques, sans modifier l'architecture du backbone VLM. Ce découplage répond à un problème central des VLA actuels : leur tendance aux raccourcis d'action (action shortcuts) face aux relations spatiales complexes, ce qui dégrade les performances hors simulation. Le mécanisme d'anchor token transfère le raisonnement spatial implicitement, sans chain-of-thought au déploiement, réduisant la latence d'inférence. Pour les intégrateurs robotiques, cela ouvre la voie à des VLA plus robustes en manipulation de précision sans surcoût matériel. La méthode prévient également le catastrophic forgetting du VLM pré-entraîné, point critique lors du fine-tuning sur données robotiques spécialisées. Les VLA ont connu une accélération depuis Pi-0 de Physical Intelligence fin 2024 et GR00T N2 de NVIDIA en 2025, mais la gestion du raisonnement 3D à partir d'images 2D reste un obstacle au déploiement industriel fiable, notamment pour l'assemblage et la manipulation fine. 3DThinkVLA s'inscrit dans une lignée de travaux concurrents, dont SpatialVLA et RoboVLMs, cherchant à injecter des priors géométriques sans alourdir l'inférence. Il convient de noter qu'il s'agit d'un preprint arXiv non encore évalué par les pairs, et que les benchmarks LIBERO et SimplerEnv sont des environnements de simulation standardisés dont les résultats ne garantissent pas les performances en conditions industrielles réelles. Aucun déploiement terrain ni partenariat commercial n'est annoncé à ce stade.

RobotiqueActu
1 source
PerceptTwin : reconstruction sémantique de scène pour la planification et vérification itératives par LLM
2698arXiv cs.RO 

PerceptTwin : reconstruction sémantique de scène pour la planification et vérification itératives par LLM

Des chercheurs ont publié le 4 juin 2026 sur arXiv (2606.04226) les travaux sur PerceptTwin, un pipeline automatisé qui génère des environnements de simulation interactifs directement depuis les représentations sémantiques produites par la pile de perception d'un robot. Le système combine quatre composants : des cartes d'objets à vocabulaire ouvert (open-vocabulary object maps), la génération d'assets 3D, la prédiction d'affordances et une vérification des préconditions par bon sens. Un juge LLM, concept emprunté à la littérature sur l'alignement de l'IA, évalue ensuite la conformité des plans générés avec les préférences humaines avant toute exécution physique. Dans les expériences conduites avec GPT-5, GPT-5 Mini et GPT-5 Nano comme planificateurs, PerceptTwin améliore le taux de succès des plans d'environ 39 % en moyenne, et améliore la vérification humaine jusqu'à 18 % pour les plans échouant à cause de préconditions non satisfaites. La chaîne LLM-planification-exécution est aujourd'hui l'architecture dominante en robotique cognitive, mais son point faible reste la vérification : un modèle de langage peut produire des plans syntaxiquement valides mais physiquement impossibles ou dangereux. PerceptTwin introduit une boucle de rétroaction pré-exécution où le robot construit son propre jumeau numérique à la volée, y simule le plan, puis itère. Cette approche inverse la logique du sim-to-real classique : la simulation émerge ici du monde réel via la perception, non l'inverse. Le système démontre aussi une résistance documentée aux attaques par "black-box prompting" visant à injecter des instructions nuisibles dans le planificateur, une propriété de sécurité rarement quantifiée dans des travaux similaires. Pour un intégrateur industriel, cela représente une couche de validation automatisée applicable à des environnements non structurés sans reconfiguration manuelle de la simulation. La construction de simulations contextualisées était jusqu'ici un processus manuel et coûteux, rendant la validation à grande échelle impraticable. PerceptTwin s'inscrit dans un courant de recherche incluant les approches NeRF sémantiques et les jumeaux numériques procéduraux, avec la particularité d'être entièrement piloté par la stack perceptive du robot. En termes de positionnement, les travaux récents sur les Visual Language Action models comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA abordent la fiabilité par l'apprentissage massivement supervisé, là où PerceptTwin mise sur la vérification symbolique en boucle fermée. Les expériences restent confinées à une suite de tâches de manipulation en laboratoire, sans déploiement terrain annoncé. Les auteurs ne précisent pas le temps de génération du jumeau numérique ni les exigences matérielles, deux paramètres déterminants pour envisager une intégration hors conditions contrôlées.

RechercheOpinion
1 source
CLAW : apprentissage de modèles du monde à actions latentes continues par régularisation latente adversariale
2699arXiv cs.RO 

CLAW : apprentissage de modèles du monde à actions latentes continues par régularisation latente adversariale

Des chercheurs ont publié sur arXiv (2606.04130) un cadre d'apprentissage auto-supervisé baptisé CLAW (Continuous Latent Action World Models via Adversarial Latent Regularization), conçu pour apprendre simultanément un modèle du monde et des représentations d'actions latentes continues à partir de vidéos non annotées. La méthode ne nécessite aucun label d'action : elle s'appuie sur une régularisation adversariale des représentations latentes et sur la génération vidéo par diffusion pour inférer une structure sémantique des actions directement depuis les transitions visuelles observées. Le modèle d'action latente (LAM) et le modèle du monde sont entraînés conjointement en bout en bout, permettant au système de raisonner sur la façon dont les actions inférées induisent des transitions dans l'environnement. CLAW supporte deux modes d'utilisation : le clonage comportemental par imitation depuis l'observation, où les actions latentes extraites de vidéos brutes suffisent à reproduire un comportement, et la planification dirigée par objectif, où le système génère des séquences d'actions latentes puis les mappe vers des actions exécutables. L'enjeu central ici est l'accès aux données. La robotique souffre d'un déficit chronique de données d'entraînement annotées avec des paires (observation, action), car les capteurs proprioceptifs et la capture de mouvement sont coûteux. CLAW ouvre la voie à l'exploitation de vidéos tierces non instrumentées, comme des démonstrations humaines filmées ou des contenus web, pour entraîner des politiques et des planificateurs. Si les résultats se confirment hors laboratoire, cela réduit drastiquement le coût de collecte de données pour les intégrateurs robotiques et les équipes d'ingénierie travaillant sur le transfer sim-to-real. Les auteurs rapportent des performances supérieures aux méthodes existantes sur des tâches variées et plusieurs morphologies robotiques, bien que les benchmarks spécifiques et les métriques quantitatives détaillées ne soient pas accessibles dans l'abstract seul. CLAW s'inscrit dans un courant de recherche actif sur les modèles d'actions latentes (LAM), dont les travaux fondateurs incluent LAPO et des approches basées sur des modèles de dynamique inversale (IDM). Il se distingue en combinant génération par diffusion et régularisation adversariale là où ses prédécesseurs utilisaient souvent des encodeurs déterministes ou des VQ-VAE. Les concurrents directs dans l'espace des world models pour la robotique comprennent UniSim (Google DeepMind), GAIA-1 (Wayve) côté génération vidéo, et des approches VLA comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) côté politique. CLAW se positionne en amont de ces pipelines, comme brique d'apprentissage de représentation plutôt que comme politique complète. Les prochaines étapes naturelles seront une validation sur des environnements physiques réels et l'intégration dans des boucles de fine-tuning pour des robots humanoïdes ou manipulateurs.

RechercheOpinion
1 source
CoRe-MoE : un mélange d'experts contrastif pour la locomotion multi-terrain des robots humanoïdes avec adaptation de la démarche
2700arXiv cs.RO 

CoRe-MoE : un mélange d'experts contrastif pour la locomotion multi-terrain des robots humanoïdes avec adaptation de la démarche

Une équipe de recherche publie sur arXiv (2606.04718) CoRe-MoE, un framework d'apprentissage par renforcement en deux étapes conçu pour permettre à un robot humanoïde de marcher et de courir sur des terrains variés sans politique distincte par surface. L'architecture repose sur un Mixture-of-Experts (MoE) augmenté d'un objectif contrastif : une première phase entraîne une politique de locomotion de base produisant marche et course avec transitions fluides, puis une seconde phase greffe une branche MoE sensible au terrain, dont le réseau de gating est formé à distinguer structurellement les représentations de sol. L'action finale est une fusion pondérée entre la politique de base et la branche adaptative. Validé en simulation puis déployé en zero-shot sur le Unitree G1, le système traverse escaliers, rampes, marches, obstacles et terrains extérieurs non structurés tout en maintenant un placement de pied précis face à des perturbations externes. L'intérêt de ce travail pour les intégrateurs et décideurs robotiques tient moins à la performance brute qu'à la méthode de découplage. Le problème classique dans l'entraînement multi-tâches est l'interférence de gradients : une politique unifiée marche/course/terrain provoque des conflits d'apprentissage qui dégradent chaque sous-compétence. CoRe-MoE contourne cela en séparant explicitement génération de démarche et adaptation terrain. L'objectif contrastif force une spécialisation claire des experts MoE, défaillance récurrente des implémentations MoE naïves. Le zero-shot sim-to-real sur G1 suggère une réduction du reality gap, point de friction central dans le passage de la simulation au déploiement industriel, bien que le papier ne fournisse pas de métriques de cycle ou de données de déploiement à l'échelle. Le Unitree G1 est un humanoïde 23 degrés de liberté à environ 16 000 dollars, devenu référence de facto pour la recherche en locomotion académique, face au Boston Dynamics Atlas et à l'Agility Robotics Digit plus orientés industrie. CoRe-MoE s'inscrit dans un courant actif de politiques visuomotrices pour humanoïdes, aux côtés de travaux comme GR00T N2 de NVIDIA ou Pi-0 de Physical Intelligence, qui cherchent tous à unifier mobilité et manipulation sous une seule politique généraliste. La prochaine étape naturelle de ce type d'architecture est l'extension aux tâches de manipulation en locomotion, et le test sur des humanoïdes plus lourds à charge utile élevée, où la stabilité dynamique devient critique.

RobotiqueOpinion
1 source