Aller au contenu principal

Actualités IA — page 106

7 607 articles au fil, du plus récent au plus ancien.

Inde : des femmes se filment en faisant le ménage pour entraîner les robots qui les remplaceront
2101La Tribune 

Inde : des femmes se filment en faisant le ménage pour entraîner les robots qui les remplaceront

En Inde, des femmes comme Nagireddy passent une heure par jour un smartphone sanglé sur la tête à se filmer en train de plier du linge, préparer du café, cuire des plats ou assembler des sandwichs. Ces micro-travailleuses sont rémunérées 250 roupies la session, soit à peine plus de deux euros, pour produire des données gestuelles destinées à entraîner les prochaines générations de robots humanoïdes. Ce marché de la collecte de données pour l'IA physique, encore largement invisible, s'inscrit dans un secteur estimé à 38 milliards de dollars d'ici 2035. L'enjeu dépasse la simple anecdote : ces femmes fabriquent littéralement l'intelligence des machines qui pourraient un jour automatiser les tâches domestiques à l'échelle mondiale. Chaque geste capturé devient un exemple d'apprentissage pour des systèmes d'IA embarqués dans des robots capables de naviguer dans des environnements humains non structurés. La précision de ces données, ancrées dans des cuisines réelles et non dans des laboratoires, est ce qui rend ce travail difficilement délocalisable vers la simulation. Ce phénomène révèle une nouvelle couche de la division internationale du travail numérique : pendant que la Silicon Valley conçoit les algorithmes et les robots, l'Inde exporte les corps comme données d'entraînement. Des entreprises spécialisées dans le data labeling physique misent sur ce vivier de main-d'œuvre peu coûteuse et disponible. La tension est saisissante : les mêmes gestes qui nourrissent ces modèles accélèrent l'avènement des robots domestiques susceptibles de rendre ce travail obsolète.

SociétéActu
1 source
Google Cloud automatise les opérations de planification urbaine avec l'IA générative
2102AI News 

Google Cloud automatise les opérations de planification urbaine avec l'IA générative

Le gouvernement britannique a déployé deux outils d'intelligence artificielle développés avec Google Cloud pour automatiser le traitement des demandes de permis de construire dans l'ensemble des collectivités locales d'Angleterre. Le ministère du Logement, des Communautés et des Gouvernements Locaux (MHCLG) et le département pour la Science, l'Innovation et la Technologie (DSIT) ont annoncé ces déploiements lors du Google Cloud Summit London. L'outil "Extract", construit en interne par des ingénieurs gouvernementaux à l'aide des modèles Gemini de Google DeepMind, a été étendu à toutes les collectivités anglaises après des essais dans plus de 20 autorités locales. Un second système baptisé "Augmented Planning Decisions" (APD) est quant à lui encore en phase de prototype. Extract analyse des milliers de pages de documents PDF historiques non structurés et les convertit en bases de données numériques exploitables en quelques minutes, éliminant environ 255 heures de saisie manuelle par collectivité et par an. L'enjeu est considérable : les demandes de particuliers, comme les extensions ou les conversions de combles, représentent près de 70 % des dossiers de permis déposés chaque année au Royaume-Uni. Chacune nécessite que les agents d'urbanisme passent des heures à croiser des documents réglementaires régionaux, des archives historiques et des fichiers PDF épars. Cette surcharge administrative retarde directement les grands projets d'infrastructure et de développement commercial. L'objectif affiché du gouvernement est de réduire de 50 % les délais de décision sur ces dossiers courants, libérant ainsi du temps pour les projets les plus complexes. Le système APD va plus loin : il pré-traite les dossiers entrants, identifie les lacunes d'information, extrait les données géographiques, évalue la conformité aux règles d'urbanisme nationales et locales, et synthétise les observations du public en signalant les objections ou précédents juridiques pertinents. Ces déploiements s'inscrivent dans la stratégie britannique visant à construire 1,5 million de logements neufs d'ici 2029, un objectif que les engorgements administratifs des collectivités locales compromettaient sérieusement. Pour garantir la sécurité des données civiques sensibles traitées par ces outils, le gouvernement a hébergé les modèles Gemini sur l'infrastructure Google Cloud dans un environnement cloisonné, avec des contrôles actifs contre les attaques par injection de prompts et des protocoles stricts de souveraineté des données. Lila Ibrahim, directrice de la préparation à l'IA chez Google DeepMind, a souligné que ces outils ont été "co-créés directement avec les collectivités pour résoudre de vrais goulets d'étranglement". Cette initiative pourrait servir de modèle à d'autres pays cherchant à moderniser leurs administrations publiques via l'IA générative, dans un contexte où la pression sur le logement et la bureaucratie ralentissent les décisions dans de nombreuses démocraties européennes.

OutilsOutil
1 source
☕️ Intelligence artificielle et taxation numérique au cœur du G7
2103Next INpact 

☕️ Intelligence artificielle et taxation numérique au cœur du G7

Emmanuel Macron a réuni ses homologues du G7 à Évian ce 17 juin pour une session de travail consacrée à l'intelligence artificielle et à la régulation du numérique. À ses côtés, les dirigeants des États-Unis, de l'Allemagne, du Canada, de l'Italie, du Japon et du Royaume-Uni ont débattu de la sécurisation des systèmes d'IA, de la protection des mineurs en ligne et de la taxation des grandes plateformes technologiques. Plusieurs patrons de l'industrie étaient également présents, dont Sam Altman d'OpenAI, Dario Amodei d'Anthropic et Arthur Mensch de Mistral AI. Sur la question des mineurs face aux réseaux sociaux, les sept pays sont globalement alignés autour d'un âge minimum compris entre 15 et 16 ans. La taxation et la souveraineté numérique se sont en revanche révélées bien plus conflictuelles : le 15 juin, Donald Trump menaçait d'imposer des droits de douane à 100 % sur le vin français si la France supprimait sa taxe numérique de 3 % sur les revenus des géants de la tech réalisés sur le territoire français. Macron a rétorqué que ce n'était « pas les États-Unis qui décident ». Les tensions autour de la fiscalité numérique révèlent un rapport de force structurel entre les démocraties occidentales et Washington. La taxe française, instaurée en 2019, cible directement les plateformes américaines comme Google, Amazon ou Meta, et a resurgi au cœur des débats budgétaires nationaux. À l'international, le Canada a déjà dû renoncer à un projet similaire en 2025 sous pression américaine. L'enjeu est double : il s'agit à la fois de faire contribuer ces entreprises aux finances publiques des pays où elles opèrent, et de ne pas sacrifier cette ambition sous la menace de représailles commerciales. Pour la France et l'Europe, abandonner cette taxe reviendrait à reconnaître l'immunité fiscale de facto des géants technologiques américains. La question de la souveraineté sur les modèles d'IA a également pesé lourd dans les discussions, d'autant que les États-Unis ont récemment bloqué l'accès à Claude 5 et Mythos 5, les derniers modèles d'Anthropic. Cet épisode a cristallisé une prise de conscience déjà ancienne : la France et le reste de l'Europe dépendent massivement de fournisseurs technologiques non européens, tant pour les modèles d'IA que pour la puissance de calcul nécessaire à leur entraînement et à leur déploiement. Mistral AI, représenté par Arthur Mensch, incarne l'ambition européenne d'une alternative crédible, mais le chemin reste long face aux investissements colossaux déployés outre-Atlantique. Donald Trump devait encore être reçu par Macron dans la soirée au château de Versailles, ouvrant la porte à des négociations bilatérales en marge du sommet.

RégulationReglementation
1 source
HSBC et Google Cloud scellent un partenariat pour l’IA bancaire
2104Le Big Data 

HSBC et Google Cloud scellent un partenariat pour l’IA bancaire

HSBC et Google Cloud ont annoncé le 17 juin 2026, lors du Google Cloud Summit de Londres, un partenariat pluriannuel destiné à accélérer le déploiement de l'intelligence artificielle dans l'ensemble des activités du groupe bancaire britannique. L'accord prévoit le déploiement de plus de 200 nouveaux cas d'usage de l'IA en deux ans, en s'appuyant sur les modèles Gemini et la plateforme Gemini Enterprise Agent de Google DeepMind. HSBC héberge déjà plus de 600 applications sur Google Cloud et identifie parmi ses projets prioritaires plusieurs initiatives susceptibles de générer chacune plus de 100 millions de dollars de revenus supplémentaires ou de gains d'efficacité. La collaboration impliquera les équipes d'ingénierie de Google Cloud et de Google DeepMind pour co-développer des outils sur mesure adaptés aux contraintes du secteur financier. Ce partenariat marque un tournant dans la maturité de l'IA bancaire : les investissements ne sont plus justifiés par l'innovation en tant que telle, mais par leur impact mesurable sur la performance opérationnelle et financière. Les trois axes stratégiques annoncés illustrent cette logique. D'abord, la gestion de patrimoine hyper-personnalisée, qui permettra à des milliers de conseillers financiers de proposer des recommandations contextualisées en temps réel, répondant aux attentes de clients habitués aux standards des grandes plateformes numériques. Ensuite, la lutte contre la criminalité financière : HSBC traite près d'un milliard de transactions par mois et estime pouvoir intervenir deux fois plus rapidement après détection d'un risque grâce aux systèmes agentiques, réduisant ainsi les pertes potentielles tout en renforçant la conformité réglementaire. Enfin, des assistants décisionnels internes visent à améliorer l'efficacité opérationnelle des équipes à l'échelle mondiale. Ce rapprochement s'inscrit dans une tendance lourde qui voit les grandes banques mondiales nouer des alliances stratégiques avec les hyperscalers pour ne pas être distancées par des concurrents plus agiles. Google Cloud, qui multiplie les partenariats dans la finance, positionne Gemini comme la colonne vertébrale des systèmes bancaires de prochaine génération. Pour HSBC, déjà engagé dans une transformation numérique de grande ampleur depuis plusieurs années, ce partenariat représente une montée en puissance significative après une phase d'expérimentation. La banque affirme vouloir conserver l'expertise humaine au cœur de la décision, un positionnement qui répond autant aux exigences réglementaires des marchés où elle opère qu'aux attentes de ses clients institutionnels et privés. Les prochains mois permettront de vérifier si ces ambitions se traduisent en déploiements concrets à l'échelle annoncée.

BusinessOpinion
1 source
Grok Imagine Video 1.5 : cette IA génère maintenant des vidéos avec le son
2105Le Big Data 

Grok Imagine Video 1.5 : cette IA génère maintenant des vidéos avec le son

xAI, la société d'intelligence artificielle fondée par Elon Musk, a annoncé le 17 juin 2026 la disponibilité générale de Grok Imagine Video 1.5, son modèle de génération de vidéo par image. Disponible sur le web via grok.com/imagine, sur les applications mobiles iOS et Android, et via l'API sous le nom grok-imagine-video-1.5, le modèle sort officiellement de sa phase de prévisualisation lancée début juin. La nouveauté la plus marquante de cette version finale est l'intégration du son natif : effets sonores, ambiances sonores et dialogues sont désormais générés simultanément à la vidéo, sans étape supplémentaire. Pour les utilisateurs grand public, xAI déploie en parallèle une version Video 1.5 Fast qui ramène le temps de génération d'une vidéo six secondes en 720p à environ 25 secondes, contre plus de 40 secondes avec le modèle précédent, soit un gain de performance de près de 40%. La synchronisation audio-vidéo native représente un changement concret pour les créateurs de contenu, qui devaient auparavant assembler son et image dans des outils tiers. La génération simultanée améliore la cohérence entre l'action et le son, et xAI indique que les voix gagnent en naturalité. Sur le plan visuel, le modèle corrige plusieurs faiblesses récurrentes des générateurs vidéo : meilleure cohérence des personnages et objets entre les images, réduction des déformations visuelles, et simulation plus réaliste de la physique, notamment le poids et l'élan. Le flux de travail créatif est également repensé avec l'ajout de projets organisables depuis une barre latérale, la possibilité de lancer plusieurs générations en parallèle via des agents simultanés, et un moteur de recherche intégré à la bibliothèque personnelle de l'utilisateur. xAI s'inscrit dans une course à la génération vidéo IA qui oppose désormais des acteurs comme Runway, Sora d'OpenAI, Veo de Google et Kling de Kuaishou. En intégrant le son directement dans le pipeline de génération, la société cherche à se différencier sur un marché où la qualité de production cinématographique devient un argument central. Pour illustrer le potentiel du modèle, xAI met en avant le projet "Odyssey" du créateur David Thompson, qui a réalisé une bande-annonce à l'esthétique cinématographique entièrement avec Grok Imagine 1.5. La disponibilité via API ouvre également la voie à des intégrations dans des outils professionnels de production. La prochaine étape pour xAI sera probablement d'étendre les durées de vidéo et la résolution maximale, deux limites encore non précisées officiellement, pour rivaliser avec les offres premium de ses concurrents.

CréationActu
1 source
La promesse d’une « IA pour tous » au service du bien commun a du plomb dans l’aile
2106Next INpact 

La promesse d’une « IA pour tous » au service du bien commun a du plomb dans l’aile

La suspension soudaine, par Anthropic, de ses deux modèles les plus avancés, Mythos 5 et sa version grand public Fable 5, a provoqué une onde de choc bien au-delà du cercle des utilisateurs directement affectés. En quelques jours, le Conseil de l'IA et du Numérique a publié une note qualifiant l'événement de « point de bascule » et affirmant que « la menace sur l'autonomie numérique européenne n'est plus une hypothèse, elle est devenue une réalité tangible ». Le Conseil, co-présidé par Anne Bouverot (ex-Orange, présidente du conseil d'administration de l'ENS) et Guillaume Poupard (ex-directeur général de l'ANSSI, aujourd'hui CTO d'Orange), souligne que la coupure a touché l'ensemble des clients, partout dans le monde, sans distinction, comme l'avait déjà fait Adobe en octobre 2019, lorsque la société avait suspendu ses services au Venezuela sur ordre de l'administration Trump, empêchant même l'ouverture de documents PDF. Ce que cet épisode révèle, c'est la matérialisation d'un risque longtemps théorisé : le kill switch. La question se posait déjà autour de S3ns et Bleu, les deux offres de cloud souverain français adossées aux infrastructures de Google et Microsoft. S3ns, certifié SecNumCloud par l'ANSSI, estime pouvoir fonctionner quelques mois sans mises à jour depuis les États-Unis ; Bleu revendique une capacité d'autarcie d'environ un an, avec la possibilité de proposer des liaisons directes à ses clients pour fonctionner totalement isolé d'Internet. Mais la coupure d'Anthropic va plus loin : ce ne sont plus de simples outils logiciels qui disparaissent, ce sont des modèles de langage devenus centraux dans des workflows professionnels entiers. Le cas Nicolas Guillou, juge français à la Cour pénale internationale privé d'accès aux services numériques américains, illustre jusqu'où peut aller cette dépendance. Pour le Conseil de l'IA, cet événement s'inscrit dans une stratégie d'endiguement technologique américaine plus large, « jusqu'ici principalement incarnée par les restrictions à l'exportation des puces NVIDIA les plus performantes » vers la Chine. Washington entend éviter un nouveau « moment DeepSeek », soit l'émergence d'une alternative non américaine capable de rivaliser. Les LLM ne sont plus perçus comme de simples services en ligne mais comme des actifs stratégiques, au même titre que les semi-conducteurs ou les réseaux télécoms. L'Europe, encore largement dépourvue de modèles fondateurs de premier rang à l'échelle mondiale, se retrouve dans une position de dépendance structurelle que cette coupure a rendue impossible à ignorer, et que ni S3ns, ni Bleu, ni aucune certification nationale ne peuvent, seuls, résoudre.

RégulationReglementation
1 source
GitHub Copilot lance une application desktop pour les flux de travail multi-agents en parallèle
2107InfoQ AI 

GitHub Copilot lance une application desktop pour les flux de travail multi-agents en parallèle

GitHub a lancé une application desktop dédiée à GitHub Copilot, conçue pour orchestrer plusieurs agents IA en parallèle depuis un seul point de contrôle. Baptisée GitHub Copilot app, elle s'adresse aux développeurs qui travaillent déjà avec des agents de codage automatisés et souhaitent superviser leur travail sans jongler entre plusieurs interfaces. Mario Rodriguez, responsable produit chez GitHub, a présenté l'outil sur le blog officiel de l'entreprise, en soulignant que la promesse de rapidité des agents récents s'accompagne trop souvent de "workflows désarticulés, de changements de contexte incessants et d'un temps excessif passé à relire le code généré". L'application cible directement ce problème d'orchestration : plutôt que de lancer un agent à la fois et d'attendre son résultat, les développeurs peuvent désormais piloter plusieurs tâches en parallèle depuis une interface unifiée. Cela réduit le temps mort entre les itérations et permet de conserver une vue d'ensemble sur ce que chaque agent produit, sans perdre le fil du projet. L'enjeu est de rendre le développement assisté par IA réellement fluide en production, et pas seulement dans des démonstrations. Ce lancement intervient dans un contexte de course effrénée entre les grandes plateformes de développement. Cursor, Windsurf, Devin ou encore Claude Code ont chacun proposé leur vision de l'agent de code autonome ces derniers mois. En répondant avec une application desktop centrée sur le contrôle humain et les workflows parallèles, GitHub cherche à repositionner Copilot non plus comme un simple assistant d'autocomplétion, mais comme un véritable système de coordination d'agents, ancré dans l'écosystème Microsoft et les habitudes des 150 millions d'utilisateurs de la plateforme.

OutilsOutil
1 source
MiniMax Sparse Attention (MSA) : attention block-sparse à deux branches pour un MoE de 109 milliards de paramètres
2108MarkTechPost 

MiniMax Sparse Attention (MSA) : attention block-sparse à deux branches pour un MoE de 109 milliards de paramètres

MiniMax a publié MSA (MiniMax Sparse Attention), une nouvelle méthode d'attention parcimonieuse construite sur la base de l'architecture Grouped Query Attention (GQA). L'équipe de recherche l'a intégrée et testée dans un modèle Mixture-of-Experts de 109 milliards de paramètres, entraîné sur un budget de 3 000 milliards de tokens avec des données multimodales natives. Le résultat concret est MiniMax-M3, un modèle de production désormais disponible, accompagné d'un noyau d'inférence publié en open source. Le principe de MSA repose sur deux étapes : une branche Index qui sélectionne les blocs de tokens clé-valeur pertinents pour chaque requête, et une branche Principale qui applique l'attention softmax exacte uniquement sur ces blocs sélectionnés. Chaque requête consulte 16 blocs de 128 tokens, soit un budget fixe de 2 048 tokens clé-valeur, quelle que soit la longueur du contexte. Un noyau optimisé rend cette sélection 5,1 fois plus rapide que torch.topk à 128 000 tokens de contexte, et 3,7 fois plus rapide que le noyau radix-select de TileLang. L'enjeu technique est direct : l'attention standard en softmax a un coût quadratique par rapport à la longueur du contexte, ce qui signifie que doubler la fenêtre de contexte quadruple le coût de calcul. MSA court-circuite ce problème en fixant le coût par requête à O(kBk), indépendamment de la taille du contexte, là où l'attention GQA dense maintient un coût en O(N). Pour les modèles qui traitent des documents longs, du code étendu ou des corpus multimodaux, cela représente un gain concret en vitesse et en coût d'inférence. La méthode préserve par construction le contexte local immédiat de chaque requête, un bloc local étant toujours inclus dans la sélection, tout en permettant aux différents groupes d'attention de couvrir des régions éloignées du contexte de manière indépendante. La course aux longues fenêtres de contexte est l'un des fronts les plus actifs du développement des grands modèles de langage en 2025 et 2026. Plusieurs laboratoires, dont Anthropic, Google DeepMind et Meta, ont publié des travaux sur des architectures d'attention efficaces pour dépasser les 100 000 tokens. MiniMax, entreprise chinoise fondée en 2021 et valorisée à plusieurs milliards de dollars, s'impose ici avec une approche originale : plutôt que de remplacer l'attention, MSA la raffine de l'intérieur en greffant la sélection parcimonieuse sur GQA sans modifier l'architecture principale. Deux modes d'entraînement sont proposés, soit un départ depuis zéro (MSA-PT, après 40 milliards de tokens de préchauffage), soit une conversion d'un checkpoint dense entraîné sur 2 600 milliards de tokens (MSA-CPT, suivi de 400 milliards de tokens supplémentaires), ce qui facilite l'adoption par des équipes disposant déjà de modèles en production.

RecherchePaper
1 source
RLWRLD désignée Pionnière Technologique du Forum Économique Mondial pour ses avancées en infrastructure d'IA physique
2109Robotics & Automation News 

RLWRLD désignée Pionnière Technologique du Forum Économique Mondial pour ses avancées en infrastructure d'IA physique

RLWRLD, société spécialisée en "physical AI", a été sélectionnée parmi les 100 Technology Pioneers 2026 du Forum Économique Mondial (WEF). La distinction, attribuée annuellement depuis 2000 à des entreprises technologiques jugées susceptibles d'exercer un impact structurant sur les industries mondiales, récompense ici le développement de RLDX-1, un modèle de fondation en robotique (Robotics Foundation Model) propriétaire. Le WEF cite RLWRLD dans son analyse officielle comme acteur positionné pour transformer l'infrastructure de l'IA physique à long terme. L'article source est toutefois un communiqué court, sans données techniques publiées sur RLDX-1 : payload, degrés de liberté contrôlés, benchmarks de performance ou sites de déploiement ne sont pas mentionnés. Il faut distinguer ici label de visibilité et validation technique : le programme WEF Pioneer est un exercice de sélection éditoriale, pas une certification de performance. Cela dit, pour une startup dans l'espace des foundation models robotiques, l'intégration au réseau WEF représente un accès réel aux décideurs industriels et aux fonds d'investissement à l'échelle mondiale. Le marché des modèles de fondation pour robots physiques est précisément le terrain où se joue la prochaine phase de la course aux humanoïdes et aux bras industriels autonomes. Le secteur des Robotics Foundation Models est en forte compétition en 2026, avec Physical Intelligence (Pi-0), NVIDIA (GR00T N2), et les propres modèles intégrés de Figure AI et 1X. RLWRLD se positionne comme couche d'infrastructure mutualisée, à destination potentiellement de plusieurs constructeurs, plutôt que comme fabricant de hardware. Les prochaines étapes à surveiller : publication de benchmarks sur RLDX-1, annonces de partenariats OEM, et levées de fonds post-label WEF.

RobotiqueActu
1 source
OpenAI étend l'évaluation des risques pré-déploiement au codage à base d'agents via des appels d'outils simulés
2110MarkTechPost 

OpenAI étend l'évaluation des risques pré-déploiement au codage à base d'agents via des appels d'outils simulés

OpenAI a publié une nouvelle méthode de sécurité pré-déploiement baptisée Deployment Simulation, décrite dans un document technique mis en ligne sur son site. Le principe est simple : avant qu'un modèle soit mis en production, on simule son déploiement à l'avance. Concrètement, OpenAI rejoue des conversations réelles passées en remplaçant les réponses de l'ancien modèle par celles du nouveau candidat, puis analyse les résultats pour détecter d'éventuels comportements indésirables. La méthode est conçue pour préserver la vie privée des utilisateurs et produit une estimation du taux de comportements problématiques par message, vérifiable après la mise en ligne sur le trafic réel. La technique présente toutefois une limite inhérente : elle ne peut pas détecter des comportements qui se produisent moins d'une fois tous les 200 000 messages, ce qui la cantonne aux risques non marginaux. L'intérêt principal de cette approche réside dans ce qu'elle corrige par rapport aux évaluations traditionnelles. Celles-ci reposent sur des jeux de données synthétiques ou construits manuellement, sélectionnés pour être difficiles ou adversariaux, ce qui introduit trois biais connus : une sélection partiale des prompts, une couverture limitée, et une «conscience de l'évaluation» car le modèle peut réagir différemment à des contextes clairement artificiels. La Deployment Simulation, en s'appuyant sur une distribution représentative du trafic réel, réduit ces trois problèmes simultanément. La qualité de l'estimation croît avec la puissance de calcul disponible, et non avec l'effort humain nécessaire pour construire des benchmarks. OpenAI précise que la méthode a déjà informé des décisions de déploiement concrètes et mis en évidence des angles morts dans les évaluations classiques. Cette publication s'inscrit dans un effort plus large de l'industrie pour combler l'écart entre les tests de sécurité en laboratoire et les comportements réels des modèles en production. Les évaluations traditionnelles restent indispensables pour les risques rares et à haute sévérité, que la Deployment Simulation ne peut pas couvrir en dessous d'un certain seuil de prévalence. OpenAI présente les deux approches comme complémentaires plutôt que concurrentes. Alors que les grands laboratoires intensifient leurs travaux sur les systèmes agentiques, capables d'exécuter des tâches autonomes et d'appeler des outils externes, la question de la sécurité pré-déploiement devient plus critique. La méthode offre un cadre scalable pour anticiper les dérives avant qu'elles n'atteignent des millions d'utilisateurs, ce qui représente un pas méthodologique concret dans un domaine où les standards restent encore largement à construire.

SécuritéOpinion
1 source
GLM-5.2 : meilleur modèle de codage frontend au monde, IndexShare pour le décodage spéculatif
2111Latent Space 

GLM-5.2 : meilleur modèle de codage frontend au monde, IndexShare pour le décodage spéculatif

Z.ai a publié GLM-5.2 le week-end du 14-15 juin 2026, un modèle de langage open-weight sous licence MIT, architecturé en mixture-of-experts avec 744 milliards de paramètres au total et 40 milliards actifs par token. Le modèle intègre une fenêtre de contexte d'un million de tokens, deux modes de raisonnement (high et max), et est disponible au même tarif que son prédécesseur GLM-5.1, soit 1,4 dollar par million de tokens en entrée et 4,4 dollars en sortie. Dès le premier jour, le support a été assuré par une dizaine d'infrastructures et plateformes majeures : vLLM, SGLang, Cloudflare Workers AI, OpenRouter, Ollama, Baseten, DeepInfra, Fireworks et Notion. Sur les benchmarks indépendants, les résultats sont remarquables : troisième place sur FrontierSWE (derrière Fable 5 et Claude Opus 4.8, mais devant GPT-5.5), première place sur le Design Arena avec un Elo de 1360, et premier modèle open-source de loin sur l'Agent Arena, classé dixième toutes catégories confondues. Sur le Code Arena Frontend, GLM-5.2 devance l'ensemble des versions d'Opus, y compris la 4.8. C'est précisément ce dernier point qui rend la sortie significative. Le front-end est considéré comme un terrain d'affrontement décisif entre modèles de code, et le fait qu'un modèle open-weight batte tous les Claude Opus sur ce segment constitue une première. Des praticiens ayant eu accès anticipé, dont le YouTubeur technique Sentdex, ont déclaré que GLM-5.2 est le premier modèle open-source qu'ils pourraient concrètement substituer à Opus ou GPT dans leurs workflows professionnels. Pour les développeurs et les entreprises, cela signifie une alternative crédible, sans frais de licence propriétaire, pour des tâches de génération de code intensives ou des agents autonomes à longue durée d'exécution. GLM-5.2 s'inscrit dans une trajectoire rapide pour Z.ai, qui avait déjà bousculé le classement des laboratoires open-source avec GLM-5 en début d'année, devançant DeepSeek, Mistral, Cohere et Moonshot sur la plupart des évaluations. La version 5.1 n'était qu'une mise à jour mineure ; le 5.2 représente un saut architectural plus substantiel, avec une extension de DeepSeek Sparse Attention baptisée IndexShare, conçue pour améliorer l'efficacité sur les très longs contextes, et une amélioration du mécanisme de prédiction multi-token pour la décoding spéculative. La sortie a été qualifiée d'"opportuniste" par certains observateurs, intervenant dans la foulée de la controverse liée à l'interdiction de Fable 5 dans certains contextes, une affaire toujours non résolue. Z.ai semble avoir profité du vide pour s'imposer comme la référence open-source du moment en matière de code et d'agents.

LLMsOpinion
1 source
Fable 5 bloqué : la Chine lance GLM-5.2, une solution open source
2112Le Big Data 

Fable 5 bloqué : la Chine lance GLM-5.2, une solution open source

Le 16 juin 2026, l'entreprise chinoise Zhipu a lancé GLM-5.2, un modèle d'intelligence artificielle en accès libre ciblant directement les tâches de programmation agentique et de raisonnement complexe. Disponible sur Ollama et Hugging Face sous licence MIT, le modèle embarque une fenêtre de contexte d'un million de jetons et propose deux niveaux de raisonnement : un mode "Max" orienté performances maximales et un mode "High" offrant un meilleur équilibre entre puissance et consommation. Sur les benchmarks publiés par Zhipu, GLM-5.2 affiche 81,0 % sur Terminal-Bench, 62,1 % sur SWE-bench Pro et 74,4 % sur Frontier SWE. Sur Design Arena, il décroche la première place avec un score Elo de 1360, devançant Claude Fable 5, et se classe deuxième sur Code Arena Frontend. Le lancement intervient au moment précis où Anthropic a suspendu l'accès à Claude Fable 5, offrant à GLM-5.2 une fenêtre de visibilité rare sur le marché. Pour les développeurs, l'enjeu est concret : la publication des poids sous licence MIT permet d'exécuter le modèle localement, de l'adapter à des cas d'usage spécifiques et de l'intégrer dans des pipelines sans dépendance à une API commerciale. Une fenêtre de contexte à un million de jetons combinée à de solides résultats sur les benchmarks de correction de bugs réels et de génération d'interfaces ouvre des perspectives directes pour l'automatisation du développement logiciel, la recherche assistée et les agents autonomes de longue durée. Il faut toutefois nuancer l'étiquette "open source" : si les poids du modèle sont bien publiés, les données d'entraînement, les pipelines de filtrage et le code complet ayant servi à l'entraîner restent privés. GLM-5.2 est donc plus précisément un modèle "open weight", une distinction qui compte pour les chercheurs et les équipes de sécurité souhaitant auditer ou reproduire le système. Par ailleurs, les chiffres de performance avancés par Zhipu n'ont pas encore été confirmés par des évaluations indépendantes. Ce lancement s'inscrit dans une tendance plus large : les laboratoires chinois, portés par des investissements massifs et l'urgence stratégique de contourner les restrictions américaines sur les semi-conducteurs, enchaînent les sorties de modèles compétitifs à un rythme soutenu. GLM-5.2 vient directement concurrencer les modèles de code occidentaux au moment où le leader de facto du secteur est temporairement indisponible.

LLMsOpinion
1 source
Les modèles fondation visuels savent-ils naviguer ? Évaluation réelle en zéro-shot et leçons apprises
2113arXiv cs.RO 

Les modèles fondation visuels savent-ils naviguer ? Évaluation réelle en zéro-shot et leçons apprises

Cinq modèles de navigation visuelle, GNM, ViNT, NoMaD, NaviBridger et CrossFormer, ont été évalués en conditions réelles dans une étude publiée sur arXiv (2603.25937), sur deux plateformes robotiques distinctes et dans cinq environnements couvrant des configurations intérieures et extérieures. Contrairement aux benchmarks habituels qui se limitent au taux de succès (le robot atteint-il son objectif ?), les chercheurs ont combiné des métriques de trajectoire, des scores de reconnaissance visuelle de l'objectif, et des tests de robustesse via des perturbations d'image contrôlées : flou de mouvement et éblouissement solaire simulé. Les modèles ont été évalués en mode zéro-shot, sans ré-entraînement spécifique aux environnements testés. Le code et les données seront rendus publics pour permettre des comparaisons reproductibles. Les résultats exposent trois failles systématiques qui nuancent sérieusement les promesses de généralisation affichées par ces architectures. Premièrement, même les modèles à base de diffusion ou de transformers, réputés plus expressifs, produisent des collisions fréquentes, ce qui trahit une compréhension géométrique de l'espace insuffisante pour un déploiement industriel fiable. Deuxièmement, les modèles peinent à discriminer des lieux visuellement similaires même lorsque des différences sémantiques subtiles existent, générant des erreurs de prédiction d'objectif dans les environnements répétitifs (couloirs, entrepôts). Troisièmement, les performances chutent dès que les conditions d'image s'écartent de la distribution d'entraînement. Pour un intégrateur ou un COO industriel, cela signifie que le taux de succès brut, la métrique la plus couramment citée dans les communications des équipes de recherche, masque des comportements qui seraient inacceptables en production. Ces modèles de navigation visuelle (VNMs) s'inscrivent dans une vague de recherche qui cherche à doter les robots d'une navigation généralisable apprise depuis de larges corpus de démonstrations visuelles, à la manière des vision-language models en perception. GNM et ViNT, développés notamment par des équipes de Berkeley, ont posé les bases de ce paradigme ; NoMaD et CrossFormer ont ensuite tenté d'étendre la robustesse via des architectures plus profondes. L'étude ne nomme pas de concurrent commercial direct, mais ses conclusions s'appliquent directement aux robots mobiles autonomes (AMR) déployés en logistique, où Exotec ou d'autres acteurs européens intègrent déjà des approches de navigation apprise. La prochaine étape naturelle est l'évaluation de modèles VLA (vision-language-action) plus récents dans ce même protocole, pour tester si la compréhension sémantique accrue compense les lacunes géométriques identifiées ici.

RechercheActu
1 source
Rapport technique Qwen-RobotManip : l'alignement permet le passage à l'échelle des modèles fondation pour la manipulation robotique
2114arXiv cs.RO 

Rapport technique Qwen-RobotManip : l'alignement permet le passage à l'échelle des modèles fondation pour la manipulation robotique

L'équipe Qwen d'Alibaba a publié le 22 juin 2026 un rapport technique décrivant Qwen-RobotManip, un modèle fondation Vision-Langage-Action (VLA) conçu pour la manipulation robotique généraliste. Construit sur l'architecture Qwen-VL, le modèle introduit un cadre d'alignement unifié couvrant trois dimensions : la représentation sensorielle, le mouvement, et le comportement. Son corpus d'entraînement atteint environ 38 100 heures de données, constitué exclusivement de jeux de données open source et de vidéos en vue subjective des mains humaines, sans aucune collecte propriétaire. Un pipeline de synthèse convertit ces démonstrations égocentrées en trajectoires robot compatibles avec 15 plateformes matérielles différentes, dont AgileX ALOHA, Franka, UR et ARX. Évalué sur six benchmarks out-of-distribution (RoboCasa365, LIBERO-Plus, EBench, RoboTwin-Clean2Rand, RoboTwin-IF, RoboTwin-XE), Qwen-RobotManip surpasse les modèles précédents sur l'ensemble des configurations et remporte la première place du RoboChallenge avec une amélioration relative de 20 % par rapport à l'état de l'art antérieur. Ce résultat est significatif parce qu'il répond directement à une question centrale du secteur : peut-on appliquer aux données de manipulation robotique la même recette de scaling qui a propulsé les grands modèles de langage ? Jusqu'ici, la réponse restait négative, en raison de l'hétérogénéité structurelle des données de manipulation (formats, espaces d'action, embodiments incompatibles), qui rendait l'entraînement multi-sources incohérent plutôt que synergique. Qwen-RobotManip avance que l'alignement préalable des données résout ce problème, permettant l'absorption à grande échelle sans dégradation. Les capacités émergentes documentées (suivi d'instructions zero-shot, récupération d'erreurs réactive, transfert cross-embodiment) constituent, si elles se confirment en conditions industrielles réelles, un changement de paradigme pour les intégrateurs : moins de fine-tuning spécifique par robot, généralisation à de nouvelles tâches sans redéploiement complet du pipeline. Il convient toutefois de noter que les résultats reposent sur des benchmarks académiques et des validations en laboratoire réel ; aucun déploiement industriel n'est encore documenté, et l'écart sim-to-real reste une inconnue à l'échelle. Qwen-RobotManip s'inscrit dans une course serrée autour des VLA pour la manipulation, où Physical Intelligence (pi0 et pi0.5), Google DeepMind (RT-2, pi-0), et Hugging Face (LeRobot) occupent déjà des positions fortes. Le modèle de Qwen se distingue en revendiquant la performance la plus élevée sur les benchmarks OOD publiés à ce jour, et surtout en n'utilisant aucune donnée propriétaire, ce qui ouvre théoriquement la voie à une adoption plus large. La publication est un preprint arXiv (arXiv:2506.17846v1), pas encore soumis à peer review, et aucune date de disponibilité du modèle ni annonce de pilote industriel n'accompagne ce rapport. Les prochaines étapes probables incluent une intégration dans l'écosystème Hugging Face ou ModelScope et des évaluations indépendantes en conditions réelles.

RobotiqueOpinion
1 source
Qwen-RobotNav : un modèle de navigation extensible conçu pour un système de navigation à base d'agents
2115arXiv cs.RO 

Qwen-RobotNav : un modèle de navigation extensible conçu pour un système de navigation à base d'agents

Alibaba Research a publié le 24 juin 2026 le rapport technique de Qwen-RobotNav, un modèle de navigation robotique entraîné sur 15,6 millions d'échantillons et disponible en deux versions, 2B et 8B paramètres. Le modèle expose une interface paramétrée à deux dimensions : des modes de tâches sélectionnables (suivi d'instructions, recherche d'objets, tracking de cible, conduite autonome) et des paramètres d'observation configurables à l'inférence -- budget de tokens, pondération par caméra, fenêtre d'historique visuel. La randomisation de ces paramètres pendant l'entraînement rend le modèle robuste à toute configuration d'inférence sans modification architecturale. Le co-entraînement avec des données vision-langage (VLA) évite l'effondrement en simple mappeur action-séquence, un problème documenté sur les modèles entraînés uniquement sur trajectoires. Les benchmarks navigation annoncés sont en état de l'art sur les principales références du domaine, avec une généralisation zero-shot validée sur robots réels en environnements variés. L'intérêt industriel de Qwen-RobotNav réside dans son architecture modulaire : un planificateur de haut niveau peut décomposer un objectif long-horizon en sous-tâches, basculer dynamiquement le mode et la stratégie de contexte en cours d'épisode, et composer des comportements complexes via des appels répétés au même modèle de base. Pour un intégrateur ou un OEM robotique, cela signifie un seul backbone navigation réutilisable sur plusieurs verticales (logistique, inspection, assistance), sans refonte du pipeline perception-planification. Le passage de 2B à 8B paramètres montre un scaling favorable, avec émergence d'un substrat spatial-planning partagé qui transfère entre familles de tâches -- ce qui valide empiriquement l'hypothèse que l'entraînement multi-tâche peut remplacer des modèles spécialisés distincts. Qwen-RobotNav s'inscrit dans l'effort d'Alibaba DAMO Academy et du groupe Qwen pour étendre leur famille de modèles au-delà du langage pur vers l'action incarnée. En termes de positionnement concurrentiel, le modèle s'inscrit dans un espace occupé par des travaux comme NaviLLM (Microsoft), OpenFMNav et UniNav, tous cherchant un modèle de navigation généraliste. La différence revendiquée par Qwen-RobotNav est l'interface paramétrique unifiée permettant la reconfiguration à l'inférence sans fine-tuning, ce qui facilite l'intégration dans des systèmes agentiques multi-étapes. Le code et les poids ne semblent pas encore publiés au moment du rapport ; les résultats zero-shot sur robots réels restent à confirmer dans des conditions industrielles non contrôlées.

RobotiqueOpinion
1 source
MuseVLA : un modèle VLA multimodal adaptatif pour la manipulation robotique
2116arXiv cs.RO 

MuseVLA : un modèle VLA multimodal adaptatif pour la manipulation robotique

Des chercheurs présentent ce mois-ci MuseVLA (arXiv:2606.17598, juin 2026), un modèle Vision-Language-Action capable d'intégrer des capteurs non-RGB comme entrées de perception active lors de tâches de manipulation robotique. Sur un robot à main dextre testée en conditions réelles, MuseVLA atteint un taux de succès moyen de 80,6 % sur trois familles de tâches : saisie guidée par la température, recherche d'objet par signal audio, et récupération d'objet dissimulé assistée par radar. L'architecture repose sur un mécanisme en deux temps : le modèle génère d'abord un "sensor token" qui sélectionne dynamiquement la modalité sensorielle pertinente pour la tâche en cours, puis convertit la mesure capteur en une "grounded sensor image", une représentation intermédiaire unifiée fusionnée avec le flux RGB classique avant la génération d'action. Les auteurs introduisent également un pipeline de synthèse de données qui augmente des datasets RGB existants avec des images capteur simulées, contournant ainsi le coût prohibitif de la collecte de données multisensorielles réelles. L'apport principal est architectural plutôt que purement empirique : le découplage entre le traitement capteur spécifique et le backbone VLA permet d'intégrer de nouveaux capteurs sans réentraîner le modèle de base, un principe analogue aux "tool calls" dans les LLM. Cette modularité répond à une limite structurelle des VLA actuels, dont Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA), qui opèrent quasi exclusivement sur RGB. La capacité de zéro-shot sur des tâches non vues lors de l'entraînement est notable, même si les conditions expérimentales restent celles d'un laboratoire, sans déploiement industriel rapporté. Les métriques de cycle time ou de robustesse en environnement non contrôlé ne sont pas fournies, ce qui limite l'interprétation du 80,6 % en contexte réel. Le papier s'inscrit dans une effervescence autour des VLA généralistes depuis mi-2024, avec des acteurs comme Physical Intelligence, 1X Technologies, Enchanted Tools côté européen, et les équipes de Google DeepMind ou Carnegie Mellon qui multiplient les approches de fusion multimodale. MuseVLA reste pour l'instant un preprint sans code ni dataset publié, et la question de la généralisation à des capteurs industriels standards (LiDAR, force/torque) n'est pas traitée. Les prochaines étapes naturelles seraient un benchmark comparatif sur des plateformes connues type Franka ou UR, et une validation hors labo pour confirmer la thèse du sim-to-real sur les données capteur synthétiques.

RobotiqueOpinion
1 source
ACE-Ego-0 : unification des données égocentrées humaines et robotiques pour le préentraînement VLA
2117arXiv cs.RO 

ACE-Ego-0 : unification des données égocentrées humaines et robotiques pour le préentraînement VLA

Pré-publiée sur arXiv en juin 2026 (identifiant 2606.17200), ACE-EGO-0 est un cadre de pretraining pour modèles Vision-Langage-Action (VLA) qui exploite conjointement 4 530 heures de données robotiques et de simulation, et 1 480 heures de vidéos égocentrées humaines converties en pseudo-trajectoires robot. Le pipeline automatise la transformation de vidéos à la première personne en séquences d'actions au format démonstration téléopérée, en représentant les mouvements dans l'espace caméra plutôt que dans un référentiel corporel. Pour atténuer le bruit inhérent à ces pseudo-labels, un objectif d'entraînement reliability-aware concentre la supervision sur les segments les plus fiables via une perte auxiliaire dédiée. Évalué sur RoboCasa GR1 TableTop (robot humanoïde GR1 de Fourier Intelligence) et RoboTwin 2.0, ACE-EGO-0 atteint les meilleures performances publiées sur les deux benchmarks et démontre, selon les auteurs, un transfert vers la manipulation bimanuelle en conditions réelles. L'apport central est la résolution d'un problème structurel : les divergences d'espaces d'action, de morphologie et de dynamiques temporelles entre humains et robots rendaient jusqu'ici l'entraînement conjoint instable ou contre-productif. En unifiant la représentation via des actions caméra-space et un time-aligned action chunking avec morphology conditioning, les auteurs montrent que des jeux de données égocentrés existants comme Ego4D ou EPIC-Kitchens peuvent fournir un signal complémentaire valide à grande échelle. Pour les équipes R&D en robotique, l'implication pratique est directe : réduire significativement le coût de collecte de trajectoires robot, l'un des principaux goulots d'étranglement du déploiement VLA à l'échelle industrielle. La course aux politiques robotiques généralisables s'est accélérée depuis Pi-0 de Physical Intelligence (novembre 2024), OpenVLA et RT-2 de Google DeepMind. Des travaux antérieurs comme Dobb-E ou Human2Robot avaient déjà exploré les données humaines égocentrées comme supervision complémentaire, mais sans framework unifié à cette échelle ni évaluation systématique. ACE-EGO-0 propose une recette reproductible évaluée sur deux benchmarks de référence, dont RoboTwin 2.0, particulièrement pertinent car la manipulation bimanuelle reste un défi ouvert pour les humanoïdes commerciaux tels que Figure 03, Optimus Gen 3 ou Unitree H1. La prépublication ne mentionne ni partenaire industriel ni déploiement annoncé : ACE-EGO-0 est pour l'instant une contribution de recherche, pas un produit livrable.

RechercheOpinion
1 source
RLRC : l'apprentissage par renforcement au service de la récupération des modèles vision-langage-action compressés
2118arXiv cs.RO 

RLRC : l'apprentissage par renforcement au service de la récupération des modèles vision-langage-action compressés

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2506.17639) RLRC, un pipeline de compression en trois étapes pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique complexe. Face au constat que ces architectures multimodales dépassent généralement plusieurs milliards de paramètres et génèrent des latences d'inférence incompatibles avec un déploiement embarqué, la méthode combine élagage structurel (structured pruning), récupération des performances par fine-tuning supervisé (SFT) et apprentissage par renforcement (RL), puis quantification. L'étape RL intègre un warm-up du critique et une régularisation par perte de clonage comportemental (BC loss) pour stabiliser l'entraînement et préserver le comportement de la politique. Les mesures sur plusieurs architectures VLA indiquent une réduction mémoire jusqu'à 8x, un gain d'inférence de 2,3x et un taux de succès aux tâches maintenu au niveau du modèle non compressé. Les auteurs rapportent que RLRC surpasse les baselines de compression existantes, bien que ces résultats restent à ce stade auto-déclarés dans un preprint. L'enjeu est concret pour les intégrateurs robotiques : les VLA de nouvelle génération comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou les dérivés d'OpenVLA requièrent aujourd'hui un GPU serveur pour l'inférence temps réel, ce qui complique leur embarquement sur un robot mobile ou un manipulateur autonome. RLRC propose une voie pour franchir ce seuil matériel sans dégrader les capacités de manipulation. L'apport différenciant est l'utilisation du RL en phase de récupération post-élagage : contrairement à un SFT seul, il corrige les dégradations comportementales induites par la compression, notamment sur des tâches à longue séquence ou à faible marge d'erreur. Le message implicite est que le goulot d'étranglement du déploiement VLA n'est plus uniquement le sim-to-real, mais aussi le compute-to-edge. Les VLA se sont imposés comme standard de facto pour la manipulation généraliste depuis RT-2 de Google DeepMind en 2023, et leur adoption s'est accélérée avec Pi-0 de Physical Intelligence en 2024. La compression de ces modèles reste un angle peu exploré : la littérature sur le pruning et la quantification cible majoritairement les LLM conversationnels comme LLaMA ou Mistral, pas les architectures action-conditionnées. RLRC vise explicitement les plateformes embarquées (NPU, SoC robotique) pour affranchir le déploiement d'une dépendance cloud. Un site projet est disponible à rlrc-vla.github.io, mais aucun partenariat industriel ni calendrier de commercialisation n'est annoncé à ce stade : il s'agit d'un résultat de recherche académique, pas d'un produit expédié.

RechercheOpinion
1 source
PearlVLA : raffinement progressif de plans d'action pour l'IA incarnée dans l'espace latent
2119arXiv cs.RO 

PearlVLA : raffinement progressif de plans d'action pour l'IA incarnée dans l'espace latent

Des chercheurs ont publié en juin 2026 PearlVLA (arXiv:2606.17924), un cadre VLA (Vision-Language-Action) conçu pour concilier faible latence d'exécution et qualité de planification. L'approche déplace le raisonnement dans l'espace latent d'un modèle VLM, évitant le recours aux chaînes textuelles ou aux sous-objectifs en pixels, deux stratégies courantes mais coûteuses en calcul. L'architecture sépare les représentations en une branche de grounding visuel fixe et une branche de plan latent itérative : à chaque cycle, une "world query" interroge un modèle de monde latent léger et gelé pour obtenir une observation future, utilisée ensuite pour affiner progressivement le plan. Après K cycles, le plan est décodé en parallèle en un "action chunk" pour l'exécution temps réel. L'entraînement repose sur un mécanisme RL baptisé "Causal Refinement-Grouped Process-Reward", qui optimise le raffinement via des récompenses issues d'horizons temporels simulés dans l'espace latent. Évalué sur le benchmark de simulation LIBERO, PearlVLA affiche des résultats à l'état de l'art parmi les méthodes existantes. Le compromis latence/planification est structurant pour le déploiement industriel des VLA. Les modèles à décodage direct restent réactifs mais peinent sur des tâches longue-horizon ; les approches délibératives via chain-of-thought améliorent la planification mais leur latence les rend incompatibles avec le contrôle temps réel. En confinant le raisonnement à l'espace latent, PearlVLA contourne ce dilemme sans coûts de génération textuelle. L'approche est conceptuellement proche des modèles de monde (DreaMer, TD-MPC2), ici appliqués aux VLA. Réserve importante : toutes les évaluations sont conduites en simulation sur LIBERO, sans résultats sur robot réel rapportés dans ce preprint, ce qui limite pour l'instant les conclusions sur la transférabilité sim-to-real. La course aux VLA s'est accélérée depuis 2024 avec π0 (Physical Intelligence), Octo, GR00T N2 (NVIDIA) et les modèles embarqués de Figure, Agility ou 1X. La compétition porte désormais sur deux axes : réduire la latence pour atteindre le contrôle temps réel, et améliorer la généralisation sans réentraînement sur de nouvelles tâches. PearlVLA s'inscrit dans cet effort académique collectif, sans affiliation commerciale identifiée dans le preprint. La prochaine étape naturelle serait une validation sur robot physique et des tests de transfert sim-to-real, qui conditionneront l'intérêt des intégrateurs industriels pour cette architecture.

RechercheOpinion
1 source
Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée
2120TechNode 

Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée

Alibaba a publié mardi une suite robotique composée de trois modèles fondamentaux : Qwen-RobotNav, Qwen-RobotManip et Qwen-RobotWorld. Qwen-RobotNav étend les capacités vision-langage à la robotique mobile en unifiant quatre tâches au sein d'un même framework : suivi d'instructions, navigation orientée objectif, tracking de cible et conduite autonome. Qwen-RobotManip standardise l'espace état-action et représente le mouvement de l'effecteur terminal sous forme de poses incrémentielles dans le référentiel caméra, une approche conçue pour faciliter la généralisation multi-plateforme. Ce modèle a été entraîné sur plus de 38 100 heures de données entièrement open source. Qwen-RobotWorld, le troisième composant, fonctionne comme un world model généraliste : il prédit des états futurs physiquement cohérents via une interface en langage naturel, couvrant simultanément la navigation, la conduite et la manipulation depuis un seul modèle. L'approche modulaire mais unifiée est la proposition de valeur centrale de cette suite. Un world model unique opérant sur trois domaines d'action représente une architecture qui, si elle tient ses promesses en conditions réelles, réduirait significativement les coûts d'intégration pour les équipes robotiques industrielles. L'utilisation de données entièrement open source pour Qwen-RobotManip est un signal notable dans un secteur où les datasets propriétaires constituent souvent un avantage concurrentiel défensif : Alibaba positionne ainsi Qwen-Robot davantage comme une infrastructure partagée que comme un produit fermé. Réserve importante cependant : l'annonce ne s'accompagne d'aucun benchmark public (RLBench, LIBERO, CARLA) ni de déploiement physique documenté. Il s'agit d'une publication de modèles, pas d'un produit shipé. L'équipe Qwen d'Alibaba est reconnue pour ses modèles multimodaux (Qwen2.5-VL, QwQ), mais ce lancement marque son entrée explicite dans l'embodied AI. Le terrain est disputé : Google DeepMind pousse ses dérivés de RT-2, Physical Intelligence a publié Pi-0 et Pi-0.5, Hugging Face soutient l'initiative LeRobot, et NVIDIA propose GR00T N2 comme backbone pour les robots humanoïdes partenaires. Côté chinois, Unitree, Agibot et Zhiyuan Robot accélèrent eux aussi leurs pipelines VLA (vision-language-action). La prochaine étape pour Alibaba sera de démontrer des résultats sur des plateformes matérielles réelles ; faute de quoi, Qwen-Robot restera un framework académique parmi d'autres dans une course déjà très chargée.

RobotiqueOpinion
1 source