Aller au contenu principal

Actualités IA — page 158

7 642 articles au fil, du plus récent au plus ancien.

Des systèmes d'IA autonomes mettent à l'épreuve la gouvernance dans les environnements physiques
3141AI News 

Des systèmes d'IA autonomes mettent à l'épreuve la gouvernance dans les environnements physiques

Le 20 mai dernier, l'Infocomm Media Development Authority (IMDA) de Singapour a publié la version 1.5 de son cadre de gouvernance pour les IA agentiques, au moment où les systèmes d'intelligence artificielle autonomes quittent les environnements logiciels pour s'installer dans les entrepôts, les réseaux de livraison et les espaces publics. Ce cadre définit des lignes directrices pour les organisations qui déploient des agents capables de planifier, décider et agir en plusieurs étapes pour accomplir des objectifs. Parallèlement, lors d'un sommet IA à Singapour la semaine dernière, des acteurs comme Grab ont présenté leurs expériences concrètes : l'entreprise pilote actuellement des véhicules autonomes et des robots de livraison dans le quartier de Punggol, à Singapour. Son directeur technique, Suthen Thomas Paradatheth, a détaillé leur approche : simulation intensive, tests en circuit fermé puis ouvert, et déploiement progressif avant tout passage à l'échelle. L'enjeu central est que les défaillances d'une IA dans le monde physique ont des conséquences bien plus graves que dans le domaine numérique. Le Dr Ya-Qin Zhang, doyen fondateur de l'Institute for AI Industry Research de l'université Tsinghua, a résumé le problème : "Tout risque dans le domaine numérique sera amplifié dans le domaine physique, et le domaine physique aura des conséquences physiques." Les systèmes de transport, les drones, les réseaux logistiques et les infrastructures critiques deviennent des points de vulnérabilité à mesure que l'IA s'intègre plus profondément dans les opérations physiques. Grab a également souligné qu'une longue traîne de problèmes imprévus peut surgir après le déploiement, ce qui rend la surveillance continue non négociable. La plupart des cadres de gouvernance existants se sont concentrés sur les risques en ligne : biais algorithmiques, désinformation, contenus nuisibles. L'émergence des IA incarnées dans des environnements physiques imprévisibles force une refonte de cette approche. Le cadre de l'IMDA préconise des déploiements graduels, une surveillance continue et des tests post-déploiement, reconnaissant explicitement que tous les risques ne peuvent être anticipés avant la mise en service. Les discussions au sommet de Singapour ont pointé vers des modèles de gouvernance fondés sur la télémétrie et les tests itératifs, plutôt que sur une certification unique. L'IMDA recommande aussi d'appliquer le principe du moindre privilège pour les accès des agents, de définir des procédures opérationnelles standard et de prévoir des mécanismes permettant de mettre hors ligne un agent défaillant. La question de la répartition des responsabilités entre développeurs, intégrateurs et opérateurs reste un chantier ouvert dans ce secteur en rapide mutation.

RégulationReglementation
1 source
IA en entreprise : entre formation insuffisante et risque de fracture générationnelle
3142Le Big Data 

IA en entreprise : entre formation insuffisante et risque de fracture générationnelle

Les entreprises françaises et internationales investissent massivement dans les licences d'outils d'intelligence artificielle, mais cette acquisition technologique ne se traduit pas en usage réel. C'est le constat dressé par Hamza Bouanani, Practice Manager IA chez MARGO et Lead Data Scientist à la BNP Risk, qui audite régulièrement les usages en entreprise. Selon ses observations, la moitié des développeurs n'intègre tout simplement pas l'IA dans leur flux de travail quotidien, et seulement 10 % maîtrisent réellement les outils d'agents de codage avancés. Même parmi les utilisateurs réguliers, la grande majorité n'exploite que 5 à 10 % du potentiel de ces solutions. Des suites comme Google Workspace AI sont déployées à grande échelle, mais les salariés continuent de créer leurs présentations manuellement, ignorant les fonctionnalités de génération automatique. L'équipement progresse, l'usage stagne. Cette sous-utilisation chronique représente un coût invisible mais réel pour les organisations. L'investissement technologique ne produit aucun retour sérieux tant que l'outil ne s'intègre pas dans un processus métier structuré. Bouanani identifie quatre lacunes critiques chez les collaborateurs non accompagnés : l'incapacité à formuler des requêtes contextualisées (les utilisateurs tapent des mots-clés comme dans un moteur de recherche plutôt que de dialoguer avec la machine), des comportements à risque sur la sécurité des données (copier-coller de codes confidentiels dans des modèles publics), une confiance excessive dans les réponses de l'IA sans validation critique, et l'impossibilité de chaîner des tâches complexes. L'interface intuitive de l'IA générative génère une dangereuse illusion de compétence : parce que l'outil répond instantanément, l'utilisateur croit le maîtriser. L'enjeu n'est plus technique, il est cognitif et méthodologique. Ce constat s'inscrit dans un débat plus large sur la fracture numérique qui se creuse au sein même des entreprises, non plus entre ceux qui ont accès à la technologie et ceux qui ne l'ont pas, mais entre ceux qui savent l'exploiter et ceux qui en restent au stade de la démonstration. Les organisations qui n'investissent pas dans une formation structurée, bien au-delà d'une démonstration rapide de ChatGPT, prennent le risque de voir leur avantage concurrentiel s'éroder face à des concurrents mieux formés. L'enjeu est de transformer les collaborateurs en véritables "directeurs artistiques" de l'IA, capables d'orchestrer les outils plutôt que de les subir. Sans ce changement de posture, la promesse de productivité portée par l'IA générative restera lettre morte pour la majorité des entreprises qui ont pourtant déjà signé le chèque.

SociétéOpinion
1 source
Dust lève 40 M$ pour accélérer les assistants IA collaboratifs en entreprise
3143Le Big Data 

Dust lève 40 M$ pour accélérer les assistants IA collaboratifs en entreprise

La startup française Dust vient d'annoncer une levée de fonds de 40 millions de dollars en série B, menée par Sequoia et Abstract, avec la participation de Snowflake Ventures et Datadog. Cette opération porte son financement total à plus de 60 millions de dollars. L'entreprise, fondée en France, revendique déjà plus de 3 000 organisations clientes, un taux d'utilisation hebdomadaire supérieur à 70 %, un taux de rétention nette des revenus de 240 % en 2025, et plus de 300 000 agents déployés sur sa plateforme. Des clients comme Vanta et Persona illustrent l'adoption concrète : chez Persona, plus de 300 agents ont été créés dans 11 départements pour automatiser des workflows transverses ; chez Vanta, les équipes ventes et support s'appuient sur ces agents pour préparer les business reviews et les prévisions commerciales. Ce financement valide une thèse que Dust pousse contre le courant dominant : l'IA en entreprise échoue à créer de la valeur collective parce que chaque employé travaille avec son propre assistant, son propre historique, sans mémoire partagée. Résultat, différentes équipes reproduisent les mêmes analyses, les mêmes recherches, les mêmes documents, sans capitaliser sur ce qui a déjà été produit. Dust propose un modèle dit "multijoueur", où agents IA et collaborateurs humains évoluent dans un environnement commun, mêmes données, mêmes outils, mêmes objectifs opérationnels. La plateforme se connecte à plus de 100 sources de données et outils métiers, permettant aux agents de générer des documents, analyser des tableurs, produire des présentations et agir directement dans les systèmes connectés. L'enjeu : transformer l'IA d'un outil d'assistance personnelle en infrastructure organisationnelle réutilisable à grande échelle. Dust s'inscrit dans une compétition qui s'accélère entre les plateformes cherchant à capter la couche d'orchestration de l'IA en entreprise, un marché aujourd'hui saturé de copilotes individuels mais encore peu structuré côté collaboration. La participation de Sequoia, l'un des fonds les plus sélectifs de la Silicon Valley, et de fonds liés à des acteurs de la data comme Snowflake et Datadog, signale que l'infrastructure d'IA collaborative est perçue comme la prochaine bataille stratégique. Face aux préoccupations croissantes des entreprises en matière de gouvernance, Dust met également en avant des contrôles de permissions avancés et des journaux d'audit, des arguments de poids pour les grandes organisations hésitant encore à industrialiser leurs usages IA. Avec 40 millions supplémentaires, Dust a désormais les ressources pour accélérer son développement commercial et s'imposer comme standard avant que les géants technologiques ne structurent définitivement ce marché.

BusinessActu
1 source
Il est temps d'agir face à la crise imminente des premiers emplois
3144MIT Technology Review 

Il est temps d'agir face à la crise imminente des premiers emplois

Les chiffres globaux de l'emploi dans les pays développés restent globalement stables depuis l'avènement de l'intelligence artificielle générative, mais un signal inquiétant émerge dans les données détaillées. Un working paper du Stanford Digital Economy Lab, publié en novembre 2025, révèle que les travailleurs âgés de 22 à 25 ans exerçant dans les métiers les plus exposés à l'IA ont subi une baisse relative de 16 % de l'emploi depuis la diffusion massive des outils génératifs, et ce après contrôle des autres facteurs économiques. Un rapport d'Anthropic de mars 2026 aboutit à des conclusions similaires. Fait notable : les travailleurs plus expérimentés des mêmes secteurs n'ont pas connu ce recul. La Réserve fédérale de New York confirme la tendance : au quatrième trimestre 2025, le taux de chômage des jeunes diplômés atteignait 5,6 %, tandis que le taux de sous-emploi culminait à 42,5 %, son niveau le plus élevé depuis la pandémie de Covid-19. Ce qui se joue n'est pas une crise de l'emploi au sens traditionnel, mais quelque chose de plus insidieux : l'érosion du premier échelon de la carrière professionnelle. Les secteurs concernés sont précisément ceux où l'IA générative s'est imposée le plus vite, développement logiciel, service client, programmation, gestion des systèmes d'information. Ce sont ces postes juniors qui absorbaient autrefois les tâches de rédaction, de tri, de résumé et de préparation administrative, tâches désormais partiellement confiées aux outils d'IA. Résultat : les jeunes diplômés envoient aujourd'hui des centaines de candidatures avant de recevoir une seule offre, et les enquêtes signalent des niveaux élevés d'anxiété, de précarité financière et d'épuisement parmi ceux qui cherchent un premier emploi. Le problème dépasse la question de l'emploi immédiat : les postes d'entrée de gamme constituent un mécanisme de formation invisible mais essentiel. C'est en classant des données qu'un jeune analyste apprend à distinguer les chiffres fiables de ceux qui ne le sont pas. C'est en codant sur des systèmes de production qu'un développeur junior comprend comment ils tombent en panne. Si l'IA absorbe ces tâches d'apprentissage, les entreprises gagneront peut-être en efficacité à court terme, mais la société risque de former une génération de professionnels privés des fondations pratiques de leur métier. Face à ce constat, les appels se multiplient : institutions éducatives invitées à repenser leurs formations, gouvernements pressés d'inciter les entreprises à embaucher et former des juniors, et entreprises elles-mêmes sommées de reconnaître que construire une main-d'oeuvre expérimentée en IA commence nécessairement par l'entrée de gamme.

SociétéOpinion
1 source
Un bilan objectif sur la panique autour de l'IA et l'emploi
3145MIT Technology Review 

Un bilan objectif sur la panique autour de l'IA et l'emploi

Malgré les manchettes alarmistes et les licenciements récents chez Coinbase, Meta et Cisco présentés comme le signe avant-coureur d'une destruction massive de l'emploi, les données économiques américaines racontent une autre histoire. Selon les analyses du Bureau of Labor Statistics (BLS), le taux de chômage dans les professions les plus exposées à l'intelligence artificielle est en réalité inférieur à celui des métiers peu concernés par la technologie. Plus révélateur encore : aucun mouvement massif de travailleurs des secteurs menacés vers des emplois réputés plus sûrs, comme les métiers manuels, n'est observable dans les statistiques. Erika McEntarfer, ancienne directrice du BLS limogée par l'administration Trump à l'automne 2025 après un rapport sur l'emploi jugé déplaisant, et désormais chercheuse au Stanford Institute for Economic Policy Research, résume la situation ainsi : "Toutes les preuves disponibles suggèrent que l'impact de l'IA sur le marché du travail actuel reste probablement faible. La disruption n'est pas encore là, et nous avons le temps de nous préparer." Ce constat ne signifie pas que tout va bien pour les travailleurs américains, mais il invite à dissocier les difficultés réelles de la cause qu'on leur attribue. Le taux de chômage des jeunes diplômés tourne autour de 5,6 %, un niveau inédit depuis la pandémie et la période post-2008. Les taux d'embauche restent particulièrement bas dans l'économie post-Covid, pénalisant surtout les 22-25 ans qui cherchent à intégrer le marché du travail, notamment en développement logiciel. Des signes indiquent que l'IA contribue à cette pression sur certains profils, mais ces professions ne représentent qu'une fraction de l'emploi total. Le recensement américain révèle par ailleurs que seulement une entreprise sur cinq utilise l'IA dans une quelconque fonction opérationnelle, ce qui relativise considérablement l'ampleur de la transformation en cours. La prudence des économistes repose sur une leçon historique bien documentée : les innovations technologiques mettent du temps à remodeler les marchés du travail, car elles doivent d'abord transformer les entreprises elles-mêmes. McEntarfer rappelle que "l'IA ne bouleversera probablement pas les marchés du travail avant d'avoir d'abord bouleversé les modèles d'affaires." Ce décalage entre le discours catastrophiste, alimenté par des figures influentes du secteur tech, et la réalité mesurable des données n'écarte pas un choc futur, potentiellement brutal lorsque l'adoption s'accélérera. Mais il plaide pour remplacer l'hystérie par une planification lucide, en s'appuyant sur ce que les chiffres montrent aujourd'hui plutôt que sur des projections anxiogènes dont aucune ne s'est encore concrétisée à grande échelle.

SociétéOpinion
1 source
Guide complet des negative prompts sur ArtSpace AI
3146Le Big Data 

Guide complet des negative prompts sur ArtSpace AI

ArtSpace AI, plateforme de génération d'images par intelligence artificielle, propose dans son interface une fonctionnalité distincte appelée "negative prompt", un champ textuel secondaire, séparé de la description principale, dans lequel l'utilisateur spécifie les éléments qu'il souhaite exclure du résultat visuel. Contrairement à d'autres outils comme Midjourney, ArtSpace AI affiche cet espace d'exclusion directement sous la boîte de dialogue principale, accessible en un clic via un onglet dédié. Le mécanisme repose sur une logique inversée propre aux modèles de diffusion : là où une invite positive oriente le calcul vers des correspondances sémantiques précises, les termes négatifs repoussent des concepts spécifiques hors du champ de génération, orientant ainsi la puissance de calcul uniquement vers les éléments jugés pertinents. L'intérêt pratique de cette fonctionnalité est direct et mesurable pour les créateurs produisant des visuels à vocation commerciale ou éditoriale. Les imperfections les plus fréquentes dans la génération d'images, mains déformées, visages asymétriques, textes flous, ombres irréalistes, filigranes fictifs ou bordures indésirables, sont bien plus efficacement corrigées par exclusion ciblée que par reformulation de l'invite positive. Le résultat est un fichier directement exploitable, sans retouche externe, ce qui représente un gain de temps significatif dans un flux de production professionnel. La composition gagne en cohérence, les espaces négatifs deviennent maîtrisés, et la direction artistique globale se raffine sans surcharger la description principale. La popularisation des negative prompts s'inscrit dans une évolution plus large de la maîtrise des outils de génération visuelle par IA. Au-delà de la simple rédaction d'une invite descriptive, les utilisateurs avancés, graphistes, directeurs artistiques, équipes marketing, ont progressivement compris que la qualité d'un rendu se joue autant sur les contraintes imposées que sur les éléments demandés. ArtSpace AI se positionne ainsi dans un marché de plus en plus compétitif où l'ergonomie du workflow créatif devient un argument de différenciation face à des concurrents comme Midjourney, Stable Diffusion ou Adobe Firefly. La séparation claire des deux champs textuels évite toute ambiguïté sémantique pour l'algorithme et fluidifie le travail des créateurs, un choix de conception qui reflète une maturité croissante des interfaces de génération d'images à destination des professionnels.

CréationOutil
1 source
La startup IA sans employés Polsia boucle une levée de fonds de 30 M$
3147Le Big Data 

La startup IA sans employés Polsia boucle une levée de fonds de 30 M$

Polsia, une startup américaine fondée par un unique fondateur, Ben Sera, vient de boucler une levée de fonds de 30 millions de dollars à une valorisation de 250 millions de dollars. L'annonce a été faite le 22 mai 2026, avec un chiffre d'affaires annuel qui approche les 10 millions de dollars. Particulièrement remarquable : la société ne compte aucun employé. Sera, ancien cofondateur de Future Foods chez Cloud Kitchens aux côtés de Travis Kalanick, a construit Polsia autour d'une orchestration d'agents IA capables de prendre en charge le développement logiciel, la prospection commerciale, la publicité en ligne, le support client et la gestion de workflows métier. Le tour de table réunit des fonds de capital-risque comme Sound Ventures, True Ventures, Offline Ventures, Adjacent, Tekton Ventures et Vaynerfund. Fait notable : Polsia affirme que son propre système d'IA a piloté une grande partie du processus de levée de fonds, notamment la création de la data room, les présentations aux investisseurs et certaines étapes de due diligence. Ben Sera n'est intervenu que lors des échanges finaux et pour signer les documents. L'impact potentiel de ce modèle dépasse largement le cas de Polsia. Si la démonstration est concluante, elle redéfinit ce qu'il est possible de construire avec un capital humain minimal : une seule personne pourrait piloter une entreprise générant des millions de dollars en déléguant la quasi-totalité des opérations à des agents spécialisés. Pour les investisseurs, la promesse est claire : réduction drastique des coûts opérationnels, accélération des cycles de production et capacité à lancer de nouveaux produits sans friction de recrutement. True Ventures va jusqu'à estimer que les outils IA pourraient transformer la création d'entreprise en faisant sauter les barrières liées au capital humain initial, rendant le modèle du fondateur solitaire structurellement viable pour la première fois. Ce positionnement s'inscrit dans un débat plus large sur ce qu'on appelle l'entreprise augmentée par l'IA, où des systèmes automatisés prennent en charge des fonctions autrefois réservées à des équipes entières. Jusqu'ici, la majorité des outils IA imposaient encore une supervision humaine constante ; Polsia cherche à franchir un palier supplémentaire en coordonnant des agents spécialisés sur des tâches complexes et stratégiques. Mais l'enthousiasme des investisseurs ne fait pas l'unanimité. Sur Reddit et d'autres plateformes, de nombreux observateurs remettent en question la crédibilité du modèle, notamment la capacité réelle d'une structure sans équipe à maintenir une croissance à 10 millions de dollars annuels sur le long terme, à gérer des crises imprévues ou à répondre à des clients exigeants. La question reste ouverte : Polsia est-elle un vrai changement de paradigme ou une démonstration de levée de fonds habilement orchestrée par ses propres outils ?

BusinessActu
1 source
OmniVoice Studio : une alternative locale et open source à ElevenLabs
3148MarkTechPost 

OmniVoice Studio : une alternative locale et open source à ElevenLabs

OmniVoice Studio est une application de bureau open source qui propose une alternative locale aux services vocaux d'ElevenLabs, dont les abonnements vont de 5 à 330 dollars par mois. Développée autour du modèle OmniVoice de k2-fsa, l'application regroupe six fonctionnalités principales : clonage de voix à partir d'un clip audio de trois secondes en zero-shot learning, conception de voix synthétiques paramétrables (genre, âge, accent, émotion), doublage automatique de vidéos YouTube ou locales, dictée en temps réel via un widget flottant système, traitement par lots jusqu'à 50 vidéos simultanées, et exposition de toutes ces capacités via un serveur MCP compatible avec Claude, Cursor ou tout client personnalisé. L'architecture repose sur un frontend React couplé à un backend FastAPI exposant 97 endpoints, avec stockage SQLite et streaming via Server-Sent Events. Les bibliothèques ML au coeur du système sont WhisperX pour la transcription (99 langues, alignement mot à mot), Demucs de Meta pour la séparation vocale, Pyannote pour la diarisation des locuteurs, et AudioSeal de Meta pour incruster un filigrane neuronal invisible dans l'audio généré. L'application supporte nativement CUDA, Apple Silicon Metal et ROCm AMD, avec bascule automatique sur CPU en dessous de 8 Go de VRAM. Ce qui distingue fondamentalement OmniVoice Studio, c'est que l'intégralité du pipeline s'exécute en local, sans envoyer aucune donnée vers des serveurs externes. Pour les créateurs de contenu, les développeurs, les journalistes ou les entreprises traitant des enregistrements sensibles, cela représente un changement de paradigme concret : zéro latence réseau, zéro dépendance à un abonnement, zéro exposition de données propriétaires. Le support de 646 langues pour la synthèse vocale, contre 32 pour ElevenLabs, ouvre des usages dans des langues minoritaires ou des dialectes régionaux que les plateformes commerciales ignorent. La fonctionnalité de doublage vidéo entièrement automatisée, transcription, traduction, synthèse, export MP4, comprime en quelques minutes un workflow qui demandait auparavant des outils multiples et des compétences spécialisées. Le projet s'inscrit dans une tendance de fond qui voit l'open source rattraper progressivement les services cloud d'IA vocale, portés par la démocratisation des modèles de diffusion et des architectures TTS performantes. OmniVoice Studio propose six moteurs TTS interchangeables via une variable d'environnement, dont CosyVoice 3 (Apache 2.0, 9 langues et 18 dialectes), MLX-Audio réservé à Apple Silicon, et MOSS-TTS-Nano capable de fonctionner en temps réel sur CPU. Ajouter un moteur personnalisé ne requiert qu'une cinquantaine de lignes de Python. L'enveloppe desktop est construite avec Tauri, framework Rust multiplateforme, pour une base de code répartie à 56 % en Python et 23,6 % en JavaScript. À mesure que les modèles locaux gagnent en qualité et que les coûts d'inférence baissent, des projets comme celui-ci fragilisent le modèle économique des plateformes SaaS vocales qui facturent l'accès à des capacités désormais reproductibles hors cloud.

CréationOutil
1 source
L’IA physique : le prochain marché que surveille déjà Wall Street
3149Robot Magazine FR 

L’IA physique : le prochain marché que surveille déjà Wall Street

Wall Street identifie désormais la "Physical AI" comme le prochain cycle d'investissement majeur après l'IA générative. Selon plusieurs cabinets spécialisés, le marché mondial de la robotique intelligente et de l'IA physique pourrait dépasser 3 000 milliards de dollars d'ici 2040. Goldman Sachs est plus précis sur le segment humanoïde : 150 milliards de dollars d'ici 2035, avec un marché global de robotique intelligente franchissant les 400 milliards. NVIDIA, valorisé à plus de 3 000 milliards de dollars en 2026, est présenté comme le principal bénéficiaire actuel de cette tendance, son PDG Jensen Huang ayant publiquement intégré la "Physical AI" à sa feuille de route. Tesla, de son côté, est repositionnée dans cette grille de lecture grâce à son robot humanoïde Optimus, au-delà de son coeur de marché automobile. À noter : ces chiffres sont des projections de marché, pas des revenus confirmés, et l'article ne cite aucune métrique opérationnelle de déploiement. La rupture que pointe cet article est structurelle : l'IA générative est restée confinée aux écrans (texte, images, code), tandis que la Physical AI vise à en faire une force de travail dans le monde réel, capable de manipuler des objets, se déplacer et exécuter des tâches physiques de manière autonome. Pour un COO industriel ou un intégrateur, ce changement de paradigme est pertinent dans un contexte de pénuries de main-d'oeuvre persistantes et d'accélération de l'automatisation. Ce qui change pour les décideurs B2B, c'est l'horizon de planification : les fonds se positionnent déjà, ce qui signifie que les valuations des acteurs émergents (robotique, simulation, edge computing industriel) vont probablement se comprimer dans les 18 à 36 prochains mois, avant même que des déploiements à grande échelle soient prouvés. Ce récit s'inscrit dans un cycle bien rodé : après le cloud (AWS, Azure), puis l'IA générative (NVIDIA, OpenAI), les analystes financiers cherchent le prochain thème de surperformance. NVIDIA a amorcé ce pivot avec ses plateformes Isaac (simulation robotique) et Cosmos (world model pour robots), et ses partenariats avec Figure, 1X, Agility Robotics ou Boston Dynamics. Tesla joue la même carte avec Optimus, dont les premières vidéos de ligne de production interne ont été diffusées fin 2024, sans chiffres de cadence publiés. L'article reste toutefois une analyse financière généraliste : il ne cite aucun robot spécifique avec des métriques techniques (DOF, payload, cycle time), aucun site de déploiement confirmé, et aucun acteur européen malgré la pertinence d'entreprises comme Wandercraft ou Enchanted Tools sur ce segment. Les prochaines étapes annoncées restent floues, ce qui est caractéristique du registre "thème d'investissement émergent" plutôt que d'un bilan opérationnel.

RobotiqueOpinion
1 source
16 % des électeurs ont demandé à l’IA pour qui voter aux municipales
3150Next INpact 

16 % des électeurs ont demandé à l’IA pour qui voter aux municipales

Lors du premier tour des élections municipales françaises du 15 mars 2026, 16 % des électeurs ont eu recours à l'intelligence artificielle générative pour les aider à choisir leur candidat, selon une étude Toluna Harris Interactive réalisée pour M6 et RTL et publiée par le think tank Terra Nova. L'enquête, conduite auprès de 4 145 personnes dans des communes de 3 500 habitants et plus, décompose cet usage en trois profils : 7 % cherchaient à confirmer un choix déjà arrêté, 5 % voulaient être influencés, et 4 % demandaient directement à l'IA de trancher. Parmi ceux qui ont consulté un chatbot, entre 30 et 40 % affirment avoir changé d'avis, entre 40 et 50 % ont été confortés dans leur intention initiale, et 20 à 30 % disent que l'outil a joué un rôle décisif. Les écarts démographiques sont nets : les hommes ont eu davantage recours à l'IA que les femmes (20 % contre 10 %), les moins de 25 ans à hauteur de 35 %, contre seulement 1 % des seniors. Les sympathisants de La France Insoumise figurent parmi les plus utilisateurs (16 %), contre 6 % pour Reconquête. Ces chiffres restent à relativiser mais ils signalent une mutation profonde dans la formation de l'opinion. Pour l'instant, l'IA demeure la 14e et dernière source d'information citée par les électeurs, loin derrière les tracts (59 %), les professions de foi (57 %) ou encore le bouche-à-oreille (47 %). Mais ce qu'elle fait de manière inédite, c'est intervenir au moment de la décision elle-même, pas seulement de l'information. Le politologue Jean-Daniel Lévy, auteur de l'étude, note que l'IA « n'est plus réservée à quelques technophiles isolés » et « commence à s'inscrire dans les pratiques politiques ordinaires d'une part identifiable de l'électorat ». À moins d'un an de la présidentielle, ce basculement interpelle directement partis, médias et institutions. Le phénomène s'inscrit dans un contexte de défiance croissante envers les médias traditionnels et de montée des usages grand public des chatbots. Emmanuel Macron avait lui-même soulevé la question en novembre dernier, s'interrogeant sur les recommandations que ChatGPT pourrait formuler aux électeurs lui demandant pour qui voter. La question n'est pas anodine : des chercheurs ont démontré que 250 documents suffisent à « empoisonner » l'entraînement d'une IA, et les campagnes de désinformation peuvent désormais générer des faux contenus à grande échelle via ces mêmes outils. Les plateformes comme OpenAI et Google ont adopté des politiques restrictives sur les questions électorales, mais leur application reste inégale. La présidentielle de 2027 s'annonce comme le premier vrai test grandeur nature de l'influence des IA génératives sur le vote français.

SociétéPaper
1 source
Concevoir un pipeline RLVR multimodal complet : Open-MM-RL, prompting vision-langage, scoring des récompenses et export GRPO
3151MarkTechPost 

Concevoir un pipeline RLVR multimodal complet : Open-MM-RL, prompting vision-langage, scoring des récompenses et export GRPO

Un tutoriel publié récemment sur Hugging Face propose un pipeline complet pour entraîner des modèles de vision-langage par apprentissage par renforcement à récompenses vérifiables (RLVR). Le travail s'appuie sur le dataset TuringEnterprises/Open-MM-RL, accessible publiquement sur la plateforme, et couvre l'intégralité du workflow : chargement des données, analyse statistique du corpus, conception d'une fonction de récompense multicritère, formatage des prompts pour les modèles multimodaux, et export final au format GRPO. Le dataset regroupe des exemples annotés répartis en plusieurs domaines (mathématiques, sciences, raisonnement visuel) avec une ou plusieurs images par exemple, des questions de longueur variable et des réponses sous formats divers, numériques, fractions, LaTeX, expressions symboliques. Le tutoriel utilise notamment SmolVLM comme modèle de test pour valider les prompts construits sur des échantillons représentatifs. L'intérêt principal de cette approche réside dans sa capacité à rendre le fine-tuning RLVR accessible sans infrastructure lourde. La fonction de récompense proposée gère cinq types de réponses différents, exact, numérique, fractionnaire, LaTeX et symbolique via sympy, ce qui permet d'évaluer automatiquement la justesse d'un modèle sur des tâches de raisonnement multimodal sans annotation humaine supplémentaire. Pour les équipes travaillant sur l'alignement ou l'amélioration de modèles vision-langage, disposer d'un tel pipeline structuré réduit considérablement le temps d'ingénierie nécessaire pour passer d'un dataset brut à une boucle d'entraînement fonctionnelle. L'export au format GRPO (Group Relative Policy Optimization) est particulièrement pertinent puisqu'il permet une intégration directe avec les frameworks d'entraînement modernes compatibles avec cette méthode. Ce tutoriel s'inscrit dans une dynamique plus large initiée fin 2024 par DeepSeek-R1, qui a popularisé le GRPO comme alternative efficace au PPO classique pour le fine-tuning par renforcement des LLMs. Depuis, la communauté open-source s'emploie à reproduire et étendre ces résultats au domaine multimodal, où les benchmarks de raisonnement visuel restent plus difficiles à évaluer automatiquement qu'en texte pur. TuringEnterprises positionne Open-MM-RL comme une ressource de référence pour combler ce manque. Les prochaines étapes logiques incluent l'entraînement effectif d'un modèle via GRPO sur ce dataset, la comparaison avec des baselines supervisées, et l'extension à des domaines visuels plus complexes comme le raisonnement spatial ou la compréhension de graphiques scientifiques.

RechercheTuto
1 source
Elon Musk prépare déjà Grok 5, la prochaine IA géante pour les développeurs ?
3152Le Big Data 

Elon Musk prépare déjà Grok 5, la prochaine IA géante pour les développeurs ?

Elon Musk a annoncé le 25 mai 2026 la fin de l'entraînement du modèle Grok V9-Medium chez xAI, un système massif de 1,5 trillion de paramètres qui devrait être commercialisé sous le nom de Grok 4.5 ou Grok 5 d'ici deux à trois semaines. Ce chiffre représente trois fois la taille de la version actuelle V8-small utilisée pour le trafic quotidien de Grok. Le modèle entre désormais dans une phase de réglage fin supervisé, avec le lancement de l'apprentissage par renforcement prévu dans les prochains jours. Parmi les éléments notables de cet entraînement, xAI a intégré un volume important de données issues de Cursor, l'assistant de code alimenté par IA qui s'est imposé comme un outil de référence dans les workflows des développeurs professionnels. L'architecture a également été optimisée pour les GPU NVIDIA Blackwell afin d'améliorer l'efficacité de calcul et de réduire les coûts d'inférence. Ce qui distingue ce nouveau modèle des précédentes versions de Grok, c'est son orientation délibérée vers la programmation et l'ingénierie logicielle. En intégrant massivement des données réelles issues des habitudes des développeurs via Cursor, xAI cherche à construire un assistant capable de comprendre le code en profondeur, de corriger des bugs et de conduire un raisonnement logique complexe, plutôt que de simplement générer des extraits de code à la demande. Pour les entreprises tech et les équipes de développement, cela signifie un concurrent sérieux face à des outils comme GitHub Copilot, Claude ou GPT-4o dans le segment des assistants de codage, un marché en croissance rapide où la différenciation se joue désormais sur la spécialisation et la précision technique plutôt que sur les capacités généralistes. xAI s'inscrit dans une dynamique de course aux paramètres qui s'emballe depuis plusieurs mois dans l'industrie de l'IA, avec des annonces de modèles toujours plus massifs de la part d'OpenAI, Google DeepMind et Anthropic. Pour Musk, ce lancement représente également une opportunité de valoriser l'infrastructure du supercalculateur Colossus de xAI, dont la société cherche à prouver qu'elle peut rivaliser avec les centres de données des géants établis. La réduction des coûts d'inférence grâce à l'optimisation Blackwell est un enjeu stratégique concret : faire tourner un modèle de 1,5 trillion de paramètres à grande échelle représente des dépenses considérables, et la viabilité commerciale du produit dépendra autant de cette efficacité opérationnelle que de ses performances brutes sur les benchmarks. La sortie publique attendue courant juin 2026 constituera un test grandeur nature.

LLMsOpinion
1 source
☕️ Les agences de renseignement américaines à court de puissance de calcul pour leurs IA
3153Next INpact 

☕️ Les agences de renseignement américaines à court de puissance de calcul pour leurs IA

La Maison Blanche aurait approuvé une enveloppe de 9 milliards de dollars destinée à doter les agences de renseignement américaines en puces IA de dernière génération, selon des informations rapportées par le New York Times. Ce financement, qui doit encore passer par le Congrès, vise à permettre à la CIA, la NSA et leurs homologues de faire tourner les modèles d'intelligence artificielle les plus récents sur des infrastructures à la hauteur. L'administration Trump aurait par ailleurs déjà redirigé 800 millions de dollars pour accélérer des achats de capacités de calcul en urgence. Parallèlement, la Maison Blanche aurait autorisé la NSA à continuer d'exploiter Mythos, le modèle le plus avancé d'Anthropic, dans le cadre d'un contrat classifié en préparation qui inclurait des restrictions sur le traitement de données concernant des citoyens américains. Les agences américaines se retrouvent dans la même situation que n'importe quel acteur privé : les infrastructures capables d'accueillir les grands modèles d'OpenAI, d'Anthropic ou de Google affichent complet, et les composants les plus puissants, comme les puces Grace Blackwell de NVIDIA, exigent des centres de données dotés de systèmes d'alimentation massifs. Or les réseaux infonuagiques classifiés du gouvernement, dont ceux opérés par AWS, ne peuvent pas être modernisés rapidement. Les agences n'auraient tout simplement pas anticipé les besoins en calcul de ces modèles, et les délais de déploiement restent incompressibles même avec de l'argent disponible. Résultat : les 800 millions déjà mobilisés représentent une goutte d'eau face à l'ampleur des besoins réels, et les 9 milliards supplémentaires n'arriveraient pas immédiatement sur le terrain. Cette situation s'inscrit dans une séquence de tensions entre Washington et les labos d'IA. Le Pentagone avait exigé un accès très large aux modèles avancés d'Anthropic pour ses opérations classifiées, ce qu'Anthropic a refusé, une affaire encore devant les tribunaux. Le DoD a finalement constitué un cercle de fournisseurs IA pour ses opérations secret défense, retenant OpenAI, Google, Microsoft et AWS, mais laissant Anthropic à l'écart, du moins officiellement. Le Pentagone qualifiait même l'entreprise de "risque" pour la chaîne d'approvisionnement et la sécurité nationale, ce qui rend d'autant plus notable la décision d'autoriser la NSA à continuer d'utiliser Mythos. Cette contradiction illustre la difficulté pour les institutions américaines de concilier impératifs de souveraineté numérique, besoins opérationnels croissants en IA, et dépendance inévitable envers quelques entreprises privées qui contrôlent les modèles les plus performants.

InfrastructureOpinion
1 source
Comprendre l'impact des modèles fondation géométriques sur les modèles vision-langage-action (VLA)
3154arXiv cs.RO 

Comprendre l'impact des modèles fondation géométriques sur les modèles vision-langage-action (VLA)

Une étude déposée sur arXiv (2605.24642) analyse rigoureusement l'intégration des modèles de fondation géométriques (GFM) dans les modèles vision-langage-action (VLA) pour la robotique de manipulation. Les chercheurs ont choisi comme sujets d'étude GR00T N1.5, le VLA de NVIDIA dédié aux robots humanoïdes, et VGGT, un GFM spécialisé dans la reconstruction 3D multi-vues. À l'aide d'une technique de sondage linéaire (linear probing), ils ont quantifié pour la première fois ce qu'ils nomment le "geometric gap" : l'écart mesurable entre la représentation spatiale d'un GFM et celle d'un VLA contemporain. Trois architectures distinctes d'injection de la géométrie dans un VLA ont ensuite été implémentées et comparées, avec des détails bas niveau maintenus constants pour assurer l'équité expérimentale. L'équipe a également mesuré l'impact de facteurs non-architecturaux : volume de données d'entraînement, nombre de caméras utilisées, et qualité de la reconstruction 3D résultante. Ce travail répond à une question que beaucoup de praticiens esquivaient : les VLAs actuels "voient-ils" vraiment en 3D, ou s'appuient-ils sur des corrélations 2D apprises statistiquement ? La réponse est formellement négative. L'analyse quantitative démontre que les VLAs de dernière génération, y compris GR00T N1.5, manquent de représentations géométriques structurées, ce qui constitue un frein identifiable pour les tâches de manipulation fine en environnement non contrôlé. Pour les intégrateurs et les équipes R&D, cela valide l'hypothèse justifiant les architectures hybrides géométriques, tout en fournissant une méthodologie d'évaluation reproductible plutôt qu'une démonstration isolée, souvent peu généralisable. Les VLAs ont connu une accélération marquée depuis 2023, avec Physical Intelligence (pi0), Google DeepMind (RT-2) et NVIDIA (GR00T N1 puis N1.5, disponible depuis début 2025) qui rivalisent sur les benchmarks de manipulation. VGGT s'inscrit dans une vague de GFMs récents visant à fournir une compréhension 3D dense sans LiDAR. Cette étude s'intègre dans une tendance plus large : combler le sim-to-real gap par une modélisation spatiale explicite plutôt que par un simple scaling de données. Les suites logiques incluent l'extension de cette analyse comparative à d'autres paires VLA/GFM, et la validation sur robots physiques des trois architectures proposées pour trancher sur laquelle produit le meilleur transfer vers les tâches réelles.

RechercheOpinion
1 source
EXPO-FT : affinage par apprentissage par renforcement économe en données pour les modèles vision-langage-action (VLA)
3155arXiv cs.RO 

EXPO-FT : affinage par apprentissage par renforcement économe en données pour les modèles vision-langage-action (VLA)

EXPO-FT est un système de fine-tuning par apprentissage par renforcement (RL) destiné à améliorer la fiabilité des politiques robotiques issues de modèles Vision-Langage-Action (VLA) pré-entraînés. Présenté dans un preprint arXiv (2605.25477, mai 2026), le système atteint un taux de réussite parfait : 30 succès sur 30 tentatives sur trois tâches de manipulation exigeantes. Ces tâches incluent guider une guirlande lumineuse dans son connecteur pour la faire s'allumer, frapper une balle de billard dans une poche, et insérer une fleur dans un goulot de bouteille à vin. Les résultats sont obtenus avec seulement 19,1 minutes en moyenne de données collectées sur robot réel, sans recours à la simulation. Le code source est publié en open source. Ce résultat attaque directement le "reliability gap" : l'écart persistant entre les capacités de généralisation des VLA pré-entraînés et leur fiabilité effective en conditions opérationnelles. Les modèles comme pi-0 (Physical Intelligence), OpenVLA (UC Berkeley) ou RT-2 (Google DeepMind) montrent une bonne généralisation entre tâches, mais peinent à dépasser les seuils de succès nécessaires en production industrielle. EXPO-FT propose une voie médiane : ni repartir de zéro avec du RL pur, coûteux en données et instable, ni se limiter au fine-tuning supervisé qui plafonne rapidement. En moins de 20 minutes de données réelles, le système atteint la perfection sur des exercices combinant précision millimétrique, dynamique de mouvement et robustesse aux variations d'état initial. Pour un intégrateur ou un COO déployant des bras robotiques sur ligne, c'est un signal que le commissioning par RL pourrait se mesurer en minutes plutôt qu'en jours, si ces résultats se confirment hors conditions de laboratoire. Ce travail s'inscrit dans la convergence accélérée entre LLM fondationnels et contrôle robotique amorcée depuis 2023. Google DeepMind avec Gemini Robotics, Physical Intelligence avec pi-0 et Covariant ont démontré que des politiques pré-entraînées à grande échelle offrent une base solide, mais la question du "last mile" restait ouverte. EXPO-FT y répond en publiant une infrastructure de RL finetuning stable et accessible. Les concurrents directs sur ce créneau sont les approches de reinforcement finetuning développées chez 1X Technologies et dans plusieurs labos académiques américains. Côté européen, des acteurs comme Enchanted Tools ou Wandercraft n'ont pas encore publié de travaux équivalents sur le RL finetuning de VLA, soulignant un écart notable avec la recherche américaine sur ce segment précis.

RobotiqueOpinion
1 source
SpecPrune-VLA : accélérer les modèles vision-langage-action via un élagage auto-spéculatif sensible aux actions
3156arXiv cs.RO 

SpecPrune-VLA : accélérer les modèles vision-langage-action via un élagage auto-spéculatif sensible aux actions

SpecPrune-VLA est une méthode d'élagage (pruning) des modèles Vision-Langage-Action (VLA) publiée sur arXiv (arXiv:2509.05614v3, version révisée). Les VLA sont les architectures neuronales qui transforment images et instructions en langage naturel en commandes motrices pour robots manipulateurs. Sans réentraînement requis, la méthode opère à deux niveaux : un élagage statique par action, combinant historique global et attention locale pour réduire les tokens visuels traités à chaque étape, et un élagage dynamique couche par couche selon l'importance estimée de chaque couche du réseau. Un troisième composant, un contrôleur léger, classifie chaque action en "grossière" ou "fine" selon la vitesse de l'effecteur terminal, et ajuste l'agressivité du pruning en conséquence. Résultats annoncés : facteur d'accélération de 1,57x en simulation LIBERO et 1,70x sur tâches réelles, avec dégradation négligeable du taux de succès. L'enjeu est directement industriel. Les modèles VLA tels que pi-0 et pi-0.5 de Physical Intelligence, OpenVLA ou GR00T N2 de NVIDIA sont progressivement déployés dans des cellules de manipulation robotique, mais leur latence d'inférence reste un verrou pour l'embarqué temps réel. Les méthodes d'accélération existantes, focalisées sur la seule information locale à chaque step, provoquent des chutes de taux de succès supérieures à 20%, ce qui est rédhibitoire pour des environnements de production. SpecPrune-VLA exploite la cohérence spatiale et temporelle inhérente aux tâches robotiques : des frames consécutives se ressemblant fortement, des tokens visuels redondants peuvent être supprimés sans sacrifier la précision motrice. L'absence de réentraînement abaisse significativement la barrière d'adoption pour les intégrateurs. Le gain de 1,70x sur tâches réelles est un résultat solide, même si les conditions expérimentales précises (type de robot, nature des tâches, payload) ne sont pas détaillées dans le résumé publié. Le pruning de tokens dans les transformers est une technique mature côté LLMs (SnapKV, DuoAttention), mais son application aux VLA soulève des défis spécifiques liés à la nature temporelle et multimodale des entrées, et au fait que les erreurs motrices se cumulent sur des horizons longs. Les principaux acteurs qui investissent dans la réduction de la latence d'inférence VLA sont NVIDIA avec Isaac GR00T, Physical Intelligence avec ses modèles pi, et Figure AI avec son architecture Helix. Aucun acteur français ou européen n'est mentionné dans ces travaux. La publication en version v3 sur arXiv signale des révisions substantielles depuis la soumission initiale, mais l'acceptation dans une conférence ou un journal n'est pas encore confirmée, ce qui invite à nuancer la portée des résultats annoncés en attendant une évaluation par les pairs.

RobotiqueOpinion
1 source
Modèles vision-langage-action (VLA) efficaces pour les longues séquences via découplage statique-dynamique
3157arXiv cs.RO 

Modèles vision-langage-action (VLA) efficaces pour les longues séquences via découplage statique-dynamique

Une équipe de chercheurs a publié sur arXiv (référence 2502.03983) un framework baptisé DySta, conçu pour rendre les modèles Vision-Language-Action (VLA) à la fois plus rapides et plus capables sur des tâches longues. Les VLA sont des architectures qui combinent compréhension visuelle, instructions en langage naturel et génération d'actions motrices pour des robots généralistes. DySta résout deux goulots d'étranglement structurels : la fenêtre de contexte limitée en entrée (qui contraint le nombre de frames exploitables) et la complexité quadratique de l'attention transformeur, aggravée par le grand nombre de paramètres. La solution repose sur une séparation explicite des tokens visuels en deux catégories : les tokens statiques (fond, structure de la scène, éléments invariants) et les tokens dynamiques (objets en mouvement, zones d'intérêt). Une seule copie des tokens statiques est conservée entre les frames, tandis qu'un mécanisme de "recache gate" décide de manière sélective quand rafraîchir le cache clé-valeur (KV cache) associé. Les gains sont mesurables : accélération de l'inférence de 2,0x en simulation (avec +2,3 points de succès) et 2,2x sur des tâches réelles générales (avec +10,6 points de succès), ainsi qu'une amélioration de 23,3 points de taux de réussite absolu sur des tâches réelles nécessitant de la mémoire temporelle. L'enjeu industriel est direct : les VLA déployés en milieu réel doivent aujourd'hui gérer des séquences longues (assemblage multi-étapes, manipulation d'objets variables, navigation conditionnelle) sans exploser le coût computationnel. La réduction du contexte via les tokens statiques répond précisément au compromis mémoire/vitesse qui bloque le passage à l'échelle de modèles comme OpenVLA, Pi-0 ou GR00T N2. Le gain de +10,6 points sur des tâches générales réelles est particulièrement significatif car il valide l'approche hors simulation, où le sim-to-real gap reste un défi non résolu pour la majorité des frameworks VLA actuels. DySta s'inscrit dans une vague de travaux d'efficacité VLA qui incluent des approches comme RoboFlamingo, SpatioTemporal Token Compression, ou les techniques de KV cache adaptatif venues du domaine NLP. Les VLA de première génération (RT-2, OpenVLA) ignoraient largement la redondance temporelle des frames visuelles ; DySta formalise ce problème et propose une solution modulaire intégrable à différentes architectures VLM de base. Le papier introduit également un benchmark dédié à l'évaluation de l'intégration multi-frames, comblant un angle mort méthodologique du domaine. Les prochaines étapes logiques incluent l'intégration à des modèles fondationnels ouverts (Llama-based VLAs) et l'évaluation sur des plateformes matérielles contraintes type Jetson, où le rapport latence/performance est critique pour la commercialisation.

RechercheOpinion
1 source
IsaacIPC : simulation haute fidélité et rendu réaliste couplés pour la robotique en contact
3158arXiv cs.RO 

IsaacIPC : simulation haute fidélité et rendu réaliste couplés pour la robotique en contact

Des chercheurs ont publié le 27 mai 2026 sur arXiv (référence 2605.24339) IsaacIPC, un framework de simulation robotique qui couple le moteur IPC (Incremental Potential Contact) accéléré GPU avec l'environnement IsaacSim/Lab de NVIDIA. Le coeur du système repose sur un mapping de déformation entre maillages de simulation et maillages de rendu, permettant un rendu visuel réaliste en temps réel pour des scénarios à contacts riches (manipulation déformable, préhension complexe). Les auteurs introduisent également le GMCP (Geometric Mortar Contact Potential), une nouvelle formulation de potentiel barrière appliquée aux surfaces tactiles pour résoudre les distributions pression-contact avec une précision supérieure aux approches existantes. Le framework est validé sur un robot quadrupède, une main dextre à doigts multiples et un préhenseur UMI (Universal Manipulation Interface). L'enjeu industriel est direct : la qualité des données de simulation conditionne la robustesse des politiques de manipulation entraînées en sim-to-real. IsaacIPC s'attaque au problème du rendu réaliste couplé à la physique du contact, un point de friction majeur pour l'entraînement de VLA (Vision-Language-Action models) et de politiques de manipulation fine. Une simulation visuellement fidèle réduit le domain gap sans recourir à la randomisation agressive, ce qui accélère le déploiement sur hardware réel. La précision tactile apportée par GMCP est particulièrement pertinente pour les intégrateurs travaillant sur l'assemblage ou la chirurgie assistée par robot. Le contexte scientifique est celui d'une compétition intense autour des simulateurs pour la robotique apprenante. IPC, initialement développé en infographie par Li et al. (2020), est reconnu pour sa robustesse aux contacts mais reste coûteux en calcul -- son intégration dans IsaacSim comble un écart entre fidelité physique et vitesse nécessaire à l'entraînement par reinforcement learning. En face, MuJoCo (DeepMind), Genesis et PhysX restent des références, mais peinent sur les déformables et la tactile. IsaacIPC reste à ce stade un preprint académique sans annonce de disponibilité publique dans Isaac Lab, mais son intégration dans l'écosystème NVIDIA ouvre une voie réaliste vers une adoption industrielle rapide si les benchmarks de contact tiennent à l'échelle.

RobotiquePaper
1 source
X-DiffVLA : têtes d'action par diffusion pour modèles VLA multi-corps
3159arXiv cs.RO 

X-DiffVLA : têtes d'action par diffusion pour modèles VLA multi-corps

Des chercheurs ont publié le 26 mai 2026 sur arXiv un nouveau modèle d'action robotique baptisé X-DiffVLA, conçu pour opérer sur plusieurs morphologies de robots sans nécessiter de réentraînement complet par plateforme. L'architecture repose sur un modèle de type VLA (Vision-Language-Action) combiné à une tête d'action par diffusion unifiée, capable de piloter des robots partageant une base commune mais équipés d'effecteurs distincts, pinces classiques ou mains dexteères à plusieurs doigts. Les évaluations rapportent des gains de 15,3 % sur le benchmark RoboCasa et de 12,5 % sur Isaac Gym par rapport aux méthodes de l'état de l'art, avec des validations en environnement réel confirmant la tenue des performances hors simulation. Le défi central que X-DiffVLA tente de résoudre est le goulot d'étranglement du fine-tuning spécifique à chaque embodiment : aujourd'hui, les modèles VLA préentraînés sur de larges corpus doivent être adaptés séparément pour chaque configuration robotique, ce qui fragmente la capitalisation des données et freine le transfert de connaissances entre plateformes similaires. Les auteurs introduisent deux mécanismes pour contourner cela. L'« Embodiment Forcing » est une technique de guidage sans classificateur (classifier-free guidance, inspirée des modèles de diffusion générative) qui oriente implicitement la génération d'actions vers les composantes fonctionnelles propres à chaque effecteur, sans supervision explicite. La « Morphological Tree Diffusion » structure les corrélations comportementales entre effecteurs hétérogènes en exploitant leur parenté morphologique, maximisant ainsi le transfert de démonstrations entre configurations. Ce travail s'inscrit dans une compétition intense autour des politiques robotiques universelles : Physical Intelligence (pi.) avec Pi-0, Google DeepMind avec RT-2 et ses successeurs, ainsi que des équipes académiques comme celles derrière OpenVLA, explorent tous des approches de généralisation cross-embodiment. X-DiffVLA se distingue par son ancrage diffusion plutôt qu'autorégressif, une tendance confirmée par des travaux récents montrant que les modèles de diffusion capturent mieux la multimodalité des distributions d'actions robotiques. Les résultats restent pour l'instant confinés à des benchmarks simulés et à quelques validations réelles non détaillées quantitativement dans l'abstract ; la robustesse à l'échelle industrielle reste à démontrer.

RechercheActu
1 source
IA incarnée : de la perception à la prise de décision
3160arXiv cs.RO 

IA incarnée : de la perception à la prise de décision

Une équipe de recherche a déposé sur arXiv (référence 2605.25813, mai 2026) EQA-Decision, un benchmark et dataset à grande échelle pour évaluer les capacités de raisonnement incarné des modèles vision-langage (VLM). Le corpus contient plus de quatre millions de paires question-réponse annotées hiérarchiquement, structurées autour de quatre dimensions : construction de scène statique, compréhension spatiale, raisonnement sur la dynamique des tâches, et décision instantanée. Les chercheurs publient également RoboDecision, un modèle baseline entraîné sur ce benchmark, conçu pour évaluer conjointement la perception, le raisonnement et la prise de décision au niveau de l'action dans des environnements incarnés simulés. Le problème adressé est structurel : les datasets existants pour l'EQA (Embodied Question Answering) sont fragmentés, chacun couvrant un sous-ensemble limité de compétences, compréhension spatiale d'un côté, raisonnement procédural de l'autre, sans cadre unifié permettant une évaluation complète. Pour les équipes qui développent des architectures VLA (vision-language-action) destinées à la manipulation ou à la navigation autonome, l'absence d'un tel benchmark rend la comparaison objective des approches difficile. EQA-Decision propose un cadre capable de tester la chaîne complète perception-raisonnement-action, plus proche des conditions réelles que les benchmarks purement perceptifs ou purement langagiers. L'EQA est un champ actif depuis les travaux fondateurs de Das et al. (Georgia Tech, 2018), où un agent naviguait dans un environnement 3D pour répondre à des questions visuelles. Depuis, plusieurs benchmarks ont émergé, OpenEQA de Meta, SQA3D, EmbodiedScan, chacun avec un périmètre étroit. EQA-Decision se positionne comme une synthèse unificatrice, avec une ambition d'échelle (4 millions de paires) comparable aux grands datasets de VQA généralistes. Il convient de noter qu'il s'agit d'un preprint arXiv, non encore soumis à peer review. RoboDecision sert de baseline de référence, mais les résultats ne correspondent pas à un déploiement sur robot physique : le gap sim-to-real reste entièrement ouvert.

RecherchePaper
1 source