Aller au contenu principal

Actualités IA — page 199

7 647 articles au fil, du plus récent au plus ancien.

Changement de rotation : comment varier les angles de vue d’un personnage ?
3961Le Big Data 

Changement de rotation : comment varier les angles de vue d’un personnage ?

Artspace, plateforme de génération d'images par intelligence artificielle, a déployé une fonctionnalité de "changement de rotation" permettant aux créateurs de modifier l'angle de vue d'un personnage généré sans perdre la cohérence anatomique du sujet. Concrètement, l'outil identifie les points de repère anatomiques de l'image source pour construire un maillage virtuel, puis recalcule en temps réel les ombres, textures et reflets en fonction du nouvel axe de pivotement. Le système agit sur les axes X et Y, permettant de passer d'un portrait de face à un profil ou une vue trois quarts tout en préservant la forme du nez, de la mâchoire, les textures de peau et les détails vestimentaires. Pour optimiser le résultat, Artspace recommande d'utiliser des images sources où le sujet est clairement détaché de son arrière-plan, afin de faciliter la segmentation par l'algorithme, l'éclairage initial conditionnant lui aussi la qualité du rendu final. Cette capacité à maintenir l'identité visuelle d'un personnage sur plusieurs angles représente une avancée significative pour les professionnels de la création visuelle. Un illustrateur ou un designer de personnages peut désormais produire des planches cohérentes, que ce soit pour une bande dessinée, un jeu vidéo ou une campagne de communication, sans craindre que les traits de son sujet ne se déforment d'une case à l'autre. Historiquement, obtenir des vues multiples rigoureusement fidèles d'un même personnage généré par IA relevait du défi technique majeur, obligeant souvent les créateurs à de longues séances de retouche manuelle. En offrant un contrôle directionnel réel plutôt que des variantes algorithmiques aléatoires, Artspace répond directement aux besoins des workflows de production professionnels où la rigueur anatomique n'est pas négociable. La génération d'images par IA a longtemps souffert d'un déficit de contrôle précis : des outils comme Midjourney produisent des rendus de haute qualité brute, mais peinent à garantir la cohérence d'un sujet sur plusieurs générations successives. C'est dans ce contexte que s'inscrit la stratégie d'Artspace, qui se positionne non pas comme un simple générateur texte-vers-image, mais comme un studio tout-en-un intégrant des capacités proches de la modélisation 3D assistée. La fonctionnalité de rotation s'inscrit dans une tendance plus large de l'industrie visant à combler le fossé entre la génération IA grand public et les outils de production professionnels tels que Blender ou Character Creator, donnant ainsi aux créateurs un contrôle accru sur la géométrie et la mise en scène de leurs personnages.

CréationOutil
1 source
IBM veut faire de l’IA le moteur de transformation des entreprises
3962Le Big Data 

IBM veut faire de l’IA le moteur de transformation des entreprises

Lors de sa conférence annuelle Think 2026, IBM a présenté ce qu'il appelle un "AI operating model", un modèle opérationnel destiné à transformer en profondeur le fonctionnement des entreprises. La pièce maîtresse de cette annonce est une nouvelle version de Watson Orchestrate, qui évolue en plateforme de contrôle multi-agents capable de superviser simultanément plusieurs IA spécialisées, finance, support client, cybersécurité, RH, supply chain. Rob Thomas, vice-président senior des logiciels chez IBM, a insisté sur un point central : la qualité des données reste le prérequis absolu de toute stratégie IA crédible. IBM s'appuie également sur son rapprochement avec Confluent pour renforcer le streaming de données en temps réel via Kafka et Flink, afin que ses modèles ne travaillent plus jamais sur des informations obsolètes. L'enjeu pour IBM est de combler ce qu'il nomme l'"AI divide" : le fossé croissant entre les entreprises qui ont intégré l'IA dans leurs opérations quotidiennes et celles qui restent coincées au stade des expérimentations isolées. Des années de pilotes IA en silo, assistants internes, automatisation documentaire, agents conversationnels, ont atteint leurs limites. IBM veut désormais que ces briques se coordonnent en un système unique et cohérent, gouverné et auditable. Mark Tauschek, vice-président recherche chez Info-Tech Research Group, confirme que la prolifération des agents autonomes crée déjà des risques réels : politiques appliquées de façon incohérente, manque de traçabilité, gouvernance absente. IBM se positionne explicitement comme fournisseur de gouvernance IA plutôt que comme simple éditeur d'outils génératifs. Ce repositionnement intervient dans un contexte où les grands acteurs technologiques se livrent une bataille féroce pour capter les budgets IA des entreprises. Microsoft, Google, Salesforce et Oracle avancent tous leurs propres frameworks d'agents. IBM, dont l'histoire est profondément ancrée dans les infrastructures d'entreprise et la gestion des données sensibles, mise sur la confiance et la gouvernance comme avantages différenciants, un argument qui résonne particulièrement dans les secteurs régulés comme la banque, l'assurance ou la santé. La stratégie repose sur quatre piliers liés : données, agents IA, automatisation et infrastructure hybride. Si IBM parvient à convaincre que cette approche intégrée réduit les risques tout en accélérant la valeur opérationnelle, Think 2026 pourrait marquer un tournant dans sa capacité à reconquérir un rôle de premier plan dans l'ère de l'IA d'entreprise.

OutilsOutil
1 source
Copyright : Hachette, Elsevier et trois autres éditeurs attaquent Meta
3963Next INpact 

Copyright : Hachette, Elsevier et trois autres éditeurs attaquent Meta

Cinq géants de l'édition mondiale ont déposé plainte mardi devant la cour du district sud de New York contre Meta et son PDG Mark Zuckerberg, visé personnellement. Hachette, Macmillan, McGraw Hill, Elsevier et Cengage, rejoints par l'auteur de thrillers et avocat Scott Turow, accusent le groupe d'avoir téléchargé illégalement via des réseaux torrent des millions de livres et articles scientifiques protégés par le droit d'auteur, avant de les copier massivement pour entraîner sa famille de modèles d'IA générative Llama, valorisée à plusieurs milliards de dollars. Les sources du téléchargement illégal identifiées dans la plainte sont connues : LibGen, Anna's Archive, Sci-Hub, Sci-Mag et d'autres sites pirates. Les avocats des éditeurs précisent que Meta avait d'abord envisagé d'obtenir des licences auprès des grands éditeurs, avant d'opter pour le piratage. Ils affirment que Zuckerberg lui-même a personnellement autorisé et activement encouragé ces violations. La plainte va plus loin que le simple téléchargement : elle soutient que les modèles Llama restituent des reproductions verbatim des oeuvres concernées, citant comme exemple la capacité du modèle à reproduire mot pour mot des passages du manuel Calculus: Early Transcendentals de James Stewart, publié par Cengage. Cette action se distingue des plaintes précédentes par son poids institutionnel. Ce ne sont plus quelques auteurs isolés qui affrontent Meta, mais des multinationales dont les catalogues représentent une part massive de l'édition scolaire et scientifique mondiale. L'enjeu est double : il s'agit à la fois de compenser un préjudice économique direct, les éditeurs voyant leurs fonds exploités sans compensation, et de peser sur la jurisprudence en construction autour de l'utilisation des contenus protégés pour l'entraînement des IA. Si Llama est capable de régurgiter verbatim des manuels sous copyright, l'argument du transformative use, pilier de la défense fair use, devient difficile à tenir. La question du fair use reste juridiquement ouverte. En 2024, les entreprises d'IA avaient remporté plusieurs batailles judiciaires, mais le débat n'avait pas été définitivement tranché. Le juge Vince Chhabria avait lui-même exprimé des doutes sur l'applicabilité du fair use aux manuels scolaires, pointant le préjudice potentiel au marché. Meta, par la voix de son porte-parole Dave Arnold, a affirmé au New York Times que l'entreprise se défendrait "avec vigueur", invoquant les bénéfices de l'IA et la jurisprudence favorable. Mais cette affaire, par sa dimension collective et la personnalisation de la mise en cause de Zuckerberg, pourrait accélérer la cristallisation d'une doctrine sur l'usage des oeuvres protégées dans l'entraînement des grands modèles de langage, avec des conséquences pour l'ensemble du secteur.

RégulationReglementation
1 source
Google teste l'agent IA Remy pour Gemini, avec un accent mis sur le contrôle utilisateur
3964AI News 

Google teste l'agent IA Remy pour Gemini, avec un accent mis sur le contrôle utilisateur

Google teste en interne un nouvel agent IA baptisé Remy, conçu pour s'intégrer à l'application Gemini et agir de manière autonome au nom des utilisateurs dans leurs tâches professionnelles et quotidiennes. L'information provient de Business Insider, qui affirme avoir consulté un document interne et échangé avec deux personnes au fait du projet. Selon ce document, Remy se présente comme un "agent personnel disponible 24h/24", capable de gérer des tâches complexes, d'apprendre les préférences de l'utilisateur et de se connecter aux services Google comme Gmail, Calendar, Docs, Drive, ainsi qu'à des plateformes tierces telles que GitHub, Spotify ou WhatsApp. Pour l'heure, le projet est en phase de "dog-fooding", c'est-à-dire testé exclusivement par des employés de Google. Aucune date de lancement public n'a été communiquée, et Google a refusé de commenter. Remy représente une évolution significative dans la stratégie de Google autour de Gemini, qui cherche à dépasser le simple chatbot pour devenir un assistant capable d'agir, et non plus seulement de répondre. Si Google propose déjà un "Agent Mode" dans Gemini, Remy serait selon les sources une version nettement plus avancée, intégrant un apprentissage des préférences utilisateur et une gestion de tâches multi-étapes. Cette orientation vers les agents autonomes soulève toutefois des questions de contrôle et de vie privée que Google semble anticiper : le Privacy Hub de Gemini permet déjà aux utilisateurs de consulter et supprimer l'historique d'activité, de gérer les données de personnalisation et de révoquer l'accès aux applications connectées. Les chercheurs de Google Research ont par ailleurs formalisé des principes pour les agents IA, insistant sur des pouvoirs strictement limités, des actions observables et l'application du principe de moindre privilège. La course aux agents autonomes s'est accélérée ces derniers mois dans l'ensemble du secteur. OpenAI a attiré l'attention début 2025 avec OpenClaw, un agent capable de répondre à des messages et de mener des recherches de façon autonome, dont le créateur a été recruté par Sam Altman en février. Le PDG de Google DeepMind, Demis Hassabis, a lui-même évoqué l'ambition de construire un "assistant numérique" de référence, sans préciser le calendrier. Remy s'inscrit dans cette dynamique où les grandes plateformes IA cherchent à passer du stade de l'assistant conversationnel à celui d'un véritable mandataire numérique. Les détails techniques restent flous: l'architecture de Remy, le modèle sous-jacent et le degré d'autonomie réel, notamment la question de savoir s'il peut agir sans confirmation explicite de l'utilisateur, n'ont pas été divulgués.

OutilsOutil
1 source
Anthropic dévoile des agents IA pour automatiser les tâches financières
3965Le Big Data 

Anthropic dévoile des agents IA pour automatiser les tâches financières

Anthropic a dévoilé le 5 mai 2026 une suite de dix agents IA spécialisés dans l'automatisation des tâches financières complexes. Construits sur Claude Opus 4.7, ces agents ciblent les banques, sociétés de gestion d'actifs et équipes finance d'entreprise. Ils couvrent un spectre large : préparation de pitchs commerciaux, analyse de résultats d'entreprises, suivi de marchés, modélisation financière, rapprochement comptable, clôture mensuelle, audit d'états financiers et vérification KYC. Chaque agent combine des compétences métiers, des connecteurs de données et des sous-agents spécialisés. Sur le benchmark Finance Agent de Vals AI, Anthropic revendique un score de 64,37 % pour Claude Opus 4.7, ce qui en ferait le modèle le plus performant du marché sur les usages financiers selon l'entreprise. En parallèle, Anthropic intègre nativement Claude à Microsoft 365 via des modules complémentaires pour Excel, PowerPoint et Word, avec une extension Outlook annoncée prochainement. Une fonctionnalité appelée Dispatch permet également d'assigner des tâches à distance par message ou commande vocale, l'agent poursuivant alors le travail en arrière-plan sur les fichiers locaux. L'enjeu opérationnel est considérable pour les services financiers, où une part significative du temps des analystes est absorbée par des tâches répétitives à faible valeur ajoutée. L'intégration native avec Microsoft 365 est particulièrement stratégique : Claude peut construire un modèle financier dans Excel, le transférer automatiquement dans PowerPoint et générer une présentation qui se met à jour en temps réel quand les données changent. Dans Word, il peut adapter des notes de crédit aux standards internes d'une institution. La continuité contextuelle entre applications, argument central d'Anthropic, élimine la friction habituelle : les analystes n'ont plus à réexpliquer leur travail lorsqu'ils changent d'outil. Pour les institutions qui souhaiteraient personnaliser les agents, Anthropic permet d'adapter les modèles aux règles de conformité, politiques de risque ou méthodes d'évaluation propres à chaque organisation. Cette offensive s'inscrit dans une compétition féroce entre les grands laboratoires d'IA pour s'implanter durablement dans les workflows des services financiers, secteur perçu comme l'un des plus rentables pour les déploiements à grande échelle. Anthropic s'appuie sur des connecteurs vers les plateformes de données de référence du secteur, FactSet, S&P Capital IQ, PitchBook, Morningstar, LSEG, pour crédibiliser son offre face à des acteurs comme OpenAI ou Microsoft Copilot, déjà bien installés dans les grandes institutions. D'après le Wall Street Journal, la demande des institutions financières pour des outils IA pleinement intégrés dans les processus métiers est en forte croissance, et Anthropic cherche à se positionner non plus comme un fournisseur de modèle, mais comme une véritable plateforme opérationnelle. Le déploiement en quelques jours promis par l'entreprise reste à vérifier à l'échelle, mais le signal envoyé au marché est clair : Claude vise désormais le cœur des opérations financières.

OutilsOutil
1 source
Google AI publie des générateurs MTP pour Gemma 4 : jusqu'à 3x plus rapide sans perte de qualité
3966MarkTechPost 

Google AI publie des générateurs MTP pour Gemma 4 : jusqu'à 3x plus rapide sans perte de qualité

Google a annoncé le lancement de drafters Multi-Token Prediction (MTP) pour sa famille de modèles Gemma 4, quelques semaines seulement après que cette gamme a franchi les 60 millions de téléchargements. Cette architecture spécialisée de décodage spéculatif permet de tripler la vitesse d'inférence, soit un gain de 3x, sans aucune perte de qualité ni de précision dans les réponses générées. Les drafters sont disponibles pour plusieurs tailles de modèles, y compris les variantes E2B et E4B conçues pour fonctionner sur appareils mobiles et équipements edge. Le problème que cette technologie résout est fondamental : les grands modèles de langage génèrent les tokens un par un, de manière séquentielle, ce qui oblige le système à charger continuellement des milliards de paramètres depuis la mémoire vidéo vers les unités de calcul. Le vrai goulot d'étranglement n'est pas la puissance brute du GPU, mais la bande passante mémoire, les processeurs restent largement sous-utilisés pendant que les données transitent. L'approche MTP contourne ce problème en découplant la génération de la vérification : un petit modèle "drafter" propose rapidement plusieurs tokens en avance, puis le modèle cible principal (comme Gemma 4 31B) vérifie l'ensemble de ces suggestions en un seul passage parallèle. Si les tokens proposés sont acceptés, l'application peut en sortir toute une séquence, plus un token supplémentaire généré par le modèle cible, dans le même temps qu'il aurait fallu pour en produire un seul. Le gain de vitesse est dit "sans perte" : la sortie finale est strictement identique à ce que le modèle aurait produit seul. Sur le plan technique, Google a introduit plusieurs optimisations architecturales pour maximiser l'efficacité. Les drafters partagent le cache KV (key-value cache) du modèle cible, ce qui évite de recalculer les contextes d'attention déjà traités. Pour les modèles edge E2B et E4B, une technique de clustering dans la couche d'embedding accélère spécifiquement le calcul des logits, l'étape qui convertit les représentations internes du modèle en probabilités sur le vocabulaire, particulièrement coûteuse sur du matériel contraint. Cette annonce s'inscrit dans une course industrielle plus large à l'efficacité d'inférence : réduire les coûts de déploiement et la latence est devenu aussi stratégique que l'amélioration des capacités brutes des modèles, surtout à mesure que les LLM s'intègrent dans des applications temps réel et des appareils grand public.

LLMsOpinion
1 source
Quand Claude hallucine au tribunal : l'affaire Latham & Watkins et la responsabilité des avocats
3967MarkTechPost 

Quand Claude hallucine au tribunal : l'affaire Latham & Watkins et la responsabilité des avocats

En mai 2025, le cabinet d'avocats Latham & Watkins, l'un des plus prestigieux au monde avec des honoraires dépassant 2 000 dollars de l'heure pour ses associés, a déposé devant un tribunal fédéral américain une déclaration contenant des citations académiques erronées dans l'affaire Concord Music Group v. Anthropic. Le détail qui rend l'incident saisissant : ces erreurs ont été générées par Claude, le modèle d'IA d'Anthropic que Latham & Watkins défendait précisément dans cette même procédure. Un collaborateur du cabinet avait trouvé une source académique via Google, puis demandé à Claude de formater la citation légale en lui fournissant l'URL correcte. Claude a restitué le bon lien et la bonne année de publication, mais s'est trompé sur le titre et les auteurs. L'équipe a vérifié que l'URL fonctionnait, sans contrôler si les métadonnées générées par le modèle étaient exactes. La partie adverse a repéré l'erreur. Le juge a ordonné la divulgation explicite de l'usage de l'IA et imposé des exigences de vérification humaine pour toutes les pièces futures. Ce qui rend cet incident structurellement dangereux, c'est précisément sa nature : Claude n'a pas inventé une source fantôme, il a mal décrit une source réelle. Ce type d'erreur est bien plus difficile à détecter qu'une citation entièrement fabriquée, puisque le lien fonctionne, le document existe et l'année est correcte. L'erreur se niche au niveau des métadonnées, pas de l'existence. C'est l'équivalent légal de citer un vrai texte de loi en lui attribuant la mauvaise juridiction. La sortie de Claude était formatée, fluide, professionnelle, retournée en quelques millisecondes, sans aucun signe d'hésitation ni marqueur d'incertitude. C'est exactement cet habillage professionnel qui trompe même des avocats expérimentés. L'incident pose une question structurelle pour l'ensemble de la profession juridique, bien au-delà d'un seul cabinet. La règle 11 des Federal Rules of Civil Procedure exige des avocats américains qu'ils certifient par leur signature que toute affirmation factuelle dans un dépôt repose sur des preuves vérifiables. Cette règle a été conçue pour un monde où la fabrication supposait l'intention ou la négligence grave. Elle n'anticipait pas un modèle capable de produire des erreurs avec une assurance totale et un rendu impeccable. Un précédent aggravant est apparu fin 2024 dans l'affaire Gauthier v. Goodyear Tire & Rubber Co., dans le district est du Texas, où un avocat avait soumis un mémoire contenant deux citations de jurisprudence inexistantes et plusieurs citations inventées, également générées par Claude. Ces deux affaires consécutives signalent une tendance : l'IA devient un vecteur de risque disciplinaire systémique pour les professions réglementées, à mesure que sa confiance apparente dépasse sa fiabilité réelle.

RégulationOpinion
1 source
Vidéo : le robot Atlas bouge déjà mieux que certains gymnastes
3968Le Big Data 

Vidéo : le robot Atlas bouge déjà mieux que certains gymnastes

Boston Dynamics a publié le 5 mai 2026 une courte vidéo montrant son robot humanoïde Atlas réaliser un appui tendu renversé suivi d'un L-sit maintenu plusieurs secondes, avant de se relever sans assistance. Cette nouvelle génération d'Atlas affiche des caractéristiques techniques imposantes : 1,88 mètre de hauteur (6,2 pieds), 90 kilogrammes, 56 degrés de liberté articulaire, des rotations à 360° sur les articulations clés, une protection IP67 contre la poussière et l'eau, et une plage de fonctionnement de -20° à +40°C. Ce n'est plus un prototype de laboratoire : il s'agit d'une version conçue pour une industrialisation future, avec seulement deux types d'actionneurs distincts dans l'ensemble du corps. Le L-sit est une figure de gymnastique artistique qui exige une force abdominale extrême, un équilibre millimétré et une coordination quasi parfaite, déjà difficile pour un humain entraîné, quasi insoluble pour une machine de 90 kilos jusqu'à récemment. Ce que Boston Dynamics démontre ici, c'est la maturité de son pipeline d'apprentissage par renforcement : Atlas s'entraîne en simulation virtuelle sur des milliers d'essais, affine ses stratégies de mouvement, puis transfère ces réflexes acquis vers le robot physique. Le résultat visible est frappant, les gestes ne ressemblent plus à des séquences programmées point par point, mais à un équilibre instinctif, comme si la machine anticipait ses propres pertes de stabilité avant qu'elles ne surviennent. C'est un saut qualitatif majeur : la fluidité du mouvement est désormais comparable à celle d'un gymnaste humain de niveau intermédiaire. Derrière la démonstration spectaculaire, les enjeux sont industriels et stratégiques. Le travail sur la locomotion généraliste est piloté par le RAI Institute, dirigé par Marc Raibert, fondateur historique de Boston Dynamics, avec l'objectif de créer un système de contrôle unifié capable de gérer aussi bien la marche quotidienne que les figures acrobatiques. Hyundai, propriétaire de Boston Dynamics depuis 2021, prévoit de déployer Atlas dans sa gigantesque usine de Géorgie dès 2028, et vise à terme une production de 30 000 unités humanoïdes par an. Atlas n'est cependant pas seul sur ce marché : Figure, Agility Robotics, Tesla avec Optimus, et plusieurs startups chinoises se disputent les mêmes contrats industriels. Boston Dynamics possède probablement l'humanoïde techniquement le plus avancé, mais la transition d'une vidéo virale à une ligne de production fiable, rentable et à grande échelle reste le vrai défi, et c'est là que la compétition se jouera dans les deux prochaines années.

RobotiqueOpinion
1 source
Entraînement des IA et droit d’auteur : l’industrie culturelle veut l’adoption rapide de la loi
3969Next INpact 

Entraînement des IA et droit d’auteur : l’industrie culturelle veut l’adoption rapide de la loi

Le 8 avril 2026, le Sénat français adoptait à l'unanimité une proposition de loi instaurant une présomption d'exploitation des contenus culturels par les fournisseurs d'intelligence artificielle. Portée par la sénatrice Agnès Evren (LR), la loi renverse la charge de la preuve : ce n'est plus au créateur de démontrer que son œuvre a été utilisée pour entraîner un modèle d'IA, mais à l'entreprise d'IA de prouver qu'elle ne l'a pas fait. Le texte attend désormais son inscription à l'ordre du jour de l'Assemblée nationale. Pour accélérer le processus, 81 organisations culturelles et de l'information, dont la SACEM, la SCAM, l'ADAMI et le SNEP, ont publié une lettre ouverte appelant les députés à examiner rapidement la proposition. Ces acteurs demandent également la création d'un marché de licences volontaires qui permettrait une rémunération négociée des ayants droit. L'enjeu est considérable pour des secteurs qui voient leurs œuvres aspirées massivement par des entreprises technologiques sans contrepartie financière ni consentement préalable. La présomption légale offrirait à l'industrie culturelle un levier juridique concret face à des acteurs comme OpenAI ou Google, régulièrement visés par des plaintes pour violation du droit d'auteur. Pour les organisations signataires, l'objectif n'est pas le procès systématique mais la création des conditions d'un vrai rapport de force : forcer les entreprises d'IA à venir négocier, plutôt que d'ignorer les créateurs. Un marché de licences structuré garantirait à la fois la compétitivité de la presse et des industries créatives, et offrirait aux modèles d'IA une sécurité juridique présentée comme un avantage concurrentiel. Le passage du texte à l'Assemblée nationale est toutefois loin d'être acquis. Le gouvernement a émis des réserves importantes : la ministre déléguée chargée du numérique, Anne Le Hénanff, a averti que la présomption d'exploitation exposerait l'ensemble des acteurs économiques utilisant de l'IA, des start-up aux entreprises du CAC 40, à un risque de contentieux « dévastateur ». La France se situe ainsi à contre-courant de la tendance mondiale : au Royaume-Uni, le gouvernement avait au contraire envisagé une exception au droit d'auteur autorisant l'entraînement commercial des modèles sans permission préalable, avant de suspendre le projet sous pression des artistes. À l'échelle européenne, le débat sur l'équilibre entre innovation et droits des créateurs reste ouvert, et l'issue française pourrait peser sur la norme continentale.

RégulationReglementation
1 source
La mise en production de l'IA à grande échelle oblige les entreprises à repenser leur infrastructure
3970VentureBeat AI 

La mise en production de l'IA à grande échelle oblige les entreprises à repenser leur infrastructure

Le déploiement de l'intelligence artificielle à grande échelle est en train de redessiner l'architecture informatique des entreprises. C'est le constat que dressent Tarkan Maner, président et directeur commercial de Nutanix, et Thomas Cornely, vice-président exécutif en charge du produit, qui observent une bascule profonde dans la façon dont les organisations abordent l'IA. Après des mois de prototypes et d'expérimentations dans le cloud, les entreprises cherchent désormais à déployer ces systèmes sur des charges de travail réelles, pour des milliers d'utilisateurs simultanés. Cornely résume l'écart : "Faire un prototype, c'est une chose. Déployer ce prototype pour 10 000 employés, c'en est une autre." La montée en puissance des agents IA, capables d'enchaîner des tâches complexes en toute autonomie, amplifie encore cette pression : les infrastructures doivent gérer des workflows multi-étapes, des charges imprévisibles en temps réel, et coordonner l'accès aux données entre équipes. Ce passage du pilote à la production révèle des contraintes pratiques que l'expérimentation en cloud avait masquées. Les questions de gouvernance des données, de contrôle, de sécurité et de coût prennent rapidement le dessus dès que les volumes augmentent. Les cas d'usage qui progressent le plus vite sont la recherche documentaire et la récupération de connaissances, la détection prédictive des menaces en cybersécurité, les workflows de développement logiciel, et le support client. Dans le secteur bancaire, notamment en Europe et aux États-Unis, des établissements déploient déjà des outils de reconnaissance faciale et de détection prédictive des cyberattaques pilotés par l'IA. L'enjeu n'est pas de remplacer les décisions humaines, mais de trouver le bon équilibre entre l'automatisation et l'intervention humaine, ce que Maner résume par l'idée d'une "harmonie" entre agents IA, robotique et capital humain, optimisée pour de meilleurs résultats opérationnels. Cette transformation s'inscrit dans un contexte de mutation accélérée qui touche l'ensemble des secteurs, des industries réglementées comme la banque, la santé et les administrations publiques jusqu'à la distribution et la manufacture. Des frameworks comme OpenClaw facilitent désormais la création d'agents par des équipes qui n'ont pas de compétences en infrastructure IA, ce qui accroît la pression sur les plateformes chargées de sécuriser ces déploiements. La trajectoire dominante est claire : débuter dans le cloud pour accéder rapidement aux ressources, puis rapatrier les applications critiques sur site à mesure qu'elles entrent en production, sur des plateformes qui résolvent les problèmes de sécurité et de coût à la fois. Nutanix se positionne explicitement sur ce segment, voyant dans cette transition une opportunité de croissance majeure à mesure que les entreprises cherchent des partenaires capables d'accompagner l'IA de l'expérimentation au déploiement industriel.

InfrastructureActu
1 source
Scandale Siri : Apple va rembourser des millions d’utilisateurs d’iPhone
3971Frandroid 

Scandale Siri : Apple va rembourser des millions d’utilisateurs d’iPhone

Apple a accepté de verser 250 millions de dollars pour clore un recours collectif intenté aux États-Unis par des utilisateurs d'iPhone mécontents. Le groupe de Cupertino était accusé d'avoir commercialisé fin 2024 des fonctionnalités d'intelligence artificielle pour son assistant Siri qui n'ont jamais été mises à disposition des consommateurs. Les plaignants estimaient avoir acheté ou conservé leurs appareils en se basant sur des promesses publicitaires mensongères concernant des capacités d'IA avancées. Cet accord représente une défaite symbolique importante pour Apple, dont la stratégie IA baptisée Apple Intelligence a accumulé les retards depuis son annonce en juin 2024. Les millions d'utilisateurs concernés pourront réclamer une indemnisation, dont le montant individuel dépendra du nombre de demandes déposées. Au-delà du volet financier, cette affaire soulève une question de fond pour toute l'industrie tech : jusqu'où les entreprises peuvent-elles promettre des fonctionnalités d'IA non encore opérationnelles pour stimuler leurs ventes ? Apple avait présenté une refonte ambitieuse de Siri lors de sa WWDC 2024, promettant une intégration poussée avec ChatGPT et des capacités de compréhension contextuelle inédites. Face aux difficultés techniques et à une concurrence acharnée de Google, Samsung et OpenAI sur le terrain de l'IA, la firme a repoussé à plusieurs reprises ces fonctionnalités. Ce règlement judiciaire pourrait inciter d'autres régulateurs et cabinets d'avocats à scruter de plus près les promesses marketing de l'ensemble du secteur technologique en matière d'intelligence artificielle.

☕️ Les promesses non tenues autour de Siri vont coûter cher à Apple
3972Next INpact 

☕️ Les promesses non tenues autour de Siri vont coûter cher à Apple

Apple a proposé un règlement amiable de 250 millions de dollars pour mettre fin à un recours collectif déposé en Californie, après que des consommateurs américains ont accusé l'entreprise de publicité mensongère autour de son assistant Siri. Le litige porte sur des spots télévisés diffusés à l'automne 2024, au moment du lancement de la gamme iPhone 16, dans lesquels l'actrice Bella Ramsey, connue pour ses rôles dans Game of Thrones et The Last of Us, interagissait avec un Siri capable de croiser des informations issues de plusieurs applications simultanément et d'exploiter le contexte de l'utilisateur pour répondre à des questions complexes. Ces fonctionnalités, présentées comme imminentes lors de la WWDC de juin 2024, n'ont jamais vu le jour. Apple a depuis discrètement retiré l'une de ces publicités, mais les archives d'internet en ont conservé la trace. Le chèque de 250 millions, qui ne comprend aucune reconnaissance de faute de la part d'Apple, doit encore être validé par le juge californien en charge du dossier. Si l'accord est approuvé, il constituera l'un des règlements judiciaires les plus importants de l'histoire d'Apple. Au-delà du montant, c'est l'ampleur du décalage entre la communication et la réalité qui frappe : les plaignants affirment qu'Apple a vendu des capacités d'IA « qui n'existaient pas à l'époque, qui n'existent toujours pas, et qui n'existeront pas dans les deux prochaines années ». Pour les consommateurs ayant acheté un iPhone 16 en partie motivés par ces promesses, la déception est concrète et mesurable. Pour l'industrie technologique plus largement, ce recours envoie un signal clair : les annonces de fonctionnalités IA non déployées peuvent désormais exposer les entreprises à une responsabilité juridique significative, à mesure que les régulateurs et les juridictions civiles s'emparent du sujet. Le retard de ce « Siri 2.0 » n'est pas un accident isolé, mais le symptôme d'une crise plus profonde au sein de la division intelligence artificielle d'Apple. L'entreprise, qui avait dévoilé Apple Intelligence avec une confiance affichée en juin 2024, a enchaîné les reports, faute de modèle suffisamment performant pour alimenter les nouvelles ambitions de l'assistant. Cette situation a déclenché une réorganisation interne et provoqué le départ de John Giannandrea, le principal responsable de l'IA chez Apple. Pour combler son retard, Cupertino a confirmé début janvier 2026 un accord avec Google pour intégrer les modèles Gemini à ses futures fonctionnalités d'IA. Le Siri personnalisé est désormais attendu avec iOS 27, mais la crédibilité d'Apple dans ce domaine reste entamée, dans un secteur où ses rivaux, Google, Microsoft, Amazon, ont déjà plusieurs longueurs d'avance.

[AINews] Silicon Valley prend les services au sérieux
3973Latent Space 

[AINews] Silicon Valley prend les services au sérieux

Anthropic et OpenAI ont simultanément annoncé le lancement de sociétés de services dédiées au déploiement de l'IA en entreprise. Anthropic s'associe à trois géants financiers, Blackstone, Hellman & Friedman et Goldman Sachs, dans une coentreprise non encore nommée, capitalisée à hauteur de 1,5 milliard de dollars (300 millions chacun des principaux participants). Le modèle opérationnel repose sur des petites équipes qui travaillent directement avec les clients pour identifier les usages à fort impact, puis construisent des systèmes sur mesure basés sur Claude en collaboration avec les ingénieurs d'Anthropic. OpenAI, de son côté, lance "The Deployment Company", soutenue par 19 investisseurs dont TPG, Brookfield Asset Management, Advent et Bain Capital, ayant déjà levé environ 4 milliards de dollars pour une valorisation pré-money de 10 milliards. Brad Lightcap, directeur des opérations d'OpenAI, quitte son poste pour diriger cette nouvelle entité, sous l'autorité directe de Sam Altman. En parallèle, OpenAI a déployé GPT-5.5 Instant comme nouveau modèle par défaut de ChatGPT, avec des améliorations en factualité, compréhension d'images et personnalisation, incluant l'accès aux souvenirs, historiques de conversations et Gmail des utilisateurs. Ce pivot vers les services marque une inflexion majeure dans le modèle économique des grands laboratoires d'IA. Vendre des modèles via API ne suffit plus, la vraie valeur, et le vrai chiffre d'affaires, se trouvent dans l'intégration effective de l'IA dans les processus métiers. Aaron Levie, PDG de Box, le résume clairement : faire fonctionner des agents en dehors du code implique de moderniser les systèmes informatiques, de fournir le bon contexte aux agents, de repenser les workflows, de gérer la relation humain-agent et de piloter l'adoption en interne. Il n'existe pas de raccourci pour ancrer l'intelligence artificielle dans un processus industriel de manière stable. Ces nouvelles entités ouvrent un marché considérable pour de nouveaux emplois et de nouvelles entreprises de services. Cette évolution traduit une tension structurelle que les laboratoires d'IA avaient jusqu'ici évitée : devenir des sociétés de conseil et d'intégration, ce qui les expose à une concurrence directe avec des acteurs comme Accenture, McKinsey ou les grandes ESN. La finance représente déjà le deuxième segment de revenus d'Anthropic, comme en témoigne l'événement "Financial Services" organisé à New York début mai avec un parterre de dirigeants du secteur. OpenAI et Anthropic font le pari que la complexité du déploiement de l'IA en entreprise est suffisamment grande pour justifier une présence directe sur le terrain, et que les marges d'un contrat d'intégration à 1,5 milliard valent bien le risque de brouiller leur positionnement de laboratoire de recherche.

BusinessOpinion
1 source
Pourquoi Jamie Foxx, Eva Longoria et Matthew McConaughey investissent dans ELEVEN LABS
3974FrenchWeb 

Pourquoi Jamie Foxx, Eva Longoria et Matthew McConaughey investissent dans ELEVEN LABS

Jamie Foxx, Eva Longoria, Matthew McConaughey et Hwang Dong-hyuk, le réalisateur de Squid Game, ont rejoint le tour de table d'ElevenLabs en participant à une extension de la série D de la startup spécialisée dans la synthèse vocale par intelligence artificielle. Ils s'associent à des investisseurs institutionnels de premier plan déjà présents au capital, dont BlackRock, NVIDIA et Wellington Management. Ce tour, dont le premier closing avait été annoncé en février dernier, confirme l'appétit des marchés financiers pour les technologies de voix génératives. Ce n'est pas un investissement symbolique. En misant sur ElevenLabs, ces figures du cinéma et de la télévision cherchent à peser dans une technologie qui pourrait fondamentalement restructurer leurs propres industries : doublage automatique, narration de contenus, droits à l'image vocale, personnalisation d'expériences audio à grande échelle. Pour les studios et producteurs, ElevenLabs représente à la fois une menace sur les métiers traditionnels de la voix et un outil capable de réduire drastiquement les coûts de localisation internationale. ElevenLabs s'est imposée en quelques années comme le leader mondial de la voix IA, avec des usages allant de l'audiobook à la localisation de films en passant par les assistants conversationnels. La présence de NVIDIA au capital souligne l'enjeu infrastructurel de cette course : générer des voix réalistes en temps réel exige une puissance de calcul considérable. En attirant des personnalités qui sont à la fois clientes potentielles, ambassadrices et actrices concernées par les implications réglementaires, ElevenLabs construit une coalition stratégique autant qu'un financement.

OGPO : un affinage complet et efficace des politiques de contrôle génératives
3975arXiv cs.RO 

OGPO : un affinage complet et efficace des politiques de contrôle génératives

Un preprint arXiv de mai 2026 (2605.03065) présente OGPO, Off-policy Generative Policy Optimization, un algorithme de fine-tuning par renforcement pour les politiques génératives de contrôle (GCPs) basées sur la diffusion ou le flow matching, paradigme central de modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). OGPO propage les gradients à travers l'intégralité du processus génératif via un objectif PPO modifié et maintient des réseaux critiques off-policy pour maximiser la réutilisation des données. Évalué sur des tâches de manipulation multi-tâches, d'insertion haute précision et de contrôle dextère, l'algorithme revendique un état de l'art et serait, selon les auteurs, le premier à fine-tuner des politiques de behavior cloning mal initialisées jusqu'au succès complet sans données expertes dans le replay buffer en ligne. Quatre stabilisateurs pratiques sont introduits : success-buffer regularization, conservative advantages, régularisation χ², et réduction de la Q-variance. Le fine-tuning RL des politiques génératives est l'un des principaux verrous pour le déploiement industriel de la robotique. Le behavior cloning pré-entraîne des modèles polyvalents sur de larges corpus de démonstrations, mais plafonne en deçà des taux de succès requis pour l'assemblage de précision ou la manipulation de pièces complexes. L'absence de données expertes dans le replay buffer est stratégiquement importante : un intégrateur adaptant un modèle fondation à une cellule de production spécifique n'a pas à collecter de nouvelles démonstrations coûteuses. Les stabilisateurs introduits adressent directement la sur-exploitation des critiques, mode d'échec documenté qui rendait les approches précédentes instables sur des observations en pixels. Les politiques diffusion pour la robotique ont émergé en 2023 avec Chi et al. (Diffusion Policy), avant d'être étendues au flow matching avec Pi-0 de Physical Intelligence et la famille GR00T de NVIDIA. Le fine-tuning RL de ces architectures avait été tenté avec des méthodes comme DPPO, mais restait limité aux politiques bien initialisées et nécessitait souvent des données expertes. OGPO se positionne comme une approche généraliste applicable à toute GCP. En compétition académique, les laboratoires de Berkeley, CMU et Stanford travaillent sur des problématiques proches. Côté industriel, Physical Intelligence, Boston Dynamics et Figure AI intègrent ce type d'optimisation dans leurs pipelines, et des acteurs européens comme Enchanted Tools (France) opèrent dans cet espace. La suite logique est une validation à plus grande échelle sur hardware réel et une extension aux architectures VLA (Vision-Language-Action) multimodales.

RechercheOpinion
1 source
Préhension dextérique réactive par planification RL hiérarchique en espace de tâche et contrôle QP en espace articulaire
3976arXiv cs.RO 

Préhension dextérique réactive par planification RL hiérarchique en espace de tâche et contrôle QP en espace articulaire

Des chercheurs ont publié le 6 mai 2026 sur arXiv (référence 2605.03363) un framework de contrôle hiérarchique hybride pour la préhension dextre réactive. L'architecture sépare explicitement deux niveaux d'exécution : un planificateur haut niveau basé sur du multi-agent RL, avec deux agents spécialisés distincts (un pour le bras, un pour la main), qui génère des commandes de vitesse en espace tâche; et un contrôleur bas niveau de programmation quadratique (QP) parallélisé sur GPU, qui traduit ces commandes en vitesses articulaires tout en respectant strictement les limites cinématiques et en assurant l'évitement de collisions. Le système a été validé sur matériel réel, avec un bras 7-DOF équipé d'une main anthropomorphique 20-DOF, en démontrant un transfert zero-shot depuis la simulation vers des objets non vus pendant l'entraînement, dans des environnements non structurés. La contribution principale n'est pas seulement la performance de saisie : c'est la propriété de "zero-shot steerability", c'est-à-dire la capacité d'un opérateur à ajuster dynamiquement les marges de sécurité ou à contourner des obstacles imprévus sans réentraîner la politique. Pour un intégrateur industriel, cela change radicalement le calcul de déploiement : les approches end-to-end classiques (VLA inclus) nécessitent typiquement un fine-tuning coûteux pour chaque variation d'environnement. Ici, la séparation structurelle entre planification et exécution permet d'injecter des contraintes nouvelles au niveau du QP sans toucher à la politique RL, ce qui accélère aussi la convergence en entraînement. La robustesse aux perturbations physiques imprévues, démontrée en conditions réelles, renforce la crédibilité du pipeline sim-to-real. Ce travail s'inscrit dans un mouvement de recherche qui cherche à dépasser les architectures purement end-to-end pour la manipulation dextre, en réintroduisant des couches de contrôle classiques (QP, contraintes cinématiques) comme fondation sûre sous une politique apprise. Des approches similaires émergent chez des équipes comme Physical Intelligence (Pi-0), Figure AI (Figure 03) ou 1X Technologies, qui combinent toutes apprentissage et contrôle structuré. La prochaine étape naturelle pour ce type de framework sera la validation sur des tâches d'assemblage industriel avec variabilité de forme et de matière, ainsi que l'extension à des mains à plus haute densité de capteurs pour fermer la boucle tactile.

RobotiquePaper
1 source
Préhension indépendante du point de vue par VLM et observations partielles
3977arXiv cs.RO 

Préhension indépendante du point de vue par VLM et observations partielles

Des chercheurs ont publié sur arXiv (arXiv:2603.07866v2) un pipeline de saisie robotique guidé par le langage naturel, conçu pour fonctionner dans des environnements encombrés avec des observations partielles. Le système prend en entrée une commande textuelle en langage libre, localise l'objet cible dans l'image RGB via détection open-vocabulary et segmentation d'instance, puis extrait un nuage de points centré sur l'objet à partir de données RGB-D. Pour compenser les zones occultées, le pipeline applique une compensation de profondeur par back-projection et une complétion du nuage de points en deux étapes. Il génère ensuite des candidats de saisie à 6 degrés de liberté (6-DoF), les filtre pour éviter les collisions, et sélectionne la saisie finale via des heuristiques orientées sécurité tenant compte de l'accessibilité, de la faisabilité d'approche et des dégagements. Évalué sur un robot quadrupède équipé d'un bras manipulateur, le pipeline atteint un taux de succès global de 90 % (9 saisies sur 10) contre 30 % (3/10) pour la baseline dépendante du point de vue, sur deux scénarios de table encombrés. Ce résultat est notable parce qu'il adresse l'un des blocages les plus persistants du manipulation robotique mobile: l'occultation partielle. Les robots humanoïdes et quadrupèdes déployés en entrepôt ou en atelier ne disposent jamais d'une vue complète de la scène. Passer de 30 % à 90 % de succès en conditions réelles de désordre, sans recalibrage de vue, valide l'approche de complétion de nuage de points couplée à la détection open-vocabulary: le système n'a pas besoin de connaître l'objet à l'avance, il le trouve par description textuelle. C'est exactement le type de généralisation que cherchent les intégrateurs industriels pour éviter la reprogrammation à chaque nouveau SKU. Ce travail s'inscrit dans la vague des pipelines VLA (Vision-Language-Action) qui tentent de combler le fossé entre compréhension sémantique et exécution physique fiable. Des approches concurrentes comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) visent également la saisie généraliste, mais depuis des plateformes humanoïdes à deux bras. Ici, l'accent est mis sur les robots quadrupèdes à bras unique, segment moins couvert commercialement mais pertinent pour inspection et logistique en terrain semi-structuré. Les auteurs ne mentionnent pas de déploiement industriel immédiat, il s'agit d'un résultat de laboratoire; les prochaines étapes probables incluent des tests sur davantage de catégories d'objets et une évaluation hors table, en environnement ouvert.

RobotiqueOpinion
1 source
RLDX-1 : rapport technique
3978arXiv cs.RO 

RLDX-1 : rapport technique

Un rapport technique déposé sur arXiv le 6 mai 2026 présente RLDX-1, une politique robotique généraliste conçue pour la manipulation dextre complexe. L'architecture centrale, baptisée Multi-Stream Action Transformer (MSAT), intègre des modalités hétérogènes via des flux spécialisés par modalité couplés à une attention croisée inter-modale (cross-modal joint self-attention). Cette conception cible trois lacunes persistantes des modèles Vision-Langage-Action (VLA) actuels : la conscience du mouvement (motion awareness), la prise de décision avec mémoire contextuelle, et l'intégration de retours sensoriels physiques. Le système combine cette architecture avec des choix de conception système : génération synthétique de données d'entraînement pour les scénarios de manipulation rares, procédures d'apprentissage spécialisées pour un geste proche du mouvement humain, et optimisations d'inférence pour le déploiement temps réel. Sur le benchmark ALLEX, conçu pour évaluer le contrôle de robots humanoïdes à haut degré de liberté (DoF) sous des exigences fonctionnelles variées, RLDX-1 atteint un taux de succès de 86,8 % contre environ 40 % pour π0.5 (Physical Intelligence) et GR00T N1.6 (NVIDIA), soit un écart de plus de 45 points. Ces résultats, obtenus à la fois en simulation et sur des tâches en environnement réel, indiquent que l'architecture MSAT surpasse les VLA de référence sur des tâches impliquant des contacts riches, des dynamiques rapides et des contraintes sensorimotrices multiples. C'est précisément sur ce segment -- la manipulation dextre en conditions réelles, pas en démonstration contrôlée -- que le fossé entre recherche et déploiement industriel reste le plus large, et que ces chiffres méritent une validation indépendante avant d'être pris au pied de la lettre. Les VLA ont connu une accélération marquée depuis 2024, portés par RT-2 (Google DeepMind), OpenVLA, puis la série π0/π0.5 de Physical Intelligence et la famille GR00T de NVIDIA. RLDX-1 s'inscrit dans cette dynamique en cherchant à dépasser le paradigme "versatilité générale" pour cibler des capacités fonctionnelles élargies sur des robots humanoïdes haute-DoF. Aucune affiliation institutionnelle ou entreprise n'est clairement identifiée dans l'abstract publié -- le rapport reste à ce stade un preprint non revu par les pairs, sans annonce de déploiement ni calendrier de commercialisation. Les étapes naturelles suivantes incluront une validation indépendante des benchmarks et une évaluation sur des plateformes humanoïdes commerciales comme celles de Figure, Unitree ou Agility Robotics.

RobotiqueOpinion
1 source
BifrostUMI : des démonstrations sans robot pour la manipulation corps entier des humanoïdes
3979arXiv cs.RO 

BifrostUMI : des démonstrations sans robot pour la manipulation corps entier des humanoïdes

Une équipe de chercheurs a publié le 6 mai 2026 BifrostUMI (arXiv:2605.03452), un framework de collecte de données sans robot dédié à l'entraînement de politiques visuomotrices full-body pour robots humanoïdes. Le principe : un opérateur humain équipé d'un casque VR léger réalise des démonstrations manuelles, capturées sous forme de trajectoires de points-clés (keypoints) épars, tandis que des caméras montées au niveau des poignets enregistrent simultanément les données visuelles. Ces données multimodales alimentent ensuite un réseau de politique haut niveau qui apprend à prédire les trajectoires futures conditionnées aux features visuelles observées. Un pipeline de retargeting traduit ensuite ces trajectoires sur la morphologie du robot cible, qui les exécute via un contrôleur corps entier (whole-body controller). L'efficacité du framework est validée sur deux scénarios expérimentaux distincts, sans que les auteurs ne précisent les benchmarks quantitatifs de performance (temps de cycle, taux de succès par tâche) dans le résumé disponible. L'enjeu est direct pour quiconque tente de scaler l'entraînement d'humanoïdes : la télé-opération robotique reste le goulot d'étranglement principal de la collecte de données. Elle exige un accès permanent au hardware, un opérateur qualifié, et génère un flux de données lent et coûteux. BifrostUMI découple complètement la phase de démonstration du robot physique, ce qui ouvre la possibilité de collecter des démonstrations en masse, avec n'importe quel opérateur humain, dans n'importe quel environnement, sans mobiliser la plateforme mécanique. C'est précisément le verrou que les acteurs du secteur cherchent à lever : Figure AI, Physical Intelligence (pi) ou Apptronik dépendent tous de pipelines de collecte lents et onéreux. Si le sim-to-real gap reste un défi ouvert, l'approche keypoint avec retargeting propose une voie alternative au full imitation learning vidéo, en s'appuyant sur une représentation compacte et plus robuste aux variations morphologiques entre démonstrateur et robot. BifrostUMI s'inscrit directement dans la lignée de l'Universal Manipulation Interface (UMI) développé par Stanford, qui avait montré qu'un graspeur instrumenté suffit à générer des démonstrations transférables. Les auteurs étendent ce paradigme au corps entier des humanoïdes, un saut de complexité significatif donné le nombre de degrés de liberté à contrôler. Sur le marché, Physical Intelligence mise sur Pi-0 et ses variantes pour des politiques générales entraînées sur données téléopérées, tandis que Boston Dynamics, Unitree et Fourier Intelligence investissent massivement en infrastructure de télé-op. BifrostUMI, en tant que preprint non encore évalué par les pairs, reste une preuve de concept académique, sans déploiement industriel annoncé ni timeline de commercialisation. Les prochaines étapes naturelles seraient une évaluation comparative sur des benchmarks standardisés (RoboSuite, DROID) et une validation sur plusieurs morphologies humanoïdes différentes.

RobotiqueOpinion
1 source
Combler le fossé entre les corps : édition vidéo inter-embodiment disentangled
3980arXiv cs.RO 

Combler le fossé entre les corps : édition vidéo inter-embodiment disentangled

Une équipe de chercheurs a publié le 6 mai 2026 sur arXiv (réf. 2605.03637) un framework génératif pour convertir des vidéos de démonstration humaine en séquences d'exécution robotique plausibles, sans données appariées humain-robot. La méthode décompose la vidéo source en deux espaces latents orthogonaux: l'un encodant la tâche accomplie, l'autre la morphologie du corps en mouvement. Un double objectif contrastif impose cette séparation en minimisant l'information mutuelle entre les deux espaces pour garantir leur indépendance, tout en maximisant la cohérence intra-espace pour stabiliser les représentations. Un adaptateur à faible coût paramétrique injecte ces codes latents dans un modèle de diffusion vidéo figé, produisant des démonstrations robotiques morphologiquement précises et cohérentes dans le temps à partir d'une seule séquence humaine. L'enjeu est critique: les approches existantes génèrent des représentations enchevêtrées où l'information de tâche reste couplée à la cinématique humaine spécifique, ce qui bloque le transfert vers d'autres morphologies. En découplant explicitement ces deux dimensions, la méthode ouvre la voie à l'exploitation des vastes corpus de vidéos humaines disponibles sur internet pour entraîner des politiques de manipulation robotique, sans collecte de démonstrations robot coûteuse par télé-opération. Les expériences rapportent des vidéos générées temporellement consistantes et morphologiquement fidèles, bien que l'abstract ne fournisse pas de métriques quantitatives comparatives avec les baselines; les résultats visuels restent la principale validation. Pour un intégrateur ou un décideur industriel, la promesse est de réduire significativement le coût de labeling nécessaire à l'apprentissage de nouveaux comportements de manipulation. Cette publication s'inscrit dans une compétition intense autour des politiques de manipulation généralisables: Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA (UC Berkeley) cherchent tous à réduire la dépendance aux démonstrations robot propriétaires. L'approche par édition vidéo emprunte un chemin différent des VLA classiques: plutôt qu'apprendre une politique directement depuis des vidéos humaines, elle synthétise d'abord une démonstration robot plausible exploitable par les pipelines d'imitation learning standards. Il s'agit à ce stade d'un preprint préliminaire, sans déploiement industriel ni partenariat annoncé. Le cadre latent disentangled proposé pourrait néanmoins rapidement intéresser des acteurs comme 1X Technologies ou Apptronik, et côté européen, des équipes travaillant sur l'imitation learning comme certains labs INRIA ou des spin-offs de manipulation comme Enchanted Tools.

RechercheOpinion
1 source