Aller au contenu principal

Actualités IA — page 151

7 629 articles au fil, du plus récent au plus ancien.

RAG (Retrieval-Augmented Generation) : une approche pour optimiser l’usage de l’IA
3001Le Big Data 

RAG (Retrieval-Augmented Generation) : une approche pour optimiser l’usage de l’IA

La Retrieval-Augmented Generation, ou RAG, est une architecture technique qui associe un modèle de langage à une base documentaire externe, permettant à l'intelligence artificielle de consulter des informations précises avant de formuler une réponse. Concrètement, le processus se déroule en trois temps : les documents de l'entreprise sont d'abord découpés en fragments, puis convertis en représentations mathématiques appelées embeddings, qui transforment le sens d'une phrase en coordonnées numériques. Lorsqu'un utilisateur pose une question, sa requête est elle aussi encodée de cette façon, puis comparée aux vecteurs stockés pour identifier les passages les plus pertinents. Ces extraits sont ensuite injectés dans le prompt envoyé au modèle, qui rédige sa réponse à partir d'un contexte documenté et vérifiable. Contrairement à une recherche par mots-clés classique, le système reconnaît deux phrases sémantiquement proches même si elles n'ont pas de termes en commun. L'intérêt pour les entreprises est considérable. Les modèles de langage traditionnels fonctionnent uniquement à partir de leur corpus d'entraînement : toute information absente ou modifiée depuis génère inévitablement des erreurs, ce que les praticiens appellent les "hallucinations". Le RAG court-circuite ce problème en dotant l'IA d'une mémoire externe dynamique, mise à jour en temps réel. Un service client peut ainsi déployer un assistant conversationnel capable de consulter les procédures internes à jour avant chaque réponse, sans que les données quittent le périmètre de l'organisation. Pour des secteurs manipulant des documents sensibles, comme le juridique, la conformité ou l'ingénierie, cette architecture représente la différence entre un outil expérimental et un outil déployable en production. Le RAG s'est imposé comme l'une des réponses les plus pragmatiques aux limites structurelles des LLM depuis que ces modèles ont commencé à être déployés en entreprise à grande échelle. Les géants du cloud, d'AWS à Microsoft Azure en passant par Google Cloud, proposent désormais des services RAG managés, tandis qu'une constellation de startups comme Pinecone, Weaviate ou Qdrant se sont spécialisées dans les bases vectorielles qui en constituent le socle technique. La question qui reste ouverte est celle de la mise à l'échelle : indexer des dizaines de milliers de documents internes, maintenir la cohérence des embeddings lors des mises à jour, et gérer la latence de récupération sont des défis d'ingénierie non triviaux. Les prochaines évolutions du RAG s'orientent vers des architectures hybrides combinant recherche vectorielle et recherche structurée, ainsi que vers des systèmes capables de raisonner sur plusieurs documents simultanément plutôt que de simplement les concaténer.

LLMsTuto
1 source
Le travail et le code dans une seule IA ? Voici Vibe, la nouvelle ambition de Mistral
3002Le Big Data 

Le travail et le code dans une seule IA ? Voici Vibe, la nouvelle ambition de Mistral

Mistral a lancé le 28 mai 2026 Vibe, une plateforme qui fusionne productivité professionnelle et développement logiciel au sein d'un même environnement. Concrètement, Vibe n'est pas un outil entièrement nouveau : il s'agit d'une évolution substantielle de Le Chat, l'assistant IA que la startup française avait déjà déployé. La plateforme intègre désormais un mode Travail, un mode Code, une interface en ligne de commande et une extension VS Code inédite. Elle se connecte à des services tiers comme Slack, GitHub et Google Workspace, et permet à l'IA de lire des fichiers, modifier du code, exécuter des commandes et récupérer du contexte via des mentions "@" dans d'autres outils. L'extension VS Code s'affiche dans un panneau latéral qui prend automatiquement en compte les documents ouverts dans l'éditeur. L'ambition centrale de Vibe est l'unification : éliminer la fragmentation entre les dizaines d'outils qu'utilisent aujourd'hui les équipes techniques et les professionnels. Pour un développeur, pouvoir passer de la revue de code sur GitHub à la rédaction d'un document ou au suivi de projet sans changer d'interface représente un gain de temps potentiellement significatif. Pour les profils non techniques, l'idée d'un agent capable de gérer plusieurs étapes d'un workflow, planification, rédaction, coordination, depuis un seul endroit répond à une vraie friction quotidienne. Mistral positionne ainsi Vibe non plus comme un simple chatbot qui répond à des questions, mais comme un agent qui agit : une distinction que l'ensemble du secteur cherche à matérialiser depuis plusieurs mois. Mistral s'inscrit dans une course très disputée à l'assistant universel, où OpenAI avec ChatGPT, Anthropic avec Claude et Google avec Gemini occupent déjà des positions solides. La startup française, fondée en 2023 et valorisée à plusieurs milliards d'euros, mise sur son ancrage européen et sa maîtrise technique pour se différencier dans ce marché. Vibe représente un pivot stratégique clair : passer d'un fournisseur de modèles de langage à une plateforme applicative complète, capable de fidéliser des utilisateurs dans leur flux de travail quotidien. Reste la question de l'exécution. Les agents IA ont accumulé les promesses depuis un an avec des résultats souvent irréguliers, entre automatisations défaillantes et réponses approximatives dans des contextes complexes. La vraie mesure de Vibe se fera sur la durée et la fiabilité, face à des concurrents qui disposent de ressources considérables et d'écosystèmes déjà très bien établis.

OutilsOutil
1 source
L'ère des agents asynchrones : Walden Yan de Cognition et Cole Murray d'OpenInspect
3003Latent Space 

L'ère des agents asynchrones : Walden Yan de Cognition et Cole Murray d'OpenInspect

En mai 2026, Cognition, la startup à l'origine de l'agent de développement Devin, a annoncé une levée de fonds de série D d'un milliard de dollars, une opération largement sursouscrite malgré la multiplication des concurrents sur le marché. Walden Yan, cofondateur et directeur produit de l'entreprise, qui a également forgé l'expression "context engineering", s'est entretenu avec Cole Murray, créateur d'OpenInspect, pour analyser ce qu'ils nomment "l'ère des agents asynchrones". Les chiffres internes parlent d'eux-mêmes : Devin a multiplié par sept son volume de pull requests, et sa part dans les commits des dépôts de Cognition est passée de 16 % à 80 % depuis le tournant de décembre 2025, quand les modèles de langage ont franchi un seuil qualitatif déterminant. Ce virage vers les agents de fond marque une rupture nette avec les deux générations précédentes d'outils IA pour développeurs. La première vague, celle des Copilot et de l'autocomplétion de Cursor, accélérait le développeur sans jamais le sortir de la boucle : il regardait le modèle suggestion par suggestion, poussait le code interaction par interaction. La deuxième vague, celle des agents locaux comme Claude Code ou Windsurf, a multiplié les terminaux parallèles mais restait centrée sur le flux de travail individuel du développeur. Aujourd'hui, le modèle émergent repose sur des agents à qui l'on confie une tâche, un dépôt, une machine, un shell, un navigateur et des boucles de révision, puis qui travaillent en arrière-plan de façon autonome. Comme l'a formulé Michael Truell, fondateur de Cursor, l'outil ne sert plus à écrire du code, mais à construire "la fabrique qui crée le logiciel", composée de flottes d'agents traités comme des coéquipiers. Ce basculement s'opère dans un paysage industriel sous tension. D'un côté, des laboratoires d'agents valorisés à plusieurs dizaines de milliards de dollars comme Sierra, Decagon ou Cursor ; de l'autre, une prolifération de frameworks open source (LangGraph, Pydantic) et d'agents managés proposés par Anthropic, Google et Amazon qui facilite la construction en interne. Des entreprises comme Shopify, Stripe ou Razorpay ont déjà développé leurs propres agents de codage, et même Ramp, proche de Cognition, a bâti le sien avec Modal. Les défis techniques restent néanmoins considérables : séparation du cerveau et de la machine d'exécution, configuration initiale des dépôts, orchestration multi-agents, limites du protocole MCP, gestion de la mémoire, sécurisation des secrets dans des environnements isolés. Le flux "spec to pull request" devient une réalité en production, mais l'infrastructure qui le rend fiable et sécurisé reste un terrain de construction active pour tout le secteur.

OutilsOutil
1 source
Apple tente d'intégrer le grand modèle Gemini dans l'iPhone pour améliorer Siri
3004Ars Technica AI 

Apple tente d'intégrer le grand modèle Gemini dans l'iPhone pour améliorer Siri

Apple travaille à intégrer le modèle d'intelligence artificielle Gemini de Google directement dans l'iPhone pour transformer Siri en profondeur, selon un rapport de The Information publié à l'approche de la Worldwide Developers Conference (WWDC) prévue début juin 2026. Promis une première fois en 2024, le nouveau Siri dopé à l'IA générative a été repoussé à plusieurs reprises. La version finale s'appuiera sur un fonctionnement hybride : une partie du traitement se fera sur l'appareil, mais la majorité des opérations complexes sera déléguée aux serveurs cloud de Google et de Nvidia. Ce virage représente un recul significatif par rapport à la position historique d'Apple sur la confidentialité. La marque à la pomme a longtemps mis en avant le traitement local des données comme garantie de vie privée, en opposant son approche à celle des concurrents qui centralisent tout dans le cloud. Confier l'essentiel du traitement IA à Google soulève des questions concrètes pour les utilisateurs soucieux de leurs données personnelles : chaque requête adressée à Siri pourrait transiter par des infrastructures tierces. Pour l'industrie, cela confirme que même Apple, avec ses puces Neural Engine réputées optimisées pour l'IA, ne peut pas faire tourner des modèles de grande taille uniquement en local. Le problème technique est fondamental : les smartphones actuels manquent de RAM pour charger des modèles d'IA massifs en mémoire, et les NPUs (unités de traitement neuronal) restent moins performants que les GPU pour inférer de gros modèles, contrairement à ce que les discours marketing laissent entendre. Apple se retrouve dans une position délicate, coincée entre son positionnement premium sur la vie privée et la course aux capacités IA imposée par ses concurrents. Le partenariat avec Google, déjà actif pour le moteur de recherche sur Safari, s'étend ainsi au coeur de l'assistant vocal, renforçant une dépendance que la firme de Cupertino cherchait pourtant à réduire.

LLMsOpinion
1 source
La recherche NVIDIA montre que des robots entraînés en simulation peuvent accomplir des tâches réelles
3005Interesting Engineering 

La recherche NVIDIA montre que des robots entraînés en simulation peuvent accomplir des tâches réelles

NVIDIA a présenté huit travaux de recherche en robotique à l'International Conference on Robotics and Automation (ICRA) 2026, tous centrés sur la réduction du "sim-to-real gap" -- l'écart de performance entre un robot entraîné en simulation et ce même robot confronté au monde physique. Parmi les systèmes mis en avant, COMPASS entraîne des robots exclusivement dans Isaac Lab (le simulateur NVIDIA) avant de transférer les politiques apprises vers des corps physiques différents. Sur 20 essais réels impliquant des robots mobiles autonomes et des humanoïdes, le framework atteint un taux de succès de 80 % en navigation, soit 4,5 fois supérieur aux baselines par imitation learning. Le système Grasp-MPC, dédié à la préhension en environnement encombré, a été entraîné sur 2 millions de trajectoires simulées couvrant 8 000 objets distincts, et atteint 75 % de succès sur des objets inconnus contre 41 % pour les méthodes de référence. Le framework SPARR, appliqué à l'assemblage industriel, découpe la tâche en deux couches -- une politique apprise en sim, corrigée en temps réel sur le hardware réel -- et affiche 38 % de gain sur le taux de succès d'assemblage et 30 % de réduction du temps de cycle par rapport aux baselines zero-shot sim-to-real. Enfin, PEEK améliore l'attention visuelle des robots (filtrage du bruit visuel non pertinent), avec une précision multipliée jusqu'à 41 fois pour des politiques purement simulées. Une collaboration avec Carnegie Mellon, l'Université de l'Utah et l'Université de Sydney a produit SEAL, un framework qui contraint le robot à n'exécuter que les séquences d'actions cohérentes avec son raisonnement planifié. Ces résultats sont significatifs pour les intégrateurs et les décideurs industriels, car ils montrent que le sim-to-real gap -- longtemps considéré comme le verrou structurel de la robotique apprise -- commence à se refermer de façon mesurable, au moins en conditions de laboratoire. Le gain de 30 % sur le temps de cycle (SPARR) est un chiffre qui parle directement aux opérateurs de lignes d'assemblage. Il convient cependant de nuancer : les taux de succès rapportés (75-80 %) sont mesurés dans des protocoles contrôlés par les chercheurs eux-mêmes, sans déploiement industriel validé en production. Les vidéos sélectionnées pour illustrer ces travaux suivent les conventions habituelles des communications académiques, qui ne montrent pas les échecs. La progression reste réelle, mais le passage de 80 % à 99 % de fiabilité -- seuil requis pour la plupart des applications industrielles critiques -- reste un problème ouvert. NVIDIA positionne cette recherche comme la couche logicielle et de simulation de son écosystème robotique plus large, qui inclut Isaac Lab, Isaac GR00T X Embodiment Sim et Omniverse NuRec. La compagnie ne fabrique pas de robots mais ambitionne de devenir l'infrastructure sur laquelle l'industrie entraîne ses systèmes, face à des concurrents comme Google DeepMind (avec ses travaux sur RT-2 et Gemini Robotics), Meta (V-JEPA) et Physical Intelligence (pi0). Sur le segment de la simulation pour la robotique, des acteurs comme Mujoco (DeepMind) et Genesis (MIT/CMU) occupent également le terrain. Les prochaines étapes annoncées par NVIDIA passent par l'extension des datasets ouverts et la montée en échelle des plateformes de simulation, sans timeline de commercialisation précisée pour les frameworks présentés à l'ICRA.

RobotiquePaper
1 source
Claude Opus 4.8 d'Anthropic disponible : mode rapide 3 fois moins cher et alignement proche de Mythos
3006VentureBeat AI 

Claude Opus 4.8 d'Anthropic disponible : mode rapide 3 fois moins cher et alignement proche de Mythos

Anthropic a lancé le 28 mai 2026 Claude Opus 4.8, une mise à jour de son modèle phare, disponible immédiatement sur claude.ai, Claude Code, l'API et Cowork. La tarification standard reste inchangée par rapport à Opus 4.7 : 5 dollars par million de tokens en entrée et 25 dollars par million de tokens en sortie. La grande nouveauté est le mode rapide ("fast mode"), qui génère les tokens à environ 2,5 fois la vitesse normale et voit son prix chuter à 10 dollars par million de tokens en entrée et 50 dollars en sortie, soit une réduction de trois fois par rapport aux 30/150 dollars du mode rapide d'Opus 4.7. Sur les benchmarks, les progrès sont réels mais modestes : 88,6 % sur SWE-bench Verified (contre 87,6 % pour Opus 4.7), 69,2 % sur SWE-bench Pro (contre 64,3 %) et 74,6 % sur Terminal-Bench 2.1 (contre 66,1 %). Opus 4.8 surpasse également GPT-5.5 d'OpenAI sur au moins 12 benchmarks, notamment en raisonnement, en codage et en utilisation d'outils agentiques. Cette baisse tarifaire sur le mode rapide est significative pour l'industrie : elle rend l'inférence à haut débit accessible aux applications de production sensibles à la latence, un segment jusqu'ici réservé aux modèles moins puissants. Databricks a rapporté une réduction de 61 % du coût en tokens par rapport à Opus 4.7, grâce à une meilleure efficacité multimodale sur les PDF et diagrammes. La startup Cognition, éditrice de Devin, confirme que le modèle corrige des problèmes de verbosité et d'appels d'outils présents dans Opus 4.7. Un fournisseur spécialisé en computer-use a atteint 84 % sur le benchmark Online-Mind2Web, dépassant à la fois Opus 4.7 et GPT-5.5. Anthropic introduit également en préversion les "dynamic workflows" dans Claude Code, permettant de lancer des centaines de sous-agents en parallèle pour des tâches dépassant la capacité d'une seule fenêtre de contexte. Opus 4.8 s'inscrit dans une trajectoire d'accélération chez Anthropic, qui positionne ce modèle entre Opus 4.7 et Claude Mythos Preview, un modèle plus puissant actuellement limité à un petit nombre d'organisations dans le cadre du Project Glasswing, dédié à la cybersécurité. Anthropic a annoncé vouloir mettre des "modèles de classe Mythos" à la disposition de l'ensemble de ses clients dans les prochaines semaines, une fois des garde-fous cyber supplémentaires en place. La course au sommet se joue désormais sur plusieurs fronts simultanément : la puissance brute, le coût d'inférence et les capacités agentiques, trois axes où OpenAI, Google et les acteurs chinois comme DeepSeek ou Alibaba exercent une pression croissante sur Anthropic.

LLMsActu
1 source
De Google Remy à Gemini Spark : l’avènement de l’agent IA autonome
3007Le Big Data 

De Google Remy à Gemini Spark : l’avènement de l’agent IA autonome

Google a officiellement lancé Gemini Spark lors de la conférence Google I/O 2026, l'aboutissement d'un projet secret baptisé Remy, révélé plusieurs mois plus tôt par Business Insider. Développé en interne et testé en phase de dogfooding par les employés de Google via une version exclusive de l'application Gemini, cet agent autonome repose sur le modèle multimodal Gemini, doté d'une fenêtre de contexte de deux millions de tokens. Son architecture, baptisée Antigravity, orchestre plusieurs micro-agents spécialisés capables de planifier des tâches complexes, d'analyser leurs erreurs en temps réel et de corriger leur trajectoire avant d'agir. Le système dispose également d'une mémoire à long terme connectée aux données personnelles de l'utilisateur, stockant préférences, habitudes et relations pour assurer une continuité entre les sessions. Cette transition marque une rupture fondamentale avec les chatbots réactifs comme ChatGPT ou Gemini classique, qui nécessitent un prompt à chaque interaction avant de redevenir passifs. Gemini Spark inverse cette logique : l'utilisateur fixe un objectif global, et l'agent prend en charge l'exécution de manière proactive, pouvant suivre un projet sur plusieurs semaines, relancer des contacts ou compiler des données sans intervention manuelle. Pour les professionnels, cela représente une réduction concrète de la charge cognitive liée aux tâches répétitives de coordination et de logistique. L'IA cesse d'être un outil ponctuel pour devenir un collaborateur opérationnel permanent, capable d'anticiper les besoins sans attendre d'instruction explicite. Le nom de code Remy, inspiré du latin Remigus signifiant "rameur", résume l'ambition de Google DeepMind : une intelligence artificielle qui rame dans l'ombre pendant que l'utilisateur conserve le cap. Ce positionnement place Google en compétition directe avec OpenAI et ses propres initiatives d'agents autonomes, dans une course à l'IA agentique qui redéfinit les standards du secteur. La question de la supervision humaine reste centrale : pour les actions critiques, un contrôle reste requis, ce qui soulève des enjeux de sécurité, de gouvernance des données personnelles et de confiance dans des systèmes capables d'agir durablement en arrière-plan. Le déploiement de Gemini Spark dans la gamme grand public et professionnelle de Google constitue la première mise à l'échelle commerciale de cette vision, et ses suites détermineront dans quelle mesure les utilisateurs sont prêts à déléguer une part substantielle de leur activité numérique à une machine autonome.

LLMsOpinion
1 source
Créez une suite de tests évolutive pour votre agent avec la gestion de datasets dans Amazon Bedrock AgentCore
3008AWS ML Blog 

Créez une suite de tests évolutive pour votre agent avec la gestion de datasets dans Amazon Bedrock AgentCore

Amazon a annoncé une fonctionnalité de gestion de jeux de données dans Amazon Bedrock AgentCore, conçue pour stabiliser l'évaluation des agents d'intelligence artificielle. Le principe repose sur la constitution de jeux de tests versionnés : chaque scénario contient une entrée, une sortie attendue, des assertions à vérifier et la séquence d'outils que l'agent doit appeler. Ces jeux de données sont d'abord éditables dans un état brouillon, puis publiés en versions numérotées immuables. Une fois verrouillée, une version ne peut plus changer, ce qui garantit que deux évaluations successives comparent exactement les mêmes entrées. Lorsqu'un bug survient en production, la trace fautive est capturée et intégrée définitivement au jeu de test, de sorte que toute modification future de l'agent sera systématiquement confrontée à ce cas limite. L'enjeu est de taille parce que les agents LLM sont non-déterministes par nature : la même requête peut produire des réponses différentes d'une exécution à l'autre. Sans entrées stables, il est impossible de distinguer une vraie amélioration de l'agent d'une simple variation statistique du modèle. Par ailleurs, un juge LLM peut apprécier si une réponse semble pertinente, mais il ne peut pas vérifier si un cours boursier est exact, si une séquence d'appels d'outils s'est déroulée dans le bon ordre, ou si des données personnelles ont fuité entre deux sessions. Seule la vérité terrain, c'est-à-dire la réponse attendue et les assertions explicites, transforme un score subjectif en mesure vérifiable. C'est précisément ce que les datasets versionnés apportent : stabilité des inputs et ancrage dans le réel. La fonctionnalité répond à deux cycles de travail distincts dans le développement d'agents. Le premier est la boucle courte du développeur, qui modifie un outil, relance une évaluation et observe le score en quelques minutes : sans jeu de tests stable en dessous, une amélioration du score peut simplement signifier que les questions sont devenues plus faciles. Le second est la pipeline CI/CD, qui doit valider chaque changement avant déploiement. La plupart des équipes ont ce verrou, mais peu disposent d'un socle de scénarios versionnés avec assertions explicites, ce qui signifie qu'un pipeline peut valider une build simplement parce que les questions ont changé, ratant les régressions réelles. En ancrant les deux boucles sur le même dataset publié, Amazon Bedrock AgentCore vise à faire du score qui convainc le développeur en local le même score que celui que surveille la CI en production.

OutilsOutil
1 source
Claude Opus 4.8 est désormais disponible sur AWS
3009AWS ML Blog 

Claude Opus 4.8 est désormais disponible sur AWS

Anthropic a annoncé la disponibilité de Claude Opus 4.8, son modèle le plus avancé de la gamme Opus, sur Amazon Bedrock et sur la Claude Platform déployée sur AWS. Ce lancement permet aux équipes de développement d'intégrer le modèle directement dans leurs environnements AWS existants, tout en bénéficiant des garanties de sécurité entreprise, de résidence régionale des données et de la scalabilité d'infrastructure propres à Amazon. Pour les cas d'usage ne nécessitant pas de résidence régionale, le modèle est également accessible via la plateforme native d'Anthropic hébergée sur AWS. Techniquement, l'accès se fait via le SDK Anthropic avec l'identifiant de modèle us.anthropic.claude-opus-4-8, ou via les API Invoke et Converse d'Amazon Bedrock. Ce qui distingue Opus 4.8 de ses prédécesseurs, c'est sa capacité à maintenir un plan d'action sur plusieurs étapes successives, à suivre ce qui a été accompli et ce qui reste à faire, et surtout à se recorriger lorsqu'un blocage survient plutôt que de simplement s'arrêter sur une erreur. Pour les équipes qui automatisent des tâches longues et complexes, cette stabilité se traduit concrètement par moins de variance dans les sorties, moins de cycles de révision manuelle, et une supervision réduite des pipelines en production. En développement logiciel, le modèle est conçu pour naviguer dans de vraies bases de code, planifier avant d'éditer, et conserver le contexte sur des sessions prolongées. Les cas d'usage industriels ciblés incluent la recherche d'investissement et l'analyse de résultats financiers, la rédaction de contrats et de mémoires juridiques, la synthèse de littérature scientifique et de soumissions réglementaires en sciences du vivant, ainsi que l'analyse de menaces et la réponse à incident en cybersécurité. Ce lancement s'inscrit dans une stratégie de partenariat approfondi entre Anthropic et AWS, qui s'est notamment matérialisée par un investissement d'Amazon pouvant atteindre quatre milliards de dollars dans Anthropic. La disponibilité sur Bedrock est stratégique pour Anthropic, qui cherche à s'imposer comme fournisseur de référence pour les déploiements en entreprise, face à la concurrence directe d'OpenAI via Azure et de Google DeepMind via Vertex AI. Opus 4.8 représente le haut de gamme de la nouvelle génération Claude 4, une famille de modèles qui comprend également Sonnet 4.6 et Haiku 4.5, chacun positionné sur un équilibre différent entre performance et coût d'inférence. La prochaine étape pour Anthropic sera probablement d'élargir la disponibilité régionale du modèle sur Bedrock, et d'affiner ses capacités dans les domaines où la régulation de l'IA évolue rapidement.

LLMsActu
1 source
Anthropic frappe fort : Claude Opus 4.8 écrase déjà GPT-5.5 et Mythos arrive bientôt
3010Frandroid 

Anthropic frappe fort : Claude Opus 4.8 écrase déjà GPT-5.5 et Mythos arrive bientôt

Anthropic lance Claude Opus 4.8 le 28 mai 2026, disponible au même tarif que son prédécesseur direct Opus 4.7. La mise à jour introduit un mode rapide proposé à un coût trois fois inférieur, rendant le modèle plus accessible pour les applications à fort volume d'appels API. Anthropic annonce également un renforcement des capacités d'honnêteté du modèle, un axe de développement central dans sa philosophie d'alignement. Sur les benchmarks publiés, Opus 4.8 surpasse GPT-5.5 d'OpenAI sur plusieurs métriques de référence. En parallèle, l'entreprise a déjà déployé Mythos, un modèle encore plus puissant, auprès d'un cercle restreint d'utilisateurs, sans calendrier officiel de sortie grand public pour l'instant. Le maintien du tarif d'Opus 4.7 tout en livrant des performances supérieures constitue une pression directe sur la concurrence. La division par trois du coût du mode rapide ouvre des perspectives concrètes pour les entreprises qui déploient des pipelines à grande échelle, où le coût par token est déterminant. L'amélioration de l'honnêteté répond aux préoccupations croissantes des utilisateurs professionnels sur la fiabilité des modèles, notamment dans les contextes juridiques, médicaux et financiers. Cette sortie s'inscrit dans une course aux modèles qui s'est considérablement accélérée depuis début 2026, avec OpenAI, Google et Meta enchaînant les mises à jour majeures à un rythme sans précédent. L'existence de Mythos, maintenu en accès restreint malgré sa maturité opérationnelle, illustre la stratégie de déploiement graduel d'Anthropic, qui préfère affiner en cercle fermé avant d'ouvrir au grand public. La société fondée par Dario et Daniela Amodei se positionne ainsi comme un acteur qui mise sur la prudence et la performance simultanément, cherchant à capturer une clientèle entreprise exigeante sans sacrifier la sécurité.

LLMsOpinion
1 source
L'architecture radicale de DeepSeek fracasse l'avantage concurrentiel de Silicon Valley sur les tokens
3011VentureBeat AI 

L'architecture radicale de DeepSeek fracasse l'avantage concurrentiel de Silicon Valley sur les tokens

DeepSeek a officialisé cette semaine la pérennisation de sa réduction de prix de 75 % sur son modèle phare V4 Pro, transformant ce qui ressemblait à une offensive temporaire en une rupture structurelle du marché. Concrètement, V4 Pro est désormais sept fois moins cher en entrées et dix-sept fois moins cher en sorties que Claude Sonnet d'Anthropic ou le GPT-5.5-Med d'OpenAI. La version allégée DeepSeek V4 Flash, optimisée pour la vitesse, est quant à elle dix à vingt-cinq fois moins chère que Claude Haiku. En Chine, le prix de lecture du cache atteint un niveau quatre-vingt-sept fois inférieur à celui des grandes plateformes cloud occidentales, un écart si brutal que Xiaomi vient d'aligner sa propre architecture MiMo sur ce même barème tarifaire. Ces deux modèles sont distribués en open-weight sous licence MIT, offrant aux entreprises une liberté totale de déploiement. Malgré ce positionnement prix, V4 Pro affiche 80,6 % sur le benchmark SWE-bench Verified pour les tâches d'agents de code, et 87,5 sur l'indice MMLU-Pro, des scores proches des meilleurs modèles occidentaux. L'impact sur les entreprises utilisatrices est déjà tangible. Uber a révélé avoir épuisé l'intégralité de son budget 2026 alloué à Claude Code et Cursor en seulement quatre mois, son directeur des opérations jugeant les coûts liés à l'usage intensif de tokens de plus en plus difficiles à justifier. Airbnb préfère depuis longtemps des alternatives plus rapides et moins chères comme Qwen d'Alibaba plutôt que de déployer massivement les modèles d'OpenAI en production. Pinterest est allé encore plus loin : son directeur technique Matt Madrigal a confirmé que l'entreprise a intégralement misé sur l'open source, en affinant Qwen sur son graphe de préférences propriétaire pour réduire ses coûts de 90 %. La baisse de prix de DeepSeek rend de tels arbitrages encore plus attractifs, accélérant la commoditisation de la couche API à fort volume. Cette dynamique s'inscrit dans un contexte de pression croissante sur les grands laboratoires occidentaux, dont les investissements en infrastructure se chiffrent en dizaines de milliards de dollars. OpenAI, dont le modèle économique repose largement sur des flux API génériques, apparaît plus exposée qu'Anthropic, dont l'offre est davantage intégrée dans des workflows logiciels différenciés. Du côté de l'adoption en entreprise, les freins demeurent importants : pour les secteurs réglementés américains, finance, santé, défense, l'utilisation de modèles chinois soulève des questions de conformité, de risques liés à la chaîne d'approvisionnement logicielle et de potentielles sanctions fédérales. L'architecture open-weight permet certes un hébergement local sans transfert de données vers des serveurs étrangers, mais les comités de conformité restent prudents. Le marché semble donc se scinder en deux : un segment premium pour les workflows critiques, et une couche agentique de fond entièrement commoditisée par les poids ouverts.

BusinessOpinion
1 source
Automatiser le triage des alertes anti-blanchiment avec Amazon Q et Snowflake Cortex AI
3012AWS ML Blog 

Automatiser le triage des alertes anti-blanchiment avec Amazon Q et Snowflake Cortex AI

Amazon Web Services et Snowflake ont présenté une architecture conjointe permettant d'automatiser le traitement des alertes de lutte contre le blanchiment d'argent (LBA) dans les institutions financières. Lors de tests internes, le système construit sur Amazon Quick et Snowflake Cortex AI a réduit le temps d'investigation par alerte de 30 à 90 minutes à moins de 5 minutes. La solution repose sur le protocole MCP (Model Context Protocol), un standard ouvert qui permet à Amazon Quick Flows d'orchestrer des appels vers les agents Cortex de Snowflake sans connecteurs personnalisés, tout en maintenant une authentification OAuth. Concrètement, un analyste entre un identifiant d'alerte, et le système valide les données, interroge les transactions structurées via Cortex Analyst, fouille les documents de conformité via Cortex Search, puis génère automatiquement un rapport de disposition complet. L'enjeu est considérable pour les équipes de conformité des grandes banques : selon des études sectorielles, entre 90 et 95 % des alertes LBA sont des faux positifs. À raison de 30 à 90 minutes par alerte traitée manuellement, les départements compliance des établissements de taille moyenne à grande se retrouvent submergés de travail répétitif à faible valeur ajoutée. En automatisant la phase de triage, les deux plateformes permettent aux analystes de concentrer leur attention sur les cas réellement suspects, d'accélérer les délais réglementaires et de réduire les coûts opérationnels. La même logique d'orchestration peut s'appliquer à d'autres processus structurés similaires, comme le suivi des coûts cloud en FinOps, la gestion d'incidents pour les équipes SRE ou les enquêtes de conformité en général. Cette solution s'inscrit dans une tendance plus large de l'IA d'entreprise, qui évolue des simples assistants conversationnels vers des pipelines automatisés capables d'orchestrer plusieurs systèmes. Snowflake et AWS entretiennent déjà plus de 50 intégrations natives, incluant Amazon S3, AWS Glue, Amazon SageMaker et Amazon Bedrock. Amazon Quick, le service d'IA générative d'entreprise d'AWS, intègre désormais Quick Flows pour transformer des requêtes utilisateur en séquences d'appels standardisés sans code sur mesure. Le protocole MCP joue ici un rôle central en servant de langage commun entre les orchestrateurs et les agents spécialisés. À mesure que ces architectures se généralisent dans le secteur financier, la question n'est plus de savoir si l'IA peut automatiser la conformité, mais à quelle vitesse les institutions sauront déployer ces pipelines sur leurs propres infrastructures réglementées.

OutilsOutil
1 source
Data Formulator 0.7 : l'analyse de données d'entreprise par IA
3013Microsoft Research 

Data Formulator 0.7 : l'analyse de données d'entreprise par IA

Microsoft Research a publié Data Formulator 0.7, une nouvelle version de son système open source d'analyse de données alimenté par l'intelligence artificielle, destiné aux équipes entreprise. Cette mise à jour introduit une fonctionnalité centrale appelée Data Connectors, qui permet d'établir des connexions persistantes et réutilisables avec une large gamme de sources de données : bases de données relationnelles, entrepôts de données, systèmes BI, stockages objets et fichiers locaux. Les connexions sont gérées de façon centralisée, avec authentification, prévisualisation et gestion des métadonnées intégrées, ce qui évite aux équipes plateforme de reconstruire manuellement les mêmes intégrations à chaque projet. Des agents IA contextuels prennent ensuite en charge la préparation des données, l'exploration analytique et la génération de visualisations, sans que les utilisateurs aient besoin de maîtriser SQL ou la programmation. L'enjeu est significatif pour les entreprises qui jonglent quotidiennement avec des données éparpillées entre dizaines d'outils hétérogènes. Jusqu'ici, avant même de commencer une analyse, les équipes devaient gérer manuellement les permissions, préparer les métadonnées et assembler des pipelines pour croiser des sources disparates. Data Formulator 0.7 réduit ce fardeau en proposant un espace de travail unifié où les agents IA ont accès à l'ensemble du contexte analytique : sources connectées, tableaux chargés, graphiques précédents et objectif de l'utilisateur. En une seule interaction, un agent peut inspecter des données, écrire et exécuter du code dans un environnement isolé, générer des spécifications de graphiques et expliquer ses résultats étape par étape. Lorsqu'une requête est ambiguë, il pose des questions de clarification avant d'agir. Cela rend l'analyse complexe accessible aux experts métier qui n'ont pas de profil technique, tout en produisant un code vérifiable et reproductible pour chaque résultat. Data Formulator est développé par Microsoft Research dans un contexte où la demande d'outils d'analyse assistée par IA explose dans les grandes organisations. Les interfaces conversationnelles classiques, comme les chatbots généralistes, montrent leurs limites face aux workflows analytiques longs et ramifiés : elles manquent de mémoire persistante, d'accès aux données d'entreprise et de continuité de contexte entre les sessions. Data Formulator 0.7 tente de combler ce fossé avec un espace de travail multimodal et itératif où les équipes peuvent affiner leurs analyses au fil du temps et les partager en interne. Le projet est open source, ce qui laisse la porte ouverte à des contributions de la communauté et à une adoption progressive dans des environnements techniques variés. La prochaine étape naturelle sera d'observer comment cette approche s'intègre avec les infrastructures de données existantes des grands groupes, notamment face à des concurrents comme Databricks, Snowflake ou les outils BI traditionnels qui développent eux aussi leurs propres couches IA.

OutilsOutil
1 source
Data center, AGI, industrie : Mistral AI sur tous les fronts
3014Next INpact 

Data center, AGI, industrie : Mistral AI sur tous les fronts

Lors de l'AI Now Summit du 28 mai 2026, Mistral AI a enchaîné les annonces majeures. La startup parisienne rebaptise d'abord son chatbot LeChat en « Vibe », désormais capable de se connecter à Outlook, SharePoint, GitHub et Slack pour générer rapports, synthèses et graphiques, avec un mode Code intégré à VS Code et une interface CLI. L'offre s'étage d'une version gratuite à 14,99 dollars par mois pour les usages avancés. Sur le plan infrastructurel, Mistral annonce un nouveau centre de données aux Ulis (Essonne), déployant 10 MW dès le troisième trimestre 2026, qui vient s'ajouter aux sites de Bruyères-le-Châtel (40 MW) et de Borlänge en Suède (23 MW). L'entreprise prévoit 200 MW de capacité en 2027 et 1 GW d'ici 2030, pour un investissement actuel de 4 milliards d'euros. Mistral lance par ailleurs une plateforme industrielle combinant modèles d'IA, ingénierie et capacités robotiques, avec pour premiers partenaires Airbus, BMW, ASML et EDF, ce dernier dans le cadre d'un accord de cinq ans autour de la maintenance et de la construction des réacteurs EPR2. Ces annonces révèlent un pivot stratégique décisif pour Mistral : la startup ne se positionne plus seulement comme un fournisseur de modèles de langage, mais comme un opérateur d'infrastructure et un intégrateur industriel à part entière. En louant sa puissance de calcul à d'autres laboratoires d'IA, Arthur Mensch confirme à CNBC que « certains demandent déjà énormément de capacité », Mistral se dote d'un modèle économique hybride, moins dépendant des seuls abonnements grand public. Les partenariats avec des géants comme ASML, pour l'optimisation de composants semiconducteurs, ou BMW, pour des simulations d'accident multimodales, valident la crédibilité technique de la startup dans des secteurs à très haute exigence. Le contrat EDF, sur cinq ans, ancre Mistral dans les infrastructures critiques françaises. Fondée en 2023, Mistral AI s'est imposée comme le principal champion européen face aux géants américains OpenAI, Google et Anthropic. Le contexte politique et industriel lui est aujourd'hui favorable : l'Europe commence à traiter l'IA comme un actif stratégique comparable au gaz, selon Mensch lui-même, ce qui facilite les investissements publics et privés dans les infrastructures. Le retard continental en matière de datacenters devient un argument commercial pour Mistral, qui se présente comme le moyen de combler cet écart sans dépendre des hyperscalers américains. La prochaine échéance sera l'ouverture du site des Ulis au troisième trimestre, premier test concret de la capacité de Mistral à honorer ses ambitions d'opérateur à l'échelle du gigawatt.

BusinessOpinion
1 source
Les journaux de requêtes SQL donnent aux agents IA le contexte nécessaire pour éviter les jointures halluccinées
3015VentureBeat AI 

Les journaux de requêtes SQL donnent aux agents IA le contexte nécessaire pour éviter les jointures halluccinées

DataHub lance ce jeudi une nouvelle couche baptisée Context Intelligence, conçue pour résoudre l'un des problèmes les plus concrets des agents IA en entreprise : les erreurs de jointure sur des entrepôts de données massifs. Le déclencheur est parlant. Lorsque l'équipe data de Miro a branché ses agents IA directement sur son environnement Snowflake, ceux-ci produisaient de mauvaises réponses dans plus de 65 % des cas. La cause n'était pas le modèle de langage, mais l'absence de contexte : avec plus de 10 000 tables et aucune couche sémantique pour orienter les requêtes, les agents ne pouvaient pas savoir quelles données correspondaient à quelles questions métier. Context Intelligence répond à ce problème en exploitant les journaux de requêtes SQL existants pour construire un index sémantique, exposé ensuite aux agents via MCP, LangChain, le Google Agent Development Kit et CrewAI. La technologie s'appuie sur la même infrastructure d'extraction de logs que DataHub utilise depuis des années pour la traçabilité des données dans ses quelque 3 000 déploiements en production dans le monde. L'enjeu est considérable pour les équipes data des grandes organisations. Aujourd'hui, les agents IA qui génèrent du SQL à la volée n'ont accès qu'aux schémas bruts, sans connaître les jointures qui ont déjà fonctionné, les métriques validées par les équipes métier, ou la logique éprouvée encodée dans des années de requêtes d'analystes. Context Intelligence renverse cette logique : le moteur filtre les journaux de requêtes pour extraire ce que Shirshanka Das, co-fondateur et CTO de DataHub, appelle les "golden queries", c'est-à-dire les requêtes de haute qualité et les pipelines planifiés représentant une logique métier validée. Ces requêtes sont ensuite inversées en définitions textuelles structurées, appelées "semantic anchors", qui constituent la base de récupération dont les agents disposent avant de générer du SQL. Une couche de validation humaine, Context Hub, permet aux experts métier de réviser les définitions proposées, de résoudre les conflits entre équipes qui calculent la même métrique différemment, et de simuler l'impact des changements avant publication. DataHub est une société fondée par l'équipe qui a construit l'outil éponyme en open source chez LinkedIn, où Das a dirigé l'infrastructure data pendant près de onze ans. Le projet open source, mis à disposition du public début 2020 après six ans de développement interne, compte aujourd'hui plus de 15 000 contributeurs. PostgreSQL est la source la plus connectée dans la base mondiale de déploiements DataHub, devant MySQL, Oracle, Snowflake et Google BigQuery, avec plus de 100 sources de métadonnées supportées. Ce capital d'infrastructure est précisément ce qui distingue Context Intelligence d'une solution construite from scratch : les capacités d'extraction et de parsing de requêtes SQL mobilisées ici ont été forgées en production, pas pour ce lancement. "La couche de consommation a changé : ce ne sont plus des humains, ce sont des agents", résume Das. Le cas Miro illustre la suite logique : avec un index sémantique ancré dans l'historique réel des requêtes, les agents ont pu naviguer dans les 10 000 tables Snowflake avec une précision radicalement supérieure.

OutilsOutil
1 source
Google Pay se prépare pour les agents IA avec le Universal Commerce Protocol
3016AI News 

Google Pay se prépare pour les agents IA avec le Universal Commerce Protocol

Google Pay annonce une refonte majeure de son infrastructure de paiement pour anticiper l'essor des transactions initiées par des agents d'intelligence artificielle. L'entreprise a présenté le Universal Commerce Protocol (UCP), une nouvelle spécification destinée à standardiser la communication entre agents IA, systèmes de paiement et marchands. En parallèle, Google déploie un nouveau serveur baptisé Merchant Commerce Platform (MCP), qui fait office d'intermédiaire entre les développeurs d'agents et les backends commerciaux. D'autres composants complètent ce dispositif : des callbacks dynamiques pour l'API Android Pay, permettant des ajustements en temps réel pendant une transaction (recalcul des frais de livraison, mise à jour de la TVA), ainsi qu'une extension du support WebView pour autoriser des paiements natifs au sein d'applications tierces comme les réseaux sociaux. Ce basculement répond à un problème concret : les agents IA conçus pour réserver des vols, commander des fournitures ou effectuer des achats en ligne sont incapables de naviguer dans des tunnels de conversion pensés pour des humains, avec leurs clics, leurs formulaires et leurs pages de confirmation visuelles. En remplaçant ce modèle par une API stable et lisible par les machines, Google cherche à s'imposer comme la plaque tournante du commerce machine-à-machine. Pour les entreprises, les implications sont immédiates : si leurs données produits, leurs prix et leurs stocks ne sont pas exposés sous forme de données structurées exploitables par un agent, elles deviennent invisibles dans ce nouveau canal commercial. Le référencement ne se fera plus uniquement pour les humains, mais aussi pour les algorithmes qui décident des achats à leur place. Ce repositionnement intervient alors que l'ensemble de l'industrie tech anticipe une explosion des transactions autonomes. En centralisant les flux via son serveur MCP, Google obtient une vue privilégiée sur les tendances commerciales générées par les agents IA, ce qui soulève des questions de gouvernance des données et de dépendance à une plateforme propriétaire. Sur le plan de la sécurité, Google introduit une authentification biométrique inter-appareils : un agent peut demander à l'utilisateur de valider un achat depuis son téléphone, même si la transaction a été orchestrée depuis un ordinateur. Ce mécanisme établit un modèle de supervision humaine pour les transactions sensibles, mais la question de savoir quand un agent peut agir de façon entièrement autonome reste ouverte et sera probablement au cœur des prochains débats réglementaires et industriels.

OutilsOpinion
1 source
Microsoft lancera un nouveau modèle de code la semaine prochaine
3017The Information AI 

Microsoft lancera un nouveau modèle de code la semaine prochaine

Microsoft s'apprête à dévoiler une gamme de nouveaux modèles d'intelligence artificielle développés en interne lors de sa conférence annuelle Build, prévue la semaine prochaine à San Francisco. Parmi les annonces attendues figure un modèle spécialisé dans la génération de code, conçu pour renforcer GitHub Copilot, l'assistant de programmation appartenant à Microsoft. L'entreprise prévoit également de présenter plusieurs modèles déclinés en différentes tailles, chacun optimisé pour des tâches spécifiques : transcription audio, raisonnement, synthèse vocale et traitement d'images. Cette famille de modèles s'inscrit dans la continuité des premiers modèles maison que Microsoft avait présentés en avant-première plus tôt cette année. L'enjeu est considérable pour GitHub Copilot, qui avait pourtant pris une longueur d'avance significative sur le marché des assistants de codage alimentés par l'IA. Cet avantage s'est progressivement érodé face à la montée en puissance de concurrents comme Cursor et Claude Code d'Anthropic, qui ont su séduire une large communauté de développeurs. Microsoft cherche donc à reconquérir ce terrain perdu en proposant des modèles plus performants et mieux adaptés aux besoins concrets des programmeurs. La capacité à regagner la confiance de cette communauté représente un test majeur pour la crédibilité de la stratégie IA de la firme de Redmond. Cette initiative s'inscrit dans un contexte de compétition intense entre les grands acteurs de la technologie pour s'imposer auprès des développeurs, qui constituent un segment stratégique dans l'adoption des outils d'IA. Microsoft, qui a investi massivement dans OpenAI, cherche en parallèle à développer ses propres capacités pour réduire sa dépendance à des partenaires externes. La conférence Build est traditionnellement le moment choisi par l'entreprise pour annoncer ses ambitions en matière de plateforme et d'outillage. La montée en puissance des cas d'usage liés à la voix et à la transcription, de plus en plus plébiscités par les développeurs, explique par ailleurs pourquoi Microsoft intègre ces capacités dès le lancement de cette nouvelle famille de modèles.

LLMsActu
1 source
YouTube : Vous pouvez enfin dicter à l’IA ce que vous voulez regarder
3018Le Big Data 

YouTube : Vous pouvez enfin dicter à l’IA ce que vous voulez regarder

YouTube expérimente une nouvelle fonctionnalité permettant aux utilisateurs de décrire en langage naturel le type de contenu qu'ils souhaitent regarder. Baptisée "Votre flux personnalisé", cette option est actuellement testée auprès des utilisateurs américains sur mobile et sur le web. Le principe est simple : depuis l'onglet dédié en haut de la page d'accueil, l'utilisateur saisit une description libre, par exemple "des méditations guidées de moins de dix minutes" ou "des podcasts approfondis sur l'intelligence artificielle", et l'IA génère immédiatement une sélection de vidéos correspondante. Le flux peut être épinglé en haut de l'accueil pour un accès direct, modifié à tout moment via la barre de texte, et nécessite que l'historique de recherche et de visionnage soit activé dans les paramètres du compte. Cette évolution représente un changement de paradigme dans la façon dont YouTube pilote ses recommandations. Jusqu'ici, l'algorithme travaillait de manière opaque, déduisant les préférences des utilisateurs à partir de leurs comportements passés sans leur donner de levier direct. Avec ce nouveau système, la relation s'inverse : l'utilisateur exprime une intention explicite, ce qui réduit la frustration face à des recommandations hors sujet et donne l'impression d'un contrôle réel sur son expérience. Pour les créateurs de contenu, cela pourrait modifier les dynamiques de visibilité, en favorisant les vidéos qui répondent précisément à des requêtes formulées plutôt que celles optimisées pour l'historique passif. Pour les annonceurs et YouTube lui-même, un utilisateur qui exprime clairement ses envies est potentiellement plus engagé et donc plus rentable. Cette initiative s'inscrit dans une tendance de fond chez les grandes plateformes de contenu, toutes engagées dans une course à la personnalisation augmentée par l'IA. Spotify propose depuis longtemps des playlists générées automatiquement selon l'humeur ou l'activité, tandis qu'Instagram a récemment introduit davantage de contrôle sur les recommandations Reels, même si son système repose sur des catégories thématiques prédéfinies plutôt que sur du texte libre. YouTube, avec ses deux milliards d'utilisateurs mensuels et son catalogue quasi-illimité, a des raisons stratégiques d'aller plus loin : fidéliser face à TikTok, dont le flux algorithmique est redoutablement efficace mais entièrement subi. La question qui demeure est celle du déploiement à grande échelle et de la gestion des dérives, YouTube ayant prévu un mécanisme de signalement pour les suggestions problématiques. Si le test américain est concluant, une extension internationale, et donc francophone, semble inévitable dans les prochains mois.

OutilsOutil
1 source
NVIDIA Research fait progresser la robotique de la simulation au monde réel
3019NVIDIA AI Blog 

NVIDIA Research fait progresser la robotique de la simulation au monde réel

À l'occasion de l'International Conference on Robotics and Automation (ICRA) 2026, NVIDIA Research a présenté huit articles scientifiques parmi les 28 acceptés, tous centrés sur le transfert simulation-vers-réel en robotique. Les travaux couvrent l'ensemble de la chaîne de développement : coordination de bras multiples, navigation sur des morphologies de robots variées, préhension d'objets inconnus et manipulation de matières déformables. Parmi les systèmes présentés, ScheduleStream exploite les GPU pour planifier les mouvements de plusieurs bras robotiques en parallèle, atteignant une accélération de 3x par rapport aux approches séquentielles classiques, et tourne notamment sur la plateforme embarquée Jetson de NVIDIA. COMPASS, un cadre de politique de navigation, combine apprentissage par imitation et apprentissage par renforcement résiduel dans le simulateur Isaac Lab pour généraliser à des robots de morphologies très différentes, sans jamais utiliser de données réelles lors de l'entraînement. Résultat : un taux de succès moyen 4,5 fois supérieur à la référence, et environ 80 % de réussite sur 20 essais réels avec des robots mobiles autonomes et des humanoïdes. Grasp-MPC, de son côté, a été entraîné sur 2 millions de trajectoires simulées issues de 8 000 objets différents, apprenant à saisir des objets inédits dans des environnements encombrés avec un taux de succès de 75 %, contre 41 % pour la méthode de référence. L'importance de ces résultats tient à ce qu'ils résolvent des verrous concrets qui bloquaient l'industrialisation de la robotique. Former un robot à naviguer dans un environnement et devoir tout recommencer dès qu'on change de plateforme physique est un frein majeur au déploiement à grande échelle. COMPASS supprime ce problème en apprenant des compétences transférables entre corps mécaniques différents, ouvrant la voie à des flottes hétérogènes d'agents robotiques dans des entrepôts, des hôpitaux ou des usines. Grasp-MPC, lui, corrige en temps réel la trajectoire d'approche du robot dans les derniers centimètres, là où les systèmes à plan fixe échouent le plus souvent. Ces avancées signifient qu'il devient possible de déployer des robots capables de traiter des tâches non scriptées dans des environnements désordonnés et imprévisibles, sans recalibration permanente. Ces recherches s'inscrivent dans une mutation profonde du secteur : la robotique sort de l'ère des démos contrôlées pour entrer dans celle de l'autonomie généralisable. NVIDIA joue un rôle structurant dans cette transition en fournissant à la fois les outils de simulation (Isaac Lab, Omniverse NuRec pour les jumeaux numériques), les bibliothèques de calcul (cuRobo, GraspGen) et le matériel embarqué (Jetson). Le fait que COMPASS et Grasp-MPC atteignent des performances robustes sans aucune donnée réelle lors de l'entraînement est une preuve de maturité du sim-to-real. La prochaine étape sera l'intégration de modèles vision-langage-action capables de raisonner avant d'agir, plusieurs des papiers ICRA ouvrant déjà cette direction.

RobotiqueActu
1 source
Apple relance son offensive pour une IA locale, sans passer par le cloud
3020The Information AI 

Apple relance son offensive pour une IA locale, sans passer par le cloud

Lors de sa conférence annuelle des développeurs (WWDC), prévue le mois prochain, Apple devrait mettre en avant une série de mises à jour d'intelligence artificielle très attendues pour l'iPhone, tout en insistant sur une capacité souvent sous-estimée : celle de faire tourner des modèles d'IA directement sur ses appareils, sans passer par le cloud. Selon des personnes proches des plans de l'entreprise, Apple entend démontrer comment ses 15 ans d'expérience dans la conception de puces personnalisées pour l'iPhone, l'Apple Watch et les Mac lui confèrent un avantage concret pour exécuter des modèles d'IA localement. Cette approche contraste avec la norme du secteur, où la plupart des traitements IA s'effectuent dans des datacenters remplis de puces coûteuses. Certaines requêtes resteront néanmoins traitées dans le cloud, notamment celles qui nécessitent une complexité élevée ou un accès à de vastes bases de données en ligne : dans le cadre d'un accord avec Google, une nouvelle version de Siri fera tourner certaines requêtes sur Google Cloud, via une version sous licence du modèle Gemini. Apple a par ailleurs récemment approuvé une technologie de confidentialité développée par Nvidia pour cet environnement, ce qui suggère que l'entreprise utilisera également des puces Nvidia pour une partie de ses besoins de calcul dans Google Cloud. L'enjeu de l'IA embarquée est considérable : exécuter des modèles localement réduit la latence, améliore la confidentialité des données et diminue la dépendance à des infrastructures cloud onéreuses. Avec des milliards d'appareils Apple en circulation, la capacité à distribuer des traitements IA à cette échelle représente un levier différenciant face à des concurrents comme Google, Microsoft ou OpenAI, dont les offres reposent quasi exclusivement sur des serveurs distants. Apple accuse un retard significatif sur ses rivaux dans la course à l'IA générative. La WWDC du mois prochain sera donc un moment clé pour démontrer que la maîtrise du matériel, via ses puces Apple Silicon, peut constituer une réponse crédible à ce retard. La coexistence d'une stratégie on-device et d'un recours au cloud via des partenaires comme Google et Nvidia illustre la complexité de la position d'Apple : rattraper rapidement les leaders du secteur tout en préservant les promesses de confidentialité qui sont au coeur de son identité de marque.

InfrastructureOpinion
1 source