Aller au contenu principal

Actualités IA — page 68

7 595 articles au fil, du plus récent au plus ancien.

Amazon et l'université du Michigan dotent des robots d'un sens du toucher
1341Amazon Science 

Amazon et l'université du Michigan dotent des robots d'un sens du toucher

Amazon et l'Université du Michigan ont développé HydroShear, un nouveau simulateur physique qui donne aux robots un véritable sens du toucher pour manipuler des objets avec précision. Le projet s'attaque à un problème resté sans solution malgré des années de recherche : modéliser le cisaillement tactile, c'est-à-dire les forces qui apparaissent quand un objet glisse ou tourne au contact d'un capteur. Les équipes se sont appuyées sur des capteurs tactiles à base de vision, comme le GelSight Mini, dont les caméras intégrées dans des embouts souples capturent la géométrie du contact. Pour calibrer leur simulateur, les chercheurs ont collecté des données réelles avec un bras robotique, isolant quatre paramètres clés : la dissipation des forces sur la surface du capteur, l'accumulation des forces tangentielles et normales, et le coefficient de friction entre l'objet et l'élastomère. Résultat : des politiques de manipulation entraînées entièrement en simulation ont été transférées sans aucune modification vers des robots réels, avec un taux de réussite moyen de 93% sur quatre tâches complexes, dont l'insertion de chevilles cylindriques. Cette avancée compte parce qu'elle lève un verrou majeur pour l'automatisation dans des secteurs comme la logistique entrepôt ou l'assistance chirurgicale, où les robots doivent accomplir des tâches délicates nécessitant un contact fin avec les objets. Jusqu'ici, les simulateurs de physique peinaient à reproduire fidèlement les forces tactiles subtiles : les méthodes basées sur les éléments finis sont précises mais trop lentes pour entraîner des politiques d'apprentissage par renforcement à grande échelle, tandis que les approximations plus rapides simplifient à l'excès la dynamique du contact et ratent des événements critiques, comme l'instant où un objet saisi commence à glisser. En résolvant ce compromis, Amazon et l'université ouvrent la voie à des robots capables d'apprendre des compétences de manipulation dextre directement en simulation, sans coûteuses phases d'essais physiques, ce qui pourrait accélérer le déploiement de robots plus habiles dans l'industrie et réduire les coûts de développement. L'innovation centrale de HydroShear repose sur ce que les chercheurs appellent le suivi de force dépendant du chemin parcouru, une extension des modèles de contact hydroélastique existants. Contrairement aux méthodes classiques qui calculent les forces uniquement à partir du contact instantané, HydroShear conserve en mémoire l'historique du mouvement de l'objet sur le capteur, suivant individuellement chaque point de contact pour modéliser la déformation de l'élastomère souple. Le système gère des mouvements en trois dimensions complets, incluant l'inclinaison et le roulement, et peut être parallélisé sur GPU pour permettre un entraînement à grande échelle. Cette capacité à combiner fidélité physique et rapidité de calcul pourrait redéfinir la manière dont l'industrie robotique conçoit et entraîne ses systèmes de préhension, ouvrant la voie à une nouvelle génération de robots capables de manipuler des objets avec une dextérité proche de celle de la main humaine.

RobotiqueActu
1 source
Tencent va racheter une participation majoritaire dans Manus après que Pékin a forcé Meta à annuler son accord de 2 milliards de dollars
1342The Decoder 

Tencent va racheter une participation majoritaire dans Manus après que Pékin a forcé Meta à annuler son accord de 2 milliards de dollars

Tencent négocie le rachat d'une participation majoritaire dans Manus, la startup chinoise spécialisée dans les agents IA, sur la même valorisation de 2 milliards de dollars que celle initialement envisagée par Meta, selon des informations du Financial Times. Cette opération intervient après que Pékin a bloqué puis contraint Meta à abandonner son propre projet de rachat de Manus, conclu pourtant à la même valorisation. Tencent, géant chinois de la tech propriétaire de WeChat, y voit des synergies directes avec ses propres ambitions dans le domaine des agents conversationnels et autonomes. Le fonds d'investissement américain Benchmark, actionnaire historique de Manus, ne devrait en revanche pas participer à ce nouveau tour de table. Cette transaction illustre la volonté de Pékin de garder le contrôle sur ses pépites technologiques stratégiques, en particulier dans le secteur naissant mais jugé critique des agents IA capables d'exécuter des tâches complexes de façon autonome. En bloquant l'entrée de Meta au capital de Manus, les autorités chinoises envoient un signal clair : les actifs d'intelligence artificielle jugés sensibles doivent rester sous contrôle national ou revenir à des acteurs chinois, quitte à écarter des investisseurs étrangers prêts à mettre le même prix. L'épisode s'inscrit dans un climat de rivalité technologique croissante entre la Chine et les États-Unis, où chaque camp cherche à sécuriser ses propres champions de l'IA sans dépendre de capitaux ou de technologies rivales. Pour Tencent, l'opération renforcerait sa position face à des concurrents comme Alibaba ou ByteDance sur le marché des agents IA, un segment que le groupe compte intégrer plus profondément à son écosystème WeChat, utilisé par plus d'un milliard de personnes.

BusinessActu
1 source
Google's TabFM se passe d'entraînement par jeu de données et prédit quand même sur des tables jamais vues
1343VentureBeat AI 

Google's TabFM se passe d'entraînement par jeu de données et prédit quand même sur des tables jamais vues

Google Research a dévoilé TabFM, un modèle de fondation capable de faire des prédictions sur des données tabulaires sans jamais être entraîné sur le jeu de données concerné. Grâce à l'apprentissage en contexte, TabFM produit ses résultats en un seul passage avant, à partir d'un prompt unique combinant les exemples historiques et les nouvelles lignes à prédire. Selon Weihao Kong, chercheur chez Google Research, ce modèle épargne aux équipes data les pipelines classiques de nettoyage, d'imputation des valeurs manquantes et d'encodage des variables catégorielles, ainsi que les boucles répétitives d'optimisation d'hyperparamètres portant sur le taux d'apprentissage, la profondeur des arbres ou les ratios de sous-échantillonnage. TabFM s'appuie sur deux architectures antérieures : TabPFN, développée par la société Prior Labs, qui avait le première démontré la faisabilité d'une classification zéro-shot sur de petits tableaux, et TabICL, conçue par l'Institut national de recherche en sciences et technologies du numérique en France, qui a résolu les limites de passage à l'échelle grâce à une technique de compression des lignes. Pour les développeurs et ingénieurs en entreprise, l'enjeu est concret : ce qui nécessitait auparavant des semaines de construction de pipelines peut désormais tenir en un simple appel API. Prenons l'exemple d'un analyste cherchant à prédire le désabonnement d'un client : au lieu d'entraîner un modèle XGBoost sur mesure, il lui suffit de transmettre à TabFM un échantillon de données de sessions passées accompagné de la session active à évaluer, pour obtenir instantanément une probabilité de churn. Cette approche supprime aussi la dette opérationnelle liée à la surveillance de la dérive des données et au réentraînement périodique des modèles, un fardeau récurrent pour les équipes qui maintiennent des systèmes de machine learning en production. Cette avancée s'inscrit dans un mouvement plus large : alors que les modèles génératifs de texte et de vision sont depuis longtemps passés à l'inférence zéro-shot par simple prompt, les données tabulaires, qui représentent pourtant la majorité des données d'entreprise stockées dans les entrepôts, les CRM et les registres financiers, étaient restées à l'écart de cette évolution. La raison tient aux limites des grands modèles de langage face aux tableaux : leur fenêtre de contexte sature vite face à des tableaux de quelques milliers de lignes, leur tokenisation fragmente maladroitement les valeurs numériques, et la mise à plat d'une structure à deux dimensions en texte linéaire leur fait perdre la correspondance entre lignes et colonnes. TabFM contourne ce problème en traitant directement les données comme une grille, préservant leur intégrité structurelle plutôt que de les forcer dans une chaîne de texte.

RechercheActu
1 source
Nemotron 3 : affinement des modèles NVIDIA avec la personnalisation serverless d'Amazon SageMaker AI
1344AWS ML Blog 

Nemotron 3 : affinement des modèles NVIDIA avec la personnalisation serverless d'Amazon SageMaker AI

Amazon vient d'annoncer l'intégration de la personnalisation de modèles serverless pour les modèles NVIDIA Nemotron 3 au sein d'Amazon SageMaker AI. Deux versions sont concernées: Nemotron 3 Nano, qui compte 30 milliards de paramètres au total dont 3 milliards actifs, et Nemotron 3 Super, plus imposant avec 120 milliards de paramètres au total dont 12 milliards actifs. Les entreprises peuvent désormais affiner ces modèles open-weight via trois techniques disponibles sans avoir à provisionner ni gérer la moindre infrastructure: le fine-tuning supervisé classique (SFT), l'apprentissage par renforcement avec récompenses vérifiables (RLVR), et l'apprentissage par renforcement avec retour d'IA (RLAIF). Nemotron 3 repose sur une architecture hybride combinant Mamba et Transformer sous forme de mélange d'experts (MoE), capable de gérer des contextes allant jusqu'à un million de tokens. Elle entrelace trois types de couches complémentaires: des couches Mamba-2 pour un traitement séquentiel rapide en temps linéaire, des couches d'attention Transformer pour un rappel associatif précis, et des couches de mélange d'experts latent qui compressent les tokens avant de les router vers des experts spécialisés. Résultat, seule une fraction des paramètres totaux est activée à chaque passage, comme les 12 milliards sur 120 pour la version Super, ce qui garantit un débit élevé à moindre coût de calcul. Pour les entreprises, affiner un modèle sur leurs propres données ne relève plus seulement de l'optimisation technique: cela revient à créer une propriété intellectuelle propriétaire, encodant leur savoir-faire, leur vocabulaire métier et leur ton de marque directement dans l'architecture du modèle. Cette approche permet souvent à des modèles plus petits et ouverts d'égaler, voire de dépasser, les performances de modèles propriétaires bien plus volumineux, tout en gardant les données sensibles dans une infrastructure privée et sécurisée. Pour les charges de travail à fort volume impliquant plusieurs agents, comme le codage ou le triage de cybersécurité, ce type d'avantage devient un facteur de compétitivité difficile à répliquer avec des modèles génériques du marché. Les deux modèles ont été entraînés via NeMo Gym, un système d'apprentissage par renforcement multi-environnements qui les aligne sur des tâches agentiques réelles en plusieurs étapes, couvrant le codage, le raisonnement et l'analyse de contextes longs. Nemotron 3 Nano affiche un débit quatre fois supérieur à son prédécesseur Nemotron 2 Nano, le rendant particulièrement adapté aux charges de travail multi-agents à fort volume où coût et latence sont critiques. Nemotron 3 Super, de son côté, cible les applications multi-agents complexes comme le développement logiciel, misant sur une capacité de raisonnement accrue tout en conservant une efficacité de calcul élevée.

OutilsActu
1 source
Vérification en temps réel des images dentaires avec Amazon SageMaker AI chez Henry Schein One
1345AWS ML Blog 

Vérification en temps réel des images dentaires avec Amazon SageMaker AI chez Henry Schein One

Henry Schein One a mis en production Image Verify, un système de vérification de la qualité des radiographies dentaires basé sur Amazon SageMaker AI, capable d'évaluer une image en temps réel dès sa capture. Jusqu'à 20 % des demandes de remboursement d'assurance dentaire sont initialement rejetées, les images manquantes ou de mauvaise qualité figurant parmi les causes principales. Auparavant, ce contrôle qualité se faisait manuellement, souvent des heures ou des jours après la prise du cliché, quand le patient avait déjà quitté le cabinet. Développé par l'équipe Platform Services de Henry Schein One, intégré nativement aux plateformes de gestion Dentrix et Dentrix Ascend, Image Verify attribue à chaque radiographie un score de qualité sur une échelle de 1 à 5 en moins de trois secondes, permettant au technicien de reprendre le cliché immédiatement si nécessaire. Le projet, conçu à l'automne 2025, était déployé dans 250 cabinets quelques semaines après son lancement, puis dans plus de 10 000 établissements fin avril 2026, soit une multiplication par 43. Plus de 11 millions de radiographies ont déjà été traitées, à un rythme de 1,5 million par semaine, et Henry Schein One vise désormais 40 000 sites répartis sur quatre régions du monde. Cette avancée change concrètement le quotidien des cabinets dentaires : moins de patients rappelés pour reprendre un cliché, des demandes de remboursement mieux documentées et donc moins de rejets, un outil de formation plus efficace pour les nouveaux technicien(ne)s, et un effet de gamification qui encourage l'engagement du personnel autour de la qualité des images. En comblant l'écart entre la capture de l'image et son évaluation, Image Verify évite les allers-retours coûteux en temps et en argent, aussi bien pour les praticiens que pour les patients. Henry Schein One insiste sur le fait qu'il s'agit d'un outil de qualité, et non de diagnostic : le système ne cherche pas à détecter une pathologie, il répond uniquement à la question de savoir si l'image est exploitable cliniquement. Cette distinction a permis à l'équipe d'itérer rapidement sans se heurter aux contraintes réglementaires propres à l'IA à visée diagnostique. Techniquement, la bascule vers AWS n'était pas une simple migration : elle imposait de répondre simultanément à cinq exigences difficiles à concilier en environnement clinique. Il fallait une latence inférieure à trois secondes pour ne pas perturber le flux de travail, une précision suffisante pour que plusieurs modèles de machine learning évaluent la netteté, l'alignement et l'exhaustivité des clichés sans multiplier les faux positifs qui érodent la confiance des cliniciens, une capacité à servir des dizaines de milliers de sites avec des volumes quotidiens de centaines de milliers d'images, une inférence GPU maîtrisée en coûts malgré cette échelle, et un déploiement cohérent sur plusieurs régions du globe. La solution précédente de Henry Schein One, hébergée sur un autre cloud, ne parvenait pas à tenir ces contraintes de latence et de coût. Le succès rapide d'Image Verify, passé du concept au déploiement à grande échelle en six mois, illustre la montée en puissance de l'IA appliquée aux flux cliniques du quotidien, au-delà des cas d'usage diagnostiques plus médiatisés.

OutilsActu
1 source
Construire une couche sémantique pour l'IA à base d'agents sur AWS avec Stardog et Amazon Bedrock AgentCore
1346AWS ML Blog 

Construire une couche sémantique pour l'IA à base d'agents sur AWS avec Stardog et Amazon Bedrock AgentCore

AWS et Stardog ont présenté une architecture technique permettant de déployer une couche sémantique pour des agents d'intelligence artificielle directement sur les infrastructures cloud d'Amazon, sans extraction, transformation ni chargement de données (ETL). Le dispositif repose sur l'application Semantic AI de Stardog, connectée simultanément à Amazon Aurora et Amazon Redshift, et pilotée par un agent Strands Agents hébergé sur Amazon Bedrock AgentCore. Concrètement, cet agent peut répondre à des questions dites de « vision client à 360 degrés » en interrogeant les deux bases de données en même temps, sans qu'un ingénieur ait besoin de dupliquer ou de fusionner préalablement les données. Le même déploiement Stardog fonctionne aussi derrière d'autres services de calcul AWS, comme Amazon EKS, Amazon ECS ou AWS Lambda. Le choix d'AgentCore s'explique par le fait que ce service regroupe en une seule solution gérée l'authentification des accès entrants, l'hébergement de l'agent et la gestion des identifiants pour les outils tiers. Cette annonce s'inscrit dans un mouvement plus large que les auteurs appellent « l'analytique agentique », prolongement logique de vingt ans d'évolution des outils décisionnels, des rapports programmés aux tableaux de bord, puis au libre-service analytique. Jusqu'ici, même les outils en libre-service dépendaient d'un modèle de données déjà construit par un ingénieur, l'analyste humain restant le point de passage obligé pour toute question sortant du cadre prévu. Les agents génératifs promettent de lever ce goulot d'étranglement en raisonnant directement sur les données en temps réel, en écrivant leurs propres requêtes et en les affinant de manière autonome. Pour les entreprises, l'enjeu est direct : accélérer l'accès à une réponse fiable sans multiplier les développements sur mesure, tout en évitant le piège des réponses incohérentes lorsque deux agents interrogent des sources différentes pour la même question métier. Le véritable obstacle, selon AWS, n'est plus la capacité des modèles de fondation disponibles sur Bedrock à planifier des tâches complexes ou à générer du SQL, mais la fragmentation des données d'entreprise elles-mêmes. Un « client » n'a souvent pas la même définition dans un système de gestion de la relation client (CRM) que dans un système de facturation, tout comme le « chiffre d'affaires » peut varier selon l'équipe qui le calcule. Sur AWS, ces données sont réparties entre Aurora et les bases RDS pour les données opérationnelles, Redshift pour l'historique analytique, et S3 combiné à Athena pour les données non structurées, notamment via des formats ouverts comme Apache Iceberg. La génération augmentée par récupération (RAG), utilisée via Amazon Bedrock Knowledge Bases, fonctionne bien pour retrouver des passages de texte, mais s'avère insuffisante dès qu'une question exige de croiser des enregistrements entre systèmes tout en respectant des règles métier et des politiques d'accès aux données, d'où l'intérêt d'une couche sémantique dédiée.

OutilsActu
1 source
Scaling des workflows à base d'agents grâce à la gestion native des cas dans Amazon Quick Automate
1347AWS ML Blog 

Scaling des workflows à base d'agents grâce à la gestion native des cas dans Amazon Quick Automate

L'article, disponible depuis mardi sur le blog technique d'AWS, détaille comment Amazon Quick Automate intègre désormais une gestion native des dossiers (case management) pour piloter des workflows agentiques à grande échelle. Le problème identifié est simple : un agent IA peut traiter une facture ou classer un ticket support isolément en démonstration, mais faire tourner ces agents sur des milliers, voire des millions d'éléments de travail en production pose des défis d'un tout autre ordre. Chaque élément de travail devient un "case" qui persiste tout au long de son cycle de vie, offrant une visibilité étape par étape sur l'état du workflow, la possibilité pour un humain d'intervenir quand un jugement est nécessaire, et une exécution parallèle permettant d'orchestrer plusieurs agents simultanément. Quick Automate combine ainsi agents IA et orchestration de workflows au sein d'Amazon Quick, avec des contrôles natifs comme la gestion fine des accès, la journalisation d'activité, le contrôle de version, la gestion des exceptions et l'intervention humaine (HITL, human-in-the-loop). L'accès nécessite une licence Enterprise et les workflows sont spécifiques à chaque région AWS. Cette avancée répond à un vrai point de friction pour les entreprises qui cherchent à déployer l'IA agentique au-delà du stade du prototype. La gestion de cas apporte une visibilité accrue : les responsables de processus voient exactement où en est chaque élément de travail, tandis que les managers peuvent surveiller le débit, repérer les goulots d'étranglement en amont et intervenir avant que les retards n'affectent l'activité. Le traitement parallèle de plusieurs cas augmente le débit et aide les organisations à respecter leurs engagements de niveau de service (SLA). Sur le plan de la conformité, chaque action, décision et transition d'état est enregistrée dans l'historique du dossier, ce qui renforce l'auditabilité et la gouvernance, un enjeu central pour les secteurs régulés comme la finance ou l'assurance. Les mises à jour de statut en temps réel remplacent aussi les échanges d'e-mails fragmentés par une collaboration centralisée, avec une propriété claire des tâches et moins de transmissions perdues entre équipes. Cette fonctionnalité s'inscrit dans une tendance plus large de l'industrie cloud à combler le fossé entre les démonstrations d'agents IA et leur déploiement opérationnel réel. Amazon, comme ses concurrents Microsoft et Google, mise sur des couches d'orchestration et de gouvernance pour rendre l'IA agentique exploitable en entreprise, au-delà de la simple capacité de raisonnement des modèles. Le billet AWS illustre ce dispositif avec un modèle dit "créateur-processeur" permettant une mise à l'échelle dynamique, ainsi qu'un cas d'usage concret combinant suivi de cas et intervention humaine. Reste à voir si cette approche, encore réservée aux clients disposant d'une licence Enterprise, se généralisera à mesure que les organisations cherchent à industrialiser leurs premiers projets d'agents IA.

OutilsOutil
1 source
Déploiement de modèles quantifiés sur Amazon SageMaker AI avec Unsloth
1348AWS ML Blog 

Déploiement de modèles quantifiés sur Amazon SageMaker AI avec Unsloth

Déployer des modèles quantifiés en production coûte cher lorsqu'ils restent en pleine précision 16 bits (BF16 ou FP16), car cela impose des instances GPU volumineuses et ralentit les cycles d'itération. Amazon Web Services a publié, avec Unsloth, un article co-écrit par Daniel Han et Michael Han détaillant comment déployer des modèles quantifiés dynamiquement sur son infrastructure. Unsloth propose une méthode appelée quantification dynamique, qui ne réduit pas uniformément la précision de toutes les couches d'un modèle. Selon Daniel Han, cofondateur d'Unsloth, un modèle nécessitant initialement 1,5 To de mémoire peut être ramené à 217 Go grâce à cette technique, soit une réduction de 86 % de la taille, pour seulement 14 % de perte de précision. Concrètement, un modèle standard utilise 16 bits par paramètre ; une quantification à 4 bits réduit la taille de 75 %, ce qui fait passer un modèle de 8 milliards de paramètres d'environ 16 Go à environ 5 Go. Le processus se déroule en trois étapes : une analyse couche par couche pour mesurer la sensibilité de chacune à la perte de précision, une allocation dynamique du nombre de bits qui conserve une précision élevée (par exemple 16 bits) pour les couches critiques tout en compressant fortement les autres (4 bits ou moins), puis un réglage fin pour que la qualité globale reste proche de l'original malgré la compression. Cette approche change trois paramètres essentiels au moment du déploiement sur AWS. D'abord le choix de l'instance : un modèle qui nécessitait auparavant plusieurs GPU peut désormais tourner sur un seul GPU, voire sur CPU. Ensuite, le profil de démarrage et de stockage : des fichiers de modèle plus légers se déplacent, se stockent et se déploient plus rapidement entre environnements. Enfin, la flexibilité de déploiement : les équipes peuvent choisir un fichier plus compact pour une inférence sensible aux coûts, une version plus fidèle pour les cas exigeant une haute qualité, ou une représentation fusionnée pour un débit plus élevé. Pour les entreprises qui opèrent des modèles de fondation à grande échelle, ces gains de mémoire et de coût peuvent se traduire par des économies substantielles sur la facture cloud. L'article présente quatre schémas de déploiement pour des modèles déjà quantifiés avec Unsloth sur l'infrastructure AWS : l'utilisation directe d'instances Amazon EC2, le service managé Amazon SageMaker AI pour l'inférence, ainsi qu'une intégration via Amazon EKS ou Amazon ECS lorsque l'inférence doit s'insérer dans une architecture de conteneurs existante. Cette publication s'inscrit dans une tendance plus large où les fournisseurs cloud et les éditeurs d'outils open source collaborent pour rendre les grands modèles de langage plus accessibles économiquement, alors que la course à des modèles toujours plus volumineux continue de faire grimper les coûts d'inférence pour les entreprises qui les déploient en production.

OutilsActu
1 source
KTern.AI développe une IA à base d'agents pour SAP sur Amazon Bedrock AgentCore
1349AWS ML Blog 

KTern.AI développe une IA à base d'agents pour SAP sur Amazon Bedrock AgentCore

Comment KTern.AI, plateforme de transformation digitale dédiée à SAP, a bâti son IA agentique sur Amazon Bedrock AgentCore en s'appuyant sur le kit Strands Agents SDK. KTern.AI est partenaire SAP Spotlight et opère une plateforme certifiée SAP de Digital Transformation as a Service, structurée autour de cinq automatisations : Digital Maps, Digital Projects, Digital Process, Digital Labs et Digital Mines. Son moteur propriétaire de connaissance institutionnelle encode des années de patterns de transformation SAP et de bonnes pratiques, permettant, combiné à une hyperautomatisation pilotée par la donnée, des transformations sept fois plus rapides avec une réduction de 24 % de l'effort global. Les nouveaux agents déployés orchestrent de façon autonome des workflows allant de la rétro-ingénierie à l'analyse de code, en passant par le fit-to-standard et le repérage d'exceptions dans les processus Finance et Ventes, sans que l'entreprise ait eu à construire une infrastructure d'agents sur mesure. Cette bascule change concrètement la donne pour les grands comptes engagés dans des migrations S/4HANA ou des conversions système, des projets qui s'étalent sur des mois voire des années et mobilisent une expertise SAP difficile à faire monter en échelle avec des consultants humains seuls. Avant AgentCore, KTern.AI faisait tourner son application sur une pile de conteneurs auto-gérée, développée et maintenue en interne, ce qui détournait du temps d'ingénierie vers de l'infrastructure sans lien avec son cœur de métier : concevoir des agents capables de comprendre la transformation SAP. En migrant vers AgentCore, l'entreprise a pu se recentrer sur cette différenciation tout en gagnant en fiabilité de production. Le passage à l'agentique posait plusieurs défis techniques qu'aucune infrastructure maison ne pouvait résoudre proprement. Il fallait un contexte persistant à grande échelle, les agents devant retenir un état sur des centaines d'interactions et bâtir un contexte cumulatif sur toute la durée d'un projet sans le perdre à chaque session, tout en évitant de les saturer d'informations superflues, ce qui ralentit les réponses, augmente les coûts et le risque d'hallucination. S'y ajoutaient l'accès sécurisé et gouverné aux API SAP, aux systèmes ERP clients et aux référentiels de processus via des connexions authentifiées et auditables, la multi-location avec une configuration propre à chaque client sans développement spécifique par déploiement, une scalabilité dynamique pouvant faire passer d'une poignée d'agents pour un audit rapide à des dizaines d'agents tournant en continu pendant des mois lors d'une migration complète, et enfin une observabilité de niveau production, avec logs, traces et métriques détaillés pour rendre traçable chaque décision d'agent et chaque appel d'outil dans des environnements d'entreprise.

OutilsActu
1 source
Préremplissage et décodage dissociés pour l'inférence LLM sur SageMaker HyperPod
1350AWS ML Blog 

Préremplissage et décodage dissociés pour l'inférence LLM sur SageMaker HyperPod

Amazon Web Services a détaillé une nouvelle architecture d'inférence pour les grands modèles de langage sur SageMaker HyperPod, baptisée Disaggregated Prefill and Decode (DPD), conçue pour éliminer les ralentissements causés par les longs prompts. L'inférence LLM comporte deux phases très différentes : le prefill, qui traite l'intégralité du prompt en parallèle pour générer le cache clé-valeur initial, est limité par la puissance de calcul, tandis que le decode, qui génère les tokens un par un, dépend surtout de la bande passante mémoire. Lorsque ces deux phases partagent le même GPU, un prompt long bloque la génération de tokens pour toutes les autres requêtes en cours. La solution d'AWS sépare physiquement ces deux étapes sur des pools de GPU distincts, reliés par la technologie Elastic Fabric Adapter (EFA) avec accès direct à la mémoire à distance (RDMA), en s'appuyant sur vLLM et le HyperPod Inference Operator. Cette séparation permet d'ajuster indépendamment le temps jusqu'au premier token (TTFT) et la latence entre les tokens (ITL), tout en offrant un contrôle plus fiable sur la latence de queue que les méthodes classiques de découpage du prefill. Elle est particulièrement utile pour les charges de travail à fort trafic et à contexte long : assistants conversationnels, pipelines d'agents autonomes, analyse de documents ou génération augmentée par récupération (RAG) avec de larges contextes récupérés. AWS recommande cette architecture dès que les prompts dépassent régulièrement 4 096 tokens, en cas de requêtes concurrentes multiples, de réponses en streaming, ou de trafic mixte mêlant prompts courts et longs. Pour des charges simples, en batch ou à faible concurrence, un déploiement classique reste suffisant, le coût de transfert du cache via EFA RDMA ne se justifiant pas en dessous d'un certain seuil. L'architecture repose sur trois composants principaux articulés autour du routeur de la pile de production vLLM, avec LMCache assurant le transfert du cache clé-valeur via NIXL et EFA. Le routeur intelligent joue le rôle de plan de contrôle : il analyse chaque prompt et, selon un seuil configurable de tokens, décide s'il doit emprunter le chemin désagrégé ou être traité entièrement par un seul décodeur. Les requêtes longues passent d'abord par un nœud de prefill, qui calcule le cache et le transmet à un nœud de décodage via LMCache, avant que ce dernier ne génère la réponse. Le routeur prend également en charge plusieurs stratégies de routage, comme la priorité aux préfixes communs, la connaissance du cache ou le round-robin, afin de maximiser la réutilisation du cache entre les répliques. Ce déploiement nécessite au minimum un nœud de prefill et un nœud de decode équipés d'un réseau EFA compatible RDMA.

InfrastructureActu
1 source
Cette IA open source est aussi puissante que Mythos : comment est-ce possible ?
1351Le Big Data 

Cette IA open source est aussi puissante que Mythos : comment est-ce possible ?

La société chinoise Z.ai a lancé début juillet un nouveau modèle d'intelligence artificielle à pondération ouverte baptisé GLM-5.2, capable selon Forbes d'effectuer des tâches de programmation à grande échelle et de rivaliser avec les modèles les plus récents d'Anthropic pour détecter des vulnérabilités logicielles. Ce lancement intervient un mois après que l'administration Trump a contraint Anthropic à suspendre ses modèles Mythos 5 et Fable 5 pour des raisons de sécurité nationale, Washington redoutant des failles dans les mécanismes de protection de Fable 5. Un déploiement limité de Mythos 5 a depuis été autorisé, et Fable 5 est de nouveau accessible au public depuis le 1er juillet, mais à un tarif élevé en dehors des abonnements classiques. Contrairement à ces modèles fermés, GLM-5.2 peut être téléchargé librement et exécuté localement sur de nombreuses machines, sans qu'aucun fournisseur ne contrôle son accès ou son utilisation. Des consultants interrogés par Axios affirment que des jailbreaks du modèle circulent déjà sur des forums russophones fréquentés par des cybercriminels, cherchant à supprimer les rares garde-fous encore en place. Cette disponibilité en accès libre inquiète les experts en cybersécurité, car elle change radicalement l'équation du risque. Un outil capable d'identifier des vulnérabilités logicielles peut tout aussi bien servir à corriger des failles qu'à préparer des attaques, et le contrôle qui existait auparavant via les fournisseurs disparaît entièrement. Comme l'a résumé le consultant Travis Lanham, un attaquant peut désormais exécuter GLM-5.2 localement sans garde-fous de sécurité, l'adapter à ses cibles et agir sans qu'aucun fournisseur ni défenseur ne puisse le surveiller. Les entreprises de sécurité Semgrep et Graphistry, qui ont testé le modèle, confirment ses performances élevées pour détecter des bugs et mener des tâches avancées de cybersécurité. Semgrep a résumé son évaluation en une phrase : « Mythos est désormais chez nous. » Les chercheurs de Graphistry avancent l'hypothèse que Z.ai aurait utilisé la distillation, une technique consistant à entraîner un modèle moins avancé à partir des réponses produites par des modèles plus performants, en l'occurrence GPT-5.5 d'OpenAI et Opus 4.8 d'Anthropic. Cette explication, si elle se confirme, éclairerait la rapidité avec laquelle la Chine semble avoir comblé son retard en intelligence artificielle. Elle prolonge aussi une série d'alertes déjà lancées par Anthropic, qui a récemment accusé des acteurs liés à Alibaba d'avoir utilisé Claude dans un but similaire, après avoir signalé en février des tentatives comparables impliquant la startup chinoise DeepSeek, ainsi que les laboratoires Moonshot AI et MiniMax.

SécuritéActu
1 source
OpenAI et Google fournissent leurs IA à des entreprises chinoises blacklistées par le Pentagone
1352Le Big Data 

OpenAI et Google fournissent leurs IA à des entreprises chinoises blacklistées par le Pentagone

OpenAI et Google fournissent leurs modèles d'intelligence artificielle à des filiales singapouriennes d'Alibaba, Baidu et Tencent, trois groupes technologiques chinois pourtant inscrits sur la liste noire du Pentagone. C'est le Financial Times qui a révélé cette information le 10 juillet 2026, confirmée directement par les deux entreprises américaines. Le point clé de cette affaire réside dans une faille juridique : la réglementation américaine interdit l'accès à certains services d'IA avancés depuis la Chine continentale, mais elle ne s'applique pas automatiquement aux filiales de ces mêmes groupes lorsqu'elles sont établies à l'étranger, à Singapour en l'occurrence. Résultat, ces entités peuvent légalement signer des contrats avec OpenAI ou Google et accéder à leurs modèles, alors même que leur maison mère fait l'objet d'une surveillance de sécurité de la part de Washington. Aucune des deux entreprises ne reconnaît de violation des sanctions américaines, puisque le montage reste, sur le papier, parfaitement conforme aux règles en vigueur. Cette situation ravive les craintes autour de la distillation, une technique qui permet d'entraîner un nouveau modèle d'IA à partir des réponses générées par un modèle plus performant, sans avoir besoin d'accéder à son architecture interne. En clair, une entreprise chinoise pourrait, via une filiale à Singapour, interroger massivement les modèles américains pour en reproduire une partie des capacités et accélérer le développement de ses propres systèmes. OpenAI affirme limiter l'accès de ses services aux juridictions où des garde-fous existent et dit surveiller les usages suspects. Google avance un discours similaire, précisant que ses conditions d'utilisation interdisent explicitement la distillation, tout en reconnaissant que ses services restent disponibles à Singapour comme à Hong Kong. Les deux groupes admettent toutefois qu'un blocage géographique ne suffit pas toujours à empêcher des acteurs déterminés de contourner les restrictions techniques. Cette affaire met en lumière les limites de la stratégie américaine de restriction technologique face à la Chine, censée freiner les progrès de l'IA chinoise via des contrôles à l'exportation et des interdictions d'accès. Elle révèle aussi des divergences stratégiques entre laboratoires occidentaux. Anthropic, par exemple, applique une politique nettement plus stricte que ses concurrents en refusant tout accès à ses modèles avancés aux sociétés dont le siège social se trouve en Chine, y compris via des filiales installées à l'étranger. Ce contraste illustre les choix différents faits par les grands acteurs de l'IA entre expansion commerciale et prudence géopolitique, alors que Washington cherche à colmater les brèches de son dispositif de sanctions technologiques.

RégulationReglementation
1 source
Mercor vaut bientôt 20 milliards grâce au nouveau pétrole de l’IA
1353Le Big Data 

Mercor vaut bientôt 20 milliards grâce au nouveau pétrole de l’IA

Mercor, la startup spécialisée dans l'entraînement de l'intelligence artificielle, serait en discussions préliminaires pour lever de nouveaux fonds sur une valorisation d'environ 20 milliards de dollars, selon Bloomberg. Ce chiffre marque un doublement spectaculaire par rapport aux 10 milliards de dollars atteints lors de sa série C de 350 millions de dollars en octobre 2025. Son PDG, Brendan Foody, affirme que le rythme de revenu annualisé de l'entreprise a franchi les 2 milliards de dollars, soit le double du niveau observé en février 2026. Presque simultanément, Mercor a annoncé le rachat de Deeptune, une startup qui construit des environnements d'entraînement pour agents IA et qui avait levé 43 millions de dollars en mars 2026 lors d'une série A menée par Andreessen Horowitz. Mercor ne fabrique ni puces ni grand modèle de langage : son activité consiste à fournir les données, les tâches et désormais les environnements nécessaires pour entraîner les modèles des grands laboratoires. Cette double annonce révèle où se déplace la valeur dans l'industrie de l'IA. Les modèles les plus avancés, comme GPT-5 ou Gemini, dominent de nombreux benchmarks mais peinent encore à exécuter de vrais workflows d'entreprise. Une étude baptisée AgentGym2, publiée en juillet 2026, a testé 15 modèles dans des conditions réalistes, avec informations bruitées, tâches incomplètement décrites et outils à découvrir : même les systèmes les plus performants y rencontrent d'importantes difficultés. Pour Mercor, c'est précisément ce goulot d'étranglement qui devient le nouveau terrain de bataille. Contrairement aux données d'entraînement classiques, qui montrent seulement ce que des humains ont produit, un environnement d'entraînement permet à un agent de pratiquer une tâche, d'échouer et de corriger sa méthode. Ce virage a des conséquences directes pour les entreprises qui cherchent à déployer des agents capables d'exécuter des tâches complexes, comme la comptabilité ou la gestion commerciale, plutôt que de simples réponses ponctuelles. Selon Mercor, un environnement d'entraînement repose sur trois éléments : le logiciel dans lequel le travail est effectué, les tâches confiées à l'agent, et les vérificateurs chargés de juger sa réussite. Deeptune apporte la première brique : la startup affirme avoir recréé des centaines d'applications d'entreprise, des tableurs jusqu'à Salesforce, pour simuler des workflows professionnels réalistes. Mercor, de son côté, s'appuie sur un réseau revendiqué de plus de cinq millions d'experts capables de concevoir des tâches et des critères d'évaluation issus de métiers réels. Andreessen Horowitz, qui avait soutenu Deeptune, considère déjà les environnements d'apprentissage par renforcement comme une couche critique et à part entière de la pile technologique de l'IA, au même titre que les données ou le calcul. Après la course aux modèles puis aux données, c'est désormais la course aux terrains d'entraînement qui structure les investissements du secteur, et Mercor entend s'y positionner en position dominante.

BusinessActu
1 source
Le résumé quotidien : le fonctionnement interne de Claude et la "super app" d'OpenAI
1354MIT Technology Review 

Le résumé quotidien : le fonctionnement interne de Claude et la "super app" d'OpenAI

Anthropic a mis au jour un espace caché dans le fonctionnement interne de son modèle Claude, baptisé J-space, grâce à un nouvel outil de recherche appelé Jacobian lens ou J-lens. Cet espace contiendrait des mots liés à la réponse que le modèle est en train d'élaborer mais qu'il ne produira pas forcément au final, une sorte d'aperçu de ce qui se joue avant même que Claude ne formule sa réponse. Le même jour, OpenAI a dévoilé ChatGPT Work, une "super app" tant attendue qui fusionne son chatbot grand public, son outil de codage et ses nouveaux modèles GPT-5.6, conçue pour effectuer des tâches à la place de l'utilisateur ou en collaboration avec lui. OpenAI développerait par ailleurs un système de recherche entièrement automatisé. Dans le même temps, le fabricant sud-coréen de puces SK Hynix a réalisé la plus importante introduction en Bourse aux États-Unis jamais menée par une entreprise étrangère, levant 26,5 milliards de dollars, porté par l'explosion de la demande en centres de données pour l'IA. Ces annonces illustrent à quel point la course à l'IA se joue désormais sur plusieurs fronts simultanés : la compréhension fine du fonctionnement des modèles, leur intégration dans des outils professionnels et le financement massif des infrastructures qui les font tourner. La découverte du J-space par Anthropic touche à l'interprétabilité, un enjeu central pour la sécurité et la confiance envers des systèmes dont le raisonnement reste largement opaque. Le lancement de ChatGPT Work marque de son côté un tournant stratégique pour OpenAI, qui cherche à s'imposer comme un outil de productivité incontournable en entreprise plutôt qu'un simple assistant conversationnel. Meta a également commencé à monétiser directement l'accès à l'IA, avec une offre payante pour les développeurs sur une nouvelle version de Muse Spark, tout en préparant la production de ses propres puces IA dès septembre. Ce mouvement s'inscrit dans un contexte de recomposition rapide du secteur. Tencent négocierait ainsi le rachat, pour au moins 2 milliards de dollars, de la startup chinoise Manus, après que Pékin a exigé de Meta qu'elle se désengage de cette acquisition. Autre signe des tensions géopolitiques autour de l'IA, une enquête révèle qu'OpenAI et Google auraient vendu des modèles d'intelligence artificielle à des groupes chinois pourtant inscrits sur liste noire américaine, via des filiales basées à Singapour appartenant à Alibaba, Baidu et Tencent, contournant ainsi les restrictions à l'export. Entre percées scientifiques, offensive commerciale et manœuvres réglementaires, l'écosystème de l'IA générative continue de se redéfinir à un rythme soutenu, avec des acteurs américains, chinois et sud-coréens tous engagés dans une compétition dont les infrastructures, les capitaux et le contrôle des flux technologiques deviennent les véritables champs de bataille.

BusinessActu
1 source
« Comment réduire le budget de tokens sans réduire l'équipe »
1355AI News 

« Comment réduire le budget de tokens sans réduire l'équipe »

Le patron de Nvidia Jensen Huang a fixé un seuil inhabituel pour juger ses ingénieurs : lors du All-In Podcast, à la clôture de la GTC 2026, il a affirmé que si un ingénieur payé 500 000 dollars par an consommait des tokens IA pour moins de la moitié de son salaire, cela le "alarmerait profondément". Nvidia vise désormais une facture annuelle de 2 milliards de dollars de tokens pour ses équipes d'ingénierie. Ce chiffre illustre un basculement déjà largement engagé ailleurs : l'argent qui finançait des postes finance de plus en plus des tokens. Les quatre plus grands hyperscalers ont annoncé environ 700 milliards de dollars de dépenses d'investissement combinées pour 2026, près du double de l'année précédente, tandis que le cabinet Challenger, Gray & Christmas recense l'IA comme premier motif de suppressions d'emplois aux États-Unis pour un quatrième mois consécutif. Un mémo interne de Meta, révélé par Reuters, décrivait les 8 000 suppressions de postes de mai comme un moyen de compenser les investissements massifs du groupe, alors même que son chiffre d'affaires progressait de 33% sur le trimestre. Ces licenciements ne relèvent donc pas de mesures de survie mais bien de financement, et le problème est que cet argent n'a pas produit les résultats promis. Une enquête de Gartner auprès de 350 dirigeants d'entreprises générant plus d'un milliard de dollars de revenus et déployant des agents IA a montré qu'environ 80% d'entre elles avaient réduit leurs effectifs sans aucune corrélation avec une amélioration du retour sur investissement. Chez Uber, l'addition a été particulièrement salée : après avoir déployé des outils de codage IA auprès de 5 000 ingénieurs en décembre, l'entreprise a épuisé tout son budget IA 2026 dès avril. Son directeur des opérations, Andrew Macdonald, a reconnu que malgré 70% de code généré par IA, le lien avec un bénéfice perceptible par les clients restait introuvable. Le vrai problème apparaît alors clairement : les entreprises ont traité leur budget de tokens comme une donnée fixe et leurs effectifs comme une variable d'ajustement, alors que c'est l'inverse qui serait pertinent, puisque des suppressions de postes emportent définitivement du savoir-faire interne. Plusieurs leviers permettent pourtant de réduire la facture sans toucher aux équipes. La mise en cache des prompts, désormais standard chez les grands fournisseurs d'API, réduit jusqu'à 90% le coût du traitement répété de contenus statiques comme les instructions système, selon les tarifs publiés par Anthropic et OpenAI. La société de sécurité ProjectDiscovery a ainsi fait passer son taux de succès de cache de 7% à 84%, réduisant sa facture LLM totale de 59 à 70% tout en servant 9,8 milliards de tokens depuis le cache. D'autres leviers existent : orienter les tâches simples vers des modèles plus petits et moins coûteux, profiter des remises de 50% sur le traitement par lots, utiliser la génération augmentée par récupération (RAG) pour n'envoyer au modèle que les données pertinentes, compresser les prompts, ou encore recourir à des modèles ouverts moins chers que les modèles propriétaires de pointe. Chez Uber, un plafond mensuel de 1 500 dollars par ingénieur a été instauré après le dépassement d'avril, signe que la discipline budgétaire finit par s'imposer, que ce soit par anticipation ou sous la contrainte.

SociétéOpinion
1 source
Microsoft officialise son utilisation intensive de l’IA pour la découverte des failles
1356Next INpact 

Microsoft officialise son utilisation intensive de l’IA pour la découverte des failles

Microsoft a publié un long billet de blog détaillant pour la première fois de façon approfondie l'usage intensif de l'intelligence artificielle générative dans la découverte des failles de sécurité de ses produits, Windows en tête. L'entreprise avait déjà évoqué brièvement le sujet en mai 2026, indiquant que ses équipes d'ingénieurs recouraient de plus en plus aux grands modèles de langage pour traquer les vulnérabilités. Le mois suivant, en juin, le traditionnel « Patch Tuesday », ce deuxième mardi du mois où Microsoft diffuse ses correctifs de sécurité, a marqué un record historique avec près de 200 failles colmatées en une seule fournée. Ce chiffre confirme que l'annonce de mai n'était pas un effet d'annonce isolé mais bien le signe d'un changement de méthode durable dans la manière dont l'éditeur traque et corrige les failles de ses logiciels. Cette bascule vers l'IA générative dans le cycle de sécurité a des conséquences concrètes pour les entreprises et les particuliers qui utilisent Windows et les autres produits Microsoft. L'éditeur explique avoir fait évoluer ses systèmes d'ingénierie et de validation afin de réduire le délai entre la découverte d'une vulnérabilité et la mise à disposition d'un correctif pour les clients, en concentrant l'effort sur les zones jugées les plus à risque. Les modèles sont désormais intégrés plus tôt dans le cycle de développement, ce qui permet de repérer des problèmes que les méthodes traditionnelles auraient mis plus de temps à révéler. Microsoft prévient toutefois d'ores et déjà ses clients qu'ils doivent s'attendre à un volume plus élevé de mises à jour de sécurité à chaque publication mensuelle, un changement d'échelle qui touchera directement les équipes informatiques chargées de déployer ces correctifs. Reste que l'automatisation de la recherche de failles par l'IA soulève une question de fond : l'expertise humaine garde-t-elle la main ? Microsoft insiste sur le fait que l'évaluation des vulnérabilités, l'arbitrage sur les risques et la vérification de la qualité des correctifs continuent de reposer sur des ingénieurs humains, l'IA n'intervenant qu'en amont pour accélérer la détection. L'éditeur tient aussi à couper court à une interprétation inverse de ces chiffres impressionnants : selon lui, ce déluge de correctifs ne traduit pas une dégradation de la sécurité de Windows, mais au contraire une meilleure capacité des équipes de défense à identifier et traiter les problèmes existants. Cette évolution s'inscrit dans un mouvement plus large de l'industrie, où l'IA devient un outil à double tranchant, aussi précieux pour les défenseurs qui cherchent à corriger les failles que pour des attaquants qui pourraient s'en servir pour les exploiter avant qu'elles ne soient corrigées.

Google Research présente SensorFM, un modèle de fondation santé portable entraîné sur mille milliards de minutes de données de capteurs
1357MarkTechPost 

Google Research présente SensorFM, un modèle de fondation santé portable entraîné sur mille milliards de minutes de données de capteurs

Google Research a dévoilé SensorFM, un modèle de fondation destiné aux données de capteurs portables, entraîné sur plus d'un trillion de minutes de données, soit plus de deux milliards d'heures, collectées auprès de cinq millions de participants consentants entre septembre 2024 et septembre 2025. Le corpus couvre plus de cent pays, les cinquante États américains et plus de vingt modèles de montres Fitbit et Pixel Watch. Le modèle ingère trente-quatre caractéristiques agrégées par minute, issues de cinq capteurs (photopléthysmographie, accéléromètre, activité électrodermale, température cutanée et altimètre), organisées en sept catégories sur une fenêtre de contexte de vingt-quatre heures. Son architecture repose sur un encodeur ViT-1D entraîné selon un objectif d'auto-encodeur masqué, avec quatre variantes allant de 138 740 à plus de 110 millions de paramètres, chacune associée à un volume de données proportionnel. L'évaluation s'appuie sur près de 14 000 sujets répartis dans trois études prospectives approuvées par un comité d'éthique, portant sur la santé métabolique, cardiaque et respiratoire, le sommeil et la santé mentale, pour un total de trente-cinq tâches prédictives. Cette approche change la donne pour un secteur où chaque nouvel indicateur de santé nécessitait jusqu'ici l'entraînement d'un modèle dédié, une méthode intenable dès qu'il faut couvrir plusieurs dizaines de pathologies ou de comportements à la fois, faute d'annotations rétrospectives disponibles. Les résultats montrent que la taille du modèle compte réellement : la version la plus grande, entraînée sur les cinq millions de sujets, réduit la perte de reconstruction de 31 % par rapport à la plus petite variante et remporte trente-trois des trente-cinq tâches évaluées, avec une aire sous la courbe ROC moyenne passant de 0,664 à 0,752 selon la taille du modèle. Autre apport clé, une technique de masquage adaptatif nommée AIM permet de gérer nativement les données manquantes, très fréquentes lors des périodes de charge ou de retrait du bracelet, sans recourir à l'imputation classique. Elle améliore de 74,8 % la reconstruction en cas d'imputation aléatoire et de 83,7 % en cas de signal de capteur manquant. Ce travail s'inscrit dans une course plus large des géants technologiques pour transformer les objets connectés grand public en outils de dépistage médical préventif, en misant sur l'échelle plutôt que sur des labels cliniques coûteux à produire. Google s'appuie ici sur son expérience acquise avec les modèles LSM, dont hérite la technique de masquage AIM, et sur sa base installée de montres Fitbit et Pixel Watch pour constituer un corpus d'entraînement difficile à égaler pour des concurrents sans écosystème matériel équivalent. Les auteurs notent toutefois que la courbe de performance ne montre encore aucun signe de saturation, laissant présager des versions futures entraînées sur des volumes plus importants encore.

RechercheActu
1 source
Avec GPT-5.6, OpenAI veut faire de ChatGPT sa super app
1358Next INpact 

Avec GPT-5.6, OpenAI veut faire de ChatGPT sa super app

Après la levée des restrictions imposées par le gouvernement américain, OpenAI a mis GPT-5.6 en ligne et en a profité pour réorganiser en profondeur son offre logicielle, jusque-là partagée entre trois applications distinctes : ChatGPT, Codex et le navigateur Atlas. Désormais, c'est l'application Codex qui absorbe ChatGPT, tout en étant rebaptisée ChatGPT. Les utilisateurs conservent la possibilité de garder l'icône et l'interface habituelle de Codex, l'application proposant deux vues, l'une pour Codex, l'autre pour ChatGPT Work. L'ancienne application ChatGPT ne disparaît pas totalement : elle devient ChatGPT Classic, une version native pour Mac, tandis que la nouvelle mouture unifiée tourne sous Electron. Le navigateur Atlas, lancé en octobre 2025, ferme quant à lui ses portes après une carrière très courte ; ses fonctionnalités migrent vers l'application ChatGPT. Celle-ci intègre désormais un agent baptisé Work, capable de gérer des tâches lourdes comme la création de feuilles de calcul, de présentations, de documents ou de sites web, et de se connecter à des outils tiers tels que Slack, Gmail, Google Drive, Teams ou Salesforce. OpenAI cite l'exemple d'une étude client transformée automatiquement en brief marketing, puis en supports de vente adaptés à différents marchés, l'agent conservant le contexte à chaque étape grâce à GPT-5.6. Les tâches planifiées (rappels, résumés récurrents, surveillance de changements) sont plafonnées à une exécution par heure, avec des limites variables selon les formules : trois tâches actives pour l'offre Go, cinq pour Plus, quinze pour Pro, Business et Enterprise. Cette fusion traduit l'ambition d'OpenAI de transformer ChatGPT en véritable « super app », capable de couvrir aussi bien les usages grand public que les besoins professionnels, en évitant de disperser ses utilisateurs entre plusieurs logiciels concurrents. En intégrant un navigateur web et un accès aux fichiers stockés localement dans ses applications macOS et Windows, disponibles gratuitement pour tous, OpenAI cherche à retenir les usages qu'elle avait imaginés pour Atlas sans avoir à maintenir un navigateur autonome coûteux à développer. Pour les entreprises, la centralisation des fonctions Work au sein d'une seule interface simplifie l'adoption et renforce la dépendance à l'écosystème OpenAI face à des concurrents comme Google ou Microsoft. Cette réorganisation s'accompagne d'une bascule technique plus large : les modèles GPT-5.4, y compris les GPTs personnalisés, ont été retirés le 26 juin, laissant place à GPT-5.5, dont la version Instant Mini sert désormais de modèle de secours en cas de limite atteinte. L'agent Work est déjà accessible sur le web et en mobile pour les abonnés Pro, Enterprise et Edu, avant une possible extension plus large. OpenAI mise ainsi sur une consolidation rapide de son catalogue pour accélérer face à la concurrence sur le terrain des agents autonomes en entreprise.

OutilsActu
1 source
GPT-5.6 Sol/Terra/Luna d'OpenAI arrive, Codex devient une superapp ChatGPT
1359Latent Space 

GPT-5.6 Sol/Terra/Luna d'OpenAI arrive, Codex devient une superapp ChatGPT

OpenAI a dévoilé le 9 juillet 2026 une nouvelle famille de modèles baptisée GPT-5.6, déclinée en trois tailles : Sol, Terra et Luna, du nom du Soleil, de la Terre et de la Lune. L'entreprise introduit aussi un nouveau niveau d'effort de raisonnement appelé "ultra", qui coordonne par défaut quatre agents en parallèle pour accélérer la résolution de tâches complexes, en plus du niveau "max" déjà existant qui laisse au modèle plus de temps que le niveau "xhigh" pour explorer des solutions et vérifier son travail. Selon OpenAI, Terra se situe juste au-dessus de Claude Fable 5 et Luna dépasse Claude Opus 4.8, tout en tournant environ trois fois plus vite, avec deux fois moins de tokens de sortie et un coût quatre fois inférieur. Les nouveaux modèles établissent aussi des records sur les benchmarks Terminal-Bench 2.1 et DeepSWE, qui évaluent respectivement les tâches en ligne de commande et l'ingénierie logicielle sur le long terme. Sol atteint un score inédit de 53,6 sur l'évaluation Agents' Last Exam, devançant Claude Fable 5 adaptive de 13,1 points. Côté tarifs, l'accès via l'API coûte 5 et 30 dollars par million de tokens en entrée et sortie pour Sol, 2,5 et 15 dollars pour Terra, 1 et 6 dollars pour Luna, avec pour la première fois une tarification pour l'écriture en cache et une réduction de 90% conservée pour la lecture en cache. Les abonnés Plus, Pro, Business et Enterprise de ChatGPT accèdent à Sol dès le niveau d'effort moyen, tandis que Pro et Enterprise peuvent choisir GPT-5.6 Pro pour les tâches les plus exigeantes. Ce lancement s'accompagne d'un remaniement de toute la gamme de produits d'OpenAI. L'entreprise a introduit ChatGPT Work, une nouvelle application de bureau fusionnant Codex et ChatGPT, une version bêta de Sites, l'appel programmatique d'outils, ainsi qu'une fonctionnalité multi-agents en bêta dans l'API Responses. Pour le PDG Sam Altman, GPT-5.6 est "sans doute le meilleur modèle que nous ayons jamais produit", et Sol représente selon lui "une avancée majeure en matière de coût par tâche" pour les entreprises. Le président Greg Brockman a de son côté résumé l'objectif de la maison comme la recherche du "meilleur prix pour chaque niveau de performance visé", combiné à un plafond de capacité toujours plus élevé. Ces gains d'efficacité comptent particulièrement pour les entreprises qui déploient l'IA à grande échelle sur des tâches d'agents, de codage ou de génération de documents, où le rapport coût-performance détermine directement la rentabilité des projets. La fusion de Codex et ChatGPT dans une seule application confirme aussi une stratégie de "superapp" évoquée par les observateurs dès avril, dernière étape avant que la question du navigateur agentique ne soit tranchée. Cette annonce intervient après une prévisualisation de GPT-5.6 quelques semaines plus tôt, dans l'attente d'une validation réglementaire mentionnée par OpenAI. Elle survient aussi le même jour que le lancement, par les Meta Superintelligence Labs, du modèle Muse Spark 1.1, jugé étonnamment compétitif et intégré pour la première fois à l'API Meta Model, un signe de confiance de Meta envers ses propres modèles. La compétition entre laboratoires d'IA générative s'intensifie ainsi sur deux fronts simultanés : la performance brute sur des benchmarks d'agents et de programmation, et l'efficacité économique par tâche accomplie, un critère de plus en plus déterminant pour les entreprises clientes. OpenAI mise sur cette structure à trois modèles pour couvrir tout le spectre des besoins, de l'usage ponctuel à très haute exigence avec Sol jusqu'au traitement massif et rapide avec Luna, en passant par Terra comme compromis intermédiaire. Les mois à venir devraient montrer si ces gains de performance et de coût se traduisent en adoption réelle chez les développeurs et les entreprises, et si Anthropic ou Google répondent avec leurs propres annonces face à cette offensive tarifaire et technique d'OpenAI.

LLMsActu
1 source
Muse Spark 1.1 : Meta agressif sur les prix pour rattraper les cadors de l’IA
1360Next INpact 

Muse Spark 1.1 : Meta agressif sur les prix pour rattraper les cadors de l’IA

Meta a lancé cette semaine Muse Spark 1.1, une nouvelle version de son modèle d'IA, accompagnée d'une API en préversion publique désormais ouverte aux développeurs tiers. Après une première mouture grand public dévoilée début avril, puis le lancement de Muse Image et la présentation de Muse Video cette même semaine, il manquait une brique essentielle : une interface de programmation permettant de tester des prompts et de prototyper des intégrations, jusque là réservée à un aperçu privé. Cette version 1.1 est présentée comme pensée pour les tâches agentiques : utilisation d'outils, navigation sur ordinateur, codage et raisonnement à partir d'images, de documents et de vidéos. Meta met en avant une fenêtre de contexte d'un million de tokens et une capacité à conserver le fil sur de longues sessions, le modèle mémorisant les actions passées pour synthétiser les étapes critiques nécessaires à la suite. Côté tarifs, l'API facture 1,25 dollar par million de tokens en entrée, 4,25 dollars en sortie, et seulement 0,15 dollar pour les tokens en entrée mis en cache. Ce choix tarifaire agressif traduit une stratégie assumée : plutôt que de viser le modèle le plus puissant du marché, Meta mise sur le rapport performances/prix pour convaincre développeurs et entreprises d'intégrer Muse Spark 1.1 dans leurs outils. Les tarifs pratiqués sont inférieurs à ceux de Grok 4.5, qui facture 2 dollars en entrée et 6 dollars en sortie, et très en deçà des 5 et 25 dollars demandés par Opus 4.8. Les benchmarks fournis par Meta montrent que le modèle domine nettement sur les tâches d'agent face à Gemini 3.1 Pro high, Opus 4.8 max et GPT-5.5 xhigh, même s'il reste en retrait sur le codage et le multimodal. Pour les développeurs, cela ouvre la possibilité d'un modèle assez robuste pour des usages agentiques répétés à grande échelle, sans le coût prohibitif des modèles premium. Meta insiste aussi sur la sécurité, affirmant que Muse Spark 1.1 reste dans des marges sûres sur les grands risques, cybersécurité, usages chimiques ou biologiques, perte de contrôle, avec une meilleure résistance aux jailbreaks et aux injections de prompt, ainsi que moins d'hallucinations et une tendance réduite à flatter l'utilisateur. Cette offensive tarifaire s'inscrit dans un contexte où Meta cherche à se repositionner après la déception suscitée par ses précédents modèles Llama. L'entreprise a massivement investi dans les infrastructures et le recrutement de talents, avec la création du Meta Superintelligence Labs dirigé par Alexandr Wang, sous l'impulsion de Mark Zuckerberg. Face à des concurrents comme Anthropic et OpenAI, dont les modèles Opus et GPT dominent encore les classements de performance pure, Meta choisit le pragmatisme et l'accessibilité économique plutôt que la course aux benchmarks. L'enjeu est de gagner des parts de marché chez les développeurs et les entreprises en misant sur un modèle assez solide pour les usages agentiques, suffisamment polyvalent, et surtout assez bon marché pour être utilisé intensivement. La bataille des coûts d'inférence, déjà engagée par SpaceXAI avec Grok 4.5, pourrait s'intensifier à mesure que les usages agentiques se généralisent et que la facture en tokens devient un critère décisif pour les entreprises.