Aller au contenu principal

Actualités IA — page 64

7 595 articles au fil, du plus récent au plus ancien.

Multi-agent : intelligence sociale avec Strands Agents et Amazon Bedrock
1261AWS ML Blog 

Multi-agent : intelligence sociale avec Strands Agents et Amazon Bedrock

Amazon Web Services a publié un article technique détaillant comment la startup Thrad.ai a construit un système multi-agents de renseignement social pour automatiser sa prospection commerciale, en s'appuyant sur le framework Strands Agents et sur Amazon Bedrock AgentCore. Thrad.ai développe une infrastructure publicitaire pour les interfaces conversationnelles basées sur des modèles de langage, permettant aux chatbots de monétiser via la publicité et aux marques d'y annoncer. Avant cette automatisation, l'équipe commerciale de la société passait entre 30 et 45 minutes par prospect à croiser manuellement six sources différentes (Hacker News, Reddit, Stack Overflow, GitHub, ProductHunt, dev.to, Wikipedia, Lobste.rs, YouTube) avant de rédiger un seul email de prospection. Le système déployé repose sur quatre agents spécialisés tournant sur Claude Sonnet 4.6 via Amazon Bedrock : un agent de recherche de tendances qui repère les lancements et signaux d'achat, un agent de recherche qui enrichit les profils des prospects, un agent d'analyse qui note chaque paire prospect-tendance sur une échelle de 0 à 100 à l'aide de critères pondérés, d'une classification d'intention et d'une décroissance temporelle, et un agent de génération qui rédige l'email personnalisé final. L'article compare également deux architectures d'orchestration, Swarm et Graph, avec des benchmarks chiffrés sur la latence, le coût et la qualité des emails produits. Un dépôt de code compagnon est disponible sur GitHub, et le déploiement complet du tutoriel prend environ une heure pour un coût de 3 à 5 dollars en appels aux modèles Bedrock. L'intérêt de cette architecture tient à sa capacité à transformer des signaux épars et bruités, un post Reddit, un pic de questions Stack Overflow, un dépôt GitHub qui dépasse les 2 400 étoiles, en un score de conversion actionnable, sans intervention humaine. Un seul agent ne peut pas gérer cette tâche efficacement car la diversité des sources, la variété des API à interroger et la finesse d'analyse nécessaire dépassent ce qu'un modèle unique traite bien ; répartir le travail entre agents spécialisés, puis fusionner les résultats via un agent d'analyse dédié aux corrélations inter-sources, change la donne pour les équipes commerciales et marketing. Au-delà de la vente, les auteurs soulignent que ce type de pipeline s'applique directement à la veille concurrentielle, au sourcing de candidats en recrutement, ou à l'étude de marché, chaque fois qu'il faut croiser des signaux dispersés sur le web pour prioriser une action. Cette publication s'inscrit dans la stratégie d'Amazon visant à positionner Bedrock AgentCore comme plateforme de référence pour les systèmes multi-agents en production, avec des services intégrés de runtime, de passerelle, de mémoire et d'observabilité. Elle illustre une tendance plus large du secteur : le passage de simples assistants conversationnels à des flottes d'agents coordonnés capables d'exécuter des tâches métier complexes de bout en bout. L'article insère aussi des garde-fous de gouvernance pour un déploiement en production, signe que les fournisseurs cloud cherchent désormais à rassurer les entreprises sur la fiabilité et le contrôle de ces architectures agentiques avant leur adoption à grande échelle.

OutilsActu
1 source
Anthropic offre Claude Premium aux profs américains… et la France ?
1262Le Big Data 

Anthropic offre Claude Premium aux profs américains… et la France ?

Mardi 14 juillet 2026, Anthropic a lancé Claude for Teachers, un programme qui offre gratuitement les fonctionnalités Premium de Claude aux enseignants américains du primaire et du secondaire pendant un an, à condition de s'inscrire avant le 30 juin 2027 et de faire vérifier leur statut professionnel. L'annonce a été relayée sur X par le compte officiel de Claude ainsi que par Drew Bent, qui présente l'offre comme incluant aussi l'outil Cowork. Le programme s'appuie sur un connecteur baptisé Learning Commons, qui donne à l'IA un accès direct aux standards académiques des cinquante États américains : lorsqu'un professeur demande un plan de cours, Claude peut s'appuyer sur les compétences attendues dans son État et sur leur progression pédagogique logique, avant que l'enseignant ne personnalise le résultat. L'outil s'intègre aussi à des plateformes déjà utilisées dans les écoles, comme Canva Éducation, MagicSchool, Diffit, TeachFX ou ASSISTments, et Anthropic annonce qu'une version pensée pour les établissements et districts scolaires arrivera prochainement. Pour les enseignants, l'enjeu est avant tout un gain de temps sur des tâches chronophages : préparation de cours, création de supports pédagogiques, adaptation d'un même exercice à plusieurs niveaux dans une classe, correction et rédaction de bilans. Anthropic met en avant des méthodes reconnues en sciences de l'éducation, comme la différenciation pédagogique ou l'apprentissage par la maîtrise, dont l'efficacité est documentée mais dont la mise en œuvre réclame un temps que peu de professeurs ont réellement à disposition. En automatisant une partie de cette charge, Claude for Teachers vise à replacer les enseignants américains, souvent décrits comme débordés, dans une position où ils peuvent se concentrer sur l'accompagnement individuel des élèves plutôt que sur la logistique pédagogique. Le fait que l'IA sache analyser les données de classe pour repérer les difficultés ajoute une dimension de suivi qui dépasse la simple génération de contenu. Cette initiative s'inscrit dans une compétition plus large entre acteurs de l'IA pour s'implanter dans l'éducation, un secteur où Microsoft, Google et OpenAI multiplient déjà des offres similaires à destination des enseignants et des établissements scolaires. Pour l'instant, Claude for Teachers reste strictement réservé aux États-Unis, et Anthropic n'a communiqué aucune date ni aucun projet concernant la France ou l'Europe plus largement. Rien n'exclut toutefois une extension internationale, d'autant qu'Anthropic multiplie les partenariats institutionnels ces derniers mois. La question du cadre réglementaire européen sur l'usage de l'IA en milieu scolaire pourrait toutefois ralentir un déploiement similaire sur le Vieux Continent.

OutilsOutil
1 source
Nemotron Labs : comment les modèles ouverts donnent aux entreprises et aux États une IA fiable, maîtrisable et personnalisable
1263NVIDIA AI Blog 

Nemotron Labs : comment les modèles ouverts donnent aux entreprises et aux États une IA fiable, maîtrisable et personnalisable

Traduction résumée de l'article : NVIDIA a publié un nouveau billet dans sa série de blog Nemotron Labs, consacrée à sa famille de modèles ouverts Nemotron. Le texte détaille comment plusieurs entreprises ont déjà personnalisé ces modèles pour des usages métiers précis. Abridge construit ainsi le premier modèle de fondation conçu spécifiquement pour les conversations cliniques. Glean a développé Waldo, un modèle de recherche agentique qui combine Nemotron avec des modèles fermés plus volumineux pour offrir une recherche d'entreprise à latence réduite et avec moins de tokens consommés. H Company a créé Holotron 3 Nano en post-entraînant Nemotron 3 Nano Omni sur des données propriétaires d'utilisation d'ordinateur, atteignant plus de 76% de précision sur OSWorld-Verified, un benchmark de référence pour les tâches informatiques, tout en égalant les modèles fermés les plus avancés pour une fraction du coût. Harvey a de son côté post-entraîné Nemotron 3 Ultra sur son propre benchmark juridique et obtenu une précision de niveau frontière, équivalente aux meilleurs modèles fermés sur des tâches juridiques complexes, avec un coût par exécution au moins dix fois inférieur. Heidi Health atteint des résultats comparables aux modèles de pointe en documentation clinique sans recourir à une puissance de calcul massive, tandis que YTL AI Labs a adapté un modèle Nemotron à la langue malaisienne pour la communauté de développeurs du pays. L'enjeu central mis en avant par NVIDIA est celui du contrôle et de la confiance. Contrairement aux modèles fermés, dont l'accès reste limité à une interface d'utilisation, les modèles ouverts permettent aux entreprises d'inspecter leur fonctionnement, de les évaluer selon leurs propres critères métier et de les affiner sans faire transiter leurs données sensibles par un tiers. Cet avantage est particulièrement décisif dans des secteurs comme la santé ou le droit, où une erreur peut avoir des conséquences lourdes et où les exigences de traçabilité et de conformité sont strictes. Pour ces industries, pouvoir auditer l'entraînement d'un modèle et le corriger devient un critère aussi important que sa performance brute. Cette approche s'inscrit dans une tendance plus large où l'avantage compétitif en IA ne dépend plus seulement du choix d'un modèle, mais de la manière dont il est adapté et intégré. NVIDIA promeut une architecture hybride où des modèles ouverts comme Nemotron gèrent des tâches spécialisées aux côtés de modèles fermés plus puissants chargés du raisonnement complexe, une répartition qui permet d'optimiser les coûts d'inférence tout en conservant de la flexibilité. L'exemple malaisien avec YTL AI Labs illustre par ailleurs un enjeu de souveraineté numérique, montrant comment des nations peuvent s'approprier des capacités d'IA adaptées à leur langue et à leur contexte local plutôt que de dépendre entièrement de fournisseurs étrangers.

LLMsActu
1 source
Flo Health met à l'échelle la revue de contenu médical avec Amazon Bedrock (partie 2)
1264AWS ML Blog 

Flo Health met à l'échelle la revue de contenu médical avec Amazon Bedrock (partie 2)

Flo Health, l'application de santé féminine qui compte des millions d'utilisatrices, a transformé une preuve de concept développée avec l'AWS Generative AI Innovation Center en un système de production complet basé sur Amazon Bedrock pour la révision et la génération de contenu médical. Ce travail, mené par Konstantin Lekh, Sasha Zinchuk et Eugene Sergueev côté Flo Health, avec Liza Zinovyeva côté AWS, a permis de réduire le temps de révision de 60% et de tripler le volume de contenu produit, sans agrandir l'équipe médicale. Auparavant, les experts médicaux de Flo Health passaient en moyenne sept jours ouvrés par article pour vérifier les faits, croiser les références avec des sources fiables et appliquer une checklist de conformité médicale en dix points. Le nouveau système repose sur une validation en trois couches: d'abord un contrôle du contenu par rapport aux directives médicales internes de l'entreprise, avec signalement des problèmes potentiels et suggestions de corrections; ensuite une vérification croisée avec des sources médicales externes reconnues, allant des outils d'aide à la décision clinique fondés sur des preuves aux revues à comité de lecture et aux organismes de régulation; enfin une relecture humaine par les experts médicaux, effectuée via une interface qui met en évidence les règles appliquées et fournit des liens directs vers les sources pertinentes. Cette avancée répond à un problème structurel bien identifié dans le secteur de la santé numérique: le recrutement de professionnels médicaux qualifiés capables de produire et vérifier du contenu est difficile, lent et coûteux, ce qui rend le simple ajout de personnel non viable pour suivre la demande croissante des utilisateurs. En s'appuyant sur l'intelligence artificielle générative plutôt que sur des outils génériques, Flo Health répond aussi à un enjeu de confiance critique: les systèmes d'IA classiques peuvent produire des hallucinations, c'est-à-dire des informations non ancrées dans des sources vérifiables, un risque inacceptable quand des millions de personnes s'appuient sur ce contenu pour comprendre leur propre santé. En construisant un système qui ne délivre que des informations sourcées et traçables, l'entreprise démultiplie l'impact de ses experts existants tout en maintenant, voire en renforçant, ses standards de fiabilité. Cette évolution s'inscrit dans une stratégie d'adoption progressive de l'IA, pensée pour bâtir la confiance par une validation continue plutôt qu'un remplacement brutal du jugement humain. Les métriques de succès retenues par Flo Health portent principalement sur deux axes: la réduction du temps de révision et la diminution du nombre de corrections requises de la part des experts. Le système intègre également des "juges IA" spécialisés, chacun dédié à une dimension particulière de la révision médicale, ainsi qu'un module de génération de contenu s'appuyant sur la génération augmentée par récupération (RAG) pour ancrer les textes produits dans des sources vérifiées. Cette approche illustre une tendance plus large dans le secteur de la santé numérique, où l'IA générative est de plus en plus déployée non pas pour remplacer l'expertise médicale, mais pour l'amplifier, ouvrant la voie à d'autres cas d'usage où fiabilité et scalabilité doivent coexister.

OutilsActu
1 source
ScienceSoft lance un planificateur vocal IA conforme HIPAA sur AWS
1265AWS ML Blog 

ScienceSoft lance un planificateur vocal IA conforme HIPAA sur AWS

ScienceSoft, partenaire d'Amazon Web Services (AWS), a développé un assistant vocal basé sur l'intelligence artificielle pour la prise de rendez-vous médicaux, conforme à la loi américaine HIPAA sur la protection des données de santé. La solution combine Amazon Nova Sonic, un modèle capable de conversations vocales naturelles, avec Amazon Bedrock Guardrails, un cadre de garde-fous pour une IA responsable qui agit comme un pare-feu vérifiant les échanges. Le système gère l'ensemble du cycle de vie d'un rendez-vous : appels entrants et sortants, vérification de l'identité du patient, consultation des disponibilités en temps réel, et intégration directe avec les systèmes hospitaliers via des API basées sur le standard FHIR (Fast Healthcare Interoperability Resources). Selon le cabinet Grand View Research, le marché mondial des logiciels de planification de patients assistés par IA pesait environ 260 millions de dollars en 2023 et devrait dépasser 1,2 milliard de dollars d'ici 2030. Cette solution répond à des inefficacités bien documentées dans les hôpitaux et cliniques américains. Un appel de prise de rendez-vous classique dure entre 8 et 12 minutes, précédé de 8 minutes d'attente en moyenne avant qu'un patient joigne un interlocuteur, et près de 30 % du temps du personnel administratif est absorbé par ces tâches de planification. Un standardiste ne peut traiter qu'un appel à la fois, ce qui limite sa capacité à 40-60 appels par jour : lors des pics d'activité, 20 à 30 % des appels restent sans réponse, les délais d'attente grimpent à 10-15 minutes, et le taux d'abandon atteint environ 30 %, dont 34 % des patients ne rappellent jamais. Ces frictions représentent une perte de revenus directe pour les établissements de santé, dont environ 25 % des coûts opérationnels sont liés à la gestion administrative des rendez-vous. En automatisant ces échanges tout en garantissant la confidentialité des données médicales, ScienceSoft cherche à désengorger les lignes téléphoniques sans sacrifier la confiance des patients. L'enjeu dépasse la simple automatisation d'un centre d'appels : il s'agit de démontrer qu'une IA générative peut opérer dans un secteur aussi réglementé que la santé américaine, où la conformité HIPAA, la nécessité d'une communication empathique et le risque de biais dans les décisions de planification sont des contraintes centrales. En s'appuyant sur les Bedrock Guardrails d'AWS pour encadrer les réponses du modèle Nova Sonic, ScienceSoft propose une architecture reproductible que d'autres établissements pourraient adapter à leurs propres flux de travail. Ce cas d'usage illustre une tendance plus large chez les fournisseurs cloud, qui cherchent à positionner leurs modèles vocaux non plus seulement comme des chatbots, mais comme des interlocuteurs capables de gérer des processus métier sensibles, où la fiabilité et l'auditabilité comptent autant que la fluidité conversationnelle.

OutilsActu
1 source
« Comment j'ai fait basculer l'IA du côté obscur »
1266IEEE Spectrum AI 

« Comment j'ai fait basculer l'IA du côté obscur »

Le chercheur en cybersécurité Dave Kuszmar a mis au jour plusieurs failles systémiques permettant de contourner les garde-fous des grands modèles de langage, une découverte qu'il détaille dans un long témoignage. Ancien directeur de la sécurité dans une startup spécialisée en IA, il a quitté ce poste en octobre 2024 pour lancer sa propre activité de conseil en sécurité numérique haut de gamme. C'est en observant que GPT-4o ignorait systématiquement la date, l'heure ou l'année réelles, se rabattant sur sa date limite de connaissances, qu'il a commencé à explorer les angles morts de ces systèmes. Ses techniques lui ont permis d'obtenir des instructions détaillées pour fabriquer des cocktails Molotov, cuisiner de la méthamphétamine, amorcer un processus d'enrichissement d'uranium jusqu'au grade militaire, ou encore compter les cartes au blackjack. La démonstration la plus frappante s'est déroulée dans le jeu vidéo Fortnite : avec son collègue Matthew Gore-Kormanik, alias Zigula, Kuszmar a discuté avec le personnage de Dark Vador, dont le moteur conversationnel s'appuyait sur Google Gemini, et a réussi à le convaincre de livrer ces informations sensibles. Cette faille n'est pas isolée : selon Kuszmar, elle traverse la quasi-totalité des grands modèles commerciaux, ce qui révèle un problème de sécurité à l'échelle de toute l'industrie plutôt qu'un simple bug ponctuel. Le paradoxe qu'il pointe est que les mêmes restrictions imposées par les éditeurs pour sécuriser leurs modèles constituent souvent le levier que des utilisateurs malveillants peuvent exploiter pour les faire dérailler. Étant donné la diffusion massive des chatbots grand public, la facilité relative avec laquelle ces outils peuvent être amenés à produire des instructions dangereuses, même sans garantie absolue de leur exactitude technique, représente selon lui un risque bien réel pour la sécurité publique. Ce qui inquiète particulièrement Kuszmar, c'est l'absence de réaction des grandes entreprises d'IA lorsqu'il a tenté de signaler ces vulnérabilités par les canaux habituels de divulgation responsable. Ce silence l'a poussé à rendre son travail public pour alerter avant qu'il ne soit trop tard. Il appelle désormais à ralentir le rythme de déploiement des modèles, à renforcer la transparence des entreprises sur leurs limites de sécurité, et à financer une recherche approfondie et à grande échelle sur la sûreté des LLM, avant que ces systèmes ne soient davantage intégrés aux usages quotidiens et aux infrastructures critiques.

SécuritéActu
1 source
L'IA d'AWS et Bluesight pour la conformité 340B des hôpitaux
1267AI News 

L'IA d'AWS et Bluesight pour la conformité 340B des hôpitaux

Amazon Web Services a détaillé comment Bluesight, éditeur spécialisé dans la gestion pharmaceutique hospitalière, a développé Prism, une couche d'intelligence artificielle reliant les données de pharmacie et de conformité à travers sa gamme de produits. Le premier module, Prism Assistant pour ControlCheck, est désormais disponible en version générale et fonctionne dans 20 réseaux hospitaliers américains, selon les chiffres communiqués par AWS. Un second agent, destiné à la conformité des achats groupés dans le cadre du programme fédéral 340B, doit sortir plus tard en 2026. Ce programme oblige certains hôpitaux, notamment ceux à but non lucratif ou spécialisés en cancérologie, à documenter chaque exception lorsqu'ils achètent des médicaments via des centrales d'achat plutôt que par les canaux habituels. AWS estime qu'un seul établissement peut consacrer plus de 4 000 heures de travail par an à croiser manuellement les données d'achat avec les alertes de pénurie de la FDA, les registres de l'American Society of Health-System Pharmacists et les prévisions de rupture de stock. L'équipe de Bluesight, huit ingénieurs épaulés par sept spécialistes d'AWS, a construit la première version de l'outil en trois jours seulement, lors d'un programme accéléré organisé en septembre 2025, en s'appuyant sur Strands Agents, Amazon Bedrock et l'environnement Bedrock AgentCore Runtime. Cette architecture change concrètement le travail quotidien des équipes de conformité pharmaceutique. Grâce à une interface conversationnelle interrogeant directement les données de ControlCheck, les délais de traitement d'une requête sont passés de cinq minutes à dix secondes, selon AWS. Samir Neyazi, directeur produit chez Bluesight, y voit un outil attendu par les responsables des programmes de lutte contre le détournement de médicaments, qui perdaient un temps considérable à enquêter manuellement. Au-delà du gain de temps, le choix technique est notable : plutôt que de laisser le modèle de langage accéder directement aux bases de données, les ingénieurs ont encapsulé les API existantes dans des fonctions AWS Lambda, gardant toute la logique métier dans la couche applicative. Cette précaution limite les risques d'erreurs ou de résultats incohérents dans un secteur où la conformité réglementaire est critique. Le futur agent dédié au 340B ambitionne d'aller plus loin en croisant les données de trois produits Bluesight, CostCheck pour les achats, ShortageCheck pour les pénuries et 340BCheck pour l'éligibilité, en s'appuyant sur les modèles Claude Sonnet 4.6 d'Anthropic pour les tâches complexes et Claude Haiku 4.5 pour les réponses rapides, le tout hébergé dans un cloud privé virtuel. Si AWS présente ce déploiement en moins de neuf mois comme une réussite, les médias spécialisés comme TechForge Media rappellent que ces délais restent des chiffres communiqués par le fournisseur, sans vérification indépendante des établissements hospitaliers concernés. Le dossier illustre néanmoins l'appétit croissant du secteur de la santé américain pour les agents IA appliqués à des tâches réglementaires lourdes et chronophages.

OutilsActu
1 source
Préparer les appels clients avec Google Gemini
1268The Information AI 

Préparer les appels clients avec Google Gemini

Google a publié un guide pratique détaillant comment utiliser son assistant Gemini pour préparer des appels commerciaux avec de nouveaux clients. La méthode se déroule en quatre étapes. D'abord, le commercial rassemble les documents pertinents (fiches produit, grilles tarifaires, formulaires déjà remplis par le prospect) et les téléverse dans Gemini, avant de demander un script d'appel personnalisé via un prompt détaillé précisant la durée de l'appel (30 minutes dans l'exemple donné), le format (visioconférence) et les éléments à inclure : réponse aux points de friction du client, garanties de livraison, tableau de remises selon les volumes, et espace réservé pour une référence client du même secteur. Ensuite, l'utilisateur affine le brouillon en dialoguant avec l'IA, qui peut aussi poser des questions pour cerner le rôle ou les priorités de l'interlocuteur. Une troisième étape consiste à générer, dans le même fil de conversation, un pitch condensé de 30 secondes reprenant les bénéfices clés et les points de différenciation face à la concurrence. Enfin, Google recommande une relecture humaine finale juste avant l'appel pour vérifier la cohérence avec la réalité de l'offre. Cette approche répond à un problème très concret pour les équipes commerciales : la difficulté à structurer un premier contact avec un prospect qui ne connaît rien du produit, où le risque est de noyer l'interlocuteur sous trop d'informations par peur d'en oublier. En positionnant Gemini comme un "partenaire de réflexion" plutôt qu'un simple générateur de texte, Google cherche à démontrer une utilisation professionnelle concrète de l'IA générative en dehors des cas d'usage habituels (rédaction, code, analyse), en visant directement les équipes de vente B2B. L'argument de vente implicite est un gain de temps sur la phase de préparation, souvent chronophage, tout en laissant le jugement final et l'expertise métier entre les mains du commercial, ce qui limite le risque d'erreurs factuelles dans un contexte à fort enjeu commercial. Cette publication s'inscrit dans la stratégie plus large de Google visant à ancrer Gemini dans les usages professionnels quotidiens, face à la concurrence de ChatGPT d'OpenAI et de Copilot de Microsoft sur le marché des outils d'IA en entreprise. Les trois grands acteurs multiplient les guides d'usage sectoriels pour convaincre les entreprises d'intégrer leurs assistants dans des flux de travail spécifiques, ici la vente, plutôt que de les cantonner à des tâches génériques. La bataille se joue autant sur la puissance des modèles que sur la capacité à démontrer des cas d'usage concrets et mesurables, un axe sur lequel Google mise fortement pour Gemini au sein de sa suite Workspace.

OutilsTuto
1 source
Performance par watt : la métrique clé pour l'efficacité des infrastructures d'IA
1269NVIDIA AI Blog 

Performance par watt : la métrique clé pour l'efficacité des infrastructures d'IA

Le journal d'électricité disponible détermine désormais combien de tokens une "AI factory" peut générer, et donc son chiffre d'affaires et sa rentabilité. NVIDIA défend l'idée que la performance par watt, une métrique qui ne peut être trafiquée mais seulement gagnée par des résultats réels, devient la mesure de référence pour l'infrastructure IA. Pratiquement tous les modèles de pointe reposent aujourd'hui sur une architecture "mixture-of-experts" (MoE), ce qui exige une conception conjointe de toutes les couches matérielles et logicielles pour servir ces modèles à l'échelle d'un rack. La plateforme Blackwell NVL72 de NVIDIA constitue cette base, avant que la future plateforme Vera Rubin ne la prolonge. Sur les modèles ouverts les plus récents, les systèmes GB300 NVL72 affichent jusqu'à 25 fois plus de performance par watt que la génération Hopper sur DeepSeek V4 Pro, 20 fois sur GLM5.1, et 10 fois sur Kimi K2.6, un modèle conçu pour les tâches agentiques de longue durée, selon les données de SemiAnalysis InferenceX. NVIDIA précise que ces chiffres évoluent encore et publie des courbes de Pareto par modèle plutôt qu'un score unique, avec un outil nommé DynoSim permettant aux équipes de trouver leur point d'équilibre optimal entre latence, débit et coût avant de mobiliser la moindre heure de calcul GPU pour validation. Cette efficacité résulte d'une conception intégrée entre silicium et logiciel. Le commutateur NVLink, désormais dans sa sixième génération avec Vera Rubin, est pensé spécifiquement pour les charges de travail IA, avec des fonctions comme SHARP qui déportent des calculs directement dans le réseau plutôt que sur les GPU. La pile logicielle d'inférence, incluant Dynamo, TensorRT LLM, SGLang et vLLM, combine quantification NVFP4, service désagrégé, parallélisme d'experts à grande échelle et gestion du cache KV. Ces optimisations logicielles continuent de progresser dans le temps : sur DeepSeek V4, la performance par watt s'est améliorée jusqu'à 5 fois en un seul mois, sans changement matériel. L'enjeu dépasse la seule puce : dans les data centers IA actuels, les pertes liées au refroidissement et à l'inefficacité des racks font qu'environ 60% seulement de l'électricité tirée du réseau se transforme en calcul utile. Pour combler cet écart, NVIDIA propose DSX MaxLPS, le logiciel de gestion énergétique de sa plateforme DSX, qui répartit la puissance entre GPU et racks en temps réel et s'appuie sur le refroidissement liquide à eau tiède. L'enjeu, dans un monde où la disponibilité électrique devient la contrainte principale de l'IA, est de déterminer quelles entreprises pourront continuer à faire croître leurs capacités de calcul face à la demande croissante générée par l'IA agentique, et lesquelles se heurteront à un plafond énergétique. Cette course à l'efficacité oppose directement NVIDIA à ses concurrents sur le terrain du coût par token généré, un indicateur qui devient central dans les décisions d'investissement des opérateurs de centres de données à travers le monde.

InfrastructureActu
1 source
L'évaluation des modèles devient encore plus difficile
1270The Information AI 

L'évaluation des modèles devient encore plus difficile

Ce succès pourrait sembler technique, mais il touche au cœur même de la course à l'intelligence artificielle : comment savoir si un modèle est réellement performant. Lors de la conférence ICML, qui s'est tenue la semaine dernière, plusieurs chercheurs ont souligné une difficulté grandissante. À mesure que les modèles progressent, ils saturent rapidement les référentiels d'évaluation existants, obligeant la communauté scientifique à concevoir sans cesse de nouveaux tests plus exigeants. Mais un problème plus insidieux se profile : certains modèles sont désormais capables de travailler sur une tâche pendant des heures, voire des jours entiers. Noam Brown, chercheur chez OpenAI, a averti lors d'un panel à l'ICML que l'on s'approche rapidement d'un point où les modèles pourront fonctionner "pendant des semaines, voire indéfiniment". Cette évolution pose un problème pratique majeur : si un modèle met des jours à accomplir une tâche, évaluer sa performance prend tout autant de temps. Brown a précisé que le processus de vérification pourrait bientôt durer plus longtemps que l'entraînement du modèle lui-même. Pour des applications comme la découverte de médicaments, un modèle pourrait passer des semaines à mener des expériences et à analyser les résultats obtenus, un scénario où cette autonomie prolongée devient un atout plutôt qu'un obstacle. Mais du point de vue de la recherche, cela complique considérablement le travail des équipes chargées de mesurer les progrès réels de l'IA. Ce constat s'inscrit dans un débat plus large sur la manière de mesurer le progrès en intelligence artificielle à l'heure où les capacités des modèles dépassent les outils censés les évaluer. Les benchmarks traditionnels, conçus pour des tâches courtes et ponctuelles, deviennent obsolètes face à des systèmes capables d'autonomie prolongée sur des missions complexes. Ce décalage risque de ralentir le rythme du développement des modèles, puisque les équipes de recherche devront attendre plus longtemps avant de pouvoir juger si une nouvelle version constitue réellement une amélioration. La question qui se pose désormais est de savoir comment concevoir des méthodes d'évaluation adaptées à des IA de plus en plus autonomes, sans pour autant freiner l'innovation.

RecherchePaper
1 source
[VIDÉO]Claude AI : les fonctionnalités que 99 % des débutants ignorent
1271Le Big Data 

[VIDÉO]Claude AI : les fonctionnalités que 99 % des débutants ignorent

Une nouvelle vidéo publiée sur LEBIGDATA.FR détaille les fonctionnalités de Claude AI que la plupart des débutants n'exploitent jamais. Le constat de départ est simple: la grande majorité des utilisateurs se limite à Claude Chat, l'interface conversationnelle classique accessible sur navigateur, mobile et ordinateur, sans savoir qu'elle ne représente qu'une fraction de ce que propose réellement l'assistant d'Anthropic. La vidéo recense six fonctionnalités au total, dont cinq restent largement méconnues du grand public. Parmi elles figurent des outils permettant d'agir directement sur les fichiers et le système de l'utilisateur, une fonction pour déléguer des tâches à distance depuis un smartphone, ainsi qu'un module dédié à la création d'applications complètes sans nécessiter de compétences en développement. Deux modules complémentaires viennent enfin étendre ces capacités pour automatiser des tâches répétitives. Cette méconnaissance a un coût concret pour les utilisateurs professionnels et occasionnels de Claude: se cantonner au simple chat revient à se priver d'un gain de productivité potentiellement important, notamment pour les tâches d'automatisation ou de développement rapide d'applications. Savoir qu'un outil no-code de création d'applications existe au sein de Claude, par exemple, peut éviter de passer par des solutions tierces payantes ou de faire appel à un développeur pour des besoins simples. De la même façon, la possibilité de déléguer des tâches depuis un téléphone change la manière dont l'IA peut s'intégrer dans un usage nomade, en dehors du poste de travail habituel. Ce type de contenu pédagogique s'inscrit dans une tendance plus large: à mesure que les assistants IA comme Claude, ChatGPT ou Gemini multiplient les fonctionnalités avancées (agents, exécution de code, intégrations tierces), l'écart se creuse entre utilisateurs avertis et grand public, qui reste souvent bloqué sur l'usage conversationnel de base. Anthropic, comme ses concurrents, mise sur ces couches supplémentaires pour justifier des offres payantes et fidéliser une base d'utilisateurs professionnels, ce qui rend ce genre de tutoriel utile pour combler l'écart de connaissance entre les capacités réelles de l'outil et son usage effectif.

OutilsTuto
1 source
Google et ses partenaires annoncent une spécification de découverte de ressources pour agents IA
1272InfoQ AI 

Google et ses partenaires annoncent une spécification de découverte de ressources pour agents IA

Google et plusieurs partenaires industriels ont dévoilé la spécification Agentic Resource Discovery (ARD), un standard ouvert destiné à la publication, la découverte et la vérification d'outils, d'API et d'agents d'intelligence artificielle. Présentée par Leela Kumili, cette annonce introduit une couche de découverte reposant sur des catalogues et des registres, permettant aux systèmes d'IA de repérer dynamiquement les capacités disponibles. ARD s'appuie sur des protocoles déjà établis comme MCP (Model Context Protocol) et OpenAPI pour la partie exécution, se positionnant comme une brique complémentaire plutôt qu'un remplacement de l'existant. Cette initiative répond à un problème concret pour les développeurs d'agents IA : à mesure que les outils, API et sous-agents se multiplient, il devient difficile de savoir quelles capacités existent, où les trouver et si elles sont fiables. En standardisant la découverte et la vérification, ARD pourrait simplifier la construction de systèmes multi-agents capables de composer des services entre eux de façon sûre et interopérable, un enjeu central pour les entreprises qui déploient des agents IA à grande échelle dans leurs infrastructures. Cette annonce s'inscrit dans une dynamique plus large de standardisation de l'écosystème agentique, où plusieurs acteurs cherchent à éviter une fragmentation des protocoles. Le MCP, porté notamment par Anthropic, s'est imposé comme référence pour la connexion des modèles aux outils externes, tandis qu'OpenAPI reste le standard pour décrire les API. En misant sur ces fondations existantes plutôt qu'en créant un protocole rival, Google et ses partenaires cherchent à renforcer la confiance et l'adoption. Les prochaines étapes attendues concernent l'implémentation concrète par les fournisseurs de cloud et les éditeurs d'outils IA.

OutilsActu
1 source
Comment utiliser GPT-5.6
1273Ben's Bites 

Comment utiliser GPT-5.6

OpenAI a déployé la nouvelle génération GPT-5.6 pour l'ensemble des utilisateurs, accompagnée de plusieurs changements de produit. L'application macOS de ChatGPT et l'application Codex ont fusionné, donnant naissance à un nouveau mode baptisé ChatGPT Work, dont l'interface reprend celle de Codex en distinguant les tâches de codage des tâches générales. Un nouveau plugin, ChatGPT Sites, permet également de créer des sites web hébergés avec une option de connexion via ChatGPT. La série GPT-5.6 comprend trois modèles, Luna, Terra et Sol, chacun disponible selon cinq niveaux de réflexion, léger, moyen, élevé, très élevé et maximal, ainsi qu'un nouveau mode Ultra qui active un fonctionnement par sous-agents multiples. Ce mode consomme cependant très rapidement les quotas d'utilisation, au point que certains utilisateurs se sont retrouvés proches de la limite dès leur première utilisation dans Codex. Au cours du week-end, OpenAI a dû réinitialiser plusieurs fois les quotas, entre quatre et cinq fois, pour corriger des bugs liés à la fusion des applications, et a temporairement supprimé la limite de cinq heures sur l'usage, ce qui signifie que les limites hebdomadaires peuvent désormais être atteintes en une seule session intensive. Ces changements ont un impact concret sur la façon dont développeurs et utilisateurs professionnels organisent leur travail quotidien avec l'IA. Sol, jugé particulièrement performant pour la conception d'interfaces et l'écriture lorsqu'il est poussé en mode maximal, devient un outil de choix pour la création et la rédaction, tandis que Terra se positionne comme une évolution incrémentale de la version 5.5, plus pilotable grâce à un meilleur suivi des instructions. Luna, plus économe, convainc moins sur les requêtes ambiguës mais reste fiable sur des tâches bien définies. La fonctionnalité Computer Use, qui permet à ces modèles de piloter eux-mêmes le curseur pour ouvrir des applications et cliquer sur des boutons en analysant l'écran, marque une avancée notable vers l'automatisation de tâches numériques complexes, un axe stratégique majeur pour OpenAI face à la concurrence. Cette sortie s'inscrit dans un climat de compétition intense entre laboratoires d'IA. Anthropic a de son côté prolongé jusqu'au 19 juillet les limites hebdomadaires élevées de Claude Code, tandis que Meta a publié Muse Spark 1.1, un modèle multimodal à fenêtre de contexte d'un million de tokens, proposé à un tarif plus compétitif via son API. Le contexte reste par ailleurs tendu sur le plan juridique, puisqu'Apple poursuit OpenAI et deux anciens employés pour vol présumé de secrets industriels liés à son futur matériel d'intelligence artificielle, accusation qu'OpenAI conteste fermement.

LLMsActu
1 source
L'envers du décor de Claude, et l'avenir des modèles du monde
1274MIT Technology Review 

L'envers du décor de Claude, et l'avenir des modèles du monde

Anthropic a dévoilé la semaine dernière une nouvelle méthode permettant d'observer les « pensées internes » de son modèle Claude pendant qu'il raisonne pour produire une réponse. James O'Donnell, journaliste chez MIT Technology Review, en a discuté avec Will Douglas Heaven, rédacteur en chef IA du magazine et titulaire d'un doctorat en informatique, qui étudie depuis longtemps ce que l'on peut réellement affirmer sur le fonctionnement des modèles d'IA. Le même jour, MIT Technology Review organisait un événement LinkedIn Live sur l'avenir des « world models », ces systèmes censés permettre à l'IA de mieux comprendre le monde physique, avec Sam Sinha, responsable recherche sur les modèles du monde chez 1X Technologies. Parmi les autres actualités marquantes du jour : l'État de New York est devenu le premier à instaurer un moratoire sur la construction de nouveaux data centers, pouvant aller jusqu'à un an ; les expéditions de smartphones ont chuté de 11 % au deuxième trimestre 2026, un plus bas en treize ans, en raison d'une pénurie de puces mémoire ; des molécules de sucre ont été détectées pour la première fois dans l'espace interstellaire ; et Nvidia a réduit de moitié sa liste d'acheteurs autorisés en Asie pour limiter les fuites de puces IA vers la Chine. Ces informations illustrent des tensions structurelles qui traversent actuellement l'industrie technologique. La recherche d'Anthropic sur l'interprétabilité de Claude touche à un enjeu central pour la sécurité de l'IA : comprendre pourquoi un modèle répond ce qu'il répond, plutôt que de le traiter comme une boîte noire, condition jugée essentielle pour anticiper ses erreurs ou ses biais, révélés notamment par une étude montrant que les valeurs exprimées par Claude varient selon la langue utilisée, le modèle se montrant plus prudent en anglais et plus déférent en arabe. Du côté matériel, le moratoire new-yorkais et la pénurie de mémoire traduisent les limites physiques et énergétiques que rencontre la croissance de l'IA, tandis que le durcissement des contrôles américains sur les exportations de puces vers la Chine, dans la continuité de la politique de l'administration Trump, souligne la dimension géopolitique croissante de cette course technologique. Ces différents fronts, recherche fondamentale sur l'explicabilité des modèles, contraintes d'infrastructure et rivalité stratégique autour des semi-conducteurs, dessinent les grands axes qui façonneront le développement de l'IA dans les mois à venir. Les résultats d'Anthropic, bien que qualifiés de préliminaires par ses propres chercheurs, s'inscrivent dans un effort plus large de la discipline de l'interprétabilité, qui cherche à rendre les grands modèles de langage moins opaques avant qu'ils ne soient déployés à plus grande échelle dans des secteurs sensibles comme la robotique, la santé ou la sécurité nationale.

SécuritéActu
1 source
PixVerse dépasse les 2 milliards de dollars : l’IA vidéo devient l’un des marchés les plus convoités
1275Le Big Data 

PixVerse dépasse les 2 milliards de dollars : l’IA vidéo devient l’un des marchés les plus convoités

PixVerse, jeune pousse singapourienne fondée en 2023, a annoncé le 14 juillet 2026 avoir bouclé une extension de sa série C portant le total des fonds levés à 439 millions de dollars. Cette opération fait grimper sa valorisation au-delà des 2 milliards de dollars, un cap franchi en seulement trois ans d'existence. L'entreprise a été créée par Wang Changhu, ancien spécialiste de la vision par ordinateur chez ByteDance, et Jaden Xie. Elle revendique aujourd'hui plus de 150 millions d'utilisateurs inscrits et 15 millions d'utilisateurs actifs mensuels. Sa plateforme permet de générer des vidéos en résolution 4K avec audio synchronisé intégré, pour un tarif annoncé d'environ 4,80 dollars la minute. L'offre s'adresse à la fois aux créateurs individuels et aux entreprises, via un accès API et plusieurs modèles spécialisés destinés au cinéma, à la publicité ou au développement de jeux vidéo. Cette levée illustre un basculement des priorités des investisseurs dans l'IA générative : après le texte et l'image, c'est désormais la vidéo qui concentre les capitaux, car elle représente un défi technique nettement plus complexe. Générer plusieurs dizaines d'images cohérentes par seconde, tout en respectant mouvements, physique, expressions, éclairage et audio synchronisé, exige des infrastructures GPU massives, des volumes de données considérables et une expertise pointue en vision par ordinateur. Peu d'acteurs réunissent ces ressources, ce qui crée une rareté sur laquelle PixVerse entend capitaliser. Pour les directions marketing, les agences, les studios de création ou les équipes de formation, ces outils promettent une production de contenus plus rapide et moins coûteuse, même si une supervision humaine reste nécessaire pour garantir la qualité et la conformité des productions, notamment pour les campagnes publicitaires, le contenu e-commerce ou la communication interne. Les fonds serviront à améliorer les modèles de PixVerse et à accélérer son expansion hors d'Asie, avec un renforcement du ciblage entreprises. La startup prévoit notamment d'intégrer ses capacités de génération vidéo dans l'écosystème d'Alibaba, tout en recrutant davantage de chercheurs et de spécialistes marketing. Selon Jaden Xie, l'avantage concurrentiel de l'entreprise ne réside pas uniquement dans la qualité visuelle des vidéos produites, mais avant tout dans la qualité de l'étiquetage des données d'entraînement, un savoir-faire hérité de l'expérience de ses fondateurs chez ByteDance. Cette annonce s'inscrit dans une accélération plus large du marché de l'IA vidéo, où les fournisseurs cherchent désormais à séduire non seulement les créateurs de contenu, mais aussi les entreprises désireuses d'automatiser une partie de leur production audiovisuelle, dans un contexte de concurrence internationale de plus en plus disputée entre startups chinoises, américaines et asiatiques.

BusinessActu
1 source
Claude fait preuve de plus de chaleur en hindi et de plus de rigueur en russe, révélant l'influence de la langue sur ses réponses
1276The Decoder 

Claude fait preuve de plus de chaleur en hindi et de plus de rigueur en russe, révélant l'influence de la langue sur ses réponses

Cette étude Anthropic sur les valeurs exprimées par Claude selon la langue et le modèle utilisé cartographie des centaines de concepts de valeurs issus de milliers de termes individuels, organisés autour de quatre dimensions fondamentales. Les chercheurs ont observé des différences systématiques et reproductibles selon la langue de conversation : Claude adopte un ton plus chaleureux et empathique lorsqu'il répond en hindi, tandis qu'il privilégie une approche plus rigoureuse et factuelle en russe. Ces variations apparaissent également d'un modèle à l'autre, suggérant que l'entraînement et l'architecture influencent directement la manière dont l'IA hiérarchise certaines valeurs plutôt que d'autres selon le contexte linguistique. Cette découverte a des implications concrètes pour les millions d'utilisateurs qui interagissent avec Claude dans des langues différentes de l'anglais, la langue principale d'entraînement du modèle. Si un assistant IA adapte inconsciemment son registre moral ou émotionnel selon la langue employée, cela soulève des questions d'équité et de cohérence pour les entreprises qui déploient ces outils à l'international. Un utilisateur russophone et un utilisateur hindiphone pourraient ainsi recevoir des réponses de nature différente face à une même question sensible, ce qui pose un défi pour les développeurs cherchant à garantir une expérience homogène à travers les marchés. Cette étude s'inscrit dans un effort plus large d'Anthropic pour comprendre et documenter le comportement de ses modèles, alors que les grands acteurs de l'IA générative font face à une pression croissante pour prouver la fiabilité et la prévisibilité de leurs systèmes. Les auteurs reconnaissent toutefois des limites méthodologiques dans leur approche de cartographie des valeurs, ouvrant la voie à des recherches complémentaires. Ces travaux interviennent alors que la question de l'alignement culturel et linguistique des IA devient un enjeu central pour les régulateurs et les entreprises déployant ces technologies à l'échelle mondiale, notamment en Europe et en Asie.

ÉthiquePaper
1 source
Pourquoi les investisseurs misent encore des milliards sur MiniMax malgré une chute de 80 % ?
1277Le Big Data 

Pourquoi les investisseurs misent encore des milliards sur MiniMax malgré une chute de 80 % ?

Malgré une chute d'environ 80 % de son cours depuis le pic atteint en mars 2026, la start-up chinoise MiniMax, cotée à Hong Kong, a annoncé le 10 juillet une levée de fonds pouvant atteindre 2 milliards de dollars. L'opération combine l'émission de 35,6 millions d'actions nouvelles, proposées avec une décote d'environ 10 % par rapport au dernier cours de clôture, et des obligations convertibles à coupon zéro arrivant à échéance en 2027. Selon Bloomberg, la souscription a été sursouscrite sept fois, avec la participation de fonds souverains. L'annonce intervient juste après un effondrement boursier marqué : le titre a perdu 18 % le premier jour de l'expiration de la période de blocage des actions, puis 12 % supplémentaires le lendemain. Dans la foulée, le fondateur et PDG Yan Junjie a annoncé renoncer à son salaire jusqu'à ce que l'entreprise atteigne l'intelligence artificielle générale (AGI), et prévoit de céder progressivement sur quatre ans des actions représentant 4 % du capital à ses employés, avec 1 % supplémentaire alloué à un fonds dédié à des projets internes. Cette opération révèle surtout que les investisseurs, y compris des fonds souverains, continuent de miser des sommes considérables sur les entreprises jugées capables de peser dans la course mondiale à l'AGI, même quand leur trajectoire commerciale immédiate déçoit. Le modèle M3 de MiniMax, lancé début juin, n'a pas rencontré le succès espéré auprès des entreprises ciblées : quelques jours seulement après son lancement, la société a dû réduire de moitié le prix de son offre la plus performante, un geste largement interprété comme un aveu de pression concurrentielle plutôt qu'une simple manœuvre tarifaire. Pour l'industrie, ce financement massif malgré une valorisation dégradée envoie un signal fort : dans la bataille pour les modèles de nouvelle génération, le capital continue d'affluer vers les acteurs jugés stratégiques, indépendamment des soubresauts boursiers de court terme. Ce paradoxe apparent s'explique par l'ampleur des investissements qu'exige aujourd'hui le développement d'un modèle d'IA de pointe : entraînement des modèles, achat massif de GPU, infrastructures cloud et recrutement de chercheurs représentent des dépenses qui se chiffrent en milliards de dollars. Manquer une levée de fonds dans ce contexte peut faire perdre plusieurs années d'avance face à des rivaux chinois et occidentaux également engagés dans cette course. Le geste de Yan Junjie, renoncer à son salaire et redistribuer une part de ses actions aux employés, s'inscrit dans cette logique : il vise à rassurer équipes et investisseurs sur l'engagement à long terme de la direction, au moment où le marché doute de la capacité de MiniMax à monétiser rapidement sa technologie. La suite dépendra largement de la compétitivité réelle des futurs modèles de l'entreprise, seule façon de transformer ce pari financier en avantage durable.

BusinessOpinion
1 source
Samsung mise sur Gemini Enterprise : Google Cloud accélère l’essor de l’IA agentique en entreprise
1278Le Big Data 

Samsung mise sur Gemini Enterprise : Google Cloud accélère l’essor de l’IA agentique en entreprise

Google Cloud et Samsung Electronics ont annoncé le déploiement mondial de Gemini Enterprise auprès des employés de la division Device eXperience (DX) du groupe sud-coréen, celle qui pilote les smartphones Galaxy, les téléviseurs et l'électroménager. Présenté par Google Cloud comme le plus important déploiement d'IA d'entreprise jamais réalisé en Corée, cet accord installe l'application comme point d'accès unifié aux bases de connaissances internes de Samsung, dispersées jusqu'ici sur plusieurs plateformes. Concrètement, les salariés pourront rechercher, synthétiser et exploiter ces informations sans naviguer manuellement d'un système à l'autre. Ruth Sun, présidente de Google Cloud Korea, décrit l'objectif comme le passage d'une simple amélioration de productivité à une véritable intelligence opérationnelle, l'IA devenant un outil intégré aux processus métier plutôt qu'un assistant de rédaction. L'ensemble fonctionnera dans un environnement Google Cloud dédié exclusivement à la division DX, afin de garder les données sensibles dans un périmètre contrôlé. Cette annonce marque une bascule stratégique pour l'industrie de l'IA en entreprise. Depuis deux ans, les fournisseurs ont surtout vendu des chatbots capables de répondre à des questions ou de résumer des documents. Avec ce partenariat, Google Cloud pousse Samsung vers l'étape suivante, celle des agents IA autonomes, capables de consulter plusieurs sources, d'enchaîner des raisonnements et de déclencher des actions dans différents systèmes informatiques. Pour un groupe de la taille de Samsung, cela représente un test grandeur nature de la capacité de l'IA agentique à transformer réellement des workflows internes, au-delà de l'effet vitrine. Pour les autres grandes entreprises qui observent le marché, ce déploiement sert de cas d'usage de référence pour juger si l'IA agentique tient ses promesses en conditions réelles, tout en répondant à une préoccupation partagée par tous les grands groupes : exploiter un patrimoine documentaire volumineux sans perdre la maîtrise des données sensibles. Le projet s'inscrit dans la stratégie plus large de Google autour de Vertex AI et de ses outils Agent Builder, qui visent à démocratiser la création d'agents IA au sein des entreprises. Le partenariat prévoit ainsi une plateforme combinant des outils low-code et no-code, destinés aux équipes RH, marketing ou conformité pour construire leurs propres assistants sans compétences de programmation avancées, et un environnement plus complet pour les ingénieurs souhaitant concevoir des modèles personnalisés. Cette approche traduit une volonté de sortir la création d'agents IA du seul giron des équipes techniques. Reste à voir comment ce déploiement à grande échelle chez Samsung se traduira concrètement dans les mois à venir, et s'il incitera d'autres géants industriels, notamment en Asie, à suivre une trajectoire similaire face à la concurrence de Microsoft et d'autres fournisseurs cloud sur ce même terrain de l'IA agentique.

BusinessActu
1 source
Robostral Navigate de Mistral AI : un modèle de 8 milliards de paramètres qui permet aux robots de naviguer dans des environnements complexes avec une simple caméra RGB
1279MarkTechPost 

Robostral Navigate de Mistral AI : un modèle de 8 milliards de paramètres qui permet aux robots de naviguer dans des environnements complexes avec une simple caméra RGB

Mistral AI a dévoilé Robostral Navigate, son premier modèle conçu pour la navigation robotique incarnée. Ce modèle de 8 milliards de paramètres prend en entrée des images RGB issues d'une simple caméra et une instruction en langage naturel, puis pilote un robot à travers un environnement complexe, qu'il s'agisse de bureaux, d'immeubles résidentiels ou commerciaux, ou d'espaces extérieurs. Contrairement à la plupart des systèmes de navigation qui s'appuient sur des capteurs de profondeur, du LiDAR ou plusieurs caméras, Robostral Navigate fonctionne avec une seule caméra RGB classique, sans capteur de profondeur. Il atteint 79,4% de taux de réussite sur le benchmark R2R-CE (Room-to-Room in Continuous Environments, basé sur Matterport3D) en validation sur environnements connus, et 76,6% en validation sur environnements inconnus, dépassant de 9,7 points la meilleure approche à caméra unique et de 4,5 points les meilleurs systèmes utilisant profondeur ou caméras multiples. Pour l'entraînement, Mistral a généré environ 400 000 trajectoires réparties sur 6 000 scènes simulées, et a appliqué ensuite un algorithme d'apprentissage par renforcement en ligne nommé CISPO, qui a permis un gain supplémentaire de 3,2% de taux de réussite. Cette avancée compte pour l'industrie robotique car elle réduit drastiquement le coût matériel nécessaire à une navigation autonome fiable: une seule caméra ordinaire suffit là où les concurrents multiplient les capteurs LiDAR ou de profondeur, ce qui rend le déploiement à grande échelle plus abordable pour les fabricants de robots domestiques, industriels ou de service. La méthode de "pointing", où le modèle prédit directement les coordonnées du point cible dans l'image plutôt que des déplacements métriques, rend aussi le système plus robuste aux changements de caméra ou d'échelle du monde réel, un problème récurrent qui limitait jusqu'ici la généralisation des robots entre différents matériels. Enfin, l'optimisation de l'entraînement via une technique de mise en cache des préfixes a permis de réduire le nombre de tokens d'entraînement par un facteur 22, transformant des cycles de recherche qui prenaient des mois en quelques jours seulement. Ce lancement s'inscrit dans la stratégie plus large de Mistral AI visant à construire des modèles fondamentaux au-delà du seul traitement du langage, en misant sur ses modèles de vision-langage déjà entraînés pour des tâches de repérage, de comptage et de localisation d'objets, dont la navigation apparaît comme une extension naturelle. Cette approche s'oppose au recours classique aux modèles open source existants et positionne l'entreprise française comme un acteur crédible face aux géants américains dans la course à la robotique généraliste, un secteur où Google DeepMind, Tesla et plusieurs startups spécialisées investissent massivement. Les prochaines étapes attendues concernent probablement l'élargissement à d'autres tâches de manipulation robotique et le déploiement sur du matériel commercial réel.

RobotiqueActu
1 source
Cette police d’écriture met l’IA en échec… tandis que les humains la lisent sans effort
1280Le Big Data 

Cette police d’écriture met l’IA en échec… tandis que les humains la lisent sans effort

Le designer Eric Lu a dévoilé le 11 juillet 2026 une police d'écriture expérimentale baptisée Ghost Font, capable de tromper plusieurs intelligences artificielles tout en restant parfaitement lisible pour un œil humain. Contrairement à une police classique, aucune lettre n'est dessinée avec des contours ou des traits fixes. À l'écran, des milliers de petits points se déplacent selon deux trajectoires distinctes : ceux qui composent les lettres suivent une direction, tandis que les autres points, en arrière-plan, suivent un mouvement différent. Le cerveau humain regroupe instinctivement ces déplacements cohérents et fait apparaître le mot caché en quelques secondes, sans effort conscient. Dès que l'animation s'arrête, l'illusion s'évanouit totalement et l'image redevient un nuage de points sans aucune structure visible. Sur X, Eric Lu a affirmé avoir testé sa création sur plusieurs modèles d'IA multimodaux, sans qu'aucun ne parvienne à déchiffrer correctement le message. Certaines versions du projet vont plus loin en intégrant un faux texte : l'IA répond alors avec assurance en lisant un message erroné, alors que l'humain continue de percevoir le véritable contenu. Cette expérience met en lumière une différence fondamentale entre la perception humaine et celle des machines, plutôt qu'une simple faiblesse ponctuelle des modèles comme ceux d'OpenAI, Google ou Anthropic. Le système visuel humain excelle dans la détection du mouvement : en une fraction de seconde, il assemble les variations entre plusieurs images pour reconstituer une forme cohérente. Ghost Font exploite précisément ce mécanisme, en supprimant les contours nets et les contrastes stables sur lesquels reposent la plupart des systèmes de reconnaissance de texte. Les modèles multimodaux, eux, traitent souvent une vidéo comme une simple succession d'images isolées, ce qui les empêche de reconstituer le mouvement global porteur d'information. Cela ne rend toutefois pas l'IA totalement aveugle au procédé : plusieurs développeurs ont rapporté de meilleurs résultats en demandant explicitement aux modèles d'analyser les images une par une, preuve que la faille peut être en partie contournée avec la bonne méthode. Le principe rappelle directement les premiers CAPTCHA, ces textes déformés que les internautes devaient identifier pour prouver qu'ils n'étaient pas des robots. À l'époque, la distorsion portait sur la forme des lettres elles-mêmes, une technique devenue largement obsolète face aux progrès de la reconnaissance d'image par IA. Ghost Font renouvelle cette logique en déplaçant l'information non plus sur la forme statique, mais sur le mouvement. Ce projet illustre ainsi un enjeu plus large : à mesure que l'IA progresse, les méthodes conçues pour distinguer humains et machines doivent elles aussi évoluer, ouvrant la voie à de nouvelles formes de vérification visuelle fondées sur nos capacités perceptives encore hors de portée des algorithmes.

SécuritéActu
1 source