Aller au contenu principal

Dossier NVIDIA — page 7

902 articles · page 7 sur 19

NVIDIA, l'arsenal de la course IA : Blackwell, Vera Rubin, Vera CPU, partenariats hyperscalers, Omniverse, et la rente CUDA face aux puces Huawei et Trainium.

301The Information AI InfrastructureActu

L'AWS fait face a une forte demande, poussant de plus en plus de startups a se tourner vers de nouveaux fournisseurs cloud

Arcee, une startup spécialisée dans l'intelligence artificielle open-source, avait signé en 2024 un engagement de 8 millions de dollars sur trois ans avec Amazon Web Services pour stocker ses données et faire tourner ses modèles d'IA. Problème selon son PDG Mark McQuade : l'entreprise n'est pas parvenue à obtenir suffisamment de serveurs équipés de puces Nvidia sur AWS pour répondre à ses besoins de calcul. Résultat, Arcee a fini par exécuter la majorité de ses modèles ailleurs, notamment chez des acteurs cloud plus récents comme Hugging Face et Together, plutôt que chez le géant du secteur. Cette situation illustre une tension croissante dans l'industrie de l'IA : la demande en puissance de calcul explose plus vite que les grands fournisseurs cloud ne peuvent l'absorber, même pour des clients ayant contractuellement réservé des ressources. Pour des startups comme Arcee, dépendre d'un fournisseur historique saturé devient un frein direct à l'innovation et à la mise en production de leurs modèles. Cela ouvre une brèche commerciale pour des plateformes spécialisées dans l'hébergement et l'exécution de modèles d'IA, capables de proposer un accès plus rapide au matériel Nvidia. Le cas d'Arcee reflète un mouvement plus large où des clients d'AWS, historiquement fidèles au leader du cloud, se tournent vers des alternatives pour contourner les pénuries de capacité GPU. Cette pénurie, alimentée par la ruée mondiale vers l'entraînement et le déploiement de grands modèles de langage, redessine les rapports de force entre fournisseurs cloud traditionnels et nouveaux entrants spécialisés dans l'infrastructure IA.

1 source
302Le Big Data 

Prime Intellect : pourquoi les entreprises créent leurs propres agents IA plutôt que d’utiliser ChatGPT ?

Prime Intellect, une startup américaine fondée en 2024, vient de lever 130 millions de dollars lors d'un tour de série A mené par Radical Ventures, portant sa valorisation à un milliard de dollars. Parmi les investisseurs figurent également Nvidia, Intel Capital, Dell, ainsi qu'une liste de business angels issus de Perplexity, Box, Harvey, Cognition ou encore Zapier. Contrairement à OpenAI ou Anthropic, l'entreprise ne cherche pas à développer un nouveau grand modèle de langage généraliste. Son ambition, selon son cofondateur Vincent Weisser, est de fournir aux entreprises l'infrastructure technique complète pour entraîner et adapter leurs propres agents d'intelligence artificielle, sans dépendre exclusivement des grands laboratoires qui concentrent aujourd'hui les capacités de développement des modèles les plus avancés. Cette levée de fonds illustre un basculement dans la manière dont les entreprises abordent l'IA générative. Après avoir massivement adopté des outils prêts à l'emploi comme ChatGPT pour automatiser certaines tâches, de nombreuses organisations se heurtent désormais aux limites de ces solutions en contexte professionnel. Les données sensibles, les procédures internes et les informations stratégiques sont de plus en plus difficiles à confier à des modèles propriétaires hébergés par des fournisseurs tiers. S'ajoute à cela la crainte d'une dépendance excessive à des plateformes dont les tarifs, les modèles ou les conditions d'accès aux API peuvent évoluer sans préavis, une inquiétude renforcée par plusieurs changements de stratégie récents et l'abandon de projets expérimentaux chez certains grands acteurs du secteur. Pour les directions informatiques, la promesse de Prime Intellect consiste précisément à reprendre la main sur les données et sur l'infrastructure, plutôt que de rester locataires d'un service externe. Cette approche répond à un besoin de différenciation concurrentielle. Un agent IA générique répond à des questions générales à partir de ses connaissances et des données fournies ponctuellement par l'utilisateur, tandis qu'un agent construit sur une infrastructure comme celle de Prime Intellect peut être connecté directement aux bases documentaires, aux feuilles de calcul et aux applications métiers d'une entreprise, avec un entraînement et un apprentissage par renforcement adaptés à son activité précise. La personnalisation devient alors un avantage difficile à répliquer, puisqu'elle repose sur des données propriétaires inaccessibles aux modèles généralistes. Cette tendance, déjà observée chez des startups spécialisées comme Harvey dans le juridique, s'inscrit dans un mouvement plus large de désintermédiation vis-à-vis des grands laboratoires d'IA, où les entreprises cherchent à sécuriser leur autonomie technologique tout en tirant parti des avancées des modèles ouverts et modulaires.

💬 Prime Intellect illustre un truc que je vois venir depuis un moment : les boîtes en ont marre de louer leur intelligence à OpenAI ou Anthropic, elles veulent la posséder. Un milliard de valorisation pour vendre de l'infra plutôt qu'un modèle, ça montre que le vrai avantage compétitif en 2026 c'est plus le LLM générique, c'est ce que tu branches dessus (tes docs, ton CRM, ton métier). Reste à voir si les boîtes qui se lancent là-dedans ont vraiment les équipes pour gérer ça, parce que l'infra IA maison, c'est un métier à part entière.

BusinessOpinion
1 source
Grok 4.5 est tellement moins cher que Fable 5 et GPT 5.5 que les écarts de benchmarks comptent peu
303The Decoder 

Grok 4.5 est tellement moins cher que Fable 5 et GPT 5.5 que les écarts de benchmarks comptent peu

xAI a dévoilé Grok 4.5, sa nouvelle génération de modèle entraînée sur des dizaines de milliers de GPU Nvidia GB300. Sur les benchmarks de codage, le modèle reste derrière Fable 5 et GPT-5.5 en termes de résultats bruts, mais il se distingue par son efficacité : il nécessite 4,2 fois moins de tokens qu'Opus 4.8 pour traiter une même tâche. Côté tarification, xAI affiche un prix de 2 dollars par million de tokens en entrée, très inférieur à celui de ses concurrents directs. La disponibilité du modèle en Europe est annoncée pour la mi-juillet. Cette différence de coût pourrait peser plus lourd que les écarts de performance mesurés sur les benchmarks. Pour les développeurs et les entreprises qui déploient des agents de codage à grande échelle, la facture liée aux tokens consommés peut rapidement dépasser l'importance du score obtenu sur un test isolé. Un modèle moins performant mais nettement moins gourmand en tokens et moins cher à l'usage peut donc s'avérer plus rentable en production, notamment pour des tâches répétitives ou du traitement en volume. Cela redistribue les cartes dans un marché où la course aux benchmarks ne garantit plus à elle seule l'adoption commerciale. Cette sortie s'inscrit dans la compétition intense que se livrent les grands laboratoires d'IA sur le terrain du codage, considéré comme l'un des usages les plus lucratifs des modèles de langage. xAI mise sur une infrastructure Nvidia GB300 dernier cri pour entraîner Grok 4.5, tout en cherchant à se démarquer par le rapport coût-efficacité plutôt que par la seule performance brute face à des rivaux comme Anthropic et OpenAI. L'arrivée prévue en Europe mi-juillet permettra de tester en conditions réelles si cette stratégie tarifaire agressive suffit à convaincre les entreprises européennes, dans un contexte où la question du coût d'exploitation des modèles devient centrale pour la rentabilité des produits basés sur l'IA générative.

UELa disponibilité annoncée de Grok 4.5 en Europe mi-juillet permettra aux entreprises françaises et européennes de tester ce modèle pour leurs usages de codage à grande échelle.

💬 Deux dollars le million de tokens et 4,2 fois moins de tokens consommés qu'Opus 4.8 pour la même tâche, ça pèse plus lourd que trois points d'écart sur un benchmark de code. En prod, sur des agents qui tournent en continu, c'est la facture qui tranche, pas le classement : le coût par tâche est en train de redistribuer les cartes du marché des modèles de langage. Reste à voir si xAI tient la promesse une fois le modèle dispo en Europe, mi-juillet.

LLMsOpinion
1 source
Les entreprises ont remplacé des employés par des tokens : les retours ne sont pas au rendez-vous
304AI News 

Les entreprises ont remplacé des employés par des tokens : les retours ne sont pas au rendez-vous

Le patron de Nvidia, Jensen Huang, a livré une déclaration remarquée sur le podcast All-In, à l'issue de la conférence GTC 2026. Selon lui, si un ingénieur payé 500 000 dollars par an ne consomme pas au moins 250 000 dollars de jetons d'intelligence artificielle, soit la moitié de son salaire, cela devrait être considéré comme alarmant. Nvidia viserait ainsi une facture annuelle de deux milliards de dollars de jetons pour ses seuls ingénieurs. Cette formule illustre un basculement budgétaire déjà bien engagé chez les géants technologiques. Les quatre plus grands fournisseurs d'infrastructure cloud prévoient environ 700 milliards de dollars de dépenses d'investissement combinées pour 2026, soit près du double de l'année précédente, tandis que le cabinet Gartner anticipe 207 milliards de dollars de dépenses en logiciels d'agents IA, en hausse de 139 %. Dans le même temps, le cabinet Challenger, Gray & Christmas signale que l'intelligence artificielle est devenue, pour le quatrième mois consécutif, la raison la plus citée des suppressions d'emplois aux États-Unis, le secteur technologique représentant 31 % des licenciements du premier semestre. Un mémo interne de Meta, obtenu par Reuters, décrit les 8 000 suppressions de postes de mai comme un moyen de compenser les investissements massifs de l'entreprise, alors même que son chiffre d'affaires progressait de 33 % ce trimestre-là. Chez Oracle, les effectifs ont chuté de 21 000 personnes pour financer la construction de centres de données. Ce déplacement de budget des salaires vers les jetons pose une question centrale : produit-il réellement les gains escomptés ? Les premiers retours chiffrés sont loin d'être concluants. Une enquête de Gartner auprès de 350 dirigeants d'entreprises générant plus d'un milliard de dollars de revenus, toutes utilisatrices d'agents IA ou d'automatisation, révèle qu'environ 80 % d'entre elles ont réduit leurs effectifs, sans qu'aucune corrélation ne soit observée avec une amélioration du retour sur investissement. Selon l'analyste Helen Poitevin, les suppressions de postes libèrent du budget mais ne créent pas de valeur : ce sont les entreprises qui utilisent l'IA pour renforcer leurs équipes, plutôt que pour les remplacer, qui progressent réellement. Le constat se vérifie aussi côté consommation de jetons : Uber, qui avait équipé 5 000 ingénieurs d'outils de codage IA en décembre, a épuisé tout son budget IA annuel dès avril. Son directeur des opérations, Andrew Macdonald, a reconnu que malgré 70 % de code généré par l'IA, le lien avec l'expérience concrète des clients reste introuvable. L'entreprise plafonne désormais les dépenses de ses ingénieurs à 1 500 dollars par mois. Walmart a imposé un rationnement similaire sur son assistant interne, la demande ayant largement dépassé les prévisions, selon Bloomberg. Un contraste frappant émerge : quand les jetons dépassent le budget, on les plafonne ; quand ce sont les employés qui coûtent trop cher, on les licencie. Klarna incarne le mieux ce retour de bâton. La fintech avait remplacé environ 700 postes du service client par un assistant propulsé par OpenAI, gelé ses embauches humaines pendant plus d'un an, et vanté ce modèle « IA d'abord » auprès des investisseurs. Mais la satisfaction client s'est dégradée et les réclamations ont augmenté, poussant son directeur général, Sebastian Siemiatkowski, à admettre publiquement sur Bloomberg que l'entreprise s'était trop concentrée sur l'efficacité et les coûts, au détriment de la qualité, une stratégie jugée non durable. Klarna recrute désormais de nouveau des humains, son patron défendant l'investissement dans la qualité du support humain comme un axe d'avenir. Gartner s'attend à ce que ce schéma se généralise, prédisant que d'ici 2027, la moitié des entreprises ayant supprimé des postes de service client au profit de l'IA referont marche arrière, souvent dans des conditions moins favorables qu'avant. Cette séquence, portée par des entreprises très rentables et non en difficulté, révèle que les coupes d'effectifs relèvent moins d'une nécessité de survie que d'un choix de financement, dont le bilan réel commence tout juste à être évalué.

UEKlarna, fintech suédoise ayant réduit ses effectifs au profit de l'IA, doit recruter de nouveau des humains, illustrant les limites de ce modèle pour les entreprises européennes.

💬 Le vrai tell de cette histoire, c'est ce contraste : quand les jetons dépassent le budget, on plafonne la dépense, mais quand c'est un employé qui coûte cher, on le vire direct. Klarna vient de payer cash cette logique, obligée de réembaucher des humains après avoir vendu son "IA d'abord" aux investisseurs pendant plus d'un an. Et le détail qui tue, c'est que 80% des boîtes qui ont supprimé des postes n'ont vu aucun gain de ROI, donc ce basculement des salaires vers les tokens ressemble moins à une stratégie qu'à un pari comptable mal calculé.

SociétéOpinion
1 source
Les agents IA ne sont pas vos collègues
305MIT Technology Review 

Les agents IA ne sont pas vos collègues

Une étude conduite par Emma Wiles, professeure en management à l'Université de Boston, révèle un paradoxe troublant : appeler un agent IA "collègue" rend les travailleurs humains moins performants. En analysant le comportement de 1 261 managers, elle a constaté que les participants détectaient 18 % d'erreurs en moins lorsque le travail était présenté comme produit par un "employé IA" plutôt que par un simple chatbot. Plus alarmant encore, ils étaient 44 % plus susceptibles d'escalader le travail douteux de l'IA à leur propre supérieur, annulant ainsi le gain de temps censé justifier le recours à ces outils. Près d'un tiers des managers interrogés indiquent que leur entreprise positionne déjà les agents IA comme des employés à part entière, 23 % allant jusqu'à les inscrire dans les organigrammes officiels. Cette confusion sémantique n'est pas anodine : elle redistribue insidieusement la responsabilité. Lorsqu'un outil est présenté comme un subordonné, les humains qui le supervisent se sentent moins imputables de ses résultats. Dans des secteurs comme la santé, l'éducation, la défense ou les institutions publiques, ce glissement peut avoir des conséquences graves. L'exemple de la frappe sur une école de filles en Iran, promptement attribuée dans l'opinion publique au modèle Claude, alors que tout indique une cascade d'erreurs humaines, illustre ce risque : les agents IA deviennent des boucs émissaires commodes pour des défaillances qui sont, en réalité, le produit de mauvaises décisions et d'une supervision insuffisante. Daron Acemoglu, économiste au MIT et lauréat du prix Nobel 2024, est direct sur ce point : "Les agents IA sont actuellement vendus comme des remplaçants de l'humain, et c'est une proposition perdante." Ce marketing du "collègue digital" s'est accéléré depuis début 2025, avec Microsoft, OpenAI, Anthropic et Google qui ont tous lancé des plateformes de gestion d'équipes d'agents IA présentés comme dotés de la flexibilité et de la puissance cognitive de véritables humains. Jensen Huang, PDG de Nvidia, évoquait dès l'an dernier des lieux de travail peuplés de "digital humans". Pourtant, une étude de Stanford portant sur 1 500 travailleurs dans 104 métiers révèle un décalage profond entre ce que les experts tech jugent automatisable et ce que les travailleurs eux-mêmes souhaitent déléguer. La conclusion s'impose : renommer un logiciel "Alex" et lui attribuer un titre ne le rend ni plus compétent, ni plus digne de confiance. Cela rend surtout les humains autour de lui moins vigilants.

UELes organisations européennes intégrant des agents IA dans leurs équipes s'exposent à une dilution de la chaîne de responsabilité, risque particulièrement grave dans les secteurs régulés comme la santé, l'éducation ou les services publics soumis au cadre de l'AI Act.

ÉthiqueOpinion
1 source
Les modeles open source profitent des restrictions imposees par la Maison Blanche
306The Information AI 

Les modeles open source profitent des restrictions imposees par la Maison Blanche

Les récentes décisions de l'administration Trump en matière de régulation de l'intelligence artificielle produisent un effet inattendu : elles accélèrent l'adoption des modèles open source. Plusieurs développeurs et dirigeants tech ont confié avoir payé le prix fort en bâtissant leurs applications sur des modèles propriétaires, notamment Fable 5 d'Anthropic, retiré peu après sa sortie, laissant des équipes entières à revoir leur architecture en urgence. L'épisode a cristallisé une crainte croissante dans l'industrie : la dépendance aux modèles fermés expose les entreprises à des ruptures imprévisibles. En parallèle, les contraintes budgétaires poussent dans le même sens. Vendredi soir, Brian Armstrong, PDG de Coinbase, a publié sur X que l'entreprise parvenait à maintenir ses dépenses IA stables malgré une utilisation en forte hausse, en testant des modèles ouverts comme GLM 5.2 de Z.ai et Kimi 2.7 de Moonshot. L'attrait de l'open source tient à deux avantages décisifs. D'abord, la résilience réglementaire : il est techniquement et juridiquement difficile pour un gouvernement d'interdire à une entreprise d'utiliser un modèle open source, sauf à lui couper l'accès aux marchés publics. Ensuite, le coût : les modèles ouverts permettent de réduire significativement la facture d'inférence, un argument de poids alors que les budgets IA subissent une pression croissante dans un contexte macroéconomique tendu. Pour des acteurs comme Coinbase, l'expérimentation devient une stratégie à part entière. Ce mouvement s'inscrit dans une dynamique plus large où les modèles open source les plus performants viennent en grande partie de Chine, Z.ai et Moonshot en tête. Des acteurs américains comme Reflection AI, soutenu massivement par Nvidia, font pression sur Washington pour assouplir la régulation des modèles ouverts, arguant qu'ils restent en dessous du niveau de risque des modèles propriétaires de pointe. Mais un rapport du Wall Street Journal publié ce week-end vient brouiller cet argument : des modèles de Z.ai auraient atteint des performances comparables à celles d'Anthropic Mythos sur certains tests de cybersécurité, ce qui pourrait relancer le débat sur les critères de dangerosité réelle des modèles open source.

UELes entreprises européennes dépendantes de modèles propriétaires américains sont exposées aux mêmes risques de rupture soudaine, ce qui renforce l'argument pour une stratégie d'IA souveraine et accélère l'adoption de modèles open source en Europe.

💬 L'ironie est totale : en voulant réguler l'IA américaine, Washington accélère l'adoption de modèles open source... majoritairement chinois. L'épisode Fable 5, retiré peu après sa sortie et laissant des équipes revoir leur architecture en urgence, a mis un mot sur ce que beaucoup savaient sans vraiment le formuler : construire sur du propriétaire fermé, c'est construire sur du sable. Le rapport du WSJ sur les perfs de Z.ai en cybersécurité va sérieusement compliquer la vie aux lobbys qui voulaient simplifier la régulation de l'open source.

RégulationReglementation
1 source
Les calculs derrière la puce Jalapeño d'OpenAI
307AI News 

Les calculs derrière la puce Jalapeño d'OpenAI

OpenAI a officiellement présenté le Jalapeño, son premier processeur maison baptisé "Intelligence Processor", développé en collaboration avec Broadcom. Conçu spécifiquement pour l'inférence de grands modèles de langage (LLM) plutôt que pour des charges de travail IA généralistes, ce circuit intégré (ASIC) est fabriqué par TSMC à Taïwan, tandis que Celestica assemble les cartes et systèmes de racks. OpenAI a fourni l'architecture de base, Broadcom s'est chargé de l'ingénierie silicium et de l'intégration réseau haute performance, notamment via le switch Tomahawk. Selon la société, des échantillons préliminaires font déjà tourner des charges de production, dont un modèle inédit GPT-5.3-Codex-Spark, à la fréquence et la consommation électrique cibles. La motivation est avant tout financière. Faire fonctionner ChatGPT a coûté 8,4 milliards de dollars en 2025 ; avec 900 millions d'utilisateurs hebdomadaires, la facture devrait atteindre 14 milliards cette année. Sur les huit prochaines années, OpenAI s'est engagé à dépenser environ 1 400 milliards de dollars en puissance de calcul, pour une entreprise qui génère actuellement 25 milliards de revenus annuels. Nvidia empoche environ 75 % de marge sur ses GPU haut de gamme, là où OpenAI ne conserve que 33 cents par dollar de chiffre d'affaires après charges opérationnelles. Concevoir son propre silicium, optimisé pour minimiser les mouvements de données et maximiser l'utilisation réelle des processeurs, est le levier le plus direct pour desserrer cet étau. En couvrant toute la chaîne, de l'architecture puce aux noyaux logiciels en passant par la gestion mémoire et le routage réseau, OpenAI se transforme d'une couche logicielle pure en une entreprise d'infrastructure verticalement intégrée, sur le modèle d'Apple avec ses puces M et iOS. OpenAI entre néanmoins sur un terrain où ses concurrents ont une avance considérable. Google déploie ses TPU depuis 2015 et contrôle environ un quart de la capacité mondiale de calcul IA hors Nvidia. Amazon a déjà livré plus d'un million de ses puces maison, Meta et Microsoft poursuivent leur propre montée en puissance. Pour combler ce retard, OpenAI a compressé son calendrier de développement. Greg Brockman, cofondateur et président, résume l'ambition ainsi : "En concevant davantage de la pile nous-mêmes, nous pouvons servir plus d'intelligence avec une plus grande efficacité." L'enjeu à long terme est un cercle vertueux : une infrastructure moins coûteuse réduit le prix de l'entraînement et de l'inférence, ce qui améliore les produits, attire plus d'utilisateurs, et génère les revenus nécessaires pour financer la prochaine génération de puces maison.

UESi OpenAI parvient à réduire ses coûts d'inférence grâce à ses puces maison, les entreprises européennes clientes d'OpenAI pourraient à terme bénéficier de tarifs plus compétitifs, mais l'impact reste indirect et lointain.

OpenAI dévoile sa première puce d'inférence IA maison, Jalapeño, développée avec Broadcom grâce à ses propres modèles
308VentureBeat AI 

OpenAI dévoile sa première puce d'inférence IA maison, Jalapeño, développée avec Broadcom grâce à ses propres modèles

OpenAI et Broadcom ont dévoilé ce matin leur premier processeur d'inférence IA sur mesure, baptisé "Jalapeño". Contrairement aux GPU grand public d'Nvidia ou AMD, ce circuit intégré à application spécifique (ASIC) est conçu exclusivement pour faire tourner des grands modèles de langage en production, notamment derrière ChatGPT, Codex et l'API OpenAI. Ce qui frappe d'emblée, c'est la vitesse de développement : de la conception initiale à la fabrication, seulement neuf mois se sont écoulés, là où un cycle habituel de développement de processeur se compte en années. Le partenariat entre OpenAI et Broadcom n'avait d'ailleurs été annoncé publiquement qu'en octobre 2025. Greg Brockman, président et cofondateur d'OpenAI, ainsi que Hock Tan, PDG de Broadcom, ont présenté la puce ce matin sur CNBC. Brockman a précisé que le processus de conception a lui-même été accéléré grâce aux propres modèles d'OpenAI, des versions antérieures au GPT-5.5. OpenAI indique avoir déjà testé GPT-5.3-Codex-Spark sur ces puces dans un environnement de production simulé, et prévoit de déployer Jalapeño dans ses centres de données actifs d'ici fin 2026. Les performances initiales sont décrites comme "remarquables", Brockman écrivant sur X que le ratio performance par watt est "incroyable". L'enjeu dépasse largement la performance technique : il s'agit de survie économique. Des documents financiers audités récemment révélés montrent qu'OpenAI a généré 13,07 milliards de dollars de revenus en 2025, mais a engagé 34 milliards de dépenses opérationnelles, accusant une perte d'exploitation de près de 20,92 milliards de dollars. La principale cause : le coût titanesque de la puissance de calcul, essentiellement louée auprès de Microsoft Azure sur des GPU Nvidia. Concevoir ses propres puces optimisées pour l'inférence LLM permettrait à OpenAI de drastiquement réduire ce coût marginal par requête et d'atteindre enfin une rentabilité opérationnelle. Broadcom apporte la conception silicium et son réseau Tomahawk, tandis que Celestica gère l'intégration au niveau carte, rack et système. Cette annonce s'inscrit dans une stratégie plus large de verticalisation de la filière IA, un mouvement déjà emprunté par Google avec ses TPU et Amazon avec ses puces Trainium et Inferentia. OpenAI, longtemps dépendant des infrastructures de ses partenaires et investisseurs, cherche à contrôler toute sa pile technologique. Fait notable : les deux entreprises positionnent explicitement Jalapeño comme une puce "construite de zéro pour les LLMs actuels et futurs de toute l'industrie", ouvrant la voie à une commercialisation auprès d'autres acteurs de l'IA. De nombreuses questions restent ouvertes, notamment les performances comparatives face aux solutions Nvidia, les coûts de fabrication et la viabilité à grande échelle. Mais si le pari réussit, OpenAI ne sera plus seulement un éditeur de modèles : il deviendra un fournisseur d'infrastructure à part entière.

UEUne réduction future des coûts d'inférence pourrait bénéficier indirectement aux entreprises et développeurs européens utilisant l'API OpenAI, sans impact réglementaire ou industriel direct sur la France/UE.

💬 Quand tu perds 21 milliards par an, tu te construis tes propres puces. Ce que Jalapeño change vraiment, c'est pas la performance par watt, c'est qu'OpenAI sort enfin d'une dépendance à Nvidia qui les saignait à blanc requête après requête. Neuf mois de conception accélérée par leurs propres modèles, c'est la vraie rupture.

Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert
309arXiv cs.RO 

Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert

Une équipe de recherche a publié sur arXiv (identifiant 2510.08807v2) Humanoid Everyday, un jeu de données massif dédié à l'apprentissage de la manipulation par les robots humanoïdes en conditions ouvertes. Le dataset compile 10 300 trajectoires et plus de 3 millions de frames couvrant 260 tâches réparties en 7 catégories larges : manipulation dextère d'objets, interaction humain-humanoïde, actions intégrant de la locomotion bipède, et d'autres scénarios du quotidien. Les données sont multimodales, RGB, profondeur, LiDAR, retour tactile, accompagnées d'annotations en langage naturel. La collecte repose sur un pipeline de télé-opération supervisée par des humains, optimisé pour maximiser le débit tout en maintenant la qualité des démonstrations. Les auteurs publient simultanément une plateforme d'évaluation cloud permettant à des équipes extérieures de déployer leurs propres politiques de contrôle et d'obtenir des métriques comparables dans un environnement standardisé. Ce dataset comble un vide structurel dans la recherche robotique : la quasi-totalité des benchmarks existants (Open X-Embodiment, DROID, BridgeData V2) ciblent des bras fixes, et les rares datasets humanoïdes disponibles se limitent à des environnements contrôlés, un faible nombre de tâches, et excluent généralement la locomotion et l'interaction avec des personnes. Pour un intégrateur ou un décideur industriel, la portée pratique est double : des données hétérogènes permettent d'entraîner des politiques plus généralisables, notamment des architectures VLA (vision-language-action) ; la plateforme d'évaluation cloud offre pour la première fois un cadre reproductible pour comparer des méthodes d'apprentissage par imitation ou par renforcement sur des tâches humanoïdes réalistes. L'article analyse aussi les performances de plusieurs politiques de référence, en identifiant leurs forces et limites par catégorie. La publication intervient dans un contexte de forte concurrence autour des données d'entraînement pour humanoïdes. Physical Intelligence (Pi-0, π0.5), NVIDIA (GR00T N2), Unitree et Figure AI misent chacun sur des datasets propriétaires pour différencier leurs politiques de contrôle. Côté recherche ouverte, AgiBot World et RH20T ont posé des jalons, mais restent limités dans leur couverture humanoïde. Humanoid Everyday est rendu entièrement public, dataset, code de collecte et plateforme d'évaluation inclus, ce qui en fait une ressource directement exploitable par des laboratoires et startups sans accès à des infrastructures de collecte massives. Les auteurs présentent cette release comme un socle pour de futurs agents incarnés généralistes, sans préciser d'échéancier pour des suites expérimentales.

UELes équipes de recherche et startups européennes en robotique humanoïde peuvent exploiter directement ce dataset open-source, 10 300 trajectoires, 260 tâches, plateforme d'évaluation cloud, sans investir dans une infrastructure de collecte massive, ce qui réduit la barrière d'entrée face aux acteurs américains et asiatiques disposant de données propriétaires.

💬 Le vrai sujet ici, c'est pas juste le volume (10 300 trajectoires, bon), c'est que les benchmarks humanoïdes existants ignoraient presque tous la locomotion et l'interaction avec des humains réels depuis le début. Des acteurs comme Pi-0 ou GR00T N2 misaient sur leurs données propriétaires comme avantage concurrentiel, et une release open-source de cette ampleur vient rogner ce levier directement. Reste à voir si ça tient face à des politiques entraînées en conditions réelles, mais pour des labos sans infrastructure de collecte massive, ça change le rapport de force.

RobotiqueOpinion
1 source
OVHcloud veut ses Mistral gagnants et se lance dans les LLM
310Next INpact 

OVHcloud veut ses Mistral gagnants et se lance dans les LLM

OVHcloud, le géant européen de l'hébergement basé à Roubaix, a annoncé lors du salon VivaTech son intention de lancer sa propre famille de modèles de langage (LLM). Octave Klaba, qui a repris la direction de l'entreprise fin 2025, a confirmé l'ambition à Reuters : sans maîtrise de cette technologie, OVHcloud ne pourrait « pas garantir son avenir ». Le groupe prévoit de déployer plusieurs modèles couvrant différents cas d'usage, sur le modèle d'Anthropic avec Opus, Sonnet et Haiku, ou d'OpenAI avec ses gammes GPT et o. La piste open source est explicitement envisagée, Klaba précisant que l'entreprise « regardera à quel moment elle sera suffisamment bonne pour open sourcer » ses modèles. Le budget estimé pour ce projet se situe entre 150 et 200 millions d'euros, contre environ un milliard il y a quelques années, grâce à la chute des coûts d'entraînement. Ce virage marque une montée en puissance significative pour OVHcloud, qui ne se positionne plus seulement comme fournisseur d'infrastructure mais comme acteur de la couche modèle, territoire jusqu'ici dominé par OpenAI, Anthropic et Mistral. Pour les entreprises européennes soucieuses de souveraineté numérique, l'émergence d'un LLM made in Europe, hébergé et entraîné sur sol européen, représente une alternative crédible aux géants américains. La qualification « et de l'IA » ajoutée récemment à tous les communiqués de presse d'OVHcloud signale que ce changement de positionnement est déjà assumé en interne, bien avant la sortie d'un premier modèle. Pour préparer ce lancement, OVHcloud a mené une série d'acquisitions ciblées depuis le début de l'année. En janvier, le groupe a racheté Seald, startup française spécialisée dans le chiffrement bout en bout, dont le SDK bénéficie d'un visa de sécurité CSPN délivré par l'ANSSI. En mars, c'est Dragon LLM qui a rejoint le giron, société française dédiée aux modèles souverains et spécialisés. Plus récemment, OVHcloud est entré en négociations exclusives pour acquérir Gladia, spécialisée dans l'IA vocale. Ces rachats s'accompagnent d'un renforcement des équipes internes en fine-tuning, la technique permettant de spécialiser un modèle pré-entraîné sur des tâches précises. La principale inconnue reste l'approvisionnement en GPU : Klaba a lui-même comparé les puces Nvidia à des fraises qui « pourrissent le lendemain », tant leur cycle de dépréciation est rapide face aux nouvelles générations. Entraîner des modèles compétitifs en exige des volumes importants, et la question de la rentabilité de ces investissements matériels reste entière.

UEOVHcloud, premier hébergeur européen basé à Roubaix, se positionne comme futur fournisseur de LLMs souverains entraînés et hébergés sur sol européen, offrant aux entreprises et institutions françaises une alternative concrète aux modèles américains pour répondre aux exigences de souveraineté numérique et de conformité réglementaire.

Les puces IA moins coûteuses d'Amazon séduisent les entreprises
311The Information AI 

Les puces IA moins coûteuses d'Amazon séduisent les entreprises

Les puces d'IA maison d'Amazon séduisent un nombre croissant d'entreprises grâce à un argument massue : le prix. Selon Karol Piatek, consultant en infrastructure IA au cabinet irlandais Co Driver Labs, l'utilisation des puces Inferentia2 et Trainium2 d'Amazon pour exécuter des modèles d'IA existants, ce qu'on appelle l'inférence, peut coûter jusqu'à 80 % moins cher que les H100 de Nvidia, à charge de travail comparable. Amazon multiplie depuis plusieurs mois les discussions avec des entreprises gérant leurs propres centres de données pour leur proposer ces alternatives : Trainium pour l'entraînement de nouveaux modèles, Inferentia pour le déploiement. L'écart de prix est suffisamment significatif pour peser dans les décisions d'infrastructure, surtout dans un contexte où les budgets IA explosent. Pour les entreprises qui n'ont pas besoin des performances brutes maximales de Nvidia mais cherchent à industrialiser leurs usages IA à moindre coût, les puces Amazon représentent un compromis crédible. L'argument de la disponibilité joue aussi : les H100 restent difficiles à obtenir en grande quantité. Cette dynamique s'inscrit dans une tendance de fond : les grands hyperscalers, Amazon, Google, Microsoft, investissent massivement dans leurs propres puces pour réduire leur dépendance à Nvidia, dont la domination sur le marché des accélérateurs IA est quasi totale. Amazon, qui vend déjà ces puces via AWS, tente désormais de convaincre les entreprises disposant de leurs propres infrastructures physiques, un segment jusqu'ici largement acquis à Nvidia. Si ces conversions se multiplient, la pression concurrentielle sur Jensen Huang et ses équipes pourrait s'intensifier.

UELes entreprises européennes gérant leurs propres infrastructures IA pourraient réduire leurs coûts d'inférence jusqu'à 80 % en adoptant les puces Inferentia2 d'Amazon comme alternative crédible aux H100 de Nvidia.

InfrastructureOpinion
1 source
Google Cloud soutient l’ambition de superintelligence d’Ineffable Intelligence
312Le Big Data 

Google Cloud soutient l’ambition de superintelligence d’Ineffable Intelligence

Ineffable Intelligence, startup londonienne fondée par David Silver, le chercheur britannique à l'origine d'AlphaGo, a annoncé lors du Google Cloud Summit London 2026 un partenariat stratégique avec Google Cloud pour soutenir le développement de son projet de superintelligence. Cette alliance intervient dans la foulée d'une levée de fonds de 1,1 milliard de dollars, la plus importante jamais réalisée par une startup européenne spécialisée dans l'IA. Concrètement, Ineffable Intelligence déploiera sur l'infrastructure Google Cloud l'un des plus grands clusters A5X au monde, équipé de GPU NVIDIA Vera Rubin NVL72, pour entraîner ce qu'elle appelle un « super-apprenant » : une intelligence artificielle capable d'acquérir des connaissances par l'expérience directe, en continu, plutôt qu'à partir de vastes ensembles de données précompilées. L'enjeu dépasse largement le simple choix d'un prestataire cloud. Les systèmes fondés sur l'apprentissage par renforcement continu imposent des contraintes d'infrastructure radicalement différentes des modèles génératifs classiques : ils génèrent, évaluent et exploitent en temps réel des flux d'expériences, ce qui exige non seulement une puissance de calcul considérable, mais aussi une interconnexion ultra-performante entre GPU, réseau à haut débit et stockage optimisé. Google Cloud se positionne précisément sur cette architecture intégrée, présentée comme un avantage décisif pour les laboratoires les plus exigeants. Pour l'industrie, ce partenariat marque une étape dans la compétition entre hyperscalers pour capter les projets d'IA les plus ambitieux, où l'infrastructure devient un levier de différenciation aussi important que les algorithmes eux-mêmes. David Silver, figure emblématique du domaine depuis sa contribution décisive à AlphaGo chez DeepMind, a quitté Google pour fonder Ineffable Intelligence avec l'ambition explicite de développer des systèmes capables de dépasser les capacités humaines dans des domaines comme les sciences, les mathématiques ou la technologie. L'approche par apprentissage par renforcement qu'il défend s'inscrit dans une tradition de recherche distincte des grandes entreprises qui misent sur la mise à l'échelle de modèles de langage entraînés sur du texte. Le choix de Google Cloud comme partenaire est une décision stratégique pour les deux parties : Ineffable Intelligence bénéficie d'une infrastructure de premier rang à grande échelle, tandis que Google utilise ce partenariat comme vitrine pour démontrer la maturité de son offre IA à une période où la concurrence entre Azure, AWS et Google Cloud pour attirer les laboratoires de recherche de pointe n'a jamais été aussi intense. La levée de 1,1 milliard confirme que le projet est pris très au sérieux par les investisseurs, même si l'horizon d'une superintelligence opérationnelle reste indéfini.

UELa levée record d'1,1 milliard de dollars par Ineffable Intelligence, startup londonienne fondée par le chercheur britannique à l'origine d'AlphaGo, s'impose comme un signal fort pour l'écosystème européen de l'IA, confirmant sa capacité à générer des laboratoires de recherche de niveau mondial capables de rivaliser avec les géants américains.

💬 David Silver quitte Google pour lever 1,1 milliard et retourner entraîner ses modèles sur... l'infra Google. Le serpent qui se mord la queue, mais version superintelligence. Ce qui m'intéresse vraiment là-dedans, c'est l'approche : de l'apprentissage par renforcement continu plutôt que du scaling de LLM sur texte, c'est une vraie bifurcation par rapport à ce que font OpenAI ou Anthropic. Reste à voir si ça donne quelque chose en dehors des jeux de plateau.

BusinessOpinion
1 source
Vulnérabilités des modèles vision-langage-action (VLA) face aux défauts physiques d'articulation
313arXiv cs.RO 

Vulnérabilités des modèles vision-langage-action (VLA) face aux défauts physiques d'articulation

Des chercheurs ont publié le 10 juin 2026 (arXiv:2606.10501) une étude identifiant une vulnérabilité critique des modèles Vision-Language-Action (VLA) face aux défauts physiques articulaires. Ces modèles, qui traduisent instructions en langage naturel et observations visuelles en commandes motrices, équipent aujourd'hui les robots humanoïdes et manipulateurs les plus avancés. Les auteurs montrent que des failles réalistes, notamment dégradation d'actionneur, friction excessive due à l'usure, dommages de collision ou limites de sécurité restreintes, cassent la boucle fermée entre action commandée, mouvement réalisé et observation suivante, dégradant les taux de succès même pour des défauts physiquement « faisables ». L'impact varie selon l'articulation affectée, rendant toute mitigation générique difficile. En réponse, les auteurs proposent J-PARC (Joint-level Physical-fault Aware Residual Calibrator), un module léger ajouté au-dessus d'une politique VLA figée, qui infère un régime de défaut latent depuis la dynamique articulaire récente et applique une correction résiduelle adaptative sans modifier le modèle de base. Ce résultat comble un angle mort réel dans la validation des systèmes robotiques à base de VLA. L'effort de robustification s'est jusqu'ici concentré sur les variations perceptuelles et sémantiques : éclairage, occlusion, reformulation d'instructions. Or tout robot industriel accumule friction, chocs et dégradation d'actionneur au fil du temps. Montrer que ces perturbations physiquement réalisables suffisent à faire chuter les performances remet en cause l'hypothèse implicite qu'un VLA entraîné sur hardware neuf reste fiable tout au long de son cycle de vie opérationnel. Pour les intégrateurs et responsables de certification, c'est un signal fort : la robustesse mécanique doit entrer dans les critères de qualification aux côtés de la généralisation sémantique. L'approche J-PARC, sans fine-tuning ni capteur supplémentaire, offre une piste d'adaptation réaliste pour les déploiements existants. Les VLA ont connu une montée en puissance rapide depuis Pi-0 (Physical Intelligence, 2024) et GR00T N2 (NVIDIA, 2025), avec des déploiements annoncés chez Figure (modèle 03), Agility Robotics et 1X Technologies. Malgré leurs performances en laboratoire, leur comportement sur hardware vieillissant reste peu documenté dans la littérature. Ce papier s'inscrit dans une tendance croissante sur la fiabilité opérationnelle à long terme, aux côtés des travaux sur le sim-to-real gap. En Europe, des acteurs comme Enchanted Tools avec Mirokaï ou Wandercraft, où la dégradation articulaire est un enjeu quotidien en milieu médical ou logistique, sont directement concernés par ces résultats. Les prochaines étapes naturelles seront une validation sur hardware en vieillissement accéléré et l'intégration de J-PARC dans des pipelines de déploiement continu.

UELes acteurs français Enchanted Tools et Wandercraft, confrontés à la dégradation articulaire en milieu médical et logistique, peuvent directement intégrer J-PARC pour fiabiliser leurs déploiements VLA sans modifier leurs modèles de base.

💬 On a tous fait cette hypothèse implicite : un VLA entraîné en labo reste fiable sur un robot qui a pris des coups après 18 mois en prod. Ce papier montre que non, et c'est un angle mort réel pour tous les intégrateurs qui déploient en milieu industriel ou médical. J-PARC corrige ça sans toucher au modèle de base, bon, reste à voir si ça tient sur du vrai hardware vieilli.

RechercheOpinion
1 source
Les agents IA embarqués se heurtent à une limite mémoire, qu'Apple contourne avec sa nouvelle architecture
314VentureBeat AI 

Les agents IA embarqués se heurtent à une limite mémoire, qu'Apple contourne avec sa nouvelle architecture

Apple a annoncé lors de la WWDC26 sa troisième génération de modèles de fondation, la famille AFM 3, développée en collaboration avec Google. Cette famille comprend cinq modèles : deux fonctionnant en local sur l'appareil et trois hébergés côté serveur, dont AFM 3 Cloud Pro, dédié aux tâches agentiques complexes et s'exécutant sur des GPU Nvidia dans Google Cloud. La pièce maîtresse de l'annonce est AFM 3 Core Advanced, un modèle de 20 milliards de paramètres conçu pour tourner directement sur les appareils Apple, et dont l'architecture rompt radicalement avec les contraintes habituelles de l'IA embarquée. Plutôt que de stocker l'ensemble des poids du modèle en mémoire vive (DRAM), Apple les place en mémoire flash NAND, la même technologie utilisée pour le stockage interne des iPhone et Mac. Un petit modèle auxiliaire prédit, à partir du prompt, quels "experts" charger depuis la flash vers la RAM avant de générer la réponse. Le nombre de paramètres actifs varie ainsi entre 1 et 4 milliards selon la complexité de la tâche, tous puisés dans le réservoir de 20 milliards stocké en flash. Cette approche lève un verrou fondamental qui bridait l'IA on-device depuis ses débuts : la capacité limitée de la DRAM contraint aujourd'hui les modèles embarqués à quelques milliards de paramètres au maximum, très loin des capacités des modèles cloud. En déplaçant le stockage vers la flash et en ne chargeant en RAM que les experts pertinents pour chaque requête, Apple ouvre la voie à des modèles locaux sensiblement plus puissants, sans dépendance permanente au réseau. Pour les développeurs d'applications, cela signifie potentiellement accéder à des capacités de raisonnement et d'outil use jusqu'ici réservées au cloud, tout en conservant les garanties de confidentialité du Private Cloud Compute d'Apple. La contrainte technique centrale que l'architecture contourne est celle de la bande passante flash-vers-RAM : dans un modèle Mixture of Experts classique, le routeur sélectionne des experts différents à chaque token généré, une cadence bien trop rapide pour la NAND. Apple résout ce problème en effectuant le routage une seule fois par prompt, chargeant un ensemble fixe d'experts pour toute la génération de la réponse. Awni Hannun, chercheur chez Anthropic et ancien scientifique chez Apple, a salué l'approche sur X tout en soulignant son caractère "exotique par rapport aux standards actuels". Des zones d'ombre demeurent cependant : selon Marco Abis, développeur du profileur Ziraph pour Apple Silicon, la documentation d'Apple ne précise ni la consommation énergétique, ni la bande passante mémoire, ni le comportement thermique du modèle, ni les conditions dans lesquelles une requête locale est silencieusement redirigée vers le cloud.

UELa fonctionnalité de traitement on-device avec garanties de confidentialité intégrées facilite potentiellement la conformité RGPD pour les développeurs européens déployant des applications IA sur appareils Apple.

LLMsOpinion
1 source
vla.cpp : un moteur d'inférence unifié pour les modèles vision-langage-action (VLA)
315arXiv cs.RO 

vla.cpp : un moteur d'inférence unifié pour les modèles vision-langage-action (VLA)

Des chercheurs de FAI ModelOpt Tech ont publié en juin 2026 vla.cpp (arXiv 2606.08094), un moteur d'inférence C++ portable construit sur llama.cpp pour exécuter des politiques VLA (Vision-Language-Action) directement sur le matériel embarqué des robots. L'engine prend en charge sept architectures couvrant cinq familles de backbones et quatre têtes d'action via un protocole requête/réponse unifié, incluant les schémas d'inférence par flow-matching et par diffusion propres aux VLA récents. Sur le benchmark LIBERO-Object, il reproduit le meilleur checkpoint SOTA à un épisode près sur 200 ; BitVLA y atteint 100 % de succès dans 1,3 Gio de mémoire. Le même bundle s'exécute sans modification sur trois niveaux matériels, d'un GPU grand public jusqu'à un module embarqué de 8 Go de RAM. Un noyau GEMM IMMA en escalier, dérivé d'une analyse roofline multi-hardware, réduit la latence par étape de BitVLA d'un facteur 4,5. Les auteurs ont également conduit un test de stress sur un bras ALOHA pour mesurer la contrainte de latence de replanification face à une cible mobile. Le problème structurel que vla.cpp attaque est la dépendance des stacks Python/PyTorch actuels à un GPU de station de travail, hypothèse incompatible avec l'électronique embarquée des robots commerciaux ou des cobots industriels. Démontrer une exécution à succès complet dans 1,3 Gio ouvre concrètement la voie au déploiement edge sans serveur distant ni dépendance cloud pour des tâches de manipulation. L'analyse roofline publiée dans le papier établit un résultat contre-intuitif pour les intégrateurs : l'inférence VLA en batch-1 est compute-bound, non bandwidth-bound, ce qui déplace le levier d'optimisation vers le taux d'utilisation du calcul. L'unification de sept architectures sous un seul protocole réduit également la fragmentation de l'écosystème VLA, frein réel à l'adoption en production. vla.cpp hérite de l'approche de quantification ggml et de la portabilité de llama.cpp de Georgi Gerganov. Les modèles ciblés incluent des architectures issues de Physical Intelligence (pi0) et des projets ouverts comme OpenVLA. La concurrence directe sur ce segment est limitée : la plupart des équipes robotiques maintiennent des pipelines Python maison dépendants de GPU Nvidia RTX 3090/4090 ; ROS 2 et Isaac ROS de Nvidia offrent des primitives d'intégration mais pas de runtime VLA unifié. Aucun acteur français ou européen n'est directement cité dans le papier. Le code, les vidéos de démonstration et le scaffold de benchmark reproductible sont disponibles sur le site du projet.

UEAucun acteur européen impliqué dans le développement, mais le runtime portable est directement exploitable par les équipes R&D françaises et européennes cherchant à déployer des politiques VLA sur matériel embarqué sans dépendance cloud.

💬 Faire tourner une politique VLA dans 1,3 Gio sans GPU de workstation, c'est le vrai débloqueur que les équipes robotique attendaient. Le reste, les sept architectures unifiées, le protocole commun, c'est utile, mais ce qui compte c'est que le déploiement edge devient une option sérieuse sans serveur distant. Reste à voir si ça tient sur des tâches moins sages que LIBERO-Object.

RobotiqueOpinion
1 source
Generalist lève 400 millions de dollars pour développer ses modèles d'IA généralistes
316The Robot Report 

Generalist lève 400 millions de dollars pour développer ses modèles d'IA généralistes

Generalist AI Inc. a annoncé une levée de fonds de 400 millions de dollars, portant son financement total à plus de 500 millions depuis sa création en 2024. Le tour a été mené par Radical Ventures, avec de nouveaux entrants incluant 8VC, Union Square Ventures, Hanabi Capital et Norwest, auxquels s'ajoutent les investisseurs historiques NVentures (NVIDIA), Boldstart Ventures, Spark Capital et Bezos Expeditions. Parmi les investisseurs individuels figurent Fei-Fei Li, Eric Yuan (PDG de Zoom), Bin Lin et Naval Ravikant. Basée à San Mateo, en Californie, la startup développe des modèles fondamentaux destinés à des robots généralistes, capables d'opérer sur différentes architectures matérielles. En novembre 2025, elle avait lancé GEN-0, présenté comme le premier modèle à appliquer les lois de mise à l'échelle (scaling laws) à la robotique physique. En avril 2026, elle a publié GEN-1, avec des métriques communiquées par la société elle-même: taux de succès moyen de 99 % sur des tâches où les modèles précédents atteignaient 64 %, vitesse d'exécution environ trois fois supérieure sur des manipulations dextères, et seulement une heure de données robotiques nécessaires par compétence apprise. Ces chiffres, s'ils se confirment en conditions industrielles réelles, représenteraient un changement structurel pour la commercialisation de la robotique généraliste. Le principal verrou du secteur reste logiciel: la plupart des intégrateurs investissent encore des semaines de collecte de données pour chaque nouvelle tâche. Un modèle nécessitant une heure de données par compétence transformerait radicalement l'économie du déploiement. Cela dit, les métriques publiées proviennent exclusivement des communications internes de Generalist AI, sans validation indépendante ni précision sur les conditions de benchmark ou la nature des tâches testées. Le concept de "data flywheel", selon lequel les déploiements chez des clients industriels génèrent les données qui alimentent le modèle suivant, est éprouvé dans le logiciel; sa transposition à la robotique physique, avec ses contraintes de sécurité et de variabilité du monde réel, reste à démontrer à l'échelle. Generalist AI a été fondée en 2024 par Pete Florence (CEO), Andy Zeng (Chief Scientist) et Andrew Barry (CTO), trois chercheurs issus des milieux académiques et industriels de la robotique. La startup s'inscrit dans un marché en forte compétition: Physical Intelligence avec son modèle Pi-0, Figure AI avec le Figure 03, Boston Dynamics, Apptronik et 1X Technologies ciblent tous le même segment des modèles d'IA généralistes pour robots physiques. En Europe, Enchanted Tools et Wandercraft progressent sur des verticales plus ciblées. Avec cette levée, Generalist AI prévoit d'accélérer le développement de modèles de nouvelle génération, d'étendre son infrastructure d'entraînement et de renforcer son moteur de collecte de données physiques. La prochaine étape observable sera la documentation de déploiements industriels concrets chez des clients identifiés, seul critère qui permettra de distinguer les performances en laboratoire de la viabilité commerciale annoncée.

UELa montée en puissance de Generalist AI accentue la pression concurrentielle sur les acteurs européens comme Enchanted Tools et Wandercraft, dont les verticales ciblées et les capacités de financement ne sont pas comparables aux 500 M$ levés par cette startup américaine en moins de deux ans.

💬 500 millions en deux ans, c'est du sérieux. Ce qui m'intéresse vraiment, c'est pas le chèque, c'est cette histoire d'une heure de données par compétence apprise (contre des semaines pour les intégrateurs actuels). Si ça tient en conditions industrielles, tu changes complètement l'économie du déploiement robotique, mais tous les chiffres sortent de chez eux sans validation externe, donc faut voir les premiers clients réels avant de s'emballer.

BusinessOpinion
1 source
OpenJarvis : un framework local pour agents IA personnels avec outils, mémoire et apprentissage
317MarkTechPost 

OpenJarvis : un framework local pour agents IA personnels avec outils, mémoire et apprentissage

Des chercheurs de l'Université Stanford et de Lambda Labs ont publié en mai 2026 OpenJarvis, un framework open-source conçu pour faire tourner des agents IA personnels entièrement en local, sans recours au cloud. Disponible sur GitHub avec déjà plus de 5 400 étoiles, le projet s'appuie sur onze modèles locaux issus de quatre familles (Qwen3.5, Gemma4, Nemotron, Granite) et supporte des moteurs d'inférence variés comme Ollama, vLLM ou llama.cpp. Les performances mesurées sur 508 tâches réparties en huit benchmarks montrent que les modèles configurés via OpenJarvis se situent à seulement 3,2 points de pourcentage en dessous des meilleurs modèles cloud, Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, tout en affichant une latence quatre fois plus faible et un coût marginal par requête environ 800 fois inférieur. Ce résultat change concrètement l'équation pour les développeurs et les entreprises qui cherchent à déployer des agents IA sans dépendre d'APIs tierces. OpenJarvis décompose un système d'IA personnelle en cinq primitives indépendantes et interchangeables, le modèle, le moteur d'inférence, la logique d'agent, les outils et la mémoire, puis l'optimiseur d'apprentissage, toutes configurables via un unique fichier TOML appelé "spec". Cette architecture permet à un même comportement d'agent de fonctionner sur un Mac Mini M4 comme sur une station de travail NVIDIA DGX Spark, sans réécrire les prompts. L'installation tient en une seule commande et prend environ trois minutes sur une connexion correcte. La contribution la plus originale du projet réside dans la "LLM-guided spec search", une méthode d'optimisation hybride locale-cloud : un modèle frontier agit comme enseignant au moment de la configuration, en analysant les traces d'exécution, diagnostiquant les échecs et proposant des modifications coordonnées sur l'ensemble des primitives. Une modification n'est acceptée que si elle améliore les cas défaillants sans provoquer de régressions ailleurs, avec une tolérance par défaut de 1%. Une fois optimisé, le système tourne entièrement en local sans aucun appel cloud. À 100 requêtes par jour, le coût amorti de cet enseignant descend sous 0,001 dollar par requête au bout de six mois. Cette approche multi-primitive récupère 13 à 32 points de pourcentage de l'écart cloud-local, contre seulement 5 points pour les optimiseurs de prompts classiques, à un coût d'optimisation 7 à 11 fois inférieur aux méthodes antérieures comme DSPy ou LoRA. Le projet s'inscrit dans un contexte où les modèles locaux gèrent déjà 88,7% des requêtes conversationnelles courantes selon une étude antérieure de la même équipe, et où l'efficacité des modèles embarqués a progressé de 5,3 fois entre 2023 et 2025.

UELes entreprises européennes soumises au RGPD peuvent déployer des agents IA performants entièrement en local sans transférer leurs données vers des services cloud américains, réduisant leur exposition aux risques de non-conformité et renforçant leur souveraineté numérique.

💬 3,2 points de moins que Claude Opus ou GPT-5, pour un coût 800 fois inférieur : à ce ratio, la question n'est plus "cloud ou local". Le truc malin c'est la spec search guidée, tu laisses un frontier calibrer ta config une fois, puis plus aucun appel cloud ensuite. Bon, faudra voir si leurs 508 tâches de benchmark ressemblent à ce qu'on rencontre vraiment en prod.

OutilsOutil
1 source
Opus 4.8
318Ben's Bites 

Opus 4.8

Anthropic a lancé Claude Opus 4.8 en intégrant une nouvelle fonctionnalité centrale dans Claude Code : les workflows dynamiques. Concrètement, le modèle génère désormais un script d'orchestration, puis instancie des sous-agents en parallèle pour traiter des tâches complexes en simultané. Sur le benchmark ARC-AGI-3, Opus 4.8 obtient le meilleur score du marché, triplant celui de GPT-5.5. Les avis divergent cependant sur l'ampleur du progrès : Simon Willison le qualifie d'amélioration modeste mais utile, notamment parce que le modèle est plus honnête sur ses incertitudes et moins enclin à rater ses propres erreurs de code. La publication Every, de son côté, est bien plus enthousiaste : ses tests internes positionnent Opus 4.8 comme un bond significatif par rapport à 4.7, compétitif avec GPT-5.5 sur un benchmark d'ingénieur senior. Le benchmark Datacurve nuance ce tableau en le plaçant en dessous de GPT-5.5 et marginalement au-dessus d'Opus 4.6, tout en signalant une consommation de tokens nettement plus élevée. En parallèle, Anthropic a déposé un S-1 confidentiel auprès de la SEC et bouclé une levée de fonds en Serie H à 65 milliards de dollars, portant sa valorisation post-money à 965 milliards de dollars, avec une introduction en bourse potentielle d'ici fin 2026. L'arrivée des workflows dynamiques dans Claude Code marque un tournant pour les développeurs qui utilisent des agents LLM en production. Plutôt que d'enchaîner les appels séquentiels, le modèle peut désormais décomposer une tâche, déléguer ses parties en parallèle et les réassembler, ce qui réduit les temps de traitement sur des projets complexes. Plusieurs observateurs soulignent toutefois une limite structurelle : les systèmes multi-agents lâches restent peu fiables, et les workflows déterministes construits autour de petites boucles agentiques sont plus robustes en pratique. Côté valorisation, 965 milliards de dollars place Anthropic parmi les entreprises privées les mieux valorisées au monde, à un niveau comparable à des géants cotés du secteur technologique. Si l'IPO se concrétise cette année, elle redéfinirait les références de valorisation de l'ensemble du secteur de l'IA générative. Cette sortie intervient dans un contexte de compétition féroce entre Anthropic et OpenAI, dont les modèles phares se disputent le leadership sur chaque nouveau benchmark. La même semaine, NVIDIA et Microsoft annonçaient le RTX Spark, une puce Windows atteignant 1 petaflop avec jusqu'à 128 Go de mémoire unifiée et capable de faire tourner localement des modèles de 120 milliards de paramètres, accompagnée de primitives de sécurité pour agents sur Windows. OpenAI, de son côté, étoffait Codex avec le contrôle à distance de machines sous Windows et un SDK Python. La convergence de ces annonces dessine une infrastructure commune qui rapproche les modèles frontières du poste de travail et ouvre la voie à des agents autonomes opérant directement sur les appareils des utilisateurs.

UELes workflows dynamiques de Claude Code offrent aux développeurs européens une nouvelle capacité d'orchestration parallèle pour leurs agents IA en production ; l'IPO potentielle d'Anthropic à près de 1 000 milliards de dollars pourrait également remodeler les standards de valorisation pour les startups IA européennes.

💬 Les workflows dynamiques dans Claude Code, c'est le vrai gain ici, pas le benchmark. Le modèle peut désormais découper une tâche, déléguer ses parties en parallèle et réassembler le tout sans qu'on câble tout à la main. La conso de tokens va piquer, mais un modèle plus honnête sur ses propres erreurs de code (Simon Willison l'a bien noté), ça compte plus à mes yeux que tripler un score ARC-AGI-3.

LLMsOpinion
1 source
L'IA peut désormais gérer votre administration
319MIT Technology Review 

L'IA peut désormais gérer votre administration

L'actualité de l'IA cette semaine illustre à la fois son essor commercial et les tensions qu'il suscite. Anthropic, la startup fondée par d'anciens membres d'OpenAI, a déposé confidentiellement un dossier d'introduction en bourse et vise une entrée sur les marchés dès cet automne, possiblement avant OpenAI elle-même, sans dévoiler de valorisation cible. En parallèle, la Floride est devenue le premier État américain à poursuivre OpenAI en justice, accusant ChatGPT de mettre en danger la sécurité des enfants et de faire primer le profit sur la sûreté publique, selon le procureur général James Uthmeier. Du côté de la cybersécurité, des hackers ont pris le contrôle de comptes Instagram de célébrités en exploitant Meta AI : en demandant simplement des informations d'accès à l'assistant, ils ont contourné les protections habituelles. Enfin, l'Union européenne envisage d'exclure les géants américains du cloud, notamment Amazon, Microsoft et Google, des contrats liés aux infrastructures critiques, dans le cadre d'un effort de souveraineté numérique accéléré par les tensions commerciales avec Washington. Ces événements convergent pour dessiner un secteur à un tournant décisif. L'IPO d'Anthropic s'inscrit dans une course au capital où être premier en bourse pourrait donner un avantage symbolique et financier considérable face à OpenAI, attendue juste après la cotation de SpaceX, valorisée à mille milliards de dollars. La poursuite floridienne signale que la patience des régulateurs américains s'amenuise face aux risques supposés des chatbots grand public, une préoccupation qui pousse déjà plusieurs plateformes à intégrer des vérifications d'âge. La faille Meta AI révèle un risque systémique croissant : déléguer le support client à des intelligences artificielles crée de nouveaux vecteurs d'attaque que les équipes de sécurité n'ont pas encore pleinement anticipés. Pour les petites entreprises, en revanche, l'IA représente une opportunité concrète : les modèles actuels peuvent déjà gérer la comptabilité de base, la facturation, la prise de notes ou la planification des réseaux sociaux, des tâches autrefois réservées aux structures capables d'embaucher des spécialistes. Ces développements s'inscrivent dans un contexte où l'IA s'est imposée en moins de quatre ans comme un enjeu géopolitique, économique et social de premier ordre. La décision européenne d'écarter les fournisseurs américains reflète une défiance croissante vis-à-vis de la dépendance technologique envers les États-Unis, renforcée par les politiques commerciales de l'administration Trump. Pendant ce temps, des universités chinoises affiliées à l'armée cherchent à se procurer des puces Nvidia en dépit des restrictions américaines à l'exportation, et Pékin développerait des outils capables de prédire la dissidence politique. Sur le front scientifique, Meta, Anthropic et DeepMind auraient intensifié leurs recherches sur la conscience des machines, ouvrant un débat philosophique que la communauté scientifique commence à prendre au sérieux. L'ensemble du secteur avance à une vitesse que les cadres réglementaires, les protocoles de sécurité et les normes éthiques peinent encore à suivre.

UEL'UE envisage d'exclure Amazon, Microsoft et Google des contrats d'infrastructures critiques, une décision qui pourrait remodeler le marché du cloud souverain européen et accélérer l'adoption de solutions locales.

💬 L'IA qui gère ton administration, c'est pas du flan, les modèles actuels font vraiment le boulot sur la compta de base ou la facturation. Mais la faille Meta AI cette semaine rappelle un truc simple : brancher un assistant sur des processus sensibles sans repenser la sécurité, c'est offrir un boulevard aux attaquants. Bon, on le savait, mais là c'est plus théorique.

BusinessReglementation
1 source
Wall-OSS-0.5 : rapport technique
320arXiv cs.RO 

Wall-OSS-0.5 : rapport technique

Une équipe de chercheurs a publié sur arXiv (2605.30877) le rapport technique de Wall-OSS-0.5, un modèle Vision-Language-Action (VLA) open source de 4 milliards de paramètres, construit sur un backbone VLM de 3B paramètres auquel sont greffés des composants de génération d'actions. Le modèle a été pré-entraîné sur plus de 20 morphologies robotiques différentes, en ingérant plus d'un million de trajectoires robot par époque, couplées à un corpus multimodal ancré. La recette d'entraînement repose sur un co-entraînement à gradient bridgé combinant trois objectifs complémentaires : prédiction d'actions discrètes pour faire circuler des gradients VLM forts dans le backbone, prédiction multimodale pour préserver la compréhension vision-langage, et flow matching continu comme interface d'action au moment du déploiement. Avant tout fine-tuning spécifique, le checkpoint pré-entraîné atteint des comportements zero-shot non triviaux sur un banc de 17 tâches réelles, y compris une tâche de manipulation d'objets déformables hors distribution. Après fine-tuning, il affiche 60,5% de progression moyenne sur 15 tâches réelles et surpasse Pi-0.5 de 17,5 points de pourcentage. Ce résultat repose la question fondamentale du pré-entraînement VLA : jusqu'ici, la quasi-totalité des preuves de performance étaient mesurées après fine-tuning, rendant impossible la distinction entre "le pré-entraînement forme une politique utilisable" et "le pré-entraînement fournit juste une meilleure initialisation". Wall-OSS-0.5 démontre que le checkpoint brut produit des comportements exécutables sur matériel physique, y compris sur des tâches jamais vues. Le fait que l'entraînement sur données d'action ne dégrade pas les capacités vision-langage générales est également significatif pour les intégrateurs : cela suggère qu'un seul modèle fondation peut couvrir perception, raisonnement et contrôle sans compromis majeur, ce qui simplifie l'architecture système. Wall-OSS-0.5 s'inscrit dans la dynamique des VLA fondationnels initiée par des modèles comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et OpenVLA. Sa publication open source le distingue dans un secteur dominé par des checkpoints propriétaires, et permet des comparaisons reproductibles. La performance zero-shot sur manipulation déformable est notable car ce type de tâche est réputé difficile à généraliser : c'est précisément le type de gap sim-to-real que les approches purement simulées peinent à combler. Les prochaines étapes probables incluent un scaling du corpus et des évaluations sur des plateformes humanoïdes commerciales, où la generalisation cross-embodiment du modèle pourra être testée en conditions industrielles.

UELe caractère open source de Wall-OSS-0.5 permet aux équipes de R&D françaises et européennes d'accéder librement à un modèle VLA fondationnel compétitif, réduisant la dépendance aux checkpoints propriétaires américains et asiatiques.

💬 Le vrai truc ici, c'est pas les 60,5% sur le benchmark. C'est que le checkpoint pré-entraîné produit des comportements exécutables sur du vrai matériel, sans fine-tuning, y compris sur des tâches jamais vues. Et open source par-dessus le marché, dans un secteur où tout le monde garde jalousement ses poids pour soi.

RobotiqueOpinion
1 source
Derrière la rencontre entre Trump et Xi, l’ombre de l’IA
321Next INpact 

Derrière la rencontre entre Trump et Xi, l’ombre de l’IA

Du 13 au 15 mai 2026, Donald Trump s'est rendu en Chine pour un sommet de deux jours avec Xi Jinping, emmenant avec lui une délégation d'une quinzaine de dirigeants de la tech et de la finance, parmi lesquels Jensen Huang (Nvidia), Elon Musk (Tesla) et Tim Cook (Apple). Le patron de Nvidia a même rejoint le groupe en dernière minute, lors d'une escale en Alaska, signe de l'importance stratégique de ce marché pour son entreprise malgré les restrictions américaines à l'export. Au menu des échanges : les terres rares, les puces électroniques, l'usage militaire de l'intelligence artificielle et les lignes rouges à ne pas franchir dans les conflits armés, où l'IA s'est déjà déployée sur le terrain, notamment au Venezuela et en Palestine. Trump a annoncé au retour que dix entreprises chinoises avaient obtenu l'autorisation d'acheter des puces Nvidia H200, mais que c'est désormais Pékin lui-même qui freine ces achats, au nom de l'indépendance technologique nationale. Peu d'accords concrets ont été noués à l'issue de ces deux jours. Ce sommet révèle, plus qu'il ne les résout, les fractures profondes entre deux modèles d'IA. Aux États-Unis, le développement est porté par le secteur privé, fondé sur une captation massive de données et de ressources, au point de susciter des résistances croissantes. En Chine, l'État impulse une stratégie open source, plus sobre en entraînement, aux performances comparables, et potentiellement structurante pour les standards mondiaux à venir. Le cas des puces H200 illustre cette divergence : là où Washington cherche à verrouiller l'accès aux technologies de pointe, Pékin préfère développer ses propres champions plutôt que de rester dépendant des infrastructures américaines. Derrière ces négociations se joue une bataille pour le contrôle des ressources critiques qui sous-tendent toute l'économie de l'IA. La Chine extrait plus de 60 % des terres rares mondiales et raffine près de 85 % des stocks globaux ; elle produit plus de 90 % de douze éléments critiques, dont le terbium et le dysprosium, indispensables aux composants des F-35 américains, aux moteurs de véhicules électriques et au hardware informatique. Cette mainmise constitue l'un des leviers de pression les plus puissants de Pékin dans la négociation. Les États-Unis, eux, dominent la conception des puces les plus avancées et contrôlent les chaînes logicielles qui font tourner les grands modèles. Le sommet de mai illustre ainsi une réalité durable : les deux puissances sont condamnées à s'affronter et à s'articuler simultanément, dans une interdépendance technologique dont aucune n'a encore trouvé la sortie.

UELa dépendance européenne aux terres rares chinoises (85 % du raffinage mondial) et aux puces de conception américaine expose l'UE à des vulnérabilités d'approvisionnement critiques, tandis que la rivalité sino-américaine sur les standards de l'IA risque de s'imposer sans que l'Europe ait son mot à dire.

💬 Jensen Huang qui saute dans un avion en Alaska pour rejoindre la délégation en dernière minute, ça dit tout sur ce que représente ce sommet pour Nvidia. Ce qui se joue là, c'est pas une négociation commerciale, c'est la cartographie des dépendances mutuelles : les terres rares d'un côté, les architectures de puces de l'autre. Et l'Europe regarde ça depuis les gradins, dépendante des deux.

InfrastructureOpinion
1 source
L'action Cerebras double presque le premier jour, valorisant le fabricant de puces IA à 100 milliards de dollars
322VentureBeat AI 

L'action Cerebras double presque le premier jour, valorisant le fabricant de puces IA à 100 milliards de dollars

Cerebras Systems, le fabricant de puces basé dans la Silicon Valley, a fait une entrée fracassante au Nasdaq le 14 mai 2026 : l'action a ouvert à 350 dollars, soit presque le double du prix d'introduction fixé à 185 dollars, propulsant la capitalisation boursière de la société au-delà des 100 milliards de dollars dès les premières heures de cotation. L'entreprise a levé 5,55 milliards de dollars en vendant 30 millions d'actions, ce qui en fait la plus grande introduction en bourse technologique américaine depuis Uber en 2019. La demande des investisseurs a littéralement submergé les attentes initiales : Cerebras avait d'abord fixé une fourchette cible de 115 à 125 dollars, l'avait relevée à 150-160 dollars face à l'engouement, avant de fixer le prix final encore au-dessus de cette bande révisée. La société, dont le chiffre d'affaires a progressé de 76 % pour atteindre 510 millions de dollars en 2025, a annoncé son intention d'investir ces nouveaux capitaux dans l'expansion de son infrastructure cloud d'inférence. Ce succès boursier repose sur une architecture radicalement différente de celle de Nvidia. Le Wafer-Scale Engine WSE-3 de Cerebras est un processeur unique qui occupe un wafer de silicium entier, le disque de la taille d'une assiette à partir duquel sont normalement découpées des dizaines de puces classiques. Avec 4 000 milliards de transistors, 900 000 cœurs de calcul et 44 gigaoctets de mémoire embarquée, il est 58 fois plus grand que le B200 de Nvidia et offre 2 625 fois plus de bande passante mémoire. Cet avantage est décisif pour l'inférence d'IA, le processus qui consiste à faire tourner un modèle entraîné pour générer des réponses : chaque token produit nécessite de déplacer l'intégralité des poids du modèle entre mémoire et calcul, une opération strictement séquentielle où la bande passante est le facteur limitant. Cerebras revendique des vitesses d'inférence jusqu'à 15 fois supérieures aux solutions GPU concurrentes sur modèles open source, un chiffre confirmé par le cabinet d'analyse indépendant Artificial Analysis. Le parcours de Cerebras jusqu'à cette cotation a été tout sauf linéaire. Fondée en 2015 sur le pari que les charges de travail de l'IA seraient fondamentalement contraintes par les communications entre mémoire et calcul, la société a passé des années à résoudre un problème que l'industrie des semi-conducteurs avait tenté et abandonné à plusieurs reprises sur 75 ans d'histoire. Cerebras avait une première fois déposé son dossier d'introduction en bourse en septembre 2024, avant de se retirer face aux questions des régulateurs sur sa dépendance quasi totale à un seul client aux Émirats arabes unis. Le redépôt d'avril 2026 présentait un profil radicalement différent : des partenariats avec OpenAI et Amazon Web Services, un service d'inférence cloud en forte croissance, et une base de revenus diversifiée. La capitalisation atteinte dès le premier jour place désormais Cerebras parmi les fabricants de semi-conducteurs les plus valorisés au monde, dans un secteur où Nvidia règne encore en maître incontesté.

💬 100 milliards le premier jour, le marché n'attendait visiblement que ça. Ce qui m'intéresse plus que le chiffre boursier, c'est que leur pari de 2015 (l'inférence est bornée par la bande passante mémoire, pas par le compute) était juste, là où l'industrie avait abandonné ce problème depuis 75 ans. Les 15x sur l'inférence sont validés par des labos indépendants, c'est pas du marketing.

InfrastructureActu
1 source
L'accord lucratif de Cerebras avec OpenAI : une arme à double tranchant
323The Information AI 

L'accord lucratif de Cerebras avec OpenAI : une arme à double tranchant

Le 24 décembre 2025, deux décisions majeures ont simultanément reconfiguré le paysage des puces pour l'intelligence artificielle. Ce soir de réveillon, Nvidia annonçait le rachat de Groq, une startup spécialisée dans l'inférence IA fondée par l'inventeur des TPU (tensor processing units) de Google, pour plusieurs milliards de dollars. Le même jour, OpenAI s'engageait contractuellement à acheter pour des milliards de dollars de puces auprès de Cerebras, le concurrent direct de Groq, révèlent des documents déposés auprès des autorités boursières américaines. Cerebras est connu pour ses wafer-scale chips, des processeurs de la taille d'une assiette capables d'exécuter des modèles d'IA à très grande vitesse. Ces deux transactions signalent un tournant dans la relation historiquement ambiguë entre Nvidia et OpenAI, et ouvrent une brèche commerciale considérable pour les startups spécialisées dans l'inférence. Alors que la demande en capacité de traitement explose, les géants du secteur cherchent à diversifier leurs fournisseurs et à réduire leur dépendance à Nvidia. Pour Cerebras, ce contrat avec OpenAI représente une validation industrielle de premier ordre, susceptible d'accélérer sa trajectoire vers une introduction en bourse. Ces événements s'inscrivent dans une compétition acharnée pour contrôler l'infrastructure d'inférence, le maillon qui permet aux modèles d'IA de répondre aux requêtes en temps réel. Nvidia domine le marché de l'entraînement, mais l'inférence reste plus contestée. En rachetant Groq, Nvidia cherche à verrouiller ce segment. OpenAI, en choisissant Cerebras, joue la carte de l'indépendance stratégique tout en obtenant des performances compétitives.

💬 Nvidia rachète Groq, OpenAI signe chez Cerebras le même soir de Noël : c'est pas un hasard, c'est une déclaration. Le marché de l'inférence est en train de se jouer maintenant, et tout le monde cherche à ne pas se retrouver pieds et poings liés à une seule source d'approvisionnement. Pour Cerebras, ce contrat c'est mieux que toutes les levées de fonds du monde, ça valide la technologie là où ça compte vraiment.

InfrastructureOpinion
1 source
Anthropic utilise le datacenter Colossus-1 de SpaceX et ses 220 000 GPU pour alimenter Claude
324The Decoder 

Anthropic utilise le datacenter Colossus-1 de SpaceX et ses 220 000 GPU pour alimenter Claude

Anthropic va s'emparer de la totalité de la capacité de calcul du centre de données Colossus-1 de SpaceX, soit plus de 300 mégawatts d'électricité et plus de 220 000 GPU NVIDIA. Cette infrastructure colossale, attendue en ligne d'ici un mois, sera entièrement dédiée à alimenter les modèles Claude de la startup californienne. En parallèle, Anthropic annonce le doublement des limites de débit pour Claude Code et une augmentation significative des quotas d'API pour ses modèles Opus. Cette prise de contrôle représente un bond considérable en termes de puissance de calcul disponible pour Anthropic, directement répercuté sur les développeurs et entreprises qui utilisent ses API. Doubler les limites de Claude Code signifie concrètement que les équipes de développement pourront automatiser davantage de tâches sans se heurter aux restrictions actuelles, tandis que la hausse des quotas Opus ouvre la voie à des déploiements en production plus intensifs. C'est un signal fort envoyé aux clients enterprise qui hésitaient à migrer vers Claude en raison des contraintes de capacité. Colossus-1 a été initialement construit par xAI, la société d'intelligence artificielle d'Elon Musk, pour entraîner ses propres modèles Grok. Le fait qu'Anthropic en récupère la pleine capacité illustre la guerre d'infrastructure qui se joue en coulisse entre les grands laboratoires d'IA : disposer de suffisamment de GPU est désormais aussi stratégique que la qualité des modèles eux-mêmes. Avec ce partenariat, Anthropic consolide sa position face à OpenAI et Google DeepMind dans la course aux ressources de calcul à grande échelle.

UELes développeurs et entreprises européennes utilisant l'API Claude bénéficieront directement du doublement des quotas Claude Code et de la hausse des limites Opus, facilitant les déploiements en production à grande échelle.

💬 220 000 GPU construits par xAI pour Grok, qui finissent chez Anthropic. C'est un peu la blague de l'année, mais ça dit surtout que l'infrastructure est devenue aussi stratégique que les modèles eux-mêmes. Ce qui m'intéresse directement, c'est le doublement des limites Claude Code: les pipelines qui plafonnaient vont enfin pouvoir tourner sans jongler avec les quotas.

InfrastructureOpinion
1 source
Le gouvernement américain diversifie ses fournisseurs d'IA et reconsidère le rôle d'Anthropic
325AI News 

Le gouvernement américain diversifie ses fournisseurs d'IA et reconsidère le rôle d'Anthropic

Le Pentagone a officialisé des partenariats avec quatre nouveaux fournisseurs d'intelligence artificielle le 6 mai 2026 : Microsoft, Amazon, Nvidia, et Reflection AI, une startup qui n'a encore publié aucun modèle accessible au grand public. Ces entreprises rejoignent OpenAI, xAI et Google dans un cercle restreint de prestataires autorisés à déployer leurs technologies pour "tout usage légal" au sein des forces armées américaines, y compris sur des données classifiées aux niveaux les plus sensibles, dits Impact Level 6 (secret) et Impact Level 7 (très secret défense). Ce mouvement intervient quelques semaines après la rupture fracassante entre le Pentagone et Anthropic : le département de la Défense avait annulé un contrat de 200 millions de dollars avec la startup, qualifiant publiquement l'entreprise de "risque pour la chaîne d'approvisionnement", une première pour une société américaine. Anthropic avait aussitôt contesté cette décision en justice, réclamant des millions en revenus perdus, après que son PDG Dario Amodei s'était opposé à la formule "tout usage légal", estimant qu'elle ouvrait la porte à la surveillance de civils américains et au développement d'armes autonomes. L'élargissement du portefeuille de fournisseurs militaires réduit mécaniquement la dépendance du Pentagone à l'égard de n'importe quel acteur individuel. Si un dirigeant comme Amodei pose des conditions éthiques, l'armée peut simplement se tourner vers des concurrents moins regardants. Le Pentagone l'a d'ailleurs formulé sans détour : l'objectif est de "bâtir une architecture qui prévient le verrouillage sur un fournisseur unique." Concrètement, les nouveaux outils doivent permettre aux forces armées de "synthétiser les données", d'"élever la compréhension situationnelle" et d'"augmenter la prise de décision des combattants dans des environnements opérationnels complexes", une formulation qui laisse ouverte la question des déploiements sur le territoire américain. Google et Amazon avaient déjà licencié des employés qui protestaient contre l'usage militaire de leurs technologies, signalant que ces entreprises n'ont pas l'intention de répéter la résistance publique d'Anthropic. Le tableau reste pourtant plus nuancé qu'il n'y paraît. Le modèle Mythos d'Anthropic serait actuellement utilisé par la NSA dans le cadre de capacités de cyberguerre et de cyberdéfense, et est en cours d'évaluation par 40 organisations dans le monde, dont seulement 12 nommées publiquement, le MI5 britannique et la NSA figurant parmi les 28 restantes. Le modèle de codage Claude d'Anthropic serait aussi toujours actif au sein d'agences gouvernementales américaines malgré la crise. Selon Axios, qui cite une source à la Maison-Blanche, l'administration Trump chercherait désormais un moyen de "sauver la face et de les ramener dans le giron." La rupture serait donc davantage tactique que définitive, dans un secteur où la dépendance à l'IA militaire s'accélère et où aucun acteur ne peut vraiment se permettre d'être exclu du plus grand client du monde.

UELe MI5 britannique figure parmi les agences évaluant le modèle Mythos d'Anthropic dans un programme mondial impliquant 40 organisations, signalant un intérêt croissant des services de renseignement européens pour ces technologies d'IA à usage militaire.

💬 Amodei fait ses principes en public, mais Mythos tourne déjà chez la NSA. Le Pentagone élargit sa liste de fournisseurs, soit, mais la vraie info c'est que tout le monde veut que ça reprenne, Maison-Blanche incluse. C'est du théâtre contractuel, pas une rupture idéologique.

BusinessOpinion
1 source
Sans crier gare, la Chine sort un supercalculateur de 2,47 ExaFLOPS… sans GPU
326Next INpact 

Sans crier gare, la Chine sort un supercalculateur de 2,47 ExaFLOPS… sans GPU

La Chine vient de révéler, sans aucune communication officielle, l'existence d'un supercalculateur exascale baptisé LineShine, hébergé au Centre National de Supercalcul de Shenzhen (NSCC-SZ). La machine atteint une puissance théorique de 2,47 ExaFLOPS, dont 1,2 ExaFLOPS ont été effectivement mesurés lors de son utilisation pour entraîner un modèle de type MLIP (Machine Learning Interatomic Potentials), soit à peine un quart de sa capacité maximale. LineShine embarque 12,4 millions de cœurs de calcul et 1 310 téraoctets de mémoire HBM. Ce qui frappe immédiatement les observateurs : cette architecture est entièrement scalaire, sans aucun GPU. L'information n'est pas venue d'un communiqué de presse mais d'une publication scientifique parue il y a deux semaines, repérée et relayée par Stéphane Requena, directeur technique du Genci (Grand Équipement National de Calcul Intensif), sur LinkedIn. Si LineShine était soumis au classement Top500, référence mondiale des supercalculateurs, il se retrouverait au coude à coude avec El Capitan, le numéro un mondial actuellement en service aux États-Unis. L'enjeu dépasse la performance brute : ce supercalculateur démontre que la Chine est capable de construire des infrastructures de calcul de premier rang mondial sans dépendre des GPU haute performance de NVIDIA, dont l'exportation vers la Chine est soumise à embargo américain. L'absence de GPU dans une machine de cette envergure représente un choix architectural délibéré et une réponse technologique directe aux restrictions imposées par Washington. Pour les acteurs de l'IA et de la simulation scientifique, c'est la preuve que les restrictions d'exportation n'ont pas bloqué la montée en puissance chinoise, mais l'ont orientée vers des solutions souveraines. La Chine ne participe plus au Top500 depuis plusieurs années, dans un contexte de tensions croissantes avec les États-Unis autour des technologies stratégiques. Depuis les premières vagues de sanctions, Pékin a systématiquement développé ses propres alternatives matérielles et logicielles, tout en maintenant le silence sur ses capacités réelles. LineShine s'inscrit dans cette logique d'autonomie technologique assumée : les avancées chinoises en supercalcul se découvrent désormais à travers des publications académiques, non par des annonces officielles. Les prochains mois pourraient révéler d'autres systèmes de cette génération, alors que la course au calcul exascale s'accélère aussi bien pour la simulation climatique, la recherche pharmaceutique que pour l'entraînement de modèles d'intelligence artificielle de grande taille.

UELa découverte a été relayée par Stéphane Requena, directeur technique du GENCI (institution française de calcul intensif), signalant que les sanctions américaines n'ont pas freiné la montée en puissance chinoise, un avertissement stratégique pour la souveraineté technologique européenne en matière d'infrastructure HPC.

💬 2,47 ExaFLOPS sans un seul GPU, et on l'apprend par une publication académique, pas un communiqué de presse. L'embargo américain n'a pas freiné la Chine, il l'a juste orientée vers ses propres solutions, et visiblement ça tient la route. Ce qui devrait vraiment inquiéter l'Europe, c'est qu'on ne sait pas combien d'autres machines comme ça existent déjà.

InfrastructureOpinion
1 source
Galbot lance LDA-1B, un modèle du monde-action en open source
327Pandaily 

Galbot lance LDA-1B, un modèle du monde-action en open source

Galbot a publié LDA-1B, un modèle fondation monde-action cross-embodiment de 1,6 milliard de paramètres, construit sur son architecture propriétaire WAM (World-Action Model). Ce modèle unifie modèles de monde et modèles d'action au niveau des données, permettant un apprentissage conjoint sur données de simulation et données réelles, données humaines et robotiques, ainsi que sur jeux de données d'action labellisés et non labellisés. LDA-1B peut s'adapter à différentes morphologies de robots après seulement une heure de post-entraînement, selon Galbot. À mesure que le volume de données d'entraînement est passé de 5 000 à 30 000 heures, l'erreur de prédiction d'action a diminué de façon continue, démontrant un comportement de scaling cohérent. La recherche a été acceptée à RSS 2026 et le code source est désormais public. Le modèle est intégré dans AstraBrain et AstraData, l'infrastructure de déploiement de Galbot, couvrant la logistique industrielle, les tâches domestiques et les scénarios retail. En avril 2026, la société est l'entreprise d'IA incarnée non cotée la mieux valorisée en Chine, avec une valorisation dépassant 20 milliards de yuans (2,8 milliards de dollars). Plusieurs points méritent attention. La capacité d'adaptation cross-embodiment en une heure de fine-tuning est une affirmation forte, mais elle reste à valider hors démonstrations contrôlées. Le comportement de scaling confirmé entre 5 000 et 30 000 heures de données est un signal positif pour les VLA (Vision-Language-Action models) à grande échelle, suggérant que les lois d'échelle s'appliquent à l'action robotique de façon analogue aux LLM textuels. L'open-source du codebase réduit la barrière d'entrée pour les intégrateurs souhaitant expérimenter sans infrastructure propriétaire, et positionne Galbot comme fournisseur d'infrastructure fondationale, pas seulement constructeur de robots. Galbot est une startup spécialisée dans les robots humanoïdes et l'IA incarnée. LDA-1B entre en compétition directe avec pi0 de Physical Intelligence, GR00T N2 de NVIDIA, et les approches internes de Figure AI et Agility Robotics côté américain. En Chine, la société rivalise avec Unitree et UBTECH sur le terrain humanoïde. L'acceptation à RSS 2026 lui confère une légitimité académique rare dans ce secteur encore dominé par les communiqués marketing. Les prochaines étapes probables incluent des pilotes industriels en logistique et retail, et une expansion internationale que la valorisation de 2,8 milliards de dollars rend plausible.

UEPression concurrentielle indirecte sur les équipes VLA européennes (INRIA, CEA-List), mais aucun déploiement ni partenariat européen annoncé.

💬 Le comportement de scaling sur les données robotiques, c'est le vrai signal ici, pas le chiffre de valorisation. Que les lois d'échelle s'appliquent à l'action physique comme au texte, ça dit quelque chose sur ce qu'on va voir dans 3 ans, et tu commences à comprendre pourquoi les gros acteurs américains s'agitent. L'open source est une bonne décision stratégique, mais une heure de fine-tuning pour changer de morphologie de robot, j'attends de voir ça hors démo contrôlée.

RobotiqueOpinion
1 source
Le tournant de l'inférence
328Latent Space 

Le tournant de l'inférence

L'inférence est devenue le nouveau champ de bataille stratégique de l'intelligence artificielle. En quelques jours, deux signaux forts ont traversé l'industrie : Noam Brown a déclaré que "la puissance de calcul d'inférence est une ressource stratégique, actuellement sous-évaluée", tandis que Sam Altman affirmait qu'OpenAI devait "dans une large mesure devenir une entreprise d'inférence IA". Ces déclarations interviennent dans le sillage du lancement très réussi de GPT-4.5, mais aussi des chiffres publiés par Lip-Bu Tan, PDG d'Intel, lors de son appel aux résultats du premier trimestre 2026 : la demande en CPU, et non en GPU, est en hausse significative, tirée précisément par les nouveaux usages d'inférence à grande échelle. Jensen Huang, PDG de Nvidia, avait posé les bases de ce constat lors de sa keynote GTC : la demande en calcul a été multipliée par 10 000 en deux ans, l'usage par 100, ce qui représente selon lui une multiplication globale de un million fois en deux ans à peine. Ce basculement n'est pas qu'une métaphore : il redessine concrètement les priorités d'investissement de toute l'industrie. Pendant deux ans, les grandes entreprises tech ont massivement réorienté leurs budgets vers les GPU pour l'entraînement des modèles, au détriment de la maintenance et du renouvellement de leur parc CPU. Or, les agents IA en production, les environnements de simulation pour le renforcement par apprentissage (RL gyms), les outils comme Claude Code, tout cela tourne sur des CPU. Résultat : une potentielle pénurie de CPU se profile, non pas parce que la demande explose de façon spectaculaire comme pour les GPU, mais parce que le cycle naturel de renouvellement de cinq à six ans coïncide avec une sous-capitalisation chronique. Pour les startups comme pour les géants, le goulot d'étranglement se déplace : plus de capacité d'inférence se traduirait directement en plus de revenus, plus d'utilisateurs, des modèles plus performants. Ce moment marque une transition de phase dans l'économie de l'IA. L'ère de l'entraînement massif cède la place à celle du déploiement et du raisonnement continu : chaque fois qu'un modèle pense, agit, lit ou génère du texte, il infère. Cette boucle vertueuse, plus de capacité, plus de tokens, plus d'intelligence, est désormais le moteur central de la compétition entre OpenAI, Anthropic, Google et les autres. Les acteurs qui sécuriseront le plus de capacité d'inférence, que ce soit via des partenariats avec des fournisseurs cloud, des investissements dans des datacenters ou des puces propriétaires, prendront un avantage structurel difficile à rattraper. Le secteur CPU, longtemps dans l'ombre des GPU, redevient soudainement stratégique.

UELe goulot d'étranglement sur la capacité d'inférence CPU affecte directement les startups et entreprises européennes déployant des agents IA en production, qui devront repenser leurs priorités d'investissement infrastructure.

💬 C'est le pivot qu'on sentait venir depuis le lancement massif des agents en prod. Pendant deux ans, tout le monde a empilé des GPU pour l'entraînement, en laissant vieillir le parc CPU, et là c'est ce même parc qui devient le goulot d'étranglement pour l'inférence à grande échelle. Celui qui sécurise de la capacité d'inférence aujourd'hui prend une avance structurelle, pas juste technologique.

InfrastructureOpinion
1 source
GPT-5.5 : le modèle à base d'agents le plus puissant d'OpenAI, à deux fois le prix de l'API
329AI News 

GPT-5.5 : le modèle à base d'agents le plus puissant d'OpenAI, à deux fois le prix de l'API

OpenAI a lancé GPT-5.5 le 23 avril 2026, présenté comme son modèle d'intelligence artificielle agentique le plus capable à ce jour. Conçu dès la base pour planifier, utiliser des outils, vérifier ses propres résultats et exécuter des tâches de façon autonome, il s'agit du premier modèle de base ré-entraîné depuis GPT-4.5, développé en coopération avec les systèmes rack NVIDIA GB200 et GB300 NVL72. Le déploiement a commencé pour les abonnés Plus, Pro, Business et Enterprise dans ChatGPT et Codex, avec un accès API ouvert dès le 24 avril. Sur Terminal-Bench 2.0, un benchmark mesurant les workflows en ligne de commande, GPT-5.5 atteint 82,7 % contre 75,1 % pour GPT-5.4 et 69,4 % pour Claude Opus 4.7. Sur SWE-Bench Pro, qui évalue la résolution de tickets GitHub, il plafonne à 58,6 %, et sur MRCR v2 à un million de tokens, il grimpe à 74,0 % contre seulement 36,6 % pour son prédécesseur. L'API est facturée 5 dollars par million de tokens en entrée et 30 dollars en sortie, soit exactement le double de GPT-5.4. La version Pro, réservée aux abonnements payants, monte à 30 dollars en entrée et 180 dollars en sortie. Ce doublement tarifaire est le principal point de friction, mais OpenAI avance un argument concret : GPT-5.5 accomplit les mêmes tâches Codex avec moins de tokens que son prédécesseur, ce qui ramène le surcoût réel à environ 20 % selon le laboratoire indépendant Artificial Analysis. Pour les entreprises qui déploient des agents automatisés traitant des volumes importants, la différence n'est donc pas nécessairement linéaire avec le prix affiché. En interne, OpenAI affirme que plus de 85 % de ses employés utilisent Codex chaque semaine, y compris les équipes marketing, qui ont notamment utilisé GPT-5.5 pour analyser six mois de demandes de prises de parole et construire un cadre de scoring automatisant les approbations à faible risque. GPT-5.5 s'inscrit dans une course à l'agentique qui structure désormais toute la compétition entre les grands labos d'IA. Le co-fondateur Greg Brockman y voit "un vrai pas vers le type de calcul qu'on attend pour le futur", tandis que le chief scientist Jakub Pachocki concède que les deux dernières années de progrès avaient semblé "étonnamment lentes". Un point reste ouvert : sur MCP Atlas, le benchmark de Scale AI mesurant l'utilisation d'outils via le Model Context Protocol, Claude Opus 4.7 d'Anthropic mène avec 79,1 % et GPT-5.5 n'affiche aucun score, ce qu'OpenAI a néanmoins inclus dans son propre tableau comparatif. Pour les équipes qui construisent des pipelines agentiques en production, les prochaines semaines permettront de déterminer si les performances en benchmark se traduisent en gains réels, notamment pour les agents terminaux non supervisés et l'automatisation DevOps.

UELes développeurs et entreprises européens utilisant l'API OpenAI devront arbitrer entre le gain de performance agentique de GPT-5.5 et son coût doublé (5 $/M tokens en entrée, 30 $ en sortie) pour leurs pipelines en production.

💬 Le doublement affiché fait frémir, mais si le coût réel en prod tourne à +20% grâce à l'efficience sur les tokens, l'arbitrage change du tout au tout. Ce qui accroche plus, c'est que GPT-5.5 n'a aucun score sur MCP Atlas et qu'OpenAI l'a quand même glissé dans son tableau comparatif avec une case vide. Avant de migrer des pipelines agentiques vers GPT-5.5, c'est ce trou-là qu'il faut creuser, pas les benchmarks terminal.

LLMsOpinion
1 source
DeepSeek : dernière avancée en IA et la course aux modèles du monde
330MIT Technology Review 

DeepSeek : dernière avancée en IA et la course aux modèles du monde

La firme chinoise DeepSeek a publié vendredi un aperçu de son nouveau modèle phare, V4, suscitant immédiatement l'attention de l'industrie. Cette version se distingue par sa capacité à traiter des contextes bien plus longs que la génération précédente, grâce à une architecture repensée pour gérer de grands volumes de texte avec une meilleure efficacité. Malgré son statut open source, ses performances se mesurent à celles des modèles propriétaires d'Anthropic, d'OpenAI et de Google. Point stratégique notable : V4 est la première release de DeepSeek optimisée pour les puces Ascend de Huawei, signalant un test grandeur nature de la capacité de la Chine à réduire sa dépendance aux GPU Nvidia. Dans le même temps, Google a annoncé un investissement pouvant atteindre 40 milliards de dollars dans Anthropic, dans une opération valorisant la startup à 350 milliards de dollars, signe que la course au calcul et aux modèles de pointe s'accélère des deux côtés du Pacifique. Ces annonces s'inscrivent dans une semaine marquée par des enjeux géopolitiques et industriels majeurs. La Chine a bloqué le projet de rachat par Meta du studio d'IA Manus pour 2 milliards de dollars, invoquant des raisons de sécurité nationale et qualifiant l'opération de tentative "conspiratrice" de vider la base technologique chinoise. Washington réplique en maintenant ses contrôles à l'exportation sur les puces avancées, tandis que le président Trump a licencié l'ensemble du National Science Board, suscitant des craintes sur l'interférence politique dans la recherche fondamentale américaine. Sur le plan économique, la pression sur les capacités de calcul commence à peser sur des secteurs entiers : emplois, prix de l'électricité et marchés de composants sont tous affectés par l'explosion de la demande en infrastructure IA. En parallèle, un autre front s'ouvre dans la recherche fondamentale : celui des "world models", ces systèmes capables de modéliser le monde physique plutôt que le seul domaine textuel. Des figures comme la professeure de Stanford Fei-Fei Li et Yann LeCun, fondateur d'AMI Labs, défendent l'idée que ces modèles sont indispensables pour dépasser les limites connues des grands modèles de langage et permettre de véritables avancées en robotique. Composer un roman ou générer du code reste infiniment plus simple pour une machine que de plier du linge ou naviguer dans une rue bondée ; les world models ambitionnent de combler cet écart. Ce sujet figure en tête de la liste des dix technologies prioritaires établie par le MIT Technology Review, signe que l'industrie considère désormais cette direction comme l'un des prochains fronts décisifs de l'intelligence artificielle.

UEL'optimisation de DeepSeek V4 sur les puces Huawei Ascend offre aux entreprises européennes une alternative open source aux modèles propriétaires américains, tandis que l'escalade de la guerre technologique sino-américaine sur les puces et les contrôles à l'exportation contraint l'Europe à clarifier son positionnement stratégique dans la course mondiale à l'IA.

LLMsActu
1 source
DeepSeek V4 Pro (1.6T-A49B) et Flash (284B-A13B), Base et Instruct, compatibles avec les puces Huawei Ascend
331Latent Space 

DeepSeek V4 Pro (1.6T-A49B) et Flash (284B-A13B), Base et Instruct, compatibles avec les puces Huawei Ascend

DeepSeek a publié les 23 et 24 avril 2026 deux nouveaux modèles d'intelligence artificielle, DeepSeek V4 Pro et DeepSeek V4 Flash, marquant la première mise à jour majeure de l'architecture depuis DeepSeek V3 en décembre 2024 et DeepSeek R1 en janvier 2025. Le modèle phare, V4 Pro, embarque 1 600 milliards de paramètres au total dont 49 milliards actifs simultanément via une architecture de type Mixture of Experts (MoE), tandis que V4 Flash reste plus compact avec 284 milliards de paramètres et 13 milliards actifs. Les deux modèles ont été entraînés sur 32 à 33 000 milliards de tokens en précision FP4 et atteignent une fenêtre contextuelle d'un million de tokens, contre 128 000 pour V3.2. DeepSeek a publié sous licence MIT à la fois les versions Base et Instruct, et livre un rapport technique de 58 pages salué par de nombreux chercheurs comme l'un des mieux documentés de l'année. Cette publication représente une avancée significative pour l'écosystème des modèles open-weights. V4 Pro se classe autour de la deuxième position parmi les modèles à poids ouverts, dans une fourchette comparable à Kimi K2.6 et GLM-5.1, et rivalise selon les benchmarks avec des modèles fermés de la gamme Claude Sonnet à Opus. La fenêtre d'un million de tokens, rendue possible par deux nouvelles techniques maison nommées Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA), est l'élément le plus commenté : à cette longueur, le modèle ne consomme que 27 % des opérations flottantes et 10 % de la mémoire KV cache comparé à DeepSeek V3.2. Les performances en codage agentique et en traitement de documents longs sont particulièrement relevées. La licence MIT et la publication des poids de base ouvrent par ailleurs la voie à des variantes spécialisées et, potentiellement, à un futur DeepSeek R2 orienté raisonnement. La sortie intervient dans un contexte géopolitique tendu autour des semi-conducteurs. DeepSeek a conçu V4 pour fonctionner sur les puces Huawei Ascend via la pile CANN, réduisant explicitement sa dépendance aux GPU Nvidia soumis aux restrictions américaines à l'export. Une étape symbolique forte : les Ascend représentent encore environ un quart des volumes d'H100, mais leur compatibilité avec un modèle de cette envergure signale une trajectoire vers une autonomie technologique chinoise complète. Sur le plan technique, le rapport documente aussi l'intégration de Muon, l'optimiseur développé par Moonshot, ainsi que des hyper-connexions contraintes par variété (mHC), publiées en janvier 2025. La complexité architecturale du modèle suscite un débat dans la communauté : certains chercheurs estiment que peu de laboratoires ouverts disposent des moyens pour reproduire ou affiner une telle infrastructure, relativisant ainsi la portée réelle de la "démocratisation" annoncée.

UELa compatibilité avec les puces Huawei Ascend illustre la trajectoire vers l'autonomie technologique chinoise, renforçant indirectement les débats européens sur la souveraineté numérique et la dépendance aux semi-conducteurs américains.

💬 Le million de tokens à 10% du cache de V3.2, ça c'est de l'ingénierie sérieuse. Mais le signal fort, c'est la compatibilité Huawei Ascend : DeepSeek documente explicitement sa sortie des GPU Nvidia, et un modèle de cette taille qui tourne sur CANN, c'est pas symbolique, c'est structurel. La licence MIT fait briller les yeux, mais reproduire 1,6T de paramètres, c'est une autre conversation.

LLMsActu
1 source
Anthropic et la stratégie marketing de la peur autour de sa nouvelle IA Mythos (2/3)
332Next INpact 

Anthropic et la stratégie marketing de la peur autour de sa nouvelle IA Mythos (2/3)

Le 7 avril dernier, Anthropic a annoncé Mythos Preview, un modèle d'intelligence artificielle spécialisé dans la cybersécurité, en mettant en avant sa capacité à avoir déjà identifié "des milliers de vulnérabilités critiques", dont des failles dites 0-day, c'est-à-dire inconnues des éditeurs concernés. Pour contrôler les risques de prolifération, Anthropic a restreint l'accès de Mythos à une cinquantaine d'entreprises et organisations américaines gérant des infrastructures logicielles critiques, regroupées au sein du projet Glasswing. Seules onze d'entre elles ont été nommées publiquement : AWS, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorganChase, la Linux Foundation, Microsoft, NVIDIA et Palo Alto Networks. Hors des États-Unis, seul l'AI Security Institute britannique (AISI) a pu évaluer le modèle à ce stade, tandis que plusieurs institutions européennes tentent depuis de négocier un accès. Cette stratégie de lancement illustre un usage délibéré de ce que le secteur tech désigne par l'acronyme FUD, pour "Fear, Uncertainty and Doubt", soit peur, incertitude et doute. En agitant la menace d'une IA capable de découvrir des failles à grande échelle tout en en limitant l'accès, Anthropic a réussi à générer une fébrilité considérable, y compris au plus haut niveau politique. L'administration Trump, qui menaçait encore récemment de blacklister Anthropic, a finalement invité le PDG Dario Amodei à la Maison-Blanche la semaine passée pour évoquer "des possibilités de collaboration", selon Politico. L'Office of Management and Budget aurait même déjà informé les agences fédérales américaines qu'elles allaient prochainement recevoir un accès à Mythos, d'après Bloomberg. L'histoire du FUD dans la tech remonte aux années 1970, quand IBM utilisait des discours anxiogènes pour freiner la concurrence, une rhétorique reprise plus tard par Microsoft pour dépeindre Linux comme une menace. Avec Mythos, Anthropic n'attaque pas directement ses concurrents, mais joue sur la même mécanique : l'exclusivité d'accès alimente l'inquiétude en Europe, où des gouvernements craignent d'être tenus à l'écart d'un outil potentiellement décisif sur le plan géopolitique. Cette anxiété s'inscrit dans un contexte plus large où l'IA semble, pour l'instant, davantage profiter aux attaquants qu'aux défenseurs, renforçant la pression sur les États à ne pas rater le virage. Que Trump se retrouve simultanément à courtiser Anthropic en justice et à lui ouvrir les portes des agences fédérales illustre bien la contradiction inhérente à cette course : personne ne veut être le dernier à accéder à l'outil qu'il redoute.

UELes institutions européennes tentent activement de négocier un accès à Mythos sans y être parvenues à ce stade, alimentant une anxiété géopolitique réelle face au risque d'exclusion d'un outil potentiellement décisif en matière de cybersécurité d'État.

SécuritéOpinion
1 source
Microsoft et les fournisseurs cloud resserrent leur emprise sur les GPU, au détriment des clients IA
333The Information AI 

Microsoft et les fournisseurs cloud resserrent leur emprise sur les GPU, au détriment des clients IA

Microsoft et d'autres grands fournisseurs de cloud redirigent leurs stocks de GPU Nvidia vers leurs équipes internes ou leurs clients enterprise les plus importants, privant les startups d'IA d'un accès fiable aux serveurs dont elles ont besoin. Cette pénurie touche des entreprises pourtant solidement financées, soutenues par des fonds majeurs comme Sequoia Capital, Founders Fund, General Catalyst et Andreessen Horowitz. La situation est suffisamment préoccupante pour qu'Hemant Taneja, directeur général de General Catalyst, ait envoyé un sondage à ses fondateurs en portefeuille pour évaluer leur capacité à accéder aux ressources de calcul. Cette tension sur l'offre a des conséquences directes et immédiates : les startups qui ne parviennent pas à obtenir des GPU auprès des fournisseurs cloud traditionnels se retrouvent contraintes de se tourner vers des alternatives plus coûteuses ou moins stables. Pour des entreprises dont le modèle repose entièrement sur la puissance de calcul, entraînement de modèles, inférence, recherche, une rupture d'approvisionnement peut ralentir le développement de produits et éroder l'avantage concurrentiel acquis grâce aux levées de fonds. Cette situation reflète une tension structurelle dans l'écosystème de l'IA : les hyperscalers comme Microsoft, Google ou Amazon ont massivement investi dans leurs propres capacités d'IA et traitent désormais leurs besoins internes en priorité. Face à une demande mondiale de GPU Nvidia qui dépasse largement l'offre disponible, les petits acteurs se retrouvent en bas de la liste d'attente, dans un marché où l'accès au calcul est devenu aussi stratégique que le capital lui-même.

UELes startups IA européennes, également dépendantes des hyperscalers américains pour l'accès aux GPU Nvidia, sont exposées à la même tension structurelle qui freine leur développement face aux priorités internes des fournisseurs cloud.

InfrastructureOpinion
1 source
GPT-5.5 et la super-application OpenAI Codex
334Latent Space 

GPT-5.5 et la super-application OpenAI Codex

OpenAI a lancé GPT-5.5 le 22 avril 2026, une semaine après la sortie de Claude Opus 4.7 par Anthropic. Le modèle est présenté comme "une nouvelle classe d'intelligence pour le travail réel" et déployé progressivement sur ChatGPT et Codex, l'accès API étant temporairement limité en attendant des vérifications de sécurité supplémentaires. Les benchmarks publiés sont impressionnants : 82,7% sur Terminal-Bench 2.0, 58,6% sur SWE-Bench Pro, 84,9% sur GDPval, 78,7% sur OSWorld-Verified et 84,4% sur BrowseComp. Le tarif API est fixé à 5$/30$ par million de tokens en entrée/sortie pour la version standard, et 30$/180$ pour la version Pro. Selon Artificial Analysis, GPT-5.5 en configuration medium atteint le même niveau que Claude Opus 4.7 au maximum sur leur Intelligence Index, mais à un quart du coût : environ 1 200 dollars contre 4 800. La fenêtre de contexte atteint 1 million de tokens en API, et Sam Altman souligne que le modèle consomme moins de tokens par tâche que son prédécesseur GPT-5.4. Ce lancement ne se résume pas à une simple mise à jour de modèle. GPT-5.5 marque un pivot stratégique d'OpenAI vers l'inférence agentique longue durée et l'efficacité économique, deux dimensions qui comptent davantage pour les entreprises que les scores bruts sur benchmarks académiques. La capacité à exécuter des tâches complexes avec moins d'interventions humaines change concrètement la proposition de valeur pour les développeurs et les équipes techniques. En parallèle, OpenAI a profondément étendu Codex : contrôle du navigateur, intégration avec Google Sheets, Slides, Docs et PDFs, dictée à l'échelle du système d'exploitation, et un mode de revue automatique reposant sur un agent secondaire dit "gardien" qui réduit le nombre de validations nécessaires sur les tâches longues. Codex n'est plus un outil de coding assisté : il devient un agent capable de naviguer dans des interfaces web, capturer des captures d'écran, itérer jusqu'à complétion, et traiter des flux de travail qui couvrent l'assurance qualité, la bureautique et la construction d'applications. Ce lancement s'inscrit dans une course frontale entre OpenAI, Anthropic et Google, dont Gemini 3.1 Pro Preview atteint un niveau comparable à GPT-5.5 à environ 900 dollars selon Artificial Analysis. OpenAI a co-conçu le modèle avec les systèmes NVIDIA GB200/300, et affirme que GPT-5.5 a contribué à améliorer sa propre infrastructure d'inférence, une affirmation qui illustre la direction que prend la compagnie. Sam Altman positionne désormais explicitement OpenAI comme une "entreprise d'inférence IA", signalant que la compétition ne se joue plus seulement sur la qualité des modèles mais sur leur coût d'exploitation à l'échelle. La décision d'absorber Prism et de faire de Codex la base d'une stratégie de superapp unifiée suggère qu'OpenAI cherche à verrouiller les workflows professionnels dans son écosystème, bien au-delà du simple chat.

UELes développeurs et entreprises européens bénéficient d'un modèle agentique de niveau SOTA à coût sensiblement réduit, ce qui modifie concrètement les arbitrages de déploiement IA à grande échelle sur le marché européen.

💬 Le ratio coût/perf, c'est là que ça se joue. GPT-5.5 medium au niveau d'Opus 4.7 max pour un quart du prix, les équipes qui hésitaient vont trancher vite. Et ce pivot vers une superapp avec Codex en moteur, c'est plus ambitieux qu'il n'y paraît : si l'agent gardien tient vraiment sur des tâches longues, OpenAI verrouille les workflows pro bien plus efficacement qu'avec n'importe quel score sur un benchmark.

LLMsOpinion
1 source
Les rumeurs disaient vrai : OpenAI lâche GPT-5.5, et ça change pas mal de choses
335Le Big Data 

Les rumeurs disaient vrai : OpenAI lâche GPT-5.5, et ça change pas mal de choses

OpenAI a officiellement lancé GPT-5.5 le 23 avril 2026, confirmant ainsi les rumeurs qui circulaient depuis plusieurs jours. Sam Altman a annoncé le modèle directement sur X, déclarant simplement qu'il "l'apprécie beaucoup", une formulation sobre pour un lancement que l'entreprise présente comme un véritable saut technologique. Le modèle est immédiatement disponible dans ChatGPT pour les abonnés Plus, Pro et Business sous la dénomination GPT-5.5 Thinking, avec une version GPT-5.5 Pro réservée aux traitements de données massifs exigeant une précision maximale. Les développeurs accédant via Codex bénéficient quant à eux d'une fenêtre de contexte de 400 000 tokens, suffisante pour ingérer des projets entiers en une seule passe. Ce qui distingue fondamentalement GPT-5.5 de ses prédécesseurs, c'est son autonomie opérationnelle. Là où les modèles précédents attendaient une instruction à chaque étape, celui-ci est conçu pour piloter des tâches complexes de bout en bout, en analysant, planifiant et utilisant les logiciels disponibles sans intervention humaine continue. En développement logiciel, cela se traduit concrètement par une capacité à résoudre des projets GitHub entiers en une seule passe, à déboguer de manière autonome en identifiant l'origine d'une faille là où un développeur passerait plusieurs heures, et à anticiper les effets de bord sur le reste du système. L'enthousiasme dans l'industrie est tel qu'un ingénieur chez NVIDIA a comparé l'idée de perdre l'accès au modèle à une amputation physique. Parallèlement, GPT-5.5 maintient une latence comparable à GPT-5.4 tout en consommant moins de tokens pour produire des résultats de meilleure qualité, ce qui améliore directement l'équation coût-performance pour les usages intensifs. Ce lancement s'inscrit dans une course à l'IA générative où chaque acteur cherche à franchir le palier de l'agent autonome, capable d'agir sur un ordinateur plutôt que de simplement répondre à des questions. OpenAI positionnne GPT-5.5 explicitement comme une "nouvelle classe d'intelligence pour le travail réel", ce qui signale un pivot stratégique vers les cas d'usage professionnels et les pipelines agentiques, au détriment du chatbot conversationnel grand public. Google, Anthropic et Meta s'engagent sur le même terrain avec leurs propres modèles capables d'utiliser des outils et d'exécuter des tâches multi-étapes. La disponibilité immédiate dans Codex suggère qu'OpenAI mise sur les développeurs comme vecteur d'adoption prioritaire, une population qui teste vite, publie ses benchmarks et influence ensuite les décisions d'achat des entreprises. La prochaine étape logique sera l'intégration plus profonde dans des environnements d'entreprise, avec des questions de sécurité, de traçabilité et de gouvernance que GPT-5.5 n'adresse pas encore publiquement.

UELes développeurs et entreprises européens utilisant l'API OpenAI via Codex peuvent immédiatement tester les capacités agentiques de GPT-5.5, ce qui soulève des questions de gouvernance et de traçabilité directement pertinentes dans le contexte du règlement européen sur l'IA.

LLMsOpinion
1 source
GPT-5.5 est arrivé et il ne rigole pas : devance légèrement Claude Mythos Preview sur Terminal-Bench 2.0
336VentureBeat AI 

GPT-5.5 est arrivé et il ne rigole pas : devance légèrement Claude Mythos Preview sur Terminal-Bench 2.0

OpenAI a dévoilé GPT-5.5 ce 23 avril 2026, le modèle le plus puissant de l'entreprise à ce jour, connu en interne sous le nom de code "Spud". Présenté lors d'un appel avec des journalistes, le modèle a été décrit par Amelia Glaese, vice-présidente de la recherche chez OpenAI, comme "le modèle le plus solide que nous ayons jamais produit sur le codage, à la fois selon les benchmarks et selon les retours de nos partenaires de confiance". Greg Brockman, cofondateur et président d'OpenAI, a insisté sur sa capacité à travailler de manière autonome : "C'est bien plus intuitif à utiliser. Il peut regarder un problème peu défini et déterminer lui-même ce qui doit se passer ensuite." Sur le plan technique, GPT-5.5 tourne sur les systèmes NVIDIA GB200 et GB300 NVL72, avec des algorithmes heuristiques personnalisés rédigés par l'IA elle-même pour optimiser la répartition des calculs sur les cœurs GPU, ce qui a augmenté la vitesse de génération de tokens de plus de 20%. Le modèle égale la latence par token de son prédécesseur GPT-5.4, tout en offrant un niveau d'intelligence supérieur. GPT-5.4 reste disponible pour les utilisateurs et entreprises à la moitié du coût API du nouveau modèle. Ce qui distingue fondamentalement GPT-5.5 de ses prédécesseurs, c'est son orientation vers la performance dite "agentique" : le modèle est conçu pour gérer des tâches complexes et fragmentées de façon autonome, sans besoin d'instructions pas à pas. Il excelle en codage, en recherche scientifique et en "computer use", c'est-à-dire l'interaction directe avec des systèmes d'exploitation et des logiciels professionnels. Un mode "GPT-5.5 Thinking" a également été introduit dans ChatGPT pour les raisonnements à forts enjeux : il laisse au modèle davantage de temps de calcul interne pour vérifier ses hypothèses avant de répondre. Sur le benchmark interne "Expert-SWE", mesurant des tâches de codage longues dont le temps de complétion médian est de 20 heures pour un humain, GPT-5.5 surpasse GPT-5.4 tout en utilisant significativement moins de tokens. La course aux grands modèles de langage entre OpenAI, Anthropic et Google n'a jamais été aussi serrée. Il y a exactement une semaine, Anthropic avait lancé Claude Opus 4.7, qui avait temporairement pris la tête du classement sur le plus grand nombre de benchmarks tiers. GPT-5.5 reprend aujourd'hui cet avantage sur les modèles publiquement disponibles, et dépasse même Opus 4.7 sur la quasi-totalité des tests de référence. Seul le modèle Claude Mythos Preview d'Anthropic, non disponible au grand public et fortement restreint, résiste encore sur Terminal-Bench 2.0, où il devance GPT-5.5 dans une marge si étroite qu'elle s'apparente à une égalité statistique. Cette dynamique illustre à quel point la frontière technologique entre les trois acteurs dominants s'est réduite, chaque nouveau modèle détrônant le précédent en l'espace de quelques semaines.

UELes développeurs et entreprises français et européens utilisant les API OpenAI pourront évaluer GPT-5.5 pour leurs usages en codage et tâches agentiques, sans impact réglementaire ou institutionnel spécifique à la France ou à l'UE.

💬 Une semaine après Opus 4.7, OpenAI reprend la tête. Le seul modèle qui résiste encore à GPT-5.5, c'est Mythos Preview d'Anthropic, sauf qu'il n'est pas disponible au grand public, donc dans la vraie vie des développeurs, OpenAI est devant. C'est le genre de course où chaque sortie rend la précédente obsolète avant qu'on ait fini de l'évaluer.

LLMsActu
1 source
CoreWeave a convaincu les marchés obligataires
337The Information AI 

CoreWeave a convaincu les marchés obligataires

En l'espace de quelques semaines d'avril 2026, CoreWeave a levé près de 16 milliards de dollars auprès d'une diversité d'investisseurs rarement vue pour une entreprise technologique. Le 31 mars, la société a bouclé une facilité de crédit de 8,5 milliards de dollars adossée à ses propres processeurs graphiques Nvidia. Le 9 avril, elle a élargi un contrat existant avec Meta Platforms à 21 milliards de dollars pour la fourniture de capacités de calcul. Elle a ensuite émis 1,25 milliard de dollars d'obligations à haut rendement et 3 milliards en titres convertibles, des opérations rapidement augmentées d'un milliard supplémentaire. Dans la foulée, Anthropic a annoncé son arrivée comme nouveau client. La semaine suivante, CoreWeave a placé encore un milliard d'obligations sans même organiser de tournée de présentation auprès des investisseurs. Au milieu de tout cela, la firme de trading Jane Street a investi 1 milliard de dollars dans CoreWeave et s'est engagée à dépenser 6 milliards en services cloud IA sur la plateforme. Le titre de l'entreprise a progressé de 55 % sur le mois. Ce niveau de financement reflète un changement de posture profond chez les investisseurs obligataires, traditionnellement prudents vis-à-vis des entreprises technologiques. Ces acteurs ont longtemps boudé le secteur, jugé trop risqué, et avaient manifesté leur inquiétude l'an dernier face à la vague d'endettement d'Oracle et d'autres constructeurs d'infrastructures IA. Désormais, la demande massive et les engagements fermes de géants comme Meta suffisent à rassurer des fonds tels que Janus Henderson Investors, dont le responsable de la recherche crédit Mike Talaga résume la position : "Nous acceptons le risque de construction parce que la demande est là." Pour les investisseurs, CoreWeave représente un levier direct sur le succès de l'IA, avec une capacité démontrée à livrer de la puissance de calcul et à convaincre ses clients d'en commander davantage. L'entrée de Jane Street, acteur financier et non développeur d'IA, signale en outre que l'appétit pour ces services dépasse désormais le cercle des pure players technologiques. La trajectoire de CoreWeave s'inscrit dans une course effrénée à l'infrastructure déclenchée par les progrès rapides de l'IA générative. La pénurie de capacités de calcul a transformé les fournisseurs de cloud spécialisés en acteurs incontournables du secteur. CoreWeave cherche à consolider son avance en enrichissant son offre de logiciels et de services pour fidéliser ses clients. Nick Robbins, vice-président en charge du développement corporate, reconnaît cependant que l'ère actuelle est "celle de la croyance plutôt que du scepticisme." Cette dynamique pourrait s'emballer à court terme, mais elle comporte des risques systémiques : contrairement aux marchés actions, une turbulence dans l'obligataire peut freiner le crédit à l'échelle de l'économie entière, et de lourdes pertes futures dans ce compartiment pourraient se propager bien au-delà du seul secteur IA.

BusinessOpinion
1 source
Mythos d'Anthropic attise les craintes en cybersécurité : quelles implications pour la Chine ?
338SCMP Tech 

Mythos d'Anthropic attise les craintes en cybersécurité : quelles implications pour la Chine ?

Le 7 avril 2026, Anthropic a dévoilé Claude Mythos Preview, son nouveau modèle d'intelligence artificielle, en restreignant délibérément son accès à un consortium sélectionné plutôt qu'en le rendant public. Cette décision inhabituelle s'explique par les capacités inédites du modèle à identifier et exploiter des failles de cybersécurité avec une précision et une autonomie qui ont immédiatement alerté gouvernements et régulateurs à travers le monde. C'est la première fois qu'un lancement de modèle d'IA provoque une réaction politique aussi rapide et coordonnée à l'échelle internationale. L'inquiétude est fondée : un système capable de cartographier et d'attaquer des infrastructures numériques sans intervention humaine représente un changement de nature dans la menace cyber, et non simplement de degré. Pour les entreprises, les États et les opérateurs d'infrastructures critiques, Mythos introduit un risque asymétrique majeur : ceux qui y ont accès disposent d'un avantage offensif considérable sur ceux qui n'en bénéficient pas. La restriction d'accès choisie par Anthropic est autant une précaution qu'un signal envoyé aux régulateurs. La question de la Chine se pose immédiatement dans ce contexte. La rivalité technologique sino-américaine s'articule de plus en plus autour des modèles frontier, et Mythos représente un écart de capacité potentiellement significatif si Pékin ne dispose pas d'équivalent. Les États-Unis contrôlent déjà les puces Nvidia via les restrictions d'export ; un modèle offensif de cette puissance, conservé sous embargo partiel, devient un levier géopolitique supplémentaire dont les implications dépassent largement le seul domaine de la cybersécurité.

UELes opérateurs d'infrastructures critiques européens et les régulateurs (ANSSI, ENISA, AI Office) devront réévaluer leur posture défensive face à un modèle offensif cyber de cette puissance auquel les acteurs européens pourraient ne pas avoir accès.

💬 La restriction d'accès, c'est le vrai signal, pas les capacités du modèle en elles-mêmes. Anthropic vient de décider, seul, qui peut tenir cette arme, et c'est exactement le genre de décision que les gouvernements auraient voulu prendre eux-mêmes. La Chine, l'Europe, tout le monde se retrouve en position défensive face à un outil offensif qu'ils n'ont pas.

SécuritéOpinion
1 source
SpaceX s’allie à Cursor avec une option de rachat à 60 milliards
339Le Big Data 

SpaceX s’allie à Cursor avec une option de rachat à 60 milliards

SpaceX a officialisé le 21 avril 2026 un accord stratégique avec Cursor, l'éditeur de l'assistant de codage IA plébiscité par les développeurs professionnels. La structure de l'opération est atypique : SpaceX dispose soit de verser 10 milliards de dollars à Cursor pour ses travaux de développement, soit de procéder à une acquisition totale valorisant la start-up à 60 milliards de dollars. En parallèle, xAI, autre entité d'Elon Musk, a commencé à louer sa puissance de calcul à Cursor, mobilisant des dizaines de milliers de puces pour l'entraînement de modèles, selon Business Insider. The Information a également révélé que deux cadres importants de Cursor ont rejoint xAI récemment. Cursor, valorisée seulement 2,5 milliards de dollars début 2025, a bondi à 9 milliards quelques mois plus tard, puis à près de 30 milliards après une levée de fonds de 2,3 milliards en série D. L'option à 60 milliards acte une nouvelle étape dans cette ascension spectaculaire. Cet accord repose sur une logique de complémentarité : Cursor apporte son produit et sa base d'utilisateurs, essentiellement des développeurs expérimentés, tandis que SpaceX met à disposition le supercalculateur Colossus, dont la puissance équivaut à un million de puces Nvidia H100. L'objectif affiché est de créer les meilleurs outils d'IA au monde pour le codage et le travail de connaissance. Pour SpaceX, l'enjeu est de s'imposer rapidement sur un segment à forte valeur sans nécessairement décaisser immédiatement les 60 milliards, en conservant une option d'achat. Pour Cursor, l'accord constitue une validation implicite de sa valorisation, supérieure aux 50 milliards que la start-up visait lors de récentes discussions privées. Ce rapprochement s'inscrit dans une logique plus large de consolidation des actifs IA d'Elon Musk, qui cherche à créer un écosystème intégré combinant infrastructure de calcul, modèles de langage et outils de distribution. Le timing n'est pas anodin : SpaceX prépare une introduction en bourse très attendue, et l'intégration d'une brique logicielle à fort potentiel renforcerait son profil de conglomérat technologique au-delà du spatial. Cependant, le partenariat révèle aussi les faiblesses structurelles des deux parties : ni Cursor ni xAI ne disposent aujourd'hui de modèles capables de rivaliser pleinement avec ceux d'OpenAI ou d'Anthropic, qui dominent le marché de l'IA pour développeurs. L'alliance vise précisément à combler ce retard, mais SpaceX doit jongler avec des engagements financiers déjà conséquents, notamment après l'acquisition de xAI et du réseau social X, et les modalités de paiement, cash ou actions, restent à préciser.

Orchestration d'agents
340MIT Technology Review 

Orchestration d'agents

Les agents IA orchestrés en réseau constituent désormais la prochaine grande rupture technologique. Alors que ChatGPT a rendu les grands modèles de langage accessibles au grand public, les outils multi-agents représentent une étape qualitativement différente : des systèmes capables de déléguer, coordonner et exécuter des tâches complexes en parallèle. Claude Code, lancé par Anthropic l'année dernière, permet par exemple de piloter simultanément plusieurs dizaines de sous-agents, chacun affecté à une portion distincte d'une base de code. Chez OpenAI, Codex joue un rôle similaire. Anthropic affirme avoir développé son application de productivité Claude Cowork en seulement dix jours grâce à Claude Code, là où un projet comparable aurait nécessité plusieurs mois. Perplexity a également lancé Computer, un outil généraliste pour professionnels. Google DeepMind propose de son côté Co-Scientist, une plateforme qui permet aux chercheurs de confier à des équipes d'agents la recherche bibliographique, la génération d'hypothèses et la conception d'expériences. L'enjeu dépasse largement le secteur du logiciel. Ces outils s'adressent désormais à tous les cols blancs : gestion de boîtes mail, suivi d'inventaires, traitement des réclamations clients. La promesse centrale est de transformer le travailleur qualifié en chef de projet capable de superviser une équipe d'agents, multipliant ainsi sa productivité. Les partisans de cette technologie évoquent une rupture comparable à ce que la chaîne d'assemblage de Henry Ford a représenté pour l'industrie manufacturière au siècle dernier : une réorganisation profonde du travail de connaissance, potentiellement synonyme de suppressions massives de postes dans les fonctions tertiaires ou, à l'inverse, d'un bond de productivité sans précédent pour ceux qui sauront maîtriser ces outils. La montée en puissance de ces systèmes s'inscrit dans une dynamique portée par les géants de la tech. Des entreprises comme Nvidia et Tencent ont déjà commencé à développer leurs propres agents en s'appuyant sur des bases open source, comme celles popularisées par OpenClaw, un assistant personnel vocal qui avait capté l'attention malgré des failles de sécurité notoires. La vraie question qui se pose aujourd'hui n'est plus technique mais systémique : jusqu'où peut-on laisser des agents autonomes interagir avec des infrastructures critiques, des systèmes de santé, des plateformes financières ou des réseaux sociaux ? Les grands modèles de langage restent imprévisibles, et ce qui n'est qu'une erreur bénigne dans une interface de chat peut devenir un incident grave lorsque l'agent agit directement dans le monde réel. Le secteur avance vite, mais le cadre de contrôle, lui, peine à suivre.

UELa prolifération d'agents autonomes dans les fonctions tertiaires et les infrastructures critiques interpelle directement le cadre réglementaire européen, notamment l'AI Act qui classe certains usages d'agents autonomes comme systèmes à haut risque nécessitant audit et supervision humaine.

OutilsOutil
1 source
ROBOGATE : détection adaptative des défaillances pour un déploiement sûr des politiques de robots via un échantillonnage en deux étapes axé sur les limites
341arXiv cs.RO 

ROBOGATE : détection adaptative des défaillances pour un déploiement sûr des politiques de robots via un échantillonnage en deux étapes axé sur les limites

Des chercheurs ont publié ROBOGATE (arXiv:2603.22126), un framework open-source de validation pré-déploiement pour les politiques de manipulation robotique, conçu pour identifier les zones de défaillance avant mise en production industrielle. Le système repose sur un échantillonnage adaptatif en deux étapes dans un espace de paramètres à huit dimensions : une première phase par Latin Hypercube Sampling (LHS) couvre l'espace global, puis une seconde phase concentre l'effort sur la zone de transition critique entre 30 % et 70 % de taux de réussite, là où les échecs sont les plus révélateurs. Le tout est exécuté dans NVIDIA Isaac Sim avec le moteur physique Newton, sur quatre morphologies robotiques : Franka Panda (7-DOF), UR3e, UR5e et UR10e (tous 6-DOF). Au total, plus de 50 000 expériences ont été simulées, produisant un modèle de régression logistique avec une AUC de 0,780 et une équation analytique fermée de la frontière de défaillance. Le framework a également benchmarké huit politiques VLA, dont une version fine-tunée de NVIDIA GR00T N1.6 (3 milliards de paramètres), entraînée sur LIBERO-Spatial pendant 20 000 étapes. Le chiffre le plus frappant de l'étude est un écart de 97,65 points de pourcentage entre les environnements de simulation : le même checkpoint GR00T N1.6 atteint 97,65 % de réussite sur le benchmark LIBERO sous MuJoCo, mais tombe à 0 % sur les 68 scénarios industriels de ROBOGATE sous Isaac Sim. Ce résultat met en lumière un problème structurel du déploiement des VLA : les scores de benchmark en simulation ne prédisent pas le comportement dans un simulateur différent, a fortiori dans le monde réel. Pour les intégrateurs et les décideurs industriels, cela signifie qu'un modèle validé sur benchmark standard peut être totalement non opérationnel dans leur environnement cible. ROBOGATE propose une couche de validation intermédiaire, inspirée du paradigme que NVIDIA a formalisé pour le calcul quantique avec Ising, transposé ici à l'IA physique. Le gap sim-to-real reste l'un des verrous majeurs de la robotique manipulatrice apprise, et la plupart des acteurs du secteur, de Figure AI (Figure 03) à Physical Intelligence (Pi-0) en passant par Boston Dynamics ou les équipes internes de NVIDIA, travaillent à le réduire via des pipelines sim-to-real renforcés ou de la synthèse de données domain-randomisée. ROBOGATE ne prétend pas résoudre ce gap mais fournit un outil de diagnostic structuré : cartographier les frontières d'échec avant déploiement, ce qui est précisément ce qui manque dans les workflows industriels actuels. Le framework est publié en open-source, ce qui devrait faciliter son adoption par les équipes de validation, en particulier celles qui travaillent sur des cellules pick-and-place standardisées avec des bras industriels UR ou Franka. Les prochaines étapes naturelles seraient l'extension à des morphologies mobiles-manipulatrices et l'intégration dans des pipelines CI/CD robotiques, un domaine encore embryonnaire mais en progression rapide chez des acteurs comme Intrinsic (Alphabet) ou Covariant.

UELes équipes R&D européennes travaillant sur des cellules robotiques avec bras UR (Universal Robots, Danemark) ou Franka Panda peuvent adopter ce framework open-source pour structurer leur validation pré-déploiement et éviter des échecs coûteux en production.

AutreActu
1 source
342AI News 

Anthropic entre à la Maison Blanche : Mythos ouvre les portes de Washington

Le PDG d'Anthropic, Dario Amodei, s'est rendu à la Maison-Blanche vendredi pour rencontrer Susie Wiles, cheffe de cabinet du président Trump, en présence du secrétaire au Trésor Scott Bessent. Les deux parties ont qualifié les échanges de "productifs et constructifs". La visite intervient quelques semaines seulement après qu'une décision de l'administration Trump avait désigné Anthropic comme un "risque dans la chaîne d'approvisionnement", une classification habituellement réservée aux adversaires étrangers, et après que Trump avait lui-même déclaré que son gouvernement ne ferait "plus jamais affaire" avec l'entreprise. Un juge fédéral de San Francisco a depuis bloqué l'application de cette directive, maintenant Anthropic éligible aux contrats avec les agences civiles le temps que le litige se règle. Le différend avec le Pentagone, lui, reste entier. Ce qui a modifié le rapport de force, c'est le modèle Mythos d'Anthropic, un système d'IA spécialisé en cybersécurité aux capacités jugées inégalées. Lors de tests internes, Mythos a localisé des milliers de failles inconnues et critiques dans tous les grands systèmes d'exploitation et navigateurs web, dont un bug vieux de 27 ans dans OpenBSD et une vulnérabilité de 16 ans dans FFmpeg, passée cinq millions de fois à travers des outils automatisés sans être détectée. Anthropic a choisi de ne pas le diffuser publiquement et l'a réservé à un cercle restreint via le "Project Glasswing", une coalition incluant AWS, Apple, Cisco, Google, Microsoft, Nvidia, CrowdStrike et JPMorganChase, soutenue par jusqu'à 100 millions de dollars en crédits d'utilisation. Des agences de renseignement américaines et la CISA (l'agence fédérale de cybersécurité) testent déjà Mythos, et le Trésor a également manifesté son intérêt. Selon Axios, un accord permettant à des agences gouvernementales de rejoindre le programme Glasswing pourrait être conclu rapidement. La réunion de vendredi avait pour objectif explicite de séparer deux dossiers qui s'étaient enchevêtrés : le conflit avec le Pentagone d'un côté, et l'accès du reste du gouvernement fédéral aux outils d'Anthropic de l'autre. En toile de fond, une tension difficile à résoudre : Mythos est un outil à double usage, capable de renforcer les défenses comme d'armer des attaquants. Un conseiller de Trump a résumé la situation à Axios en ces termes : "Tout le monde se plaint, il y a tout ce drame, donc ça a été remonté à Susie pour qu'elle écoute Dario." Sean Cairncross, directeur national de la cybersécurité, doit diriger un groupe de hauts fonctionnaires chargé d'identifier les vulnérabilités des infrastructures critiques, une mission pour laquelle Mythos devient difficile à ignorer.

UELes failles critiques découvertes par Mythos dans des systèmes largement déployés en Europe (OpenBSD, FFmpeg, navigateurs majeurs) concernent indirectement les infrastructures européennes, mais le programme Glasswing et les accords gouvernementaux restent pour l'instant limités aux agences américaines.

💬 Un bug de 27 ans dans OpenBSD, passé cinq millions de fois sous les outils automatisés sans être vu. Ça explique pourquoi Dario Amodei se retrouve à la Maison-Blanche trois semaines après que Trump avait juré de ne plus jamais travailler avec eux. Bon, le problème du double usage, lui, ne se règle pas avec une réunion à Washington.

SécuritéActu
1 source
OpenAI va dépenser plus de 20 milliards de dollars en puces Cerebras et obtenir une participation au capital
343The Information AI 

OpenAI va dépenser plus de 20 milliards de dollars en puces Cerebras et obtenir une participation au capital

OpenAI a conclu un accord majeur avec Cerebras Systems, le fabricant de puces AI concurrent de Nvidia, pour un montant total dépassant 20 milliards de dollars sur trois ans. Selon plusieurs sources proches du dossier, cette somme, deux fois supérieure aux chiffres précédemment évoqués, servira à financer l'utilisation de serveurs équipés des puces Cerebras. En parallèle, OpenAI s'est engagé à injecter environ 1 milliard de dollars supplémentaires pour financer la construction de centres de données destinés à héberger ses produits d'intelligence artificielle. En contrepartie de ces dépenses, OpenAI recevra des bons de souscription donnant accès à une participation minoritaire dans Cerebras, participation qui pourrait croître proportionnellement aux sommes dépensées. Cet accord constitue une tentative directe de réduire la dépendance d'OpenAI envers Nvidia, dont les puces H100 et H200 dominent le marché de l'infrastructure IA. Pour OpenAI, l'enjeu est double : diversifier ses fournisseurs de calcul tout en pesant sur les coûts d'entraînement et d'inférence de ses modèles, qui représentent plusieurs milliards de dollars par an. Cerebras, connue pour ses puces WSE (Wafer Scale Engine) aux performances élevées sur certaines charges de travail, tentait de lancer son introduction en bourse depuis 2024, un processus retardé notamment par des questions réglementaires liées à ses investisseurs du Moyen-Orient. Cet accord avec OpenAI change radicalement sa trajectoire et sa valorisation potentielle. Il s'inscrit dans un mouvement plus large de l'industrie tech visant à diversifier l'approvisionnement en silicium face à la pénurie et au pouvoir de marché de Nvidia, tandis que des acteurs comme AMD, Intel et des startups comme Groq cherchent également à s'imposer comme alternatives crédibles.

💬 20 milliards sur Cerebras, c'est pas une commande de puces, c'est un message envoyé à Jensen Huang. OpenAI commence enfin à construire un levier de négociation réel, parce qu'être client captif de Nvidia à cette échelle, c'est juste intenable sur la durée. Reste à voir si les WSE tiennent la charge en prod sur des workloads variés, parce que Cerebras performe bien dans certains cas mais c'est pas encore la puce universelle qu'on nous vend.

InfrastructureActu
1 source
344Le Big Data 

Pourquoi les infrastructures cloud dédiées à l’IA deviennent un enjeu stratégique en Europe ?

Le groupe SWI (Stoneweg Icona Group) a annoncé l'acquisition d'une participation majoritaire dans Polarise, une société allemande spécialisée dans les infrastructures cloud pour l'intelligence artificielle, valorisant cette dernière à 500 millions d'euros. En parallèle, SWI s'engage à injecter un milliard d'euros supplémentaires pour accélérer le développement de ce qui se veut le premier opérateur d'infrastructures numériques souveraines à l'échelle européenne. Polarise dispose déjà de 14 centres de données opérationnels à travers l'Europe, d'une capacité totale de 2,3 GW via sa plateforme AiOnX, et d'un partenariat privilégié avec Nvidia lui donnant accès direct aux GPU les plus puissants du marché. La société a également lancé la première "AI Factory" d'Allemagne en collaboration avec Deutsche Telekom, positionnant d'emblée ce rapprochement comme une initiative industrielle de premier plan. Max-Hervé George, fondateur et PDG de SWI Group, pilote cette stratégie d'intégration verticale, couvrant la chaîne complète du foncier aux logiciels cloud. L'enjeu est considérable : les entreprises et gouvernements européens cherchent à réduire leur dépendance aux hyperscalers américains, AWS, Azure, Google Cloud, pour les charges de travail les plus sensibles. L'acquisition permet à SWI de proposer un modèle "GPU-as-a-Service" permettant aux organisations de louer de la puissance de calcul GPU à la demande, sans investissement lourd en matériel, via une infrastructure localisée en Europe et soumise au droit européen. Pour les industries de pointe en Allemagne, en France ou en Norvège, cela représente un accès à des capacités de calcul haute performance sans compromis sur la souveraineté des données. Ce modèle favorise également une innovation plus rapide pour les startups et PME qui n'ont pas les moyens de construire leur propre infrastructure. Cette opération s'inscrit dans un mouvement plus large de structuration de la filière IA européenne face à la domination des géants américains et à la montée en puissance des acteurs chinois. L'Union européenne multiplie depuis plusieurs années les appels à bâtir une capacité numérique autonome, notamment à travers le règlement sur l'IA et les investissements du programme Horizon. La rareté des GPU Nvidia, dont Polarise est revendeur agréé, confère à cette alliance un avantage concurrentiel structurel dans un marché sous tension. Les prochaines étapes visent l'extension géographique vers l'Allemagne et la Norvège, deux pays disposant d'une énergie abondante et bon marché indispensable pour alimenter ces infrastructures énergivores. Si SWI tient ses engagements d'investissement, le groupe pourrait devenir un acteur de référence pour les contrats publics et les grandes entreprises cherchant une alternative crédible aux solutions extraeuropéennes.

UEL'acquisition crée un opérateur cloud souverain européen offrant aux entreprises et gouvernements de l'UE une alternative concrète aux hyperscalers américains pour leurs charges de travail sensibles, avec accès aux GPU Nvidia via une infrastructure soumise au droit européen.

InfrastructureOpinion
1 source
Tencent HY-World 2.0 : cette IA transforme vos mots en jeux vidéo… et c’est open source !
345Le Big Data 

Tencent HY-World 2.0 : cette IA transforme vos mots en jeux vidéo… et c’est open source !

Tencent a publié le 16 avril 2026 HY-World 2.0, un modèle d'intelligence artificielle open source capable de générer des environnements 3D interactifs complets à partir d'un simple texte, d'une image ou d'une vidéo. Le processus prend environ 712 secondes, soit moins de douze minutes, en exploitant des GPU NVIDIA H20. Le modèle repose sur une chaîne de quatre modules spécialisés : HY-Pano 2.0 convertit le point de départ en panorama sphérique à 360 degrés, WorldNav planifie jusqu'à 35 trajectoires de caméra pour explorer l'espace sans collision, WorldStereo 2.0 génère de nouvelles vues pour combler les angles morts, et WorldMirror 2.0 reconstruit la scène finale en 3D Gaussian Splatting. L'algorithme MaskGaussian réduit le volume des données de 73,7 % en éliminant les points superflus, sans dégrader la qualité visuelle, maintenant un PSNR de 25.017. Les scènes exportées sont directement compatibles avec Unity et Unreal Engine, et incluent la détection de collisions pour la robotique. Tencent publie les poids, le code et le rapport technique en accès libre. Cette publication change concrètement l'accès à la génération de mondes 3D, jusqu'ici réservée à des équipes disposant de ressources considérables. Un développeur de jeu indépendant, un studio de simulation ou une équipe de robotique peut désormais produire un environnement 3D explorable en moins d'un quart d'heure, sans pipeline propriétaire ni licence coûteuse. Le fait que les exports soient nativement compatibles avec les deux moteurs de jeu dominants du marché supprime une étape d'intégration habituellement chronophage. Pour la robotique incarnée, la possibilité de générer des environnements de simulation physiquement cohérents à la demande ouvre des perspectives importantes pour l'entraînement d'agents autonomes à moindre coût. HY-World 2.0 arrive dans un contexte de compétition intense autour des "world models", ces systèmes capables de simuler des environnements physiquement plausibles. Google DeepMind a présenté Genie 3, qui adopte une approche par génération vidéo, tandis que World Labs de Fei-Fei Li a lancé Marble, solution entièrement fermée. Tencent choisit délibérément l'open source pour s'imposer comme référence de la recherche et attirer la communauté des développeurs, une stratégie déjà utilisée avec la série Hunyuan sur la génération d'images et de vidéos. L'enjeu dépasse le jeu vidéo : les world models sont considérés comme une brique fondamentale pour entraîner des robots et des agents IA capables d'agir dans le monde réel. En rendant HY-World 2.0 librement accessible, Tencent accélère la diffusion de cette technologie et complique la position des acteurs qui misaient sur la fermeture de leurs systèmes comme avantage concurrentiel.

UELes studios indépendants et équipes de robotique français et européens peuvent désormais générer des environnements 3D professionnels gratuitement, réduisant leur dépendance aux solutions propriétaires coûteuses.

💬 12 minutes pour un monde 3D explorable, exportable direct dans Unity ou Unreal, open source. Ce qui est intéressant ici, c'est pas la performance technique (solide, mais la concurrence existe), c'est que Tencent lâche tout en public pile au moment où World Labs joue la carte du fermé, le même coup qu'avec Hunyuan. Un studio indé peut démarrer avec ça demain, sans débourser un centime.

CréationOpinion
1 source
Google annonce Gemma 4, ses modèles IA open source sous licence Apache 2.0
346Ars Technica AI 

Google annonce Gemma 4, ses modèles IA open source sous licence Apache 2.0

Google a lancé ce mercredi Gemma 4, sa nouvelle génération de modèles d'IA open-weight, disponible en quatre tailles optimisées pour un usage local. La gamme comprend notamment un modèle 26 milliards de paramètres en architecture Mixture of Experts (MoE) et un modèle dense de 31 milliards de paramètres, tous deux conçus pour tourner non quantifiés en format bfloat16 sur un seul GPU NVIDIA H100 de 80 Go. Quantifiés en précision réduite, ces modèles peuvent également fonctionner sur des cartes graphiques grand public. Autre changement majeur : Google abandonne sa licence propriétaire Gemma au profit de la licence Apache 2.0, bien plus permissive et largement adoptée dans l'écosystème open source. Ce passage à l'Apache 2.0 répond directement aux frustrations exprimées par les développeurs, qui se heurtaient jusqu'ici à des restrictions d'usage limitant l'intégration de Gemma dans des projets commerciaux ou open source. La licence Apache 2.0 supprime ces barrières et aligne Gemma sur les standards attendus pour des modèles véritablement ouverts. Sur le plan technique, le modèle 26B MoE n'active que 3,8 milliards de ses 26 milliards de paramètres en inférence, ce qui lui confère un débit en tokens par seconde nettement supérieur aux modèles de taille équivalente, réduisant ainsi la latence sur du matériel local. Le 31B Dense, lui, privilégie la qualité et est pensé pour être affiné sur des cas d'usage spécifiques. Gemma 3 avait été lancé il y a plus d'un an, et cette nouvelle version s'inscrit dans une dynamique de concurrence intense autour des modèles ouverts, où Meta (avec Llama), Mistral AI et d'autres acteurs se disputent l'adoption des développeurs. Google dispose d'un avantage structurel avec ses propres accélérateurs TPU et son infrastructure cloud, mais cherche également à s'imposer sur les machines locales, un segment en forte croissance depuis l'essor des inférences embarquées. Avec Gemma 4, l'entreprise tente de réconcilier puissance et accessibilité, tout en reprenant la main sur un écosystème open source qu'elle avait jusqu'ici abordé avec prudence.

UELes développeurs européens peuvent désormais intégrer Gemma 4 dans des projets commerciaux et open source sans restriction grâce au passage à la licence Apache 2.0.

💬 Le passage à Apache 2.0, c'est la vraie nouvelle ici, pas les 26B de paramètres. La licence Gemma d'avant rendait le modèle quasi inutilisable pour quoi que ce soit de sérieux, et Google le savait depuis des mois. Reste à voir si le 26B MoE tient ses promesses en local, mais sur le papier, activer 3,8B de paramètres pour le débit d'un petit modèle avec la qualité d'un grand, c'est exactement le genre de compromis qu'on attendait.

OpenAI lève 3 milliards auprès d'investisseurs particuliers dans une levée record de 122 milliards
347TechCrunch AI 

OpenAI lève 3 milliards auprès d'investisseurs particuliers dans une levée record de 122 milliards

OpenAI a bouclé un tour de financement record de 122 milliards de dollars, dont 3 milliards levés directement auprès d'investisseurs particuliers — une démarche inhabituelle pour une entreprise non cotée. Le tour est mené par Amazon, Nvidia et SoftBank, et porte la valorisation de la société à 852 milliards de dollars, la plaçant parmi les entreprises privées les plus valorisées de l'histoire. L'ouverture aux investisseurs retail signale qu'OpenAI prépare activement son introduction en bourse. En associant le grand public à ce tour pré-IPO, la société élargit sa base d'actionnaires et génère une dynamique de marché favorable avant une cotation. Pour les investisseurs institutionnels comme SoftBank — déjà engagé à hauteur de 500 millions de dollars dans le projet Stargate — c'est une opportunité de consolider leur position avant que le titre ne soit accessible à tous. Cette levée intervient dans un contexte de course effrénée aux capitaux dans l'IA générative. OpenAI fait face à la montée en puissance de concurrents comme Anthropic, Google DeepMind et des acteurs chinois tels que DeepSeek. Avec une valorisation frôlant les 1 000 milliards de dollars, l'entreprise fondée par Sam Altman s'approche d'un statut de « trillion-dollar company » avant même son entrée en bourse, une IPO qui pourrait redéfinir les standards du secteur technologique.

UELa valorisation record d'OpenAI à 852 milliards de dollars et sa future IPO renforceront la dépendance des entreprises européennes aux infrastructures IA américaines, aggravant les enjeux de souveraineté numérique de l'UE.

💬 852 milliards avant même l'IPO, c'est du jamais vu et c'est pas un accident. Ouvrir le tour aux particuliers, c'est pas de la générosité envers les petits porteurs, c'est la mécanique classique pour chauffer la base actionnaire et arriver en bourse avec un marché déjà acquis. Ça va faire une IPO spectaculaire sur le papier, bon, reste à voir ce que ça donne quand les vrais chiffres de marge seront publics.

BusinessActu
1 source
Claude rattrape OpenClaw
348The Information AI 

Claude rattrape OpenClaw

Anthropic a multiplié les nouvelles fonctionnalités pour ses agents Claude ces dernières semaines, au point de rivaliser directement avec OpenClaw, l'outil open-source de développement d'agents IA personnels devenu viral. Parmi les ajouts récents : la prise de contrôle complète de l'ordinateur de l'utilisateur pour exécuter des tâches complexes dans n'importe quelle application — lancée lundi soir avec beaucoup de communication —, la réception de commandes via des messageries comme Telegram ou iMessage, la mémorisation d'informations entre les sessions, et l'exécution automatique de tâches récurrentes selon un planning. L'avantage de Claude sur OpenClaw réside surtout dans l'accessibilité et la sécurité. Là où OpenClaw exige une installation en ligne de commande, une configuration manuelle des modèles et des intégrations, Claude ne nécessite qu'une application desktop. Sur le plan de la cybersécurité, Claude Cowork demande une confirmation avant de modifier des fichiers et s'exécute dans une machine virtuelle isolée du système principal — une précaution qui évite les risques qui ont longtemps terni la réputation d'OpenClaw, et qui poussaient certains utilisateurs à acquérir des Mac Mini ou des machines Nvidia dédiées pour cloisonner leurs agents IA. Malgré cette concurrence frontale, OpenClaw reste une force considérable. Les données NPM indiquent que l'outil a été téléchargé plus de 400 000 fois le mardi suivant l'annonce d'Anthropic, proche de son record absolu de 500 000 téléchargements quotidiens atteint plus tôt dans le mois — et ces chiffres n'incluent pas les innombrables forks, comme NemoClaw développé par Nvidia. La bataille pour l'agent IA dominant se joue désormais sur deux terrains : la puissance technique des solutions open-source d'un côté, et la commodité des offres commerciales packagées de l'autre.

UELes nouvelles fonctionnalités d'agents Claude (contrôle d'ordinateur, mémoire persistante, tâches planifiées) sont directement accessibles aux développeurs et entreprises européens souhaitant automatiser leurs workflows.

OutilsOutil
1 source
Mark Zuckerberg et Jensen Huang rejoignent le nouveau conseil technologique de Trump
349The Verge AI 

Mark Zuckerberg et Jensen Huang rejoignent le nouveau conseil technologique de Trump

Mark Zuckerberg (Meta), Larry Ellison (Oracle), Jensen Huang (Nvidia) et Sergey Brin (Google) seront les quatre premiers membres du Conseil des conseillers du président sur la science et la technologie (PCAST), selon le Wall Street Journal. Ce panel, qui aura son mot à dire sur la politique en matière d'IA, comptera 13 membres au départ et pourrait s'étendre à 24. Il sera coprésidé par David Sacks, le « tsar » de l'IA et des cryptomonnaies de Trump, et Michael Kratsios, conseiller technologique de la Maison-Blanche. Cette initiative place directement les PDG des géants technologiques au cœur de la politique fédérale sur l'intelligence artificielle. Leur influence pourrait peser lourd sur les réglementations à venir, les investissements publics et la position américaine face à la concurrence chinoise dans la course à l'IA. Le fait que des dirigeants de sociétés privées siègent officiellement dans un organe consultatif présidentiel soulève aussi des questions sur les conflits d'intérêts potentiels. Le PCAST est une instance historique qui conseille la Maison-Blanche sur la science, la technologie, l'éducation et l'innovation — sa composition reflète la priorité absolue accordée par l'administration Trump à la domination américaine dans le domaine de l'IA.

UELa composition pro-industrie de ce conseil pourrait accélérer la divergence réglementaire entre Washington et Bruxelles, renforçant la pression concurrentielle sur les entreprises européennes d'IA soumises à l'AI Act.

RégulationReglementation
1 source
Des employés de Supermicro inculpés pour contrebande présumée de puces IA d'un milliard de dollars
350The Information AI 

Des employés de Supermicro inculpés pour contrebande présumée de puces IA d'un milliard de dollars

Le département américain de la Justice a inculpé trois employés de Super Micro Computer pour avoir illégalement exporté vers la Chine des serveurs IA avancés d'une valeur d'au moins 2,5 milliards de dollars, en violation des contrôles à l'exportation américains. Les puces spécifiques impliquées n'ont pas été précisées, bien que Nvidia domine largement ce marché. Cette affaire illustre le renforcement de l'application des restrictions américaines sur les technologies d'IA à destination de la Chine.

UELes entreprises européennes exportant des technologies d'IA vers la Chine doivent surveiller de près le renforcement des contrôles américains, qui créent un précédent susceptible d'influencer les réglementations européennes similaires.

RégulationReglementation
1 source