LLMsVentureBeat AI · 6 juin 2026, 01:55· 2 min de lecture

Le directeur IA de Microsoft affirme que l'entreprise est "libérée" d'OpenAI pour poursuivre la superintelligence

Résumé IASource uniqueImpact UE Take éditorial

Mustafa Suleyman, directeur de Microsoft AI, a révélé lors de Microsoft Build 2026 qu'un changement contractuel conclu il y a environ six mois avec OpenAI a officiellement autorisé sa division à développer de manière autonome ce qu'il appelle ouvertement la "superintelligence". Cette annonce, faite en coulisses du Fort Mason Center à San Francisco, s'est accompagnée d'une démonstration concrète : Microsoft a présenté une famille de sept modèles d'IA entièrement développés en interne par son équipe AI Superintelligence Team, regroupés sous le nom "MAI". Le modèle phare, MAI-Thinking-1, est un modèle de raisonnement de 35 milliards de paramètres actifs qui, selon Microsoft, rivalise avec les meilleurs modèles de sa catégorie sur les benchmarks d'ingénierie logicielle et de raisonnement mathématique. La famille comprend également MAI-Code-1-Flash pour GitHub Copilot et VS Code, MAI-Image-2.5 pour la génération et l'édition d'images, MAI-Transcribe-1.5 couvrant 43 langues, et MAI-Voice-2 pour la synthèse vocale multilingue. Tous sont disponibles via Microsoft Foundry, et pour la première fois, les développeurs peuvent ajuster les poids des modèles via des plateformes tierces comme OpenRouter, Fireworks et Baseten.

Ce virage stratégique marque une rupture significative pour une entreprise dont l'identité en matière d'IA était jusqu'ici presque entièrement définie par son partenariat avec OpenAI, dans lequel elle a investi un total cumulé dépassant 13 milliards de dollars. Le point le plus frappant du discours de Suleyman n'est pas la liste de modèles, mais la philosophie qui les sous-tend : tous sont entraînés depuis zéro sur des données propres et commercialement licenciées, sans distillation à partir de modèles tiers. Cette position contraste directement avec une pratique répandue dans l'industrie, où les labs utilisent les sorties de modèles concurrents pour entraîner leurs propres systèmes. Pour les entreprises clientes soucieuses de la traçabilité des données et des risques juridiques liés au copyright, ce choix représente un argument différenciant concret.

La relation avec OpenAI n'est pas rompue pour autant, mais elle se transforme. Pendant des années, un arrangement contractuel spécifique limitait la capacité de Microsoft à construire ses propres modèles de frontier, la positionnant davantage comme distributeur et intégrateur que comme laboratoire de recherche à part entière. L'assouplissement de ces clauses il y a six mois marque donc un tournant institutionnel autant que technique. Suleyman l'a clairement formulé : l'objectif est qu'en 2030 et au-delà, Microsoft soit capable de "construire les meilleurs modèles au monde", et non plus seulement de les acheter. Cette transition sera longue, et les sept modèles annoncés ne sont qu'une preuve de concept. Ce qui se joue ici, c'est la capacité de Microsoft à devenir un acteur de recherche fondamentale en IA, aux côtés d'OpenAI, Google DeepMind et Anthropic, plutôt que dans leur ombre.

Impact France/UE

Pour les entreprises et développeurs européens utilisant Azure ou GitHub Copilot, la famille MAI, entraînée exclusivement sur des données licenciées, constitue un argument de conformité potentiellement pertinent face aux exigences de traçabilité de l'AI Act et au droit d'auteur européen.

💬 L'analyse de Mathieu

Le plus intéressant dans cette histoire, c'est pas les sept modèles, c'est le changement contractuel signé il y a six mois dans la plus grande discrétion. Microsoft s'est reconstruite une liberté de recherche sans rompre avec OpenAI, c'est bien joué. Et le choix d'entraîner depuis zéro sur des données licenciées, sans distillation depuis les concurrents, ça pèse lourd pour les boîtes qui naviguent avec l'AI Act.

Dans nos dossiers

Microsoft OpenAI Google DeepMind Anthropic

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1Frandroid

Microsoft dévoile sept modèles d’IA maison pour s’émanciper d’OpenAI et partir chasser sur les terres d’Anthropic et de Google

Lors de sa conférence Build, Microsoft a annoncé le lancement de sept modèles d'intelligence artificielle développés entièrement en interne, marquant une rupture stratégique significative avec sa dépendance historique à OpenAI. Cette famille de modèles maison, dévoilée devant les développeurs et partenaires de l'entreprise, couvre différentes tailles et usages, des modèles légers optimisés pour les appareils locaux aux versions plus puissantes destinées au cloud Azure. Microsoft positionne explicitement ces modèles face à Claude d'Anthropic et aux modèles Gemini de Google. Ce pivot vers l'autonomie technologique représente un changement profond pour les entreprises clientes de Microsoft, qui disposent désormais d'une alternative aux modèles OpenAI au sein même de l'écosystème Azure et Copilot. Pour les développeurs, cela signifie plus de choix, potentiellement des coûts différents et une moindre exposition aux aléas de la relation Microsoft-OpenAI. Pour l'industrie, c'est la confirmation que les grands éditeurs tech ne veulent plus sous-traiter le cerveau de leurs produits IA. Ce mouvement s'inscrit dans une tension croissante entre Microsoft et OpenAI, deux entités liées par un partenariat de plusieurs milliards de dollars mais dont les intérêts divergent à mesure qu'OpenAI se rapproche d'une structure commerciale indépendante. En bâtissant sa propre capacité de modélisation, Microsoft réduit sa vulnérabilité stratégique et entre directement en compétition avec les laboratoires qu'elle finançait indirectement. La guerre des modèles fondamentaux se joue désormais aussi dans les couloirs de Redmond.

UELes entreprises et développeurs européens utilisant Azure et Copilot disposent désormais d'alternatives aux modèles OpenAI, avec des implications potentielles sur les coûts et la dépendance stratégique au sein de l'écosystème Microsoft.

💬 C'est le genre de move qu'on voyait venir depuis que la relation Microsoft-OpenAI a commencé à craquer en public. Sept modèles d'un coup, du léger pour les appareils locaux au costaud pour Azure, ça ressemble moins à une annonce produit qu'à une déclaration d'indépendance. Bon, faut encore que ces modèles tiennent la route, parce que s'attaquer frontalement à Claude et Gemini, c'est pas anodin.

LLMsOpinion

1 source

2VentureBeat AI

Google affirme que Gemini 3.5 Flash peut réduire les coûts IA des entreprises de plus d'un milliard de dollars par an

Google a présenté mardi Gemini 3.5 Flash lors de sa conférence annuelle I/O, un nouveau modèle d'intelligence artificielle qui revendique une rupture avec l'un des compromis les plus tenaces du secteur : la capacité et la vitesse ne seraient plus antinomiques. Selon Sundar Pichai, PDG de Google, les entreprises traitant environ mille milliards de tokens par jour sur Google Cloud pourraient économiser plus d'un milliard de dollars par an en basculant 80 % de leurs charges de travail vers Flash et d'autres modèles frontier. Sur les benchmarks standards, Gemini 3.5 Flash dépasse Gemini 3.1 Pro, qui était encore positionné comme le modèle phare de l'entreprise il y a quatre à cinq mois : 76,2 % sur Terminal-Bench 2.1, 1656 Elo sur GDPval-AA, 83,6 % sur MCP Atlas et 84,2 % sur CharXiv Reasoning. Il génère des tokens quatre fois plus vite que les modèles frontier concurrents comparables, voire douze fois plus vite dans sa version optimisée disponible dès maintenant sur Antigravity, la plateforme de développement agentique de Google. Koray Kavukcuoglu, directeur technique de Google DeepMind, confirme : « Nous avons développé une version encore plus optimisée de Flash, non pas quatre fois, mais douze fois plus rapide, à qualité égale. » L'enjeu est considérable pour les entreprises qui ont massivement investi dans l'IA générative. Depuis trois ans, les DSI sont contraints de jongler entre des modèles puissants mais lents et coûteux pour les tâches complexes, et des modèles légers mais moins fiables pour les requêtes simples. Ce pilotage en portefeuille génère une ingénierie coûteuse, des expériences utilisateur inégales et, surtout, des budgets tokens qui s'épuisent à toute vitesse. Pichai l'a formulé sans détour lors d'un briefing presse lundi : « Vous avez probablement entendu des DSI dire que leurs entreprises ont déjà dépassé leur budget annuel de tokens, et on est seulement en mai. » Flash, à environ un tiers à la moitié du coût des modèles frontier actuels tout en atteignant selon Google 90 % de leurs performances, rendrait ce compromis obsolète pour la majorité des cas d'usage. Cette annonce s'inscrit dans une bataille d'efficience qui s'est intensifiée depuis que les entreprises ont commencé à déployer des agents IA en production à grande échelle. La course ne porte plus seulement sur l'intelligence brute des modèles, mais sur leur coût d'exploitation réel. Google fait face à une pression croissante d'Anthropic, d'OpenAI et de Meta, qui ont tous lancé des modèles intermédiaires visant le même créneau. Avec Flash, Google revendique la position unique de modèle occupant le quadrant supérieur droit de l'index intelligence/vitesse d'Artificial Analysis, sans concurrent direct à date. La disponibilité immédiate du modèle turbo dans Antigravity suggère que Google mise sur les workflows agentiques comme terrain de différenciation durable face à ses rivaux.

UELes entreprises européennes sur Google Cloud peuvent réduire significativement leurs budgets tokens en adoptant Flash pour leurs charges de travail agentiques, sans attendre de réglementation spécifique UE.

LLMsOpinion

1 source

3MarkTechPost

Phi-4-Mini de Microsoft : implémentation pour l'inférence quantifiée, le RAG et l'affinage LoRA

Microsoft a publié Phi-4-mini-instruct, un modèle de langage compact de la famille Phi-4, conçu pour fonctionner efficacement sur du matériel grand public. Des chercheurs et développeurs ont récemment publié un tutoriel complet montrant comment exploiter ce modèle dans un notebook Google Colab sur GPU T4, en couvrant l'ensemble du spectre des usages modernes : inférence en streaming, raisonnement structuré, appels d'outils, génération augmentée par récupération (RAG) et fine-tuning par LoRA. Le pipeline s'appuie sur une quantification 4 bits au format NF4 via la bibliothèque BitsAndBytes, combinée à bfloat16 et double quantification, ce qui permet de charger le modèle en moins de 2 Go de VRAM tout en conservant des performances proches du modèle en pleine précision. La stack technique repose sur des versions précises de Transformers (4.49 à 4.57), PEFT, Accelerate, Datasets, sentence-transformers et FAISS, toutes compatibles avec l'architecture native phi3 de Microsoft. Ce travail illustre une tendance de fond dans l'industrie : rendre les workflows LLM avancés accessibles sans infrastructure coûteuse. Un développeur équipé d'un simple GPU de jeu ou d'un accès gratuit à Colab peut désormais expérimenter le tool calling, le RAG ou l'adaptation par LoRA sur un modèle performant, sans dépendre d'API payantes ni de clusters H100. Pour les entreprises, cela ouvre la voie à des déploiements on-premise de petits modèles capables de gérer des tâches complexes, avec un contrôle total sur les données et des coûts d'inférence drastiquement réduits. La démocratisation de ces techniques touche directement les équipes data, les startups et les développeurs indépendants qui ne peuvent pas se permettre de faire tourner des modèles de 70 milliards de paramètres en continu. Cette publication s'inscrit dans la stratégie de Microsoft autour de la famille Phi, dont l'objectif affiché est de prouver que la taille n'est pas le seul vecteur de performance. Phi-4-mini succède à Phi-3, qui avait déjà surpris l'industrie en dépassant des modèles nettement plus grands sur plusieurs benchmarks de raisonnement. La concurrence sur ce segment des petits modèles efficaces est aujourd'hui vive : Google pousse Gemma, Meta propose Llama 3.2 en versions 1B et 3B, et Mistral entretient sa gamme Mistral-Nemo. Le fait que Phi-4-mini supporte nativement le tool calling et s'intègre facilement dans des pipelines RAG renforce son positionnement pour des cas d'usage en production, notamment les assistants embarqués, les agents autonomes légers et les systèmes d'analyse documentaire tournant en local.

UELes développeurs et startups européens peuvent déployer ce modèle en local sur du matériel grand public, réduisant leur dépendance aux API cloud payantes et facilitant la conformité RGPD par traitement on-premise.

LLMsTuto

1 source

4MarkTechPost

Meta Superintelligence Labs lance Muse Spark 1.1, un modèle de raisonnement multimodal pour les tâches à base d'agents sur Meta Model API

Meta Superintelligence Labs a dévoilé Muse Spark 1.1, un modèle de raisonnement multimodal conçu pour les tâches agentiques, et a ouvert en parallèle un aperçu public de la Meta Model API. Ce second élément marque un tournant structurel : jusqu'ici, les modèles de Meta étaient distribués principalement en poids ouverts, alors que Muse Spark 1.1 est fermé, hébergé et facturé au token. Le modèle dispose d'une fenêtre de contexte d'un million de tokens (1 048 576 selon la documentation technique de l'API) et accepte du texte, des images, de la vidéo et des documents en entrée, avec une sortie textuelle. Son effort de raisonnement est ajustable à chaque requête, et l'API propose en complément la sortie structurée, l'appel d'outils en parallèle, une Files API, la mise en cache des prompts et un outil de recherche web renvoyant des réponses sourcées. Côté accès, les particuliers profitent du mode "Thinking" gratuitement dans l'application Meta AI et sur meta.ai, tandis que les développeurs paient 1,25 dollar par million de tokens en entrée et 4,25 dollars par million en sortie, avec 20 dollars de crédits offerts à la création d'un compte. Le lancement reste pour l'instant réservé aux États-Unis, sans disponibilité en Europe. Sur le plan des performances, Meta positionne clairement Muse Spark 1.1 comme un modèle d'orchestration plutôt qu'un champion du code. Il domine les benchmarks liés à l'usage d'outils : 88,1 sur MCP Atlas contre 82,2 pour Opus 4.8, 75,3 pour GPT-5.5 et 78,2 pour Gemini 3.1 Pro, et 54,7 sur JobBench contre 48,4, 38,3 et seulement 15,9 pour Gemini. Il obtient aussi le meilleur score sur Humanity's Last Exam (62,1). En revanche, sur le code pur, il se classe troisième, avec 61,5 sur SWE-Bench Pro et 53,3 sur DeepSWE 1.1, loin derrière Gemini 3.1 Pro sur ce dernier test (67,0). Ce qui distingue vraiment le modèle, c'est sa gestion active de son contexte massif : il mémorise ses actions, retrouve des informations issues de travaux antérieurs et compacte ce qu'il conserve. Il peut aussi déléguer des tâches à des sous-agents en parallèle lorsqu'il agit comme agent principal, et exécuter fidèlement une mission tout en sachant remonter un problème lorsqu'il agit comme sous-agent, avec une capacité de généralisation immédiate à de nouveaux outils, serveurs MCP ou compétences personnalisées. Cette sortie s'inscrit dans une bataille plus large entre grands laboratoires d'IA pour dominer les usages agentiques, où la capacité à orchestrer des outils et des sous-tâches complexes compte désormais autant que la performance brute sur le code. En rendant son API compatible avec le format OpenAI, Meta facilite l'intégration : migrer vers Muse Spark 1.1 revient essentiellement à changer une URL de base plutôt qu'à réécrire une application, et les environnements compatibles avec le format Anthropic peuvent pointer vers l'équivalent Messages API. Pour l'automatisation d'ordinateur, le modèle a été entraîné à choisir entre écrire un script ou cliquer directement selon ce qui est le plus efficace, générant des lots d'actions à chaque étape. L'absence d'accès européen et le choix par Meta de son propre jeu de benchmarks invitent toutefois à la prudence avant d'en tirer des conclusions définitives sur sa supériorité réelle face aux modèles concurrents.

💬 Muse Spark 1.1 n'essaie pas de battre GPT-5.5 ou Gemini sur le code, il joue une autre partie : celle de chef d'orchestre qui délègue à des sous-agents et gère un million de tokens de contexte sans perdre le fil. C'est révélateur d'un vrai basculement dans la course à l'IA, la bataille se déplace du "qui code le mieux" vers "qui orchestre le mieux", et les scores sur MCP Atlas ou JobBench comptent maintenant autant que SWE-Bench. Reste que c'est fermé, payant, réservé aux US, et benchmarké par Meta lui-même, donc j'attends de voir ça tourner ailleurs qu'en démo avant de crier au génie.

LLMsActu

1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic