Aller au contenu principal
LLMsFrandroid · 1 min de lecture

Anthropic dit écraser OpenAI sur un test d’IA : GPT reprend la main avec une simple option

Source originale ↗·

Alors qu'Anthropic communiquait sur des scores historiques obtenus par son modèle Claude Opus 5, OpenAI a réagi presque aussitôt en ajustant deux paramètres de configuration sur GPT-5.6 Sol, un modèle déjà existant, ce qui a suffi à repasser devant Claude sur le même test. Cette bascule ne provient pas d'un nouvel entraînement ni d'une nouvelle architecture, mais d'une simple modification du "harnais", c'est-à-dire de l'environnement logiciel qui entoure le modèle lors de l'évaluation, ce qui a permis à OpenAI de reprendre la tête du classement quelques jours seulement après l'annonce d'Anthropic.

Cet épisode illustre un problème de fond pour l'industrie de l'IA, à savoir la fiabilité des benchmarks utilisés pour comparer les modèles entre eux. Si un simple réglage de paramètres externes au modèle suffit à inverser un classement présenté comme le reflet des capacités brutes d'une IA, la valeur communicative de ces scores devient discutable pour les entreprises, développeurs et investisseurs qui s'appuient dessus pour choisir un modèle ou évaluer les progrès du secteur. Cela relance aussi la question de la transparence méthodologique : sans détail sur la configuration exacte utilisée, deux résultats affichant le même score peuvent ne pas mesurer la même chose.

Cette séquence s'inscrit dans une rivalité de plus en plus frontale entre Anthropic et OpenAI, où chaque annonce de score record est scrutée puis potentiellement contestée par le concurrent dans la foulée. Les benchmarks sont devenus un argument marketing central dans la course aux grands modèles de langage, ce qui pousse les deux entreprises à optimiser non seulement leurs modèles mais aussi la façon dont ils sont évalués. Ce cycle d'annonces et de contre-annonces devrait se poursuivre à mesure que de nouvelles versions, comme celles évoquées pour Claude et GPT, continueront de sortir à un rythme soutenu.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Microsoft dévoile sept modèles d’IA maison pour s’émanciper d’OpenAI et partir chasser sur les terres d’Anthropic et de Google
1Frandroid 

Microsoft dévoile sept modèles d’IA maison pour s’émanciper d’OpenAI et partir chasser sur les terres d’Anthropic et de Google

Lors de sa conférence Build, Microsoft a annoncé le lancement de sept modèles d'intelligence artificielle développés entièrement en interne, marquant une rupture stratégique significative avec sa dépendance historique à OpenAI. Cette famille de modèles maison, dévoilée devant les développeurs et partenaires de l'entreprise, couvre différentes tailles et usages, des modèles légers optimisés pour les appareils locaux aux versions plus puissantes destinées au cloud Azure. Microsoft positionne explicitement ces modèles face à Claude d'Anthropic et aux modèles Gemini de Google. Ce pivot vers l'autonomie technologique représente un changement profond pour les entreprises clientes de Microsoft, qui disposent désormais d'une alternative aux modèles OpenAI au sein même de l'écosystème Azure et Copilot. Pour les développeurs, cela signifie plus de choix, potentiellement des coûts différents et une moindre exposition aux aléas de la relation Microsoft-OpenAI. Pour l'industrie, c'est la confirmation que les grands éditeurs tech ne veulent plus sous-traiter le cerveau de leurs produits IA. Ce mouvement s'inscrit dans une tension croissante entre Microsoft et OpenAI, deux entités liées par un partenariat de plusieurs milliards de dollars mais dont les intérêts divergent à mesure qu'OpenAI se rapproche d'une structure commerciale indépendante. En bâtissant sa propre capacité de modélisation, Microsoft réduit sa vulnérabilité stratégique et entre directement en compétition avec les laboratoires qu'elle finançait indirectement. La guerre des modèles fondamentaux se joue désormais aussi dans les couloirs de Redmond.

UELes entreprises et développeurs européens utilisant Azure et Copilot disposent désormais d'alternatives aux modèles OpenAI, avec des implications potentielles sur les coûts et la dépendance stratégique au sein de l'écosystème Microsoft.

💬 C'est le genre de move qu'on voyait venir depuis que la relation Microsoft-OpenAI a commencé à craquer en public. Sept modèles d'un coup, du léger pour les appareils locaux au costaud pour Azure, ça ressemble moins à une annonce produit qu'à une déclaration d'indépendance. Bon, faut encore que ces modèles tiennent la route, parce que s'attaquer frontalement à Claude et Gemini, c'est pas anodin.

LLMsOpinion
1 source
Mistral mise sur l'IA sur mesure pour concurrencer OpenAI et Anthropic dans l'entreprise
2TechCrunch AI 

Mistral mise sur l'IA sur mesure pour concurrencer OpenAI et Anthropic dans l'entreprise

Mistral AI franchit une nouvelle étape dans la conquête du marché enterprise en lançant Mistral Forge, une offre permettant aux entreprises d'entraîner des modèles d'IA entièrement personnalisés à partir de leurs propres données. Cette approche rompt avec les méthodes dominantes du secteur et positionne la startup française comme un concurrent direct d'OpenAI et d'Anthropic sur le segment le plus stratégique : les grands comptes. L'enjeu est de taille. Jusqu'ici, la personnalisation des LLMs en entreprise reposait principalement sur deux techniques : le fine-tuning (ré-entraînement partiel d'un modèle existant) et le RAG (Retrieval-Augmented Generation, qui enrichit les réponses avec des documents externes). Ces approches, bien que populaires, restent limitées, elles n'intègrent pas véritablement la connaissance métier au cœur du modèle. Mistral Forge propose une alternative radicale : repartir de zéro avec les données propriétaires du client, pour produire un modèle véritablement sur mesure. Pour les entreprises, cela ouvre des possibilités inédites en matière de confidentialité, de performance sectorielle et de souveraineté sur leurs modèles. Plutôt que de dépendre d'un modèle généraliste adapté en surface, elles obtiendraient un système entraîné nativement sur leur vocabulaire, leurs processus et leurs données critiques, sans que celles-ci transitent par l'infrastructure d'un tiers. C'est précisément l'argument que ni OpenAI ni Anthropic, dont les offres enterprise reposent majoritairement sur du fine-tuning ou des API enrichies, ne peuvent opposer facilement. Cette initiative s'inscrit dans la stratégie d'expansion B2B de Mistral, qui cherche à transformer son avantage technologique européen en parts de marché concrètes face aux géants américains. La capacité à proposer un entraînement from scratch différencie Mistral sur un marché où la souveraineté des données devient un critère de sélection croissant, notamment en Europe.

UEMistral, entreprise française, renforce la souveraineté numérique européenne en proposant aux entreprises une alternative locale pour entraîner des modèles IA sur leurs propres données.

LLMsOutil
1 source
Claude Sonnet 5 d'Anthropic réduit l'écart avec la gamme Opus, plus chère
3The Decoder 

Claude Sonnet 5 d'Anthropic réduit l'écart avec la gamme Opus, plus chère

Anthropic a dévoilé Claude Sonnet 5, la dernière évolution de sa gamme de modèles de langage. Selon l'entreprise, ce nouveau modèle surpasse son prédécesseur, Sonnet 4.6, sur l'ensemble des benchmarks utilisés pour l'évaluer. Fait notable, Sonnet 5 devance même Opus 4.8, le modèle haut de gamme et plus coûteux de la même famille, sur le test GDPval-AA v2, qui évalue les compétences en travail de connaissance : il y obtient un score de 1 618 points. Anthropic précise également que Sonnet 5 affiche des résultats nettement inférieurs, sur les tâches liées à la cybersécurité, à ceux des modèles que le gouvernement américain a actuellement interdits pour ce type d'usage. Cette annonce a une portée qui dépasse la simple mise à jour technique. En rattrapant, voire en dépassant sur certains critères, un modèle plus onéreux, Sonnet 5 permet aux entreprises et développeurs d'obtenir des performances de premier plan à moindre coût, ce qui pourrait redistribuer les usages entre les différentes gammes de modèles d'Anthropic. La mention explicite des scores en cybersécurité n'est pas anodine : elle intervient alors que les autorités américaines examinent de près les capacités offensives de l'intelligence artificielle et envisagent de restreindre l'accès à certains modèles jugés trop performants dans ce domaine. Ce positionnement s'inscrit dans un contexte plus large de compétition entre laboratoires d'IA, où chaque nouvelle génération de modèle cherche à combiner puissance et maîtrise des risques. En insistant sur le fait que Sonnet 5 reste loin des seuils jugés problématiques par Washington, Anthropic cherche à démontrer sa capacité à proposer des modèles à la fois performants et conformes aux exigences réglementaires émergentes, dans un débat toujours en cours sur l'encadrement des IA les plus avancées.

LLMsActu
1 source
SpaceX lance Grok 4.5 a moitie prix de la concurrence, un defi pour Anthropic et OpenAI
4VentureBeat AI 

SpaceX lance Grok 4.5 a moitie prix de la concurrence, un defi pour Anthropic et OpenAI

SpaceX a dévoilé mercredi Grok 4.5, le tout premier modèle d'intelligence artificielle qu'elle a entraîné spécifiquement pour la programmation et les agents autonomes. Il s'agit du premier produit concret issu du rachat pour 60 milliards de dollars de la startup de coding Cursor, finalisé quelques semaines plus tôt. Sur X, l'entreprise a présenté Grok 4.5 comme un modèle offrant "une intelligence de pointe avec une vitesse et une efficacité de coût inégalées", entraîné en partie avec les données de Cursor. Côté tarifs, SpaceX facture 2 dollars par million de tokens en entrée et 6 dollars par million en sortie, soit moins de la moitié du prix des offres haut de gamme d'Anthropic (Claude Opus) et d'OpenAI, tout en consommant deux fois moins de tokens par tâche. Elon Musk a lui-même reconnu que Grok 4.5 est "à peu près comparable à Opus 4.7, mais bien plus rapide". Le cabinet d'évaluation indépendant Artificial Analysis a classé le modèle quatrième sur son indice GDPval-AA v2, qui mesure les performances sur des tâches réelles de travail agentique, avec un score Elo de 1543, juste derrière les dernières versions de Claude. En revanche, sur le plan du coût, Grok 4.5 se démarque nettement : 0,49 dollar par tâche accomplie, près de 90% moins cher que les modèles qui le devancent au classement. Cet écart de prix pourrait bousculer l'équilibre du marché des agents IA en entreprise. Les charges de travail agentiques, où un modèle opère seul pendant plusieurs minutes voire plusieurs heures en lisant du code, en appelant des outils et en itérant sur ses propres résultats, consomment énormément de tokens. Un modèle 90% moins cher par tâche, même légèrement moins performant, change radicalement les calculs économiques pour toute organisation qui déploie des agents auprès de centaines de développeurs. L'investisseur Gavin Baker a résumé cette dynamique en évoquant un modèle "dominant au sens de Pareto" pour le coding, tout en restant prudent sur le ressenti réel des utilisateurs. Ce lancement s'inscrit dans une stratégie bâtie en plusieurs étapes. En avril, SpaceX avait obtenu le droit de racheter Cursor pour 60 milliards de dollars, ou de verser des milliards en frais et en capacité de calcul en cas de désistement. Quelques jours après son entrée en bourse au Nasdaq en juin, l'entreprise a exercé cette option via une opération entièrement en actions, entraînant une dilution d'environ 3,4% à la valorisation de l'introduction, tandis que le titre SpaceX bondissait de 16%. L'intérêt stratégique tient autant aux données qu'au produit : l'éditeur de code de Cursor génère un flux massif d'interactions de développeurs expérimentés, directement injecté dans l'entraînement de Grok, tandis que Cursor a obtenu en retour l'accès au supercalculateur Colossus de SpaceX à Memphis.

UEImpact indirect : la baisse du cout des agents IA pourrait bénéficier les entreprises européennes qui déploient ces outils, sans lien direct avec une entité ou réglementation française ou européenne.

💬 Le vrai coup ici, c'est pas la perf, c'est le prix : 90% moins cher par tâche que les modèles qui le devancent au classement, ça change le calcul économique pour toute boîte qui fait tourner des agents à l'échelle. Sur le papier Grok 4.5 reste juste derrière Claude en qualité, mais en pratique une entreprise qui fait bosser des agents des heures durant va regarder la facture avant le score Elo. Anthropic et OpenAI ont un problème de marge à gérer, pas un problème technique.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic