Aller au contenu principal
LLMsLe Big Data · 2 min de lecture

Grok 4.5 : l’IA qui veut dépasser GPT-5.5 et Claude sur le code

Source originale ↗·

Grok 4.5 est le nouveau modèle d'intelligence artificielle de xAI, lancé le 8 juillet 2026 et spécialisé dans le code et le raisonnement complexe. Avec cette version, la firme d'Elon Musk vise directement le segment entreprise dominé par OpenAI et Anthropic, en opposant Grok 4.5 à GPT-5.5 et Claude Opus. Le modèle repose sur une architecture baptisée V9, annoncée avec près de 1,5 trillion de paramètres, et propose une fenêtre de contexte pouvant atteindre 500 000 tokens, ce qui lui permet de conserver une grande quantité d'informations au fil d'une conversation ou d'un projet. xAI met en avant une vitesse d'inférence d'environ 80 tokens par seconde ainsi qu'un moteur optimisé pour maintenir ses performances même sur de gros volumes de données, le tout à un coût d'exploitation présenté comme inférieur à celui de plusieurs concurrents.

Pour les entreprises et les développeurs, l'enjeu dépasse la simple génération de code. Grok 4.5 a été conçu pour appréhender des projets logiciels entiers, expliquer du code existant et assister le débogage sur des bases complexes, plutôt que de se limiter à produire des extraits isolés. Il intègre nativement l'exécution de code, la recherche d'informations et l'analyse de contenus, évitant aux équipes de jongler entre plusieurs outils externes. Son raisonnement est configurable : le modèle privilégie la rapidité pour une requête simple, mais mobilise davantage de ressources de calcul pour les problèmes complexes, un compromis pensé pour optimiser à la fois le temps de réponse et la précision selon les besoins métier. Cette flexibilité, combinée à une vision multimodale capable d'analyser images et schémas techniques, vise à automatiser des workflows d'ingénierie entiers et à accélérer la production de documentation, des usages qui parlent directement aux équipes techniques des entreprises.

Ce lancement s'inscrit dans une course effrénée entre laboratoires d'IA pour capter le marché professionnel du code, où OpenAI et Anthropic ont jusqu'ici concentré l'essentiel de l'attention avec leurs modèles Codex et Claude. xAI cherche à se différencier par l'échelle de son architecture, la taille de sa fenêtre de contexte et un positionnement tarifaire agressif, tout en misant sur l'intégration d'outils natifs plutôt que sur un écosystème de plug-ins tiers. La capacité multimodale du modèle, capable d'assister l'inspection visuelle de schémas industriels, laisse entrevoir des usages au-delà du seul développement logiciel, dans l'ingénierie ou la recherche. Reste à voir si ces annonces se traduiront par une adoption réelle face à des concurrents déjà bien implantés dans les environnements de développement professionnels, et si les promesses de performance et de coût de Grok 4.5 se vérifieront à l'usage sur des charges de production.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

GPT-5.5 vs Claude Opus 4.7 : quelle est vraiment l’IA la plus puissante ?
1Le Big Data 

GPT-5.5 vs Claude Opus 4.7 : quelle est vraiment l’IA la plus puissante ?

OpenAI et Anthropic ont tous deux lancé leurs nouveaux modèles phares à quelques semaines d'intervalle : GPT-5.5 et Claude Opus 4.7. Sur l'Artificial Analysis Intelligence Index, qui agrège les performances sur un large éventail de tâches, GPT-5.5 s'impose avec un score de 60 contre 57 pour Claude Opus 4.7, le plaçant en tête du classement mondial toutes catégories confondues. Mais les benchmarks spécialisés racontent une histoire différente : sur le GPQA Diamond, un test composé de questions de niveau doctorat en sciences dures, Claude Opus 4.7 obtient 94,2 % contre 93,6 % pour GPT-5.5. Sur l'Humanity's Last Exam, conçu pour résister à la mémorisation et testant le raisonnement interdisciplinaire pointu, l'avantage d'Anthropic se creuse davantage : 46,9 % pour Opus 4.7 contre 41,4 % pour GPT-5.5 sans outils. Les deux modèles s'appuient sur des tokens de raisonnement invisibles qui améliorent leurs capacités mais les rendent plus lents et sensiblement plus chers à l'usage. L'écart entre les deux modèles révèle deux profils d'excellence distincts qui auront des conséquences concrètes sur les choix des développeurs et des entreprises. GPT-5.5 domine sur les capacités agentiques, utilisation d'un terminal, navigation web autonome, cybersécurité offensive, ce qui en fait l'outil de référence pour l'automatisation et les workflows qui nécessitent qu'une IA "fasse des choses" de façon autonome. Claude Opus 4.7 s'impose en revanche sur les tâches qui exigent un raisonnement profond, la résolution de problèmes complexes sans réponse évidente, et la stratégie à long terme. Pour les équipes qui construisent des agents autonomes, le choix penchera vers OpenAI ; pour celles qui ont besoin d'analyse, de synthèse ou de conseil de haut niveau, Anthropic prend l'avantage. Cette confrontation s'inscrit dans une phase d'accélération sans précédent de la course aux modèles de base. OpenAI et Anthropic se disputent la position de référence auprès des entreprises, des développeurs et des plateformes tierces, sachant que le modèle adopté en infrastructure devient difficile à déloger. L'émergence des tokens de raisonnement comme standard, une technique issue des travaux sur les "chain-of-thought" et popularisée par o1 d'OpenAI fin 2024, marque un tournant : les deux acteurs ont convergé vers la même architecture de base, rendant les différenciations de plus en plus fines et contextuelles. La prochaine étape sera probablement de voir qui parvient à maintenir ce niveau de performance tout en réduisant les coûts d'inférence, condition sine qua non pour une adoption à grande échelle.

UELes développeurs et entreprises en France et en UE devront arbitrer entre GPT-5.5 pour les workflows agentiques et Claude Opus 4.7 pour l'analyse approfondie lors de leurs décisions d'infrastructure IA.

💬 Ce que je retiens, c'est pas le score global, c'est la ligne de partage qui s'impose : GPT-5.5 pour orchestrer des agents autonomes, Opus 4.7 pour les tâches où tu as besoin que le modèle réfléchisse vraiment. C'est utile pour choisir son stack, mais le sous-texte de tout ça, c'est que les deux convergent sur les tokens de raisonnement, et ça coûte cher. Reste à voir qui réussit à tenir ce niveau de performance tout en faisant baisser l'addition.

LLMsOpinion
1 source
SpaceXAI lance Grok 4.5 : Tout savoir sur la nouvelle IA de code d’Elon Musk
2Le Big Data 

SpaceXAI lance Grok 4.5 : Tout savoir sur la nouvelle IA de code d’Elon Musk

SpaceXAI, l'entreprise d'Elon Musk, a officiellement lancé Grok 4.5 le 8 juillet 2026, après plusieurs semaines de tests en version bêta. Présenté comme le modèle le plus avancé de la société, il cible en priorité le développement logiciel, les tâches agentiques (où l'IA enchaîne plusieurs actions de façon autonome) et les usages professionnels. Musk le classe dans la catégorie des modèles « Opus », en référence directe à la gamme d'Anthropic. Techniquement, Grok 4.5 repose sur une architecture de 1 500 milliards de paramètres entraînée grâce au supercalculateur Colossus, avec la participation de Cursor comme partenaire d'entraînement. Sur le plan des performances, il affiche 83,3 % sur Terminal-Bench 2.1 contre 78,9 % pour Claude Opus 4.8, et 62 % sur DeepSWE 1.0 contre 55,8 % pour son rival. En revanche, Claude Opus 4.8 garde l'avantage sur SWE-Bench Multilingual (84,4 % contre 78 %) et sur SWE-Bench Pro, qui évalue la correction de vrais bugs (69,2 % contre 64,7 %). Ces chiffres comptent parce qu'ils redessinent la concurrence sur le marché des IA de code, un segment devenu stratégique pour les développeurs et les entreprises tech. Grok 4.5 revendique un net avantage économique : il génère jusqu'à 80 tokens par seconde, facturés 2 dollars par million de tokens en entrée et 6 dollars en sortie, et SpaceXAI affirme qu'il consomme jusqu'à quatre fois moins de tokens que Claude Opus 4.8 pour une tâche équivalente. Concrètement, cela pourrait réduire sensiblement la facture des professionnels qui l'utilisent au quotidien via Grok Build, Cursor ou une clé API, même si le modèle ne domine pas systématiquement les benchmarks de programmation les plus exigeants. Ce lancement illustre l'accélération continue de la course aux modèles d'IA, où chaque acteur promet d'être plus rapide, plus performant et moins cher que le précédent. Il s'inscrit aussi dans un contexte de surveillance croissante de la part des autorités américaines : la sortie de Grok 4.5 avait été retardée le mois dernier à la demande du gouvernement des États-Unis, qui souhaitait examiner les risques d'utilisation abusive des modèles d'IA les plus avancés, un scénario déjà observé avec GPT 5.6 et Fable 5. Pour les utilisateurs européens, la patience reste de mise puisque le déploiement dans l'Union européenne n'est prévu que pour la mi-juillet. Reste à voir si SpaceXAI parviendra à transformer cet avantage tarifaire en gains de parts de marché face à Anthropic et OpenAI, dans un secteur où l'écart entre les modèles se resserre benchmark après benchmark.

UELe déploiement de Grok 4.5 dans l'Union européenne est prévu pour la mi-juillet 2026, sans impact réglementaire ou concurrentiel direct pour les entreprises européennes à ce stade.

LLMsOpinion
1 source
Grok 4.5 casse les prix, GPT-Live donne de la voix
3Next INpact 

Grok 4.5 casse les prix, GPT-Live donne de la voix

xAI, rebaptisée SpaceXAI, a lancé Grok 4.5, un nouveau modèle qui ne cherche pas à dominer les benchmarks mais à casser les prix. Sur les tests techniques, les résultats sont mitigés : 53 % sur DeepSWE 1.1, contre des scores plus élevés pour GPT-5.5 xhigh, Opus 4.8 ou Fable max. Sur Terminal Bench 2.1, Grok 4.5 obtient 83,3 %, quasiment à égalité avec GPT-5.5 (83,4 %) et Fable (84,3 %). Il devance en revanche OpenAI sur SWE Bench Pro, avec 64,7 % contre 58,6 %, tout en restant derrière Opus 4.8 et Fable max (80,4 %). La vraie rupture se joue sur la facture : Grok 4.5 coûte 2 dollars par million de tokens en entrée et 6 dollars en sortie, quand Opus 4.8 facture 5 et 25 dollars, GPT-5.6 5 et 30 dollars, et Fable 5 monte à 10 et 50 dollars. xAI avance aussi une consommation nettement inférieure, avec 15 854 tokens de sortie en moyenne sur SWE Bench Pro contre 67 020 pour Opus 4.8, soit 4,2 fois moins. Le modèle est disponible dès maintenant dans Grok Build, Cursor et la console xAI, avec des plugins pour Word, PowerPoint et Excel, mais les utilisateurs européens devront attendre mi-juillet. Le même jour, OpenAI a présenté GPT-Live, une nouvelle génération de modèles vocaux destinée à rendre ChatGPT Voice moins mécanique, capable de parler et d'écouter simultanément. Cette stratégie tarifaire de xAI rappelle celle des modèles chinois comme DeepSeek : plutôt que de chercher la suprématie sur les benchmarks, l'entreprise mise sur le rapport performance-prix pour attirer développeurs et entreprises, un public particulièrement sensible au coût par token à grande échelle. Si les chiffres avancés se confirment en production, cela pourrait forcer les concurrents à revoir leurs grilles tarifaires, surtout face à des usages intensifs en code où le volume de tokens consommés pèse lourd sur la facture finale. Du côté d'OpenAI, GPT-Live cible un autre enjeu : rendre l'assistant vocal plus naturel et réactif, avec des voix retravaillées et l'affichage de cartes visuelles (météo, résultats sportifs) pendant la conversation, même si les fonctions multimodales comme le partage d'écran ou la caméra manquent encore à l'appel. Ces annonces interviennent alors qu'OpenAI attend toujours le feu vert de l'administration Trump pour déployer GPT-5.6 et ses variantes Sol, Terra et Luna, des restrictions qui, selon Axios, viendraient d'être levées. Le marché des grands modèles de langage entre ainsi dans une phase où la compétition ne se joue plus seulement sur les capacités brutes mais sur l'efficacité économique et l'expérience utilisateur, deux terrains où xAI et OpenAI cherchent chacun à se différencier avant l'arrivée de la prochaine génération de modèles.

UELes utilisateurs européens devront attendre mi-juillet pour accéder à Grok 4.5, retardant l'adoption de ce modèle moins cher par les développeurs et entreprises françaises et européennes.

💬 Grok 4.5 ne cherche pas à battre les autres sur les benchmarks, il cherche à les tuer sur la facture. Trois fois moins cher qu'Opus 4.8 en sortie, quatre fois moins de tokens consommés sur SWE Bench Pro : c'est le genre d'écart qui change le calcul économique d'une boîte qui fait tourner du code à grande échelle. xAI reprend la stratégie prix de DeepSeek, et ça va forcer OpenAI et Anthropic à revoir leurs grilles tarifaires, pendant qu'OpenAI, avec GPT-Live sorti le même jour, préfère miser sur l'expérience utilisateur plutôt que sur le prix.

LLMsOpinion
1 source
Le nouveau modèle affiné Fin Apex 1.0 d'Intercom surpasse GPT-5.4 et Claude Sonnet 4.6 en support client
4VentureBeat AI 

Le nouveau modèle affiné Fin Apex 1.0 d'Intercom surpasse GPT-5.4 et Claude Sonnet 4.6 en support client

Intercom, la plateforme de service client fondée il y a quinze ans, a annoncé jeudi le lancement de Fin Apex 1.0, un modèle d'intelligence artificielle développé en interne et spécifiquement conçu pour la résolution de demandes clients. Selon les benchmarks partagés avec VentureBeat, ce modèle atteint un taux de résolution de 73,1 %, la proportion de problèmes résolus sans intervention humaine, contre 71,1 % pour GPT-5.4 et Claude Opus 4.5, et 69,6 % pour Claude Sonnet 4.6. Fin Apex répond en 3,7 secondes, soit 0,6 seconde plus vite que ses concurrents directs, affiche une réduction de 65 % des hallucinations par rapport à Claude Sonnet 4.6, et coûte environ cinq fois moins cher que les grands modèles frontières utilisés directement. Il est inclus dans les plans tarifaires existants d'Intercom, basés sur un modèle « par résolution ». Le modèle alimente déjà Fin, l'agent IA d'Intercom qui traite plus de deux millions de conversations clients par semaine. Un écart de 2 points de pourcentage peut sembler anecdotique, mais pour les entreprises gérant des millions d'interactions, l'impact financier est considérable. « Si vous gérez de grandes opérations de service à l'échelle, avec 10 millions de clients ou un milliard de dollars de chiffre d'affaires, un delta de 2 ou 3 % représente une quantité énorme de clients, d'interactions et de revenus », a déclaré le PDG Eoghan McCabe. Au-delà des chiffres, Fin Apex illustre une stratégie de plus en plus viable pour les éditeurs de logiciels verticaux : plutôt que de se reposer sur des API génériques de OpenAI ou Anthropic, ils peuvent construire des modèles spécialisés plus rapides, moins coûteux et plus précis dans leur domaine, en capitalisant sur leurs données propriétaires accumulées au fil des années. Ce lancement s'inscrit dans une tendance de fond : le post-entraînement devient le véritable champ de bataille de l'IA, la pré-formation des grands modèles étant désormais considérée comme une commodité. Intercom a affiné son modèle de base, un modèle open-weights dont la société refuse de révéler l'identité « pour des raisons concurrentielles », avec des années de données de service client issues de Fin, en intégrant des systèmes d'apprentissage par renforcement ancrés sur des résolutions réelles. Cette opacité partielle rappelle la controverse qu'a connue Cursor, accusé d'avoir dissimulé que son modèle Composer 2 était basé sur un modèle open source affiné. Intercom reconnaît utiliser une base open-weights, mais refuse d'en préciser la source, une posture qui soulèvera sans doute des questions sur la réalité de sa « transparence ». La société indique vouloir changer de modèle de base à l'avenir, ce qui suggère que Fin Apex est moins un modèle figé qu'une infrastructure d'optimisation continue, et potentiellement un modèle que d'autres plateformes verticales pourraient chercher à reproduire.

UELes entreprises françaises et européennes utilisant Intercom pour leur support client bénéficient directement des gains de résolution automatique et de la réduction des coûts apportés par Fin Apex 1.0.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic