LLMsTowards AI14sem· 1 min de lecture

TAI #195 : GPT-5.4 et l'arrivée de l'auto-amélioration de l'IA ?

OpenAI a lancé GPT-5.4 le 5 mars, son modèle frontier le plus orienté productivité à ce jour, avec une fenêtre contextuelle d'1M tokens, l'utilisation native d'ordinateur et un tarif de 2,50$/15$ par million de tokens. Dans les benchmarks, aucun modèle ne domine clairement : GPT-5.4 mène sur ProofBench et le codage, tandis que Gemini 3.1 Pro excelle sur LegalBench et GPQA, et Claude Opus 4.6 sur SWE-bench. Parallèlement, l'expérience "autoresearch" d'Andrej Karpathy démontre que des agents IA peuvent identifier de façon autonome des améliorations réelles à l'entraînement des réseaux de neurones — signalant potentiellement l'émergence d'une IA capable de s'améliorer elle-même en boucle fermée.

Dans nos dossiers

OpenAI Claude Opus GPT-5 Gemini

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1OpenAI Blog

Présentation de GPT-5.4 mini et nano

OpenAI lance GPT-5.4 mini et nano, deux versions allégées et plus rapides de GPT-5.4. Ces modèles sont optimisés pour le codage, l'utilisation d'outils, le raisonnement multimodal et les charges de travail API à fort volume ainsi que les sous-agents.

UELes développeurs et entreprises européens peuvent accéder à ces modèles allégés via l'API OpenAI pour réduire leurs coûts sur les charges de travail à fort volume.

LLMsActu

1 source

2Le Big Data

Anthropic lance Claude Opus 4.8 : L’IA délivrée des hallucinations enfin arrivée ?

Anthropic a lancé le 28 mai 2026 Claude Opus 4.8, la nouvelle version de son modèle phare, disponible immédiatement au même tarif que son prédécesseur Opus 4.7. Le modèle affiche des performances notables sur les benchmarks techniques : 69,2 % sur SWE-Bench Pro et 74,6 % sur Agentic Terminal Coding, des scores qui le placent devant GPT-5.5 d'OpenAI et Gemini 3.1 Pro de Google selon les comparatifs publiés par Anthropic. Dans Claude Code, l'entreprise introduit un système de flux de travail dynamiques capable de générer des scripts JavaScript pour orchestrer des centaines de sous-agents en parallèle. Un utilisateur a rapporté avoir réécrits 750 000 lignes de code en 11 jours grâce à ce système. Un mode rapide est également disponible via la commande /fast : même modèle, vitesse 2,5 fois supérieure, coût réduit de près des deux tiers. La principale promesse d'Opus 4.8 n'est pas spectaculaire mais potentiellement décisive : la fiabilité. Anthropic cible directement le problème des hallucinations et de la fausse confiance qui plombe l'adoption des IA en contexte professionnel. Le modèle serait désormais capable de reconnaître ses propres limites, de signaler ses incertitudes et d'identifier des incohérences dans ses propres analyses avant que l'utilisateur ne s'en aperçoive. Michael Ran de Bridgewater Associates, la plus grande société de gestion de fonds au monde, témoigne que Claude Opus 4.8 repère de lui-même certains problèmes dans les analyses produites, là où d'autres modèles laissaient passer les erreurs silencieusement. Anthropic affirme également avoir réduit les risques de comportements désalignés et amélioré la gestion des contenus sensibles. Opus 4.8 s'inscrit dans un cycle de publication accéléré chez Anthropic : Opus 4.7 n'avait été lancé que quelques semaines auparavant. L'entreprise prend soin de qualifier cette nouvelle version d'amélioration « modeste mais tangible », une prudence qui répond aux critiques adressées à Opus 4.7, accusé d'une réflexion adaptative mal calibrée, trop de temps sur les tâches simples, trop peu sur les complexes. Pour corriger ce défaut, Anthropic introduit un panneau de contrôle de l'effort permettant aux utilisateurs d'ajuster le niveau de réflexion du modèle selon la nature de la tâche. La course à la fiabilité devient ainsi le nouveau front concurrentiel entre les grands laboratoires, après la course aux paramètres et aux benchmarks bruts qui a dominé les deux dernières années.

💬 La promesse anti-hallucinations, c'est l'angle qui m'accroche ici, pas les benchmarks SWE. Un modèle qui repère ses propres incohérences avant que tu t'en aperçoives, ça débloque l'adoption en contexte pro mieux que n'importe quel score sur un leaderboard. Le `/fast` à moins 65% de coût en prime, c'est du concret.

LLMsOpinion

1 source

3OpenAI Blog

Présentation de GPT-5.4

OpenAI a présenté GPT-5.4, un modèle de pointe optimisé pour le travail professionnel, doté de capacités avancées en programmation, utilisation des ordinateurs, recherche d'outils et un contexte de 1 million de tokens. Ce modèle combine efficacité et performance pour des tâches complexes.

LLMsOutil

1 source

4The Decoder

OpenAI améliore la lisibilité de GPT-5.5 Instant et retire deux anciens modèles

OpenAI vient d'annoncer une mise à jour de GPT-5.5 Instant destinée à produire des réponses plus naturelles et plus lisibles. En parallèle, la société retire la fonctionnalité Canvas de ses modèles les plus récents : les tâches de rédaction et de programmation s'effectueront désormais directement dans l'interface de chat, sans environnement séparé. OpenAI annonce également la fin de deux modèles plus anciens, o3 et GPT-4.5, qui seront définitivement retirés de ChatGPT d'ici août 2026 au plus tard. Ces changements reflètent une stratégie de rationalisation du portefeuille de modèles d'OpenAI. Supprimer Canvas au profit d'une expérience intégrée au chat simplifie l'interface pour les utilisateurs tout en concentrant les efforts de développement sur les modèles de nouvelle génération. La retraite d'o3 et de GPT-4.5 signale que la société entend éviter la fragmentation de son offre, qui multipliait les options aux performances et aux coûts variables pour les développeurs comme pour les abonnés. Cette consolidation intervient dans un contexte de forte compétition, où Anthropic, Google et Meta poussent leurs propres familles de modèles à un rythme soutenu. OpenAI cherche à clarifier sa gamme après une période marquée par une prolifération rapide de variantes, o1, o3, GPT-4o, GPT-4.5, GPT-5, parfois difficile à suivre même pour les professionnels. La suppression progressive des modèles anciens laisse présager une architecture plus lisible autour de GPT-5 et de ses déclinaisons directes dans les mois à venir.

UELes développeurs et entreprises européens utilisant l'API OpenAI devront planifier la migration de leurs intégrations basées sur o3 ou GPT-4.5 avant août 2026.

💬 Enfin du ménage. Le catalogue OpenAI était devenu franchement illisible, avec o1, o3, GPT-4o, GPT-4.5 qui se marchaient dessus en termes de positionnement et de coût, sans qu'on comprenne vraiment quoi choisir pour quel usage. La date d'août 2026 pour retirer o3 et GPT-4.5 laisse le temps de planifier les migrations, c'est au moins ça.

LLMsOpinion

1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, rédigé par un humain · désinscription en un clic