Aller au contenu principal
LLMs · Actu ·

L'avenir de Latent Space

Anthropic a dévoilé Claude Opus 5.5, qui prend la tête du classement SimpleBench avec un score de 88,4 % et se hisse, selon les évaluations de vision partagées sur X par Skalski, au rang de meilleur modèle visuel d'Anthropic à ce jour, devant Fable 5 et GPT-6 Sol, mais derrière GPT-6 Astra, pour un coût environ 60 % inférieur à Fable 5.1. Sur le benchmark Terminal-Bench-Science, Opus 5.5 passe de 24 % en effort de raisonnement faible à 62 % en effort "xhigh", avant de retomber à 59 % en mode "max". OpenAI a de son côté lancé la famille GPT-6, avec Astra, Sol et Luna : Astra et Opus 5.5 devancent Fable 5.1 d'environ 20 points sur Terminal-Bench-Science, le meilleur modèle extérieur à ces deux laboratoires restant Qwen3.8 Max à 12 %. Google a publié Gemini 3.8 Flash, qui obtient 41 points à l'indice d'intelligence AA à une vitesse de 291 tokens par seconde avec un contexte d'un million de tokens, et affiche 89,2 % sur ARC-AGI v2 pour 0,40 dollar par tâche. Xiaomi a mis à disposition MiMo-V2.6-Pro sous licence MIT, un modèle omni-modal à contexte d'un million de tokens, avec un score de 46 à l'indice AA, juste derrière GPT-5.6 Sol (47), pour un coût de 0,13 dollar par tâche contre 1,99 dollar. Par ailleurs, la société TypeSafe AI a levé 10 milliards de dollars après un podcast exclusif de la newsletter Latent Space le week-end précédent.

2 min de lecturePertinence 57

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de Latent Space. Lire l'article original →

Cette accélération simultanée de plusieurs laboratoires, avec des baisses de prix marquées chez Anthropic et OpenAI, redessine rapidement le rapport coût-performance sur lequel les entreprises choisissent leurs modèles. La sortie d'un modèle chinois open source aussi compétitif que MiMo-V2.6-Pro, à une fraction du prix des modèles propriétaires occidentaux, intensifie la pression concurrentielle et élargit l'accès à des capacités de pointe pour les développeurs disposant de budgets limités. Du côté des usages professionnels, une partie de la communauté estime que l'offre Claude Code à 200 dollars surpasse désormais Codex, tandis qu'Astra s'impose comme le modèle de référence pour la revue et l'audit de code, illustrant l'intensité de la compétition sur les outils de développement assisté par IA.

Cette semaine chargée s'inscrit dans un contexte de transformation pour Latent Space elle-même, dont la newsletter AINews, rédigée quotidiennement par swyx depuis trois ans et forte de plus de 200 000 abonnés, prépare une refonte fusionnant son Discord et son édition, une migration vers la plateforme Beehiiv et la réouverture aux sponsors. L'écosystème continue par ailleurs de s'étoffer avec l'événement Supabase Select prévu le 2 octobre à San Francisco, la société de base de données valorisée 10 milliards de dollars devant y dévoiler ses prochaines annonces, en amont du DevDay d'OpenAI.

VidéoVoir la vidéo de cet article sur YouTube →
Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01GPT-5.5, un signal pour l'avenir48One Useful ThingLLMs 02Ce que mon agent sait de moi43Ben's BitesLLMs 03SpaceX progresse dans l'IA, avec un coup de main de Cursor48The Information AILLMs 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.