Aller au contenu principal
LLMs · Actu ·

[AINews] Opus 5.5 excelle dans la création de vidéos explicatives

Claude Opus 5.5 est sorti cette semaine et l'accueil est massivement positif, notamment grâce aux vidéos explicatives qu'il produit et qui ont envahi les fils d'actualité. Le modèle prend la tête de SimpleBench avec 88,4 %. En vision, l'analyste @skalskip92 le classe comme le meilleur modèle visuel d'Anthropic à ce jour : meilleur que Fable 5 et GPT-6 Sol, mais derrière GPT-6 Astra, pour un coût inférieur d'environ 60 % à celui de Fable 5.1. Sur Terminal-Bench-Science, son score passe de 24 % en effort faible à 62 % en effort « xhigh », puis retombe à 59 % en « max ». @theo déconseille ce dernier réglage, qui impose un budget de raisonnement minimal. GPT-6 Astra et Opus 5.5 devancent Fable 5.1 d'environ 20 points, et le meilleur modèle hors de ces deux laboratoires, Qwen3.8 Max, plafonne à 12 %. Côté OpenAI, Astra aurait battu NetHack à sa troisième tentative, et Luna [Max] entre à la 24e place de Code Arena WebDev (1593 points) pour environ 0,40 dollar par million de jetons. Gemini 3.8 Flash obtient 41 à l'indice AA, à 291 jetons par seconde avec un contexte de 1 million de jetons, et 89,2 % sur ARC-AGI v2 pour 0,40 dollar par tâche. Xiaomi publie sous licence MIT MiMo-V2.6-Pro, un modèle omni-modal à 46 points, juste derrière GPT-5.6 Sol (47), pour 0,13 dollar par tâche contre 1,99 dollar, avec son code d'apprentissage par renforcement.

3 min de lecturePertinence 61

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de Latent Space. Lire l'article original →

Ces résultats redessinent le rapport de forces entre laboratoires. Beaucoup d'utilisateurs estiment désormais que l'abonnement Claude Code à 200 dollars surpasse Codex, tandis qu'Astra reste le modèle préféré pour les revues et audits. L'écart de prix entre modèles fermés et ouverts se creuse : Databricks indique que ses ingénieurs ont cessé de recourir aux modèles fermés dès que des modèles open source ont été routés vers ses agents de code internes. Le même mouvement touche les tâches de jugement. TypeSafe, qui lèverait plus d'un milliard de dollars pour une valorisation supérieure à 10 milliards, une semaine après un tour de 200 millions, propose Jev, un modèle entraîné par apprentissage par renforcement qui renvoie des décisions typées avec probabilités plutôt qu'un texte de raisonnement. Selon l'étude associée, il coûte 0,044 dollar pour 1 000 jugements, avec 152 ms de latence médiane, soit environ 277 fois moins que GPT-6. Il reste à moins de 3 points sur RewardBench et HaluEval, mais accuse 14,5 points de retard sur JudgeBench. Une cascade renvoyant les cas incertains à Astra conserve 99 % de la précision pour 57 % du coût.

Le contexte est celui d'une course où les modèles de pointe se succèdent à un rythme hebdomadaire, tandis que des acteurs plus petits attaquent des fonctions précises à bas coût. Ramp a égalé la précision de reranking de GPT-5.6 Luna avec une latence de queue dix fois plus faible (300 ms) et un coût trois fois moindre. Des alternatives émergent : CLM, un modèle contrastif environ neuf fois plus rapide que Jev, GLiNER2.5-Decide de Fastino (167 ms sur CPU) et Tev1 0,8B, qui tourne localement en 50 ms. Grok 4.7 débute au 16e rang de l'Agent Arena, et Muse Spark 1.3 de Meta arrive sur GCP et Oracle. Du côté de l'infrastructure d'agents, LangChain a présenté à Interrupt Managed Deep Agents 0.8, avec mémoire utilisateur et agent, politiques d'accès et API de fichiers en bac à sable. La question est désormais de savoir si les gains de l'apprentissage par renforcement se généraliseront, puisque @teortaxesTex note que ceux de MiMo ne se transfèrent pas aux mathématiques plus difficiles.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01[AINews] Reve 2 et Ideogram 4 : mises en page dans la génération d'images50Latent SpaceLLMs 02GPT-5.5 et la super-application OpenAI Codex52Latent SpaceLLMs 03[AINews] Claude Opus 5 : performances dignes de Fable, au prix d'Opus (moitié moins cher que Fable)50Latent SpaceLLMs 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.