Ce que mon agent sait de moi

L'édition du jour de la newsletter Ben's Bites s'ouvre sur un outil baptisé « reflection engine », un fichier markdown volumineux à soumettre à son agent IA pour obtenir une analyse introspective à partir de ses propres documents personnels. L'auteur l'a testé avec les modèles Fable en configuration haute et Sol en configuration maximale, ce dernier produisant un rapport jugé plus cohérent. Sur le plan des modèles, OpenAI a annoncé une baisse de prix de 80 % pour GPT-5.6 Luna et de 20 % pour Terra : Luna, poussé à son effort de réflexion maximal, atteint désormais des performances proches de GPT-5.4 xhigh, qui était il y a quatre mois le meilleur modèle disponible, pour seulement 8 % de son coût. OpenAI a également teasé un futur modèle majeur nommé Astra, présenté comme ayant résolu dix problèmes non résolus de longue date en mathématiques et en informatique théorique. De son côté, Google a lancé Gemini Robotics 2, un système conçu pour piloter aussi bien des bras robotiques que des humanoïdes complets, avec un modèle de mouvement à partir d'instructions visuelles, un module de planification de tâches complexes et une version embarquée fonctionnant directement sur l'appareil.
Ces annonces marquent une accélération de la course à l'efficacité économique des modèles de langage : une division par plus de dix du coût pour un niveau de performance équivalent signifie, concrètement, la possibilité de faire dix à douze fois plus de travail avec le même budget. Pour les développeurs et les entreprises qui construisent des produits sur ces modèles, cela change la donne en matière d'usage quotidien, même si les tâches de développement plus complexes nécessitent encore de recourir à des modèles plus coûteux comme Sol en configuration haute. Du côté de la robotique, l'arrivée d'un système unique capable de contrôler des humanoïdes entiers, de gérer des tâches délicates et de coordonner plusieurs robots simultanément représente une étape vers une automatisation physique plus polyvalente et accessible.
Cette semaine illustre aussi l'intensification de la concurrence sur les modèles ouverts et les tarifs cassés : DeepSeek V4 Flash propose un contexte d'un million de tokens à 0,14 et 0,28 dollar par million de tokens en entrée et sortie, Qwen a annoncé un modèle à 2 400 milliards de paramètres proche des performances de pointe pour le code, et Thinking Machines a publié en poids ouverts un modèle nommé Inkling-Small qui égale des modèles quatre fois plus gros. Par ailleurs, l'écosystème des agents continue de se structurer, avec un ancien de Ben's Bites désormais chez Vercel qui a construit un modèle d'équipe marketing pilotée par agents, YC qui a mis en open source un harnais multi-agents utilisé en interne pour la comptabilité, le juridique et l'ingénierie, et Vercel qui a développé son propre agent interne baptisé « @v » couvrant la finance, la communication et l'analyse business.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




