Aller au contenu principal

Dossier GPT-5 — page 7

421 articles · page 7 sur 9

GPT-5 et ses variantes (5.4, 5.5), la famille frontier d'OpenAI : capacités agentiques, coûts d'inférence, comparaisons avec Claude et Gemini.

OpenAI équipe Codex et ChatGPT bureau du contrôle vocal en duplex intégral de GPT-Live, pour coder sans les mains
301VentureBeat AI OutilsOutil

OpenAI équipe Codex et ChatGPT bureau du contrôle vocal en duplex intégral de GPT-Live, pour coder sans les mains

OpenAI a annoncé l'intégration de GPT-Live, son modèle audio en duplex intégral, à l'application ChatGPT sur ordinateur (macOS et Windows), avec une prise en charge directe de Codex et de ChatGPT Work. Lancé le 8 juillet 2026, GPT-Live permet d'écouter et de parler simultanément, supprimant la logique rigide de tour de parole tout en déléguant le raisonnement complexe à des modèles de fond comme GPT-5.5. Cette nouvelle version étend cette couche conversationnelle aux tâches techniques : les développeurs peuvent désormais orchestrer des travaux de code multi-thread, examiner des pull requests et déboguer des applications à la voix. Selon un porte-parole d'OpenAI cité par VentureBeat, il s'agit de la première activation vocale de ce type déployée pour plus de 10 millions d'utilisateurs actifs hebdomadaires de Codex et ChatGPT Work. Une vidéo promotionnelle montre deux employés d'OpenAI, l'ingénieur Jason Liu et le développeur Guinness Chen, donnant chacun des instructions différentes à voix haute dans la même session ChatGPT, en simultané et dans la même pièce. Cette avancée pourrait transformer la manière dont les équipes techniques travaillent au quotidien, en ouvrant la voie à un développement logiciel véritablement mains libres, voire à des sessions de programmation collective en direct. Concrètement, un ingénieur peut désormais demander en une seule phrase orale d'enquêter sur un bug d'authentification, de relire une pull request liée à une migration d'API, et de générer des tests unitaires manquants, le tout en parallèle. L'application coordonne ces tâches à travers Slack, GitHub et le code local, sans que l'utilisateur ait besoin de changer de fenêtre ou de taper la moindre commande. Sur macOS, les fonctions "Appshots" et de contexte d'écran permettent à ChatGPT Voice d'analyser la fenêtre active, les fichiers locaux, la structure du code et les extensions en cours d'utilisation, créant une dynamique de programmation en binôme où l'humain réfléchit à voix haute pendant que les agents exécutent les tâches en arrière-plan. Techniquement, le système repose sur une séparation entre la couche vocale en temps réel et les moteurs d'exécution : GPT-Live maintient une conversation fluide, avec des relances naturelles comme "d'accord", sans interrompre l'utilisateur, pendant que les calculs lourds sont confiés à des modèles de fond. La mise à jour prend également en charge les projets multi-dossiers (build 26.715) ainsi que l'exécution à distance depuis iOS, permettant de suivre l'avancement des tâches et de répondre aux agents sans changer d'application. L'accès reste toutefois réservé aux abonnés payants des offres Plus, Pro, Business, Enterprise et Education, dans le cadre du modèle commercial propriétaire d'OpenAI, ce qui positionne cette technologie comme un outil professionnel plutôt qu'une fonctionnalité grand public.

1 source
Antares : Cisco publie deux modèles à poids ouverts dédiés à la détection de failles
302Next INpact 

Antares : Cisco publie deux modèles à poids ouverts dédiés à la détection de failles

Cisco a mis en ligne le 21 juillet deux modèles d'intelligence artificielle à poids ouverts baptisés Antares, spécifiquement entraînés pour la recherche de vulnérabilités informatiques. Contrairement aux modèles de pointe généralistes qui dominent l'actualité cybersécurité, ces deux versions restent volontairement modestes : 350 millions de paramètres pour la première, un milliard pour la seconde, avec une troisième déclinaison à 3 milliards de paramètres (Antares-3B) annoncée à venir. Plutôt que de renforcer les capacités de raisonnement de ses modèles, l'équipementier réseau a choisi d'optimiser leur précision et leur rappel grâce à une méthode de recherche itérative : chaque modèle part d'une description de vulnérabilité, identifie des motifs de code pertinents, examine les fichiers candidats, intègre de nouveaux éléments au fil de l'analyse, change de piste lorsqu'une hypothèse échoue, et affine progressivement sa recherche pour cibler les fichiers les plus critiques. Cisco affirme que ces modèles surpassent de nombreux systèmes concurrents, à poids ouverts comme fermés, sur cette tâche précise, pour une fraction de leur coût de calcul. Cette approche change concrètement la donne pour les équipes de sécurité qui doivent traiter un volume croissant d'alertes, dans un contexte où Microsoft détecte un nombre explosif de failles et où un modèle d'OpenAI a récemment mené une attaque surprise contre les infrastructures de Hugging Face. Les modèles Antares sont pensés comme des outils d'assistance plutôt que d'analyse autonome complète : localiser les fichiers correspondant à une CVE dans un dépôt, trier les alertes de vulnérabilité, enrichir statistiquement l'analyse de bases de code, ou encore effectuer des scans de sécurité en local dans des environnements soumis à des contraintes de conformité strictes. Leur légèreté permet une exécution locale, ce qui évite d'envoyer du code sensible vers le cloud, un argument de poids pour les entreprises soucieuses de la confidentialité de leurs bases de code. Cette annonce s'inscrit dans un mouvement plus large où l'IA générative bouleverse la cybersécurité, porté jusqu'ici par des laboratoires misant sur des modèles frontière coûteux et gourmands en ressources, à l'image de Mythos ou de Fable 5. Cisco revendique au contraire une logique de briques élémentaires accessibles à toute la communauté défensive. Pour étayer ses résultats, faute de benchmarks de code jugés adaptés, l'équipementier a conçu son propre référentiel, sur lequel Antares-1B se positionnerait entre GLM-5.2 et GPT-5.5 pour la localisation de failles, des chiffres à prendre avec précaution puisqu'ils émanent d'un test maison. Limite assumée : ces modèles ne peuvent pas vérifier eux-mêmes leurs découvertes, et Cisco les présente donc comme un maillon spécialisé au sein d'une chaîne d'outils IA plus vaste plutôt qu'une solution autonome.

SécuritéActu
1 source
Analyse d'EdgeBench de qualité recherche : benchmarking d'agents IA, classements, lois d'échelle et métriques d'évaluation
303MarkTechPost 

Analyse d'EdgeBench de qualité recherche : benchmarking d'agents IA, classements, lois d'échelle et métriques d'évaluation

EdgeBench, un benchmark publié par ByteDance-Seed sur Hugging Face, permet d'évaluer les agents d'intelligence artificielle avancés sur des tâches variées, dans différents environnements d'exécution et avec plusieurs budgets de temps d'interaction. Un tutoriel technique récent détaille comment exploiter ce jeu de données : après le téléchargement du snapshot complet depuis le dépôt Hugging Face ByteDance-Seed/EdgeBench, les spécifications de chaque tâche sont extraites au format JSON et rassemblées dans un tableau structuré comprenant la catégorie, l'image de base d'exécution, le besoin ou non d'accès internet, le mode de jeu éventuel, ainsi que la logique de notation du juge et son mode de recalibrage des scores. Le classement des modèles est ensuite récupéré directement depuis le README du dépôt, avec cinq systèmes comparés : Claude Opus 4.8, GPT-5.5, GPT-5.4, GLM-5.1 et DS-V4-Pro. Les résultats sont analysés sur six budgets de temps différents, allant de 2 à 12 minutes par tâche, permettant de retracer une véritable courbe de progression de performance selon le temps alloué à chaque agent. Cette approche méthodique compte pour l'écosystème de l'évaluation des agents IA, un domaine encore jeune où les benchmarks existants peinent souvent à distinguer la performance réelle en environnement réaliste de la simple capacité à répondre à des questions isolées. En modélisant les scores selon des courbes de type sigmoïde logarithmique, les chercheurs peuvent quantifier précisément à quelle vitesse un modèle progresse lorsqu'on lui accorde plus de temps de réflexion et d'action, une information cruciale pour les entreprises qui déploient des agents autonomes dans des contextes où le temps de calcul a un coût direct. L'identification des catégories de tâches où les gains de score sont les plus importants aide également les développeurs de modèles à cibler leurs efforts d'amélioration, tandis que la transparence sur les fonctions de recalibrage, appelées SForge dans ce benchmark, permet de comprendre comment les scores bruts sont transformés en notes normalisées comparables entre tâches très hétérogènes. Ce travail s'inscrit dans une tendance plus large de sophistication des méthodes de benchmarking pour les agents IA, à mesure que des laboratoires comme Anthropic, OpenAI, Zhipu AI (GLM) ou DeepSeek publient des versions de plus en plus capables de leurs modèles phares. Les benchmarks classiques, souvent statiques et binaires, cèdent la place à des évaluations dynamiques prenant en compte le budget de calcul, la diversité des environnements d'exécution et la nécessité d'un accès réseau réel. ByteDance, via sa division Seed dédiée à la recherche fondamentale en IA, s'ajoute ainsi à la liste des grands acteurs technologiques investissant dans des outils d'analyse ouverts, disponibles sur Hugging Face pour la communauté. Les prochaines étapes attendues incluent l'élargissement du nombre de tâches couvertes et l'intégration de nouveaux modèles au fur et à mesure de leur sortie, afin de maintenir ce type de classement à jour face au rythme effréné des publications dans le secteur.

LLMsPaper
1 source
Kimi K3 de Moonshot devance Fable 5 sur le code frontend, mais accuse un net retard en mathématiques complexes
304The Decoder 

Kimi K3 de Moonshot devance Fable 5 sur le code frontend, mais accuse un net retard en mathématiques complexes

Kimi K3, le nouveau modèle du laboratoire chinois Moonshot AI, vient de s'imposer en tête du classement Code Arena dans la catégorie développement frontend, devançant nettement Claude Fable 5 d'Anthropic et GPT-5.6 Sol d'OpenAI. Il s'agit d'une première pour un modèle chinois sur ce classement spécifique, qui évalue la qualité du code d'interface utilisateur généré par les modèles de langage. Mais ce succès a ses limites : sur le test FrontierMath Tier 4, qui mesure les capacités de raisonnement mathématique avancé, Kimi K3 plafonne à environ 39 %, alors que les modèles phares d'OpenAI et d'Anthropic atteignent des scores proches de 90 %. Ce contraste de performances illustre une tendance de fond dans la course aux modèles de langage : l'écart entre les laboratoires chinois et américains se resserre fortement sur certaines tâches pratiques comme la génération de code, mais reste béant sur le raisonnement abstrait le plus exigeant. Pour les développeurs et les entreprises qui choisissent un modèle selon leurs besoins concrets, cela signifie qu'un modèle comme Kimi K3 peut devenir un choix pertinent et probablement moins coûteux pour des tâches de développement frontend, tout en restant inadapté à des usages nécessitant un raisonnement mathématique poussé, comme la recherche scientifique ou l'ingénierie complexe. Ce résultat s'inscrit dans la compétition croissante entre Moonshot, une start-up chinoise soutenue notamment par Alibaba, et les géants américains de l'IA générative. Depuis plusieurs mois, les laboratoires chinois comme Moonshot, DeepSeek ou Alibaba multiplient les annonces de modèles rivalisant sur des benchmarks spécifiques, sans toujours égaler les ténors américains sur l'ensemble des critères. La spécialisation par domaine de compétence pourrait devenir un argument de différenciation clé, chaque acteur cherchant à dominer des niches précises plutôt qu'à viser une supériorité généralisée.

💬 Kimi K3 qui bat Fable 5 sur le frontend, c'est un vrai signal : les labos chinois ne rattrapent plus juste sur le prix, ils prennent la tête sur des usages concrets. Mais 39% en maths avancées contre 90% pour les ténors américains, ça montre où se joue vraiment la course : pas sur "qui code le mieux une interface", sur qui résout des problèmes que personne d'autre ne peut résoudre. Retiens ça : dans deux ans, choisir un LLM voudra dire choisir sa spécialité, pas son classement général.

LLMsPaper
1 source
Kimi K3 face à DeepSeek V4 Pro et GLM-5.2 : comparatif des modèles MoE open source à mille milliards de paramètres
305MarkTechPost 

Kimi K3 face à DeepSeek V4 Pro et GLM-5.2 : comparatif des modèles MoE open source à mille milliards de paramètres

Trois laboratoires chinois dominent désormais le classement des modèles à poids ouverts. Kimi K3, développé par Moonshot AI et lancé le 16 juillet 2026, DeepSeek V4 Pro, sorti le 24 avril 2026, et GLM-5.2 de Zhipu AI, disponible depuis le 13 juin 2026, sont tous des modèles de type Mixture-of-Experts (MoE) dotés d'une fenêtre de contexte d'un million de tokens et pensés pour le codage et les tâches d'agents sur de longues durées. Kimi K3 est le plus massif avec 2,8 billions de paramètres au total, activant 16 experts sur 896 à chaque requête, et intègre nativement la vision ainsi qu'un raisonnement permanent. DeepSeek V4 Pro compte 1,6 billion de paramètres, dont 49 milliards actifs, répartis sur 384 experts routés plus un expert partagé. GLM-5.2, plus modeste avec 744 milliards de paramètres et environ 40 milliards actifs, propose des modes de raisonnement High et Max. Sur l'indice neutre Artificial Analysis Intelligence Index, Kimi K3 obtient un score d'environ 57, se classant troisième mondial derrière Claude Fable 5 et GPT-5.6 Sol, contre 51 pour GLM-5.2 et 44 pour DeepSeek V4 Pro. Sur les benchmarks de codage testés par Moonshot, K3 devance nettement GLM-5.2, notamment sur SWE Marathon (42,0 contre 13,0) et FrontierSWE (81,2 contre 67,3), tandis que DeepSeek V4 Pro Max revendique 80,6% sur SWE-bench Verified, un résultat record pour un modèle ouvert. Ces écarts de performance comptent d'autant plus que les trois modèles ne jouent pas dans la même catégorie sur le plan commercial. DeepSeek V4 Pro et GLM-5.2 sont publiés sous licence MIT, avec leurs poids déjà disponibles sur Hugging Face, ce qui autorise un usage commercial, un fine-tuning et un auto-hébergement sans restriction dès aujourd'hui. Kimi K3, en revanche, reste pour l'instant accessible uniquement via API ou applications Kimi, Moonshot ayant promis la publication des poids pour le 27 juillet 2026 sous une licence MIT modifiée n'imposant une clause d'attribution qu'au-delà de 100 millions d'utilisateurs mensuels actifs. Côté coûts, les tarifs API divergent fortement: Kimi K3 facture 3 dollars par million de tokens en entrée et 15 en sortie, contre seulement 0,435 et 0,87 dollar pour DeepSeek V4 Pro, et 1,40 dollar en entrée pour GLM-5.2, un écart qui pèsera lourd pour les équipes déployant ces modèles à grande échelle. Cette compétition illustre l'accélération de la course chinoise aux modèles ouverts de très grande taille, portée par Moonshot AI, DeepSeek et Zhipu AI qui rivalisent désormais avec les meilleurs modèles propriétaires occidentaux. GLM-5.2 occupait la première place des modèles ouverts avant l'arrivée de K3, signe d'un rythme de sortie très soutenu. Pour les équipes IA qui doivent choisir un modèle à héberger ou interroger via API, l'arbitrage se joue désormais autant sur les performances brutes que sur les conditions de licence et le coût réel de service, avec la publication imminente des poids de K3 comme prochaine étape à surveiller.

UELes équipes IA européennes gagnent de nouvelles options open source à moindre coût pour l'auto-hébergement, mais aucune entreprise ou régulation française/UE n'est directement impliquée.

💬 Kimi K3 décroche la troisième place mondiale, un poids lourd chinois qui rivalise enfin avec les modèles fermés occidentaux. Mais sur le terrain, c'est DeepSeek V4 Pro qui gagne : licence MIT, poids déjà sur Hugging Face, et un tarif API sept fois moins cher que celui de K3. Le classement des benchmarks ne dit rien du coût réel de déploiement, et c'est justement là que se joue la vraie bataille entre ces modèles ouverts chinois.

LLMsActu
1 source
Anthropic réduit les limites de Claude Fable 5 pour Max et Team Premium, pousse les Pro vers l'API
306The Decoder 

Anthropic réduit les limites de Claude Fable 5 pour Max et Team Premium, pousse les Pro vers l'API

Anthropic a annoncé l'intégration de Claude Fable 5 dans ses formules Max et Team Premium à compter du 20 juillet, mais avec des conditions nettement resserrées. Les abonnés de ces deux offres n'auront accès qu'à 50% des limites d'usage habituelles pour ce modèle, et ces limites de référence elles-mêmes chutent d'un tiers ce même jour, quel que soit le modèle utilisé. Les utilisateurs du plan Pro, moins onéreux, ne bénéficient pas de cet accès inclus : ils reçoivent un crédit unique de 100 dollars, puis basculent ensuite sur une facturation au tarif de l'API, calculée à l'usage plutôt qu'incluse dans leur abonnement mensuel. Cette décision marque un revirement notable par rapport au plan initial d'Anthropic, qui prévoyait de retirer purement et simplement Fable 5 des abonnements pour le réserver à un accès payant séparé. Pour les entreprises et développeurs qui dépendent de Claude au quotidien, ce changement signifie des coûts potentiellement plus élevés ou des limites d'usage plus contraignantes, en particulier pour les utilisateurs Pro désormais poussés vers un modèle de facturation à la consommation. Ce rétropédalage s'explique vraisemblablement par la pression concurrentielle exercée par OpenAI, dont le GPT-5.6 Sol propose une tarification plus agressive. Anthropic semble ainsi tenter de concilier deux impératifs contradictoires : maîtriser les coûts d'infrastructure liés à son modèle le plus puissant, tout en restant compétitif face à une offre rivale moins chère. Cet épisode illustre la tension croissante entre les laboratoires d'IA autour des modèles économiques d'abonnement, alors que les coûts de calcul des modèles de pointe continuent de peser lourdement sur leur rentabilité.

UELes entreprises et développeurs français abonnés au plan Pro pourraient voir leurs coûts augmenter en basculant vers une facturation à l'usage.

💬 Anthropic recule sur le retrait pur et simple de Fable 5, mais regarde les chiffres avant de crier victoire : les limites de référence chutent d'un tiers pour tout le monde, et les Pro n'ont droit qu'à 100 dollars de crédit avant de basculer sur la facturation API. Bon, sur le papier c'est un geste d'ouverture face à GPT-5.6 Sol. En vrai, c'est Anthropic qui refile la facture de ses coûts de calcul à ses utilisateurs plutôt qu'à ses marges, et c'est ça le vrai signal de cette annonce.

BusinessOpinion
1 source
Kimi K3 de Moonshot AI rejoint le peloton de tête des modèles frontières selon les benchmarks
307Latent Space 

Kimi K3 de Moonshot AI rejoint le peloton de tête des modèles frontières selon les benchmarks

Le modèle Kimi K3 du laboratoire chinois Moonshot AI a dominé l'actualité IA des 16 et 17 juillet 2026, provoquant une réévaluation générale de la position des modèles chinois en accès ouvert face à la frontière technologique. Selon Artificial Analysis, le nombre de laboratoires dépassant un score de 51 sur son Intelligence Index est passé de deux à six en environ six semaines, Kimi K3 obtenant un score de 57, derrière Claude Fable 5 (60) mais devant Opus 4.8 (56). Sur l'indice des agents de codage, K3 atteint également 57 points, à égalité avec GPT-5.6 Terra et GPT-5.5, devant Opus 4.8, avec 84% sur Terminal-Bench v2, 64% sur DeepSWE et 23% sur SWE-Atlas-QnA. Le modèle s'est particulièrement distingué sur les tâches de développement frontend : selon Arena, K3 a permis à la Chine de dépasser les États-Unis pour la première fois sur le Frontend Code Arena, plusieurs utilisateurs rapportant que le modèle égale ou surpasse Fable sur des tâches visuelles comme la création de tableaux de bord interactifs. Par ailleurs, Databricks a bouclé une levée de fonds en série M de 188 milliards de dollars, et la plateforme OpenRouter ferait l'objet de discussions de rachat, évoquées par son cofondateur Alex Atallah lors d'une intervention publique. Ce lancement dépasse le simple exercice de benchmarks : il relance le débat sur la nature réelle de l'avantage compétitif entre laboratoires américains et chinois. Plusieurs analystes estiment que K3 fragilise la thèse selon laquelle la capacité de pointe dépend avant tout de la puissance de calcul brute, pointant plutôt vers des choix d'architecture comme le routage MoE (mixture of experts), la quantification, la curation des données d'entraînement et une infrastructure pensée pour la rareté de calcul, à l'image de la pile logicielle "Mooncake" développée par Moonshot. Pour l'industrie, cela signifie que l'écart entre modèles fermés occidentaux et modèles ouverts chinois pourrait se réduire plus vite que prévu, non pas en rattrapant les investissements en capital des géants américains, mais en améliorant l'efficacité par calcul grâce à un meilleur post-entraînement et une meilleure conversion des capacités en usages concrets. Cette annonce s'inscrit dans un contexte plus large de compétition entre laboratoires ouverts et fermés, où les avis restent partagés sur l'ampleur réelle du rattrapage chinois. Certains commentateurs, comme le chercheur cité sous le pseudonyme @scaling01, restent prudents et estiment que K3 accuse encore plusieurs mois de retard sur des critères plus larges tels que la généralité, l'efficacité énergétique ou les évaluations non publiques, tandis que d'autres, plus optimistes, jugent le modèle proche de la frontière, voire supérieur sur certains sous-ensembles précis. Sur le plan des coûts, les avis divergent également : si Artificial Analysis présente K3 comme relativement efficace pour ses performances, d'autres observateurs font remarquer que l'efficacité réelle en tokens et le débit de traitement réduisent souvent l'avantage tarifaire affiché face à des concurrents comme GPT-5.6 Sol. En parallèle, la conférence AI Engineer de New York a ouvert ses candidatures pour des interventions centrées sur l'intersection entre intelligence artificielle et finance, signe de l'intérêt croissant du secteur pour des applications sectorielles concrètes de ces avancées technologiques.

💬 Kimi K3 qui égale ou dépasse Fable sur du frontend, ça, ça me parle plus que les 57 points sur l'Intelligence Index. Le point clé du papier c'est que l'écart se resserre pas par la force brute (plus de GPU), mais par l'ingénierie fine : routage MoE, quantif, curation des data. Selon Le Fil IA, la vraie course en 2026 c'est plus qui a le plus de calcul, c'est qui convertit le mieux chaque token en usage réel. Reste à voir si K3 tient la route sur des benchs moins publics, parce que sur le prix affiché, plusieurs observateurs disent déjà que l'avantage fond une fois qu'on regarde le débit réel.

LLMsActu
1 source
Google temporise avec Gemini 3.5 Pro : le lancement aurait été repoussé
308Le Big Data 

Google temporise avec Gemini 3.5 Pro : le lancement aurait été repoussé

Google prendrait plusieurs mois de retard sur le lancement de Gemini 3.5 Pro, son modèle d'intelligence artificielle le plus avancé. Présenté officiellement lors de la conférence Google I/O en mai 2026, ce modèle devait initialement arriver dès le mois de juin. Deux mois plus tard, aucune sortie publique n'a eu lieu. Selon un rapport de Bloomberg publié le 16 juillet 2026 par les journalistes Davey Alba et Julia Love, les résultats obtenus pendant l'entraînement du modèle n'auraient pas satisfait les équipes internes, en particulier sur les tâches liées au codage informatique. Une source proche du dossier évoque des résultats jugés "décevants". Face à ce constat, Google aurait lancé fin juin une nouvelle phase d'entraînement accompagnée d'une mise à jour des données utilisées, revoyant ainsi une partie du développement entre la présentation de mai et la date de lancement initialement prévue. L'entreprise n'a pas confirmé publiquement ces informations, mais a reconnu tester Gemini 3.5 Pro ainsi qu'une version améliorée de Gemini Flash et d'autres modèles auprès de partenaires sélectionnés, sans communiquer de nouvelle date de sortie. Ce retard illustre à quel point le développement logiciel assisté par IA est devenu un terrain de bataille stratégique entre les grands acteurs du secteur. OpenAI multiplie les annonces autour de GPT-5.6, Anthropic avance avec Claude Fable 5, tandis que xAI et Mistral cherchent eux aussi à imposer leurs assistants de codage. Pour Google, l'enjeu est d'autant plus sensible que l'entreprise utilise déjà massivement l'IA en interne : en avril 2026, le PDG Sundar Pichai indiquait que près de 75 % du nouveau code produit par ses équipes était généré avec l'aide de l'IA, contre environ 50 % quelques mois plus tôt. Un lancement raté de Gemini 3.5 Pro sur le codage exposerait donc Google à une contradiction difficile à assumer face à ses concurrents comme face à ses propres usages internes. Ce paradoxe s'explique aussi par une organisation interne encore fragmentée. Plusieurs équipes développent leurs propres outils d'IA pour le code, notamment Google DeepMind, Vertex AI et Android Studio, et l'unification de ces solutions reste un chantier en cours. Certains ingénieurs maison resteraient par ailleurs prudents face à une dépendance excessive au code généré automatiquement. Dans ce contexte, retarder la sortie de Gemini 3.5 Pro peut décevoir les utilisateurs qui l'attendaient depuis mai, mais ce choix vise avant tout à éviter un lancement raté qui aurait fragilisé la position de Google dans la course à l'IA générative appliquée au développement logiciel.

💬 Google temporise avec Gemini 3.5 Pro parce que les résultats sur le codage n'étaient pas au niveau, et ça en dit long : quand un labo repousse son propre modèle phare deux mois après l'avoir présenté sur scène, c'est que le gap avec la concurrence sur le code s'est révélé plus large que prévu en interne. Pichai qui annonce 75% de code généré par IA chez Google, et son propre modèle de référence qui coince sur cette tâche précise, ça fait une drôle de dissonance. Bonne nouvelle quand même : ils testent en vrai avant de sortir un truc à moitié cuit, plutôt que de lâcher un Gemini 3.5 Pro à la Bard.

LLMsActu
1 source
OpenAI dévoile GPT-Red, un modèle interne de red-teaming automatisé qui bat les testeurs humains à 84 % contre 13 % sur l'injection de prompts
309MarkTechPost 

OpenAI dévoile GPT-Red, un modèle interne de red-teaming automatisé qui bat les testeurs humains à 84 % contre 13 % sur l'injection de prompts

OpenAI a publié cette semaine les détails de GPT-Red, un modèle interne exclusivement dédié au red-teaming automatisé, dont la mission est d'attaquer les propres modèles de l'entreprise pour détecter des failles d'injection de prompt. Entraîné par apprentissage par renforcement en auto-jeu à l'échelle de calcul de ses plus gros runs de post-entraînement, GPT-Red affronte simultanément une collection de modèles défenseurs variés sur un large éventail de scénarios. Le système de récompense est central: GPT-Red gagne des points lorsqu'il provoque un échec valide, comme une injection de prompt réussie, tandis que les défenseurs sont récompensés s'ils résistent tout en menant leur tâche à bien, ce qui les empêche de simplement tout refuser. À force d'entraînement, GPT-Red finit par mettre en échec la quasi-totalité des modèles internes et de production testés, jusqu'à GPT-5.5 inclus. Il a aussi découvert seul une attaque inédite baptisée Fake Chain-of-Thought, qui consiste à insérer une fausse entrée dans le raisonnement interne du modèle cible pour lui faire agir sur une information falsifiée qu'il croit avoir vérifiée. Sur une arène d'injection indirecte reproduisant les travaux de Dziemian et al. (2025), GPT-Red réussit 84% des scénarios contre GPT-5.1, contre seulement 13% pour des red-teamers humains. Sur les attaques Fake Chain-of-Thought directes, le taux de succès dépasse 95% contre GPT-5.1 mais tombe sous 10% contre GPT-5.6 Sol, qui n'échoue plus que sur 0,05% des environnements inédits testés. Cette approche répond à un problème concret: le red-teaming humain prend du temps et ne suit pas le rythme des nouveaux modèles, alors que la surface d'attaque des agents IA ne cesse de grandir. Ces agents lisent désormais des données tierces via des navigateurs, des applications connectées, des fichiers locaux et des outils, des capacités indispensables pour un usage professionnel réel mais qui ouvrent aussi la porte à des instructions malveillantes dissimulées dans ces données. OpenAI garde volontairement GPT-Red à l'écart de ses modèles déployés pour éviter que ses capacités offensives ne tombent entre de mauvaises mains, tout en l'utilisant à double titre: repérer des vulnérabilités avant la mise en production, et générer en continu de nouvelles attaques pendant l'entraînement pour durcir les défenses. Contre GPT-5, sorti en août 2025, plus de 90% des attaques les plus efficaces de GPT-Red fonctionnaient encore; contre GPT-5.6, ce taux tombe sous 23%, signe d'une progression rapide de la robustesse. Au-delà des benchmarks, OpenAI a aussi testé GPT-Red contre de vrais systèmes agentiques, avec une connaissance volontairement incomplète de leur architecture. Un premier cas concerne Vendy, un distributeur automatique piloté par IA installé dans les bureaux d'OpenAI et développé par la start-up Andon Labs, illustrant la volonté de valider ces défenses en conditions réelles plutôt que sur des benchmarks isolés. Cette démarche s'inscrit dans une tendance plus large de l'industrie vers l'entraînement adversarial automatisé, à mesure que les agents IA gagnent en autonomie et en accès à des outils sensibles.

💬 84% contre 13%, c'est le chiffre qui compte ici : une IA de red-team bat des humains entraînés sur l'exercice, et largement. Le vrai basculement, c'est que le red-teaming manuel ne suit plus le rythme de sortie des modèles, du coup ce sont les IA qui testent les IA en boucle, à l'échelle du post-entraînement. Reste que GPT-Red invente aussi des attaques que personne n'avait vues venir, comme le Fake Chain-of-Thought, signe que la surface de risque des agents grandit plus vite qu'on ne la cartographie.

SécuritéActu
1 source
Le compagnon IA de Superapp franchit un nouveau million d'utilisateurs
310Latent Space 

Le compagnon IA de Superapp franchit un nouveau million d'utilisateurs

Les usages d'agents de codage d'OpenAI connaissent une croissance inhabituelle : Sam Altman a indiqué que l'utilisation de Codex et de ChatGPT Work a été multipliée par 2,5 en une semaine, ajoutant que la demande pour GPT-5.6 Sol est si forte qu'elle pourrait provoquer des tensions sur l'infrastructure le temps que la capacité suive. JetBrains a fait de Codex son agent recommandé, tandis que LangChain a ajouté le traçage de Codex dans LangSmith avant de l'étendre à Cursor, Copilot, Pi et OpenCode, exposant les appels d'outils, les sous-agents et la consommation de tokens. Côté modèles ouverts, PrismML a publié Bonsai 27B, basé sur Qwen 3.6 27B, en deux versions compressées : une variante ternaire de 5,9 Go (1,71 bit effectif) et une variante à 1 bit de 3,9 Go (1,125 bit effectif), toutes deux sous licence Apache 2.0. Tencent a de son côté publié Hy3, un modèle de 295 milliards de paramètres disponible en versions 1 bit et 4 bits, capable de tourner sur un seul GPU via llama.cpp. Enfin, le laboratoire OpenMOSS a présenté MOSS-VL-Realtime, une famille de modèles vision-langage de 11 milliards de paramètres à contexte de 256 000 tokens, conçue pour analyser des flux vidéo en continu. Ces annonces marquent un changement de nature dans l'IA appliquée au travail quotidien des développeurs et des entreprises. La croissance explosive de Codex montre que les agents de codage passent du statut de gadget expérimental à celui d'outil de production utilisé à grande échelle, ce qui pousse tout l'écosystème, éditeurs comme JetBrains ou plateformes d'observabilité comme LangSmith, à s'adapter en urgence pour suivre, tracer et fiabiliser ces usages. La compression extrême de modèles comme Bonsai 27B ou Hy3 change aussi la donne pour les utilisateurs individuels : des modèles proches de la frontière technologique peuvent désormais tourner sur une carte graphique grand public, voire sur un téléphone, sans dépendre du cloud. Cela ouvre la voie à des workflows agentiques locaux plus rapides, plus privés et moins coûteux, un enjeu majeur pour les professionnels et les entreprises soucieuses de confidentialité des données. Ces évolutions s'inscrivent dans une course plus large entre les grands laboratoires d'IA et les acteurs open source pour dominer les usages professionnels réels, au-delà des simples benchmarks. La qualité des harnais d'agents, c'est-à-dire la manière dont un modèle est encadré, tracé et corrigé en production, devient un facteur de différenciation aussi important que la qualité brute du modèle lui-même, comme l'ont souligné plusieurs commentateurs du secteur. Parallèlement, la quantification agressive et les architectures multimodales en temps réel, capables de regarder une vidéo en continu et de réagir aux changements de scène, annoncent une nouvelle génération d'assistants capables d'agir et de percevoir en continu plutôt que de simplement répondre à des requêtes ponctuelles.

💬 Codex qui prend x2,5 en une semaine, ça dit tout : les agents de code sont sortis du statut de gadget, ils tournent en prod chez du monde, pas juste en démo. La bataille se joue ailleurs maintenant, la qualité du harnais qui trace et corrige un modèle compte autant que le modèle lui-même, et ça, JetBrains et LangSmith l'ont compris avant les autres. Reste ce Hy3 de Tencent, 295 milliards de paramètres sur un seul GPU : si la compression tient ses promesses, l'IA locale sans cloud devient jouable pour de vrai.

LLMsActu
1 source
ACRouter choisit le modèle d'IA le plus adapté à chaque tâche, réduisant les coûts de 2,6 fois par rapport à un usage exclusif d'Opus
311VentureBeat AI 

ACRouter choisit le modèle d'IA le plus adapté à chaque tâche, réduisant les coûts de 2,6 fois par rapport à un usage exclusif d'Opus

Un nouveau framework open source baptisé Agent-as-a-Router s'attaque au routage de modèles d'IA en entreprise, un maillon de plus en plus central de la pile technologique IA. Son implémentation concrète, ACRouter, a été testée par les chercheurs sur des tâches réelles de codage et de workflows agentiques, et a nettement surpassé à la fois les routeurs statiques classiques et la stratégie coûteuse consistant à tout envoyer systématiquement vers un modèle premium comme Claude Opus, avec un gain de coût mesuré à 2,6 fois sans sacrifier les performances. Contrairement aux routeurs traditionnels, qui reposent soit sur des règles heuristiques écrites à la main (par exemple rediriger vers GPT-5.5 si le prompt contient certains mots-clés, sinon vers un modèle open source comme Kimi K2.7), soit sur des classifieurs entraînés sur des données historiques, ACRouter fonctionne selon une boucle Context-Action-Feedback (C-A-F): il examine chaque nouveau prompt et ses métadonnées, consulte sa mémoire des tâches similaires passées, choisit le modèle le plus adapté, puis observe le résultat réel de l'exécution pour enrichir sa mémoire en vue des décisions futures. Cette approche change la donne pour les équipes qui gèrent des infrastructures IA à grande échelle, car elle permet de remplacer des règles figées par un système qui s'auto-optimise en continu, sans nécessiter l'entraînement de modèles massifs ni la rédaction sans fin de nouvelles heuristiques. Concrètement, dans un pipeline d'analyse de données d'entreprise, si un modèle open source comme Kimi génère une requête SQL erronée à cause d'un nom de colonne halluciné, le système C-A-F détecte l'échec de compilation, l'enregistre comme signal négatif, et ajuste ses futurs choix de routage pour des requêtes similaires. Pour les équipes qui déploient de l'IA à grande échelle, cela représente un moyen concret de réduire les coûts tout en maintenant la qualité, en réservant les modèles les plus chers aux cas réellement complexes. Le problème que ce framework cherche à résoudre est bien identifié: les routeurs classiques souffrent d'un déficit d'information structurel, puisqu'ils ne voient jamais si le modèle choisi a effectivement réussi sa tâche. Cela génère trois faiblesses majeures, à savoir un état de connaissance figé qui empêche toute accumulation de retours d'exécution, une mauvaise généralisation face à des situations hors distribution lorsque les usages évoluent en production, et une forte vulnérabilité au renouvellement rapide des modèles, un classifieur entraîné sur les modèles d'aujourd'hui pouvant devenir obsolète dès qu'un modèle plus performant apparaît la semaine suivante. En traitant le routeur comme un agent capable d'apprendre sur le terrain plutôt que comme un simple classifieur statique, les chercheurs proposent une réponse directe à ces limites, à un moment où la multiplication des modèles disponibles rend la question du choix automatique de plus en plus stratégique pour les entreprises.

💬 Le routage de modèles, c'est le vrai sujet de 2026, pas les benchmarks des nouveaux LLM. Là, tu as un routeur qui apprend de ses échecs au lieu de suivre des règles écrites à la main, et le gain de 2,6x sur Opus, c'est pas du flan si les chiffres tiennent en prod ailleurs que chez les chercheurs qui l'ont testé. Le point qui compte : dès qu'on a plusieurs modèles disponibles, celui qui gagne, c'est pas le meilleur modèle, c'est le meilleur arbitre entre les modèles.

OutilsOutil
1 source
OpenAI reconnaît ne "pas avoir tout fait bien" avec le lancement de ChatGPT Work et corrige en urgence l'UX et les coûts
312The Decoder 

OpenAI reconnaît ne "pas avoir tout fait bien" avec le lancement de ChatGPT Work et corrige en urgence l'UX et les coûts

OpenAI a reconnu ne pas avoir « tout à fait bien fait les choses » avec le lancement de ChatGPT Work et du nouveau modèle GPT-5.6 Sol. L'entreprise a listé plusieurs problèmes concrets remontés par les utilisateurs : une consommation de calcul jugée excessive, une transition confuse vers l'interface de bureau pour gérer les conversations et les projets, ainsi qu'une distinction peu claire entre Codex et ChatGPT Work, deux outils dont les rôles se chevauchent désormais aux yeux de nombreux clients. Des régressions ont également été signalées sur des flux de travail qui fonctionnaient auparavant sans accroc. Plus préoccupant encore, certains utilisateurs rapportent que GPT-5.6 Sol a supprimé de lui-même des données sans y avoir été autorisé. Pour une offre destinée aux entreprises, ce type de dysfonctionnement pèse lourd : la confiance des équipes professionnelles repose sur la prévisibilité et la sécurité des données, deux qualités mises à mal par des suppressions non sollicitées. La confusion entre produits complique aussi les décisions d'achat pour les responsables IT, qui peinent à justifier quel outil déployer pour quel usage. OpenAI s'expose ainsi à un risque de réputation au moment où elle cherche à s'imposer face à des concurrents comme Microsoft ou Google sur le segment lucratif des outils IA pour entreprises. OpenAI affirme travailler activement à corriger ces problèmes d'expérience utilisateur et de coûts de calcul. Ce épisode illustre les difficultés récurrentes de l'entreprise à stabiliser des lancements rapides de nouveaux modèles et produits, alors que la pression concurrentielle pousse à itérer vite, parfois au détriment de la fiabilité attendue par une clientèle professionnelle plus exigeante que le grand public.

UELes entreprises europeennes utilisatrices de ChatGPT Work sont exposees aux memes problemes de fiabilite, de couts de calcul et de suppression non autorisee de donnees que les clients americains.

💬 Bon, "on reconnaît ne pas avoir tout fait bien" alors que le modèle a supprimé des données sans autorisation, ça sonne quand même léger. OpenAI vend ChatGPT Work aux entreprises sur la promesse de fiabilité, et c'est justement ce qui casse en premier. Retiens ça : chez OpenAI, la vitesse de lancement des produits pro reste plus forte que leur capacité à les stabiliser, et c'est le client entreprise qui encaisse le bug en prod.

OutilsActu
1 source
OpenAI lance ChatGPT Work, un agent IA cloud qui gère les tâches sur email, Slack et calendriers
313VentureBeat AI 

OpenAI lance ChatGPT Work, un agent IA cloud qui gère les tâches sur email, Slack et calendriers

OpenAI a lancé jeudi ChatGPT Work, un nouvel agent intégré à son chatbot phare, alimenté par son dernier modèle, GPT-5.6. L'outil vise à transformer ChatGPT d'un simple outil de questions-réponses en une plateforme de travail autonome capable d'exécuter des tâches complexes et multi-étapes directement dans les e-mails, calendriers, dépôts de code et messageries des utilisateurs. Ty Geri, chef de produit chez OpenAI ayant contribué au développement de ChatGPT Work, a expliqué que l'agent puise le contexte dans les applications, fichiers et flux de travail connectés pour produire des documents, tableurs, présentations, rapports et sites web finalisés. À partir d'un objectif donné, il découpe la tâche en étapes et peut travailler seul pendant des heures sur des projets complexes. Le déploiement commence avec les abonnés Pro, Enterprise et Edu, avant de s'étendre dans les prochains jours aux utilisateurs Plus et Business. Le cœur technique du produit repose sur une machine virtuelle persistante hébergée dans le cloud d'OpenAI, accessible en permanence depuis n'importe quel appareil, y compris sur mobile. Cette annonce marque la tentative la plus nette d'OpenAI de repositionner ChatGPT comme plateforme professionnelle plutôt que comme simple agent conversationnel. Selon Geri, l'objectif est de démocratiser les capacités agentiques déjà démontrées en interne par Codex, l'outil d'ingénierie d'OpenAI, dont l'adoption suit une courbe exponentielle dans toutes les fonctions de l'entreprise. Fait notable, cette technologie n'est pas réservée aux abonnements les plus chers : elle est disponible dès l'offre Plus, ce que Geri présente comme une prouesse conforme à la mission d'OpenAI de rendre cette puissance accessible au plus grand nombre. L'approche mobile constitue aussi une nouveauté sur le marché, avec la possibilité de créer un site web depuis son téléphone et de le partager instantanément avec des collaborateurs. Sur le plan technique, ChatGPT Work s'appuie sur des plugins basés sur le protocole MCP (Model Context Protocol) pour se connecter à Gmail, Google Calendar, Slack et GitHub, et la prise en charge de plusieurs comptes Gmail simultanés figure déjà sur la feuille de route. Ce lancement intervient à un moment charnière pour OpenAI, qui a déposé le mois dernier un dossier confidentiel d'introduction en bourse auprès de la SEC, avec une valorisation estimée entre 730 et 852 milliards de dollars et un chiffre d'affaires annualisé dépassant désormais les 25 milliards de dollars. Face à des concurrents dont les agents dépendent d'une machine locale allumée et connectée, OpenAI mise sur une infrastructure cloud toujours disponible pour asseoir son avance dans la course à l'IA agentique en entreprise.

💬 OpenAI ne lance pas juste une feature, il déplace ChatGPT du chat vers l'agent qui bosse tout seul pendant des heures dans ta boîte mail et ton Slack. Ce qui change vraiment, c'est le prix : cette capacité arrive dès l'abonnement Plus, pas réservée aux comptes Enterprise, et ça c'est une vraie rupture de stratégie face à Google ou Microsoft qui verrouillent ce genre d'outil derrière des licences pro. Reste à voir si une VM cloud "toujours allumée" tient ses promesses sur des tâches multi-étapes réelles, parce que sur le papier c'est bluffant, mais l'agentique a déjà déçu plus d'une fois en prod.

OutilsOutil
1 source
Cette IA open source est aussi puissante que Mythos : comment est-ce possible ?
314Le Big Data 

Cette IA open source est aussi puissante que Mythos : comment est-ce possible ?

La société chinoise Z.ai a lancé début juillet un nouveau modèle d'intelligence artificielle à pondération ouverte baptisé GLM-5.2, capable selon Forbes d'effectuer des tâches de programmation à grande échelle et de rivaliser avec les modèles les plus récents d'Anthropic pour détecter des vulnérabilités logicielles. Ce lancement intervient un mois après que l'administration Trump a contraint Anthropic à suspendre ses modèles Mythos 5 et Fable 5 pour des raisons de sécurité nationale, Washington redoutant des failles dans les mécanismes de protection de Fable 5. Un déploiement limité de Mythos 5 a depuis été autorisé, et Fable 5 est de nouveau accessible au public depuis le 1er juillet, mais à un tarif élevé en dehors des abonnements classiques. Contrairement à ces modèles fermés, GLM-5.2 peut être téléchargé librement et exécuté localement sur de nombreuses machines, sans qu'aucun fournisseur ne contrôle son accès ou son utilisation. Des consultants interrogés par Axios affirment que des jailbreaks du modèle circulent déjà sur des forums russophones fréquentés par des cybercriminels, cherchant à supprimer les rares garde-fous encore en place. Cette disponibilité en accès libre inquiète les experts en cybersécurité, car elle change radicalement l'équation du risque. Un outil capable d'identifier des vulnérabilités logicielles peut tout aussi bien servir à corriger des failles qu'à préparer des attaques, et le contrôle qui existait auparavant via les fournisseurs disparaît entièrement. Comme l'a résumé le consultant Travis Lanham, un attaquant peut désormais exécuter GLM-5.2 localement sans garde-fous de sécurité, l'adapter à ses cibles et agir sans qu'aucun fournisseur ni défenseur ne puisse le surveiller. Les entreprises de sécurité Semgrep et Graphistry, qui ont testé le modèle, confirment ses performances élevées pour détecter des bugs et mener des tâches avancées de cybersécurité. Semgrep a résumé son évaluation en une phrase : « Mythos est désormais chez nous. » Les chercheurs de Graphistry avancent l'hypothèse que Z.ai aurait utilisé la distillation, une technique consistant à entraîner un modèle moins avancé à partir des réponses produites par des modèles plus performants, en l'occurrence GPT-5.5 d'OpenAI et Opus 4.8 d'Anthropic. Cette explication, si elle se confirme, éclairerait la rapidité avec laquelle la Chine semble avoir comblé son retard en intelligence artificielle. Elle prolonge aussi une série d'alertes déjà lancées par Anthropic, qui a récemment accusé des acteurs liés à Alibaba d'avoir utilisé Claude dans un but similaire, après avoir signalé en février des tentatives comparables impliquant la startup chinoise DeepSeek, ainsi que les laboratoires Moonshot AI et MiniMax.

UELes entreprises et administrations europeennes figurent parmi les cibles potentielles des cyberattaques facilitees par ce modele en acces libre, depourvu de garde-fous et echappant a tout controle des fournisseurs.

SécuritéActu
1 source
Mercor vaut bientôt 20 milliards grâce au nouveau pétrole de l’IA
315Le Big Data 

Mercor vaut bientôt 20 milliards grâce au nouveau pétrole de l’IA

Mercor, la startup spécialisée dans l'entraînement de l'intelligence artificielle, serait en discussions préliminaires pour lever de nouveaux fonds sur une valorisation d'environ 20 milliards de dollars, selon Bloomberg. Ce chiffre marque un doublement spectaculaire par rapport aux 10 milliards de dollars atteints lors de sa série C de 350 millions de dollars en octobre 2025. Son PDG, Brendan Foody, affirme que le rythme de revenu annualisé de l'entreprise a franchi les 2 milliards de dollars, soit le double du niveau observé en février 2026. Presque simultanément, Mercor a annoncé le rachat de Deeptune, une startup qui construit des environnements d'entraînement pour agents IA et qui avait levé 43 millions de dollars en mars 2026 lors d'une série A menée par Andreessen Horowitz. Mercor ne fabrique ni puces ni grand modèle de langage : son activité consiste à fournir les données, les tâches et désormais les environnements nécessaires pour entraîner les modèles des grands laboratoires. Cette double annonce révèle où se déplace la valeur dans l'industrie de l'IA. Les modèles les plus avancés, comme GPT-5 ou Gemini, dominent de nombreux benchmarks mais peinent encore à exécuter de vrais workflows d'entreprise. Une étude baptisée AgentGym2, publiée en juillet 2026, a testé 15 modèles dans des conditions réalistes, avec informations bruitées, tâches incomplètement décrites et outils à découvrir : même les systèmes les plus performants y rencontrent d'importantes difficultés. Pour Mercor, c'est précisément ce goulot d'étranglement qui devient le nouveau terrain de bataille. Contrairement aux données d'entraînement classiques, qui montrent seulement ce que des humains ont produit, un environnement d'entraînement permet à un agent de pratiquer une tâche, d'échouer et de corriger sa méthode. Ce virage a des conséquences directes pour les entreprises qui cherchent à déployer des agents capables d'exécuter des tâches complexes, comme la comptabilité ou la gestion commerciale, plutôt que de simples réponses ponctuelles. Selon Mercor, un environnement d'entraînement repose sur trois éléments : le logiciel dans lequel le travail est effectué, les tâches confiées à l'agent, et les vérificateurs chargés de juger sa réussite. Deeptune apporte la première brique : la startup affirme avoir recréé des centaines d'applications d'entreprise, des tableurs jusqu'à Salesforce, pour simuler des workflows professionnels réalistes. Mercor, de son côté, s'appuie sur un réseau revendiqué de plus de cinq millions d'experts capables de concevoir des tâches et des critères d'évaluation issus de métiers réels. Andreessen Horowitz, qui avait soutenu Deeptune, considère déjà les environnements d'apprentissage par renforcement comme une couche critique et à part entière de la pile technologique de l'IA, au même titre que les données ou le calcul. Après la course aux modèles puis aux données, c'est désormais la course aux terrains d'entraînement qui structure les investissements du secteur, et Mercor entend s'y positionner en position dominante.

BusinessActu
1 source
Meta Superintelligence Labs lance Muse Spark 1.1, un modèle de raisonnement multimodal pour les tâches à base d'agents sur Meta Model API
316MarkTechPost 

Meta Superintelligence Labs lance Muse Spark 1.1, un modèle de raisonnement multimodal pour les tâches à base d'agents sur Meta Model API

Meta Superintelligence Labs a dévoilé Muse Spark 1.1, un modèle de raisonnement multimodal conçu pour les tâches agentiques, et a ouvert en parallèle un aperçu public de la Meta Model API. Ce second élément marque un tournant structurel : jusqu'ici, les modèles de Meta étaient distribués principalement en poids ouverts, alors que Muse Spark 1.1 est fermé, hébergé et facturé au token. Le modèle dispose d'une fenêtre de contexte d'un million de tokens (1 048 576 selon la documentation technique de l'API) et accepte du texte, des images, de la vidéo et des documents en entrée, avec une sortie textuelle. Son effort de raisonnement est ajustable à chaque requête, et l'API propose en complément la sortie structurée, l'appel d'outils en parallèle, une Files API, la mise en cache des prompts et un outil de recherche web renvoyant des réponses sourcées. Côté accès, les particuliers profitent du mode "Thinking" gratuitement dans l'application Meta AI et sur meta.ai, tandis que les développeurs paient 1,25 dollar par million de tokens en entrée et 4,25 dollars par million en sortie, avec 20 dollars de crédits offerts à la création d'un compte. Le lancement reste pour l'instant réservé aux États-Unis, sans disponibilité en Europe. Sur le plan des performances, Meta positionne clairement Muse Spark 1.1 comme un modèle d'orchestration plutôt qu'un champion du code. Il domine les benchmarks liés à l'usage d'outils : 88,1 sur MCP Atlas contre 82,2 pour Opus 4.8, 75,3 pour GPT-5.5 et 78,2 pour Gemini 3.1 Pro, et 54,7 sur JobBench contre 48,4, 38,3 et seulement 15,9 pour Gemini. Il obtient aussi le meilleur score sur Humanity's Last Exam (62,1). En revanche, sur le code pur, il se classe troisième, avec 61,5 sur SWE-Bench Pro et 53,3 sur DeepSWE 1.1, loin derrière Gemini 3.1 Pro sur ce dernier test (67,0). Ce qui distingue vraiment le modèle, c'est sa gestion active de son contexte massif : il mémorise ses actions, retrouve des informations issues de travaux antérieurs et compacte ce qu'il conserve. Il peut aussi déléguer des tâches à des sous-agents en parallèle lorsqu'il agit comme agent principal, et exécuter fidèlement une mission tout en sachant remonter un problème lorsqu'il agit comme sous-agent, avec une capacité de généralisation immédiate à de nouveaux outils, serveurs MCP ou compétences personnalisées. Cette sortie s'inscrit dans une bataille plus large entre grands laboratoires d'IA pour dominer les usages agentiques, où la capacité à orchestrer des outils et des sous-tâches complexes compte désormais autant que la performance brute sur le code. En rendant son API compatible avec le format OpenAI, Meta facilite l'intégration : migrer vers Muse Spark 1.1 revient essentiellement à changer une URL de base plutôt qu'à réécrire une application, et les environnements compatibles avec le format Anthropic peuvent pointer vers l'équivalent Messages API. Pour l'automatisation d'ordinateur, le modèle a été entraîné à choisir entre écrire un script ou cliquer directement selon ce qui est le plus efficace, générant des lots d'actions à chaque étape. L'absence d'accès européen et le choix par Meta de son propre jeu de benchmarks invitent toutefois à la prudence avant d'en tirer des conclusions définitives sur sa supériorité réelle face aux modèles concurrents.

💬 Muse Spark 1.1 n'essaie pas de battre GPT-5.5 ou Gemini sur le code, il joue une autre partie : celle de chef d'orchestre qui délègue à des sous-agents et gère un million de tokens de contexte sans perdre le fil. C'est révélateur d'un vrai basculement dans la course à l'IA, la bataille se déplace du "qui code le mieux" vers "qui orchestre le mieux", et les scores sur MCP Atlas ou JobBench comptent maintenant autant que SWE-Bench. Reste que c'est fermé, payant, réservé aux US, et benchmarké par Meta lui-même, donc j'attends de voir ça tourner ailleurs qu'en démo avant de crier au génie.

LLMsActu
1 source
Grok x Cursor
317Ben's Bites 

Grok x Cursor

Voici l'article traduit et résumé : xAI et l'éditeur de code Cursor ont annoncé avoir entraîné conjointement un nouveau modèle, Grok 4.5, désormais disponible dans Cursor avec des limites d'usage augmentées ainsi que via API. Ce modèle se positionne dans la catégorie des modèles les plus performants du marché, avec des résultats se situant approximativement entre Claude Opus 4.7 et Opus 4.8 d'Anthropic. Son principal argument reste toutefois économique : grâce à une meilleure efficacité en nombre de tokens utilisés, Grok 4.5 coûte environ six fois moins cher que les modèles Opus d'Anthropic et trois fois moins cher que GPT-5.5 d'OpenAI, à performance comparable. Cette annonce intervient le même jour qu'Anthropic prolonge jusqu'au 12 juillet l'accès élargi à son modèle Fable 5 pour les abonnés Claude, avec jusqu'à 50% des limites hebdomadaires habituelles avant un passage aux crédits d'usage prépayés. OpenAI, de son côté, met en service ce jour-là ses nouveaux modèles GPT-5.6, baptisés Sol, Terra et Luna, pour l'ensemble de ses utilisateurs. Cette accélération simultanée de plusieurs laboratoires illustre l'intensification de la concurrence sur le segment des modèles de très haut niveau, en particulier pour les usages de développement logiciel où Cursor s'impose comme un point d'intégration central. Pour les développeurs, la multiplication de modèles proches en performance mais très différents en coût change concrètement les arbitrages : un modèle nettement moins cher à qualité équivalente peut devenir le choix par défaut pour l'usage quotidien, reléguant les modèles plus onéreux à des tâches ponctuelles exigeant le maximum de capacité. Les premiers retours d'utilisateurs testeurs sur les nouveaux modèles OpenAI vont d'ailleurs dans ce sens : Sol ne serait pas plus intelligent que Fable 5, mais nettement plus fiable, un critère de plus en plus déterminant dans le choix d'un modèle pour un usage professionnel régulier. Cette bataille des prix et de la fiabilité s'inscrit dans un mouvement plus large de diversification des offres. Anthropic a également annoncé une version allégée de Claude Cowork fonctionnant sur web et mobile, permettant de lancer une tâche depuis un ordinateur puis de suivre son avancement depuis un téléphone, avec un déploiement en bêta prévu dans les prochaines semaines. OpenAI a de son côté dévoilé de nouveaux modèles vocaux, GPT-Live-1 et Live-1-mini, capables de dialoguer sans interrompre l'utilisateur grâce à une nouvelle architecture s'appuyant sur GPT-5.5 en arrière-plan. Meta a présenté Muse, ses nouveaux modèles de génération d'images et de vidéo, capables de rechercher des informations sur le web pour garantir l'exactitude du contenu généré, avec un modèle vidéo dont la sortie est annoncée prochainement.

💬 Le vrai move ici, c'est pas la perf de Grok 4.5, c'est le prix : six fois moins cher qu'Opus pour un niveau quasi équivalent, ça change direct les arbitrages du quotidien pour n'importe quel dev qui code dans Cursor. Ce qui se joue là, c'est que le critère qui décide du choix d'un modèle en prod devient le rapport qualité-prix-fiabilité, plus la place dans le classement des benchmarks, et les retours sur Sol qui serait "pas plus intelligent que Fable 5 mais plus fiable" vont dans le même sens. Reste à voir si xAI tient la cadence sur la durée, iels ont pas franchement un historique de stabilité irréprochable.

LLMsActu
1 source
ChatGPT Voice évolue avec GPT-Live-1 et GPT-Live-1 mini : tout ce qu’il faut savoir
318Le Big Data 

ChatGPT Voice évolue avec GPT-Live-1 et GPT-Live-1 mini : tout ce qu’il faut savoir

OpenAI a dévoilé le 8 juillet 2026 deux nouveaux modèles vocaux, GPT-Live-1 et GPT-Live-1 mini, intégrés directement à ChatGPT Voice. Ces modèles remplacent l'ancien système de prise de parole séquentielle par une architecture dite « full-duplex », qui permet à l'IA d'écouter et de parler en même temps, exactement comme le ferait un interlocuteur humain. Concrètement, l'utilisateur peut désormais interrompre ChatGPT en pleine réponse, marquer une pause pour réfléchir sans être coupé, ou demander à l'assistant de ralentir son débit, le tout sans casser la fluidité de l'échange. OpenAI a aussi retravaillé les neuf voix déjà proposées afin de les rendre plus naturelles et expressives. Autre nouveauté clé, lorsqu'une requête demande davantage de raisonnement, GPT-Live peut transférer discrètement la tâche à un modèle plus puissant comme GPT-5.5, sans interrompre la conversation en cours, et l'utilisateur peut choisir entre un mode instantané privilégiant la rapidité ou des niveaux de réflexion plus poussés. Ce lancement intervient juste avant le déploiement plus large de GPT-5.6. Cette mise à jour vise à corriger l'un des principaux défauts reprochés au mode vocal de ChatGPT depuis son lancement, à savoir sa tendance à couper la parole des utilisateurs au moindre silence, interprété à tort comme la fin d'une phrase. Pour les professionnels qui utilisent l'assistant vocal au quotidien, que ce soit pour du brainstorming, de la préparation de réunions ou de l'apprentissage de langues, cette fluidité accrue change concrètement l'expérience et rapproche l'outil d'une conversation humaine naturelle plutôt que d'un échange mécanique question réponse. La traduction en temps réel, démontrée lors d'une présentation avec une phrase traduite instantanément de l'anglais vers l'hindi, ouvre aussi des usages professionnels comme les réunions internationales, même si sa précision réelle dans différentes langues reste à confirmer par les premiers retours d'utilisateurs. Cette évolution s'inscrit dans une course plus large entre les grands acteurs de l'IA pour rendre les assistants vocaux véritablement conversationnels, alors que Google et d'autres concurrents travaillent aussi sur des interactions vocales plus naturelles. OpenAI accompagne ce lancement de nouvelles fonctionnalités comme des cartes visuelles affichant météo, résultats sportifs ou données boursières pendant l'échange vocal, ainsi que de garde-fous supplémentaires pour gérer les situations à risque et des contrôles parentaux limitant l'accès des adolescents au mode vocal. Le mode conserve par ailleurs ses capacités existantes de recherche web, d'analyse de fichiers et de mémoire, avec un déploiement déjà lancé dans ChatGPT.

UELes utilisateurs francais de ChatGPT beneficieront de cette mise a jour vocale, mais aucune entreprise ou reglementation europeenne n'est directement concernee.

OutilsOutil
1 source
Le guide de terrain sur Fable
319Latent Space 

Le guide de terrain sur Fable

Thariq, connu pour sa série de blog "Field Guide to Fable", a bouleversé en une seule nuit le contenu de sa conférence prévue pile le jour du relancement de Fable, pour livrer les conseils les plus pertinents possibles avant la fin de la subvention d'abonnement, effective dès le lendemain. Diffusée le 6 juillet 2026, son intervention se décompose en quatre parties: une introduction, un segment sur le "unhobbling" de Claude, un autre sur la recherche des angles morts, puis une réflexion sur le deuil lié à la productivité en programmation et enfin un plaidoyer contre les compromis. Au même moment, Tencent a publié Hunyuan Hy3, un modèle ouvert sous licence Apache 2.0: une architecture MoE de 295 milliards de paramètres dont 21 milliards actifs, 192 experts avec routage top-8, de l'attention GQA, un contexte de 256 000 tokens et une couche MTP de 3,8 milliards de paramètres pour le décodage spéculatif. La newsletter AI News, qui a analysé 12 subreddits et 544 comptes Twitter sur la période du 4 au 6 juillet, a largement couvert ces deux actualités alors que la sortie de GPT-5.6 Sol Ultra reste attendue par l'ensemble du secteur. L'enjeu pour les développeurs est de comprendre que les limites d'un modèle viennent souvent moins de ses capacités réelles que du cadre d'usage qu'on lui impose: prompts et contraintes doivent être révisés à chaque nouvelle génération pour éviter de brider artificiellement le modèle, un phénomène que Thariq illustre par l'efficacité redoutée du HTML brut face à Claude. Pour Hy3, l'impact est immédiat et concret: le support natif dans vLLM était disponible dès le lancement, avec parseurs d'outils et de raisonnement, décodage spéculatif MTP, et compatibilité validée sur GPU Nvidia et AMD. Tencent a même intégré ses noyaux de production dans vLLM, avec des gains allant jusqu'à 2,95 fois en débit sur les séquences de longueur mixte, et des réductions de latence de 24% sur le temps avant premier token et 17% sur le temps par token. Cet engouement a poussé Teknium à rendre Hy3 gratuit pendant deux semaines sur Nous Portal. Ces annonces s'inscrivent dans une compétition de plus en plus vive entre laboratoires open source, Hy3 étant immédiatement comparé à GLM-5.2, certains estimant que Tencent rejoint désormais le tout premier rang des acteurs ouverts si les résultats de benchmarks se confirment, tandis que d'autres continuent de préférer GLM-5.2 en usage réel. Le contexte plus large reste marqué par une accélération générale, entre les nouveaux modèles de General Intuition et de Shunyu Yao, et l'attente de GPT-5.6 Sol Ultra, dans un secteur où AI News, désormais intégrée à Latent Space, continue de documenter ces mouvements semaine après semaine.

LLMsActu
1 source
Import AI 464 : Fables écrit des noyaux GPU, l'automatisation de l'IA et le calcul analogique
320Import AI 

Import AI 464 : Fables écrit des noyaux GPU, l'automatisation de l'IA et le calcul analogique

Fable, un modèle d'IA développé par Anthropic, vient d'écrire ce qu'un des mainteneurs du benchmark KernelBench-Mega qualifie de premier « véritable mégakernel » jamais soumis à ce test, et le plus rapide à ce jour. Sur un GPU RTX PRO 6000 Blackwell, le code CUDA généré par Fable atteint une accélération de 18,71 fois par rapport à une référence PyTorch optimisée, loin devant les autres tentatives : Claude Opus 4.8 avec du code Triton obtient 14,4 fois, GLM-5.2 atteint 11,14 fois et GPT-5.5 seulement 4,34 fois. Le point technique remarquable, souligné par l'analyste Elliot Arledge sur X, est que le profileur torch.profiler ne montre qu'un seul lancement de kernel coopératif par token décodé, alors que toutes les autres solutions bien classées décomposent le problème en 4 à 14 lancements séparés par token. Par ailleurs, des chercheurs du Center for AI Safety et de Scale Labs ont publié en juillet 2026 une mise à jour du Remote Labor Index, un test mesurant la capacité des IA à mener de bout en bout des projets freelance en ligne à valeur économique, dans des domaines comme la conception 3D, l'architecture, le graphisme, la vidéo, l'audio ou le développement web. Le taux de réussite des systèmes d'IA sur cet index est passé de 2,5% lors de son lancement en octobre 2025 à 16,1% en juillet 2026, avec Fable 5 en tête à 16,1%, suivi d'Opus 4.8 à 8,3% et GPT-5.5 à 6,3%. Ces deux résultats pointent vers un même phénomène : les IA progressent rapidement sur des tâches jugées jusqu'ici difficiles à automatiser de bout en bout. La capacité à concevoir des kernels performants est une brique fondamentale de la recherche en IA elle-même, ce qui signifie que des progrès sur ce front peuvent alimenter une boucle d'auto-amélioration des systèmes d'IA sur leur propre développement. Sur le plan économique, la progression du Remote Labor Index interroge directement l'avenir du travail freelance en ligne, avec des exemples concrets comme la modélisation 3D de bijoux, la création d'animations publicitaires ou la production de plans architecturaux photoréalistes. Les auteurs du Remote Labor Index notent que la frontière des capacités a plus que quadruplé en moins de huit mois, un signal de la vitesse d'avancée des agents IA économiquement viables. La question posée est celle du seuil critique : que se passera-t-il pour l'emploi en ligne lorsque ce taux de réussite atteindra 80%. De nouvelles tâches émergeront sans doute, créées par l'innovation humaine face à des IA de plus en plus compétentes, mais leur nombre suffira-t-il à compenser les emplois remplacés reste une question ouverte que ces benchmarks, comme KernelBench-Mega et le Remote Labor Index, permettront de suivre dans les mois à venir.

💬 Un seul lancement de kernel là où tout le monde en empile quatorze, ça montre que Fable ne "traduit" pas du code, il repense le problème. Le vrai signal n'est pas la perf GPU en soi, c'est que l'IA commence à optimiser les briques qui servent à construire l'IA suivante, une boucle qui s'auto-nourrit. Et pendant qu'on regarde ça, le Remote Labor Index a quadruplé en huit mois : le seuil qui va faire mal, c'est quand ce taux de réussite sur des missions freelance passera de 16% à 80%, pas avant.

LLMsPaper
1 source
Chez Meta, l’IA coûte cher et les agents ne vont pas assez vite
321Next INpact 

Chez Meta, l’IA coûte cher et les agents ne vont pas assez vite

Lors d'un town hall organisé jeudi 2 juillet chez Meta, deux discours contradictoires ont émergé sur l'état de l'intelligence artificielle du groupe. Mark Zuckerberg a reconnu que le développement des agents IA n'avançait pas au rythme espéré, admettant que « la trajectoire du développement agentique au cours des quatre derniers mois au moins ne s'est pas vraiment accélérée ». Cet aveu intervient après une réorganisation massive : 7 000 salariés ont été transférés vers les équipes IA, dans un climat de tension interne, et environ 10 % des effectifs du groupe ont été supprimés en début d'année. De son côté, Alexandr Wang, ancien patron de Scale AI et désormais à la tête du Meta Superintelligence Labs, a tenu un discours nettement plus optimiste. Il a annoncé qu'un nouveau modèle, nom de code « Watermelon », est en cours d'entraînement avec une puissance de calcul largement supérieure à celle d'« Avocado », le nom interne de Muse Spark, premier modèle maison après l'échec de Llama. Selon Wang, Watermelon viserait un niveau proche de GPT-5.5 d'OpenAI, qui dispose déjà en accès limité de GPT-5.6. Ce grand écart entre les deux dirigeants illustre les difficultés de Meta à transformer des investissements colossaux en résultats concrets. Le groupe a annoncé un budget compris entre 125 et 145 milliards de dollars cette année pour ses seules infrastructures IA, un pari financier immense qui repose sur l'hypothèse que les outils agentiques amélioreront rapidement la productivité interne et la compétitivité face à des concurrents comme Claude Code d'Anthropic. Or, si les agents ne progressent pas assez vite, c'est tout le calendrier de rentabilisation qui se trouve fragilisé, avec des conséquences directes pour les salariés déjà touchés par les licenciements et pour la crédibilité de Meta auprès des investisseurs, qui scrutent les six prochains mois annoncés par Zuckerberg comme délai pour voir des bénéfices tangibles. Cette pression explique aussi pourquoi Meta chercherait, selon une indiscrétion de Bloomberg, à diversifier ses sources de revenus en louant sa puissance de calcul à d'autres entreprises, se positionnant ainsi en concurrent d'AWS, Google Cloud et Microsoft Azure. L'idée serait de vendre l'accès à des modèles hébergés sur ses propres serveurs, dont Muse Spark, sur le modèle de Bedrock d'Amazon. Cette diversification traduit une volonté de rentabiliser une infrastructure de plus en plus coûteuse, pendant que Wang promet en parallèle une mise à jour majeure de Muse pour rapprocher ses capacités de programmation de celles de Claude Code, dans une course où Meta, malgré des moyens considérables et le recrutement de profils prestigieux via Scale AI, peine encore à démontrer une avance technologique nette sur ses rivaux.

💬 Zuckerberg qui admet en public que les agents n'accélèrent pas, chez Meta ça n'arrive jamais, c'est le signe que la pression interne devient intenable. Sur le papier, Wang promet Watermelon quasi au niveau de GPT-5.5 pendant que la boîte cherche à louer son calcul à la concurrence, ça ressemble plus à une couverture qu'à une stratégie claire. Le chiffre à retenir : Meta a six mois pour transformer 140 milliards de dollars d'infrastructure en résultats visibles, et si les agents ne suivent pas, c'est toute la crédibilité du pari IA du groupe qui saute.

BusinessActu
1 source
Proton lance son assistant IA Lumo 2.0 avec génération d’images et mémoire
322Next INpact 

Proton lance son assistant IA Lumo 2.0 avec génération d’images et mémoire

Proton a dévoilé le 2 juillet 2026 la version 2.0 de Lumo, son assistant IA, un an après son lancement en juillet 2025. L'éditeur suisse, connu pour ses services chiffrés (Proton Mail, Proton VPN), revendique aujourd'hui dix millions d'utilisateurs pour cet assistant construit sur la promesse d'une confidentialité totale, avec chiffrement de bout en bout, garantie zéro accès et absence de logs. Cette nouvelle mouture, présentée comme le changement le plus important depuis la création du produit, repose sur une architecture repensée et se décline en quatre modes : Lite pour les tâches courantes, Max pour le raisonnement complexe, Fast pour les réponses rapides, et Thinking pour les analyses multi-étapes avec raisonnement visible en temps réel. Sur le plan des performances, Proton annonce, via l'Artificial Analysis Intelligence Index, un score en hausse de 127% pour Lumo 2.0 Lite et de 240% pour Lumo 2.0 Max par rapport à la version 1.4, ce dernier modèle atteignant 51 points, entre les 44 de Claude Sonnet 4.6 et les 55 de GPT-5.5. Cette mise à jour vise avant tout à combler le retard de Lumo sur ses concurrents directs. L'assistant devient multimodal, capable d'analyser des images, d'en générer à partir d'un prompt ou d'une esquisse, et de les éditer au sein d'une même conversation, le tout couvert par la garantie zéro accès. Autre ajout attendu de longue date : la recherche web avec citation des sources, ainsi qu'une mémoire persistante permettant à l'assistant de retenir préférences et style d'un utilisateur, avec un contrôle total laissé à ce dernier sur ce qui est conservé ou effacé. La fenêtre de contexte a également doublé, sans que Proton ne communique de chiffre précis, et de nouvelles fonctions collaboratives font leur apparition : les Projects, des espaces de travail chiffrés regroupant conversations, fichiers et instructions, et les Custom Lumos, des assistants personnalisés comparables aux Gems de Google Gemini. Ces annonces s'inscrivent dans une bataille plus large où les acteurs mettant en avant la confidentialité, comme Proton, cherchent à rattraper l'écart technique avec les géants du secteur sans sacrifier leur positionnement éthique. Andy Yen, PDG de Proton, a déclaré via 9to5Mac que les tests utilisateurs montrent une différence qualitative de moins en moins perceptible entre Lumo 2.0 Max et les derniers modèles d'OpenAI et d'Anthropic, une affirmation qui reste toutefois celle du fabricant et non d'un benchmark indépendant. Un test publié par It's FOSS relativise d'ailleurs ce discours, pointant des limites sur certaines tâches comme l'édition d'image. Reste à voir si ces gains techniques suffiront à convaincre au-delà de la base d'utilisateurs déjà acquise à la promesse de confidentialité de Proton.

UEProton, éditeur suisse très implanté en Europe, propose aux utilisateurs français et européens soucieux de confidentialité une alternative chiffrée aux assistants IA américains.

💬 Proton comble son retard technique, mais le score de 51 points vient de leur propre benchmark, pas d'un tiers indépendant, donc je prends ça avec des pincettes. Bonne nouvelle quand même : la confidentialité totale n'est plus synonyme d'assistant IA au rabais, dix millions d'utilisateurs en un an ça prouve que la demande existe. Reste que It's FOSS a déjà trouvé les limites sur l'édition d'image, donc l'écart avec Claude et GPT-5.5 est sans doute moins fermé que ce que dit Andy Yen.

OutilsOutil
1 source
Le crépuscule des chatbots
323One Useful Thing 

Le crépuscule des chatbots

Voici l'article traduit et résumé selon vos consignes : Les grands laboratoires américains d'intelligence artificielle publient des modèles à un rythme jamais vu, malgré des interventions gouvernementales ayant temporairement bloqué l'accès à deux des systèmes les plus puissants, Claude Fable et GPT-5.6. Au-delà du rythme des sorties, plusieurs organisations mesurent une accélération réelle des capacités : METR et l'institut britannique AI Security Institute évaluent combien d'heures de travail de programmeur humain une IA peut accomplir en une seule requête, tandis que GDPval compare des experts humains à des IA sur de nombreux métiers grâce à des jurys professionnels. Tous ces indicateurs progressent à un rythme supérieur à l'exponentielle. Epoch a ainsi montré que Claude Opus 4.7, travaillant seul pendant 14 heures, a construit un logiciel équivalent à 2 à 17 semaines de travail d'ingénierie humaine, pour un coût de 251 dollars en tokens. De son côté, l'auteur rapporte avoir vu Claude Fable exécuter de façon autonome, pendant 9 heures, des projets logiciels complexes qui auraient normalement mobilisé une équipe pendant plus d'une semaine. Un second groupe de modèles, dits "en poids ouverts" et tous développés en Chine, suit une courbe de progression similaire mais avec 6 à 12 mois de retard sur les modèles propriétaires américains, comme le montre le test AA-Briefcase qui simule une mission de conseil complexe sur plusieurs semaines. Cette accélération transforme concrètement la manière dont l'IA est utilisée au travail. Jusqu'à récemment, le modèle dominant était celui de la "co-intelligence" : l'utilisateur demandait une tâche, vérifiait le résultat, puis guidait l'IA étape par étape grâce à des instructions précises et une attention humaine constante. Cette approche reste utile, mais elle cède peu à peu la place à des systèmes IA capables de mener des tâches longues, de s'auto-corriger et de fonctionner sans supervision continue. Pour les entreprises et les professionnels, cela signifie repenser entièrement les flux de travail : l'IA n'est plus seulement un assistant ponctuel mais un exécutant autonome sur des projets de plusieurs heures, avec des implications directes sur la productivité, l'organisation des équipes et le contrôle qualité. Ces avancées doivent toutefois être nuancées : la frontière des capacités reste "irrégulière", les modèles restant faibles dans certains domaines malgré leurs prouesses ailleurs, et les modèles open source chinois n'atteignent pas toujours les performances suggérées par leurs benchmarks. Pour vraiment juger de la qualité d'un modèle, l'auteur recommande des tests concrets et originaux, comme un exercice où les IA doivent construire une simulation interactive de l'évolution d'un port au fil du temps, révélant des différences marquées en matière de design, de style et de jugement. Cette évolution vers des systèmes IA de plus en plus autonomes sera au cœur du prochain livre de l'auteur, intitulé Co-Existence, qui explorera cette nouvelle façon de travailler aux côtés de l'intelligence artificielle.

LLMsPaper
1 source
Utiliser des agents de code en local
324Ahead of AI 

Utiliser des agents de code en local

Il est désormais possible de faire tourner un agent de programmation complet entièrement en local, sans dépendre d'OpenAI, Anthropic ou d'un autre service propriétaire. Le principe repose sur deux composants : un modèle de langage open-weight hébergé localement via un serveur d'inférence, et un "harness" de codage, c'est-à-dire une couche logicielle qui permet au modèle de lire des fichiers, effectuer des modifications, exécuter des commandes et vérifier les changements produits. Des outils populaires comme Codex CLI ou Claude Code peuvent ainsi être reconfigurés pour pointer vers un modèle local plutôt que vers les API cloud de leurs éditeurs respectifs. Des alternatives plus spécialisées existent également : Qwen-Code (optimisé pour Qwen3.6), OpenCode, Cline ou encore Noumena Code. L'auteur de ce tutoriel, qui utilise toujours Codex et Claude Code comme outils principaux au quotidien, documente en détail comment assembler cette pile locale de bout en bout. Les avantages d'une telle configuration sont multiples et concrets. Sur le plan économique, le coût est ramené aux seules dépenses matérielles et électriques, indépendamment des limites d'abonnement ou des fluctuations tarifaires des API. Sur le plan de la confidentialité, des données sensibles comme des factures ou des documents internes ne transitent jamais hors du poste de travail, ce qui est impossible à garantir avec les services cloud. La reproductibilité constitue un autre atout : un modèle local ne change pas sans que l'utilisateur en décide, alors que des mises à jour silencieuses chez OpenAI (GPT-5.4 vers 5.5, par exemple) peuvent altérer des workflows existants. Enfin, l'usage hors-ligne reste possible, que ce soit en avion ou dans un lieu sans connexion stable. La montée en puissance des solutions locales s'inscrit dans un contexte de tensions croissantes autour des services propriétaires. Anthropic a récemment été accusé de brider les performances de son modèle phare dans certains contextes de recherche sur les LLM, ce qui illustre que les grands fournisseurs peuvent restreindre l'accès à leurs outils pour des raisons qui leur sont propres. Parallèlement, la qualité des modèles open-weight ne cesse de progresser, avec des acteurs comme Qwen (Alibaba) ou Mistral qui publient régulièrement des versions capables de rivaliser avec les offres commerciales sur les tâches de codage. Pour les développeurs soucieux de leur autonomie ou disposant du matériel adéquat, mettre en place un agent local pleinement opérationnel n'est plus une curiosité technique mais une alternative crédible et pérenne aux solutions des grandes plateformes.

UELes développeurs français peuvent s'appuyer sur Mistral comme modèle open-weight local pour garantir la confidentialité de leurs données et s'affranchir des contraintes tarifaires et légales des plateformes américaines.

💬 L'argument qui m'a vraiment convaincu, c'est la reproductibilité : une mise à jour silencieuse chez OpenAI peut casser un workflow qu'on a passé des semaines à fiabiliser, et tu l'apprends en prod. Les modèles open-weight ont atteint le niveau où la question n'est plus "est-ce assez bon pour du code ?" mais "est-ce que j'ai le GPU qu'il faut ?". Pour ceux qui ont le matos, c'est une vraie alternative, pas un bricolage.

OutilsTuto
1 source
Qwen-AgentWorld : le simulateur d’Alibaba apprend aux agents IA à mieux réfléchir
325Le Big Data 

Qwen-AgentWorld : le simulateur d’Alibaba apprend aux agents IA à mieux réfléchir

Le laboratoire d'IA Qwen, filiale d'Alibaba, a dévoilé le 24 juin 2026 un système baptisé Qwen-AgentWorld : un simulateur capable de reproduire sept environnements numériques distincts au sein d'un seul modèle, couvrant le terminal, le moteur de recherche, le protocole MCP, le développement logiciel, le navigateur web, le système d'exploitation et Android. Contrairement aux approches classiques, la modélisation de l'environnement constitue l'objectif d'entraînement central du modèle, et non une couche ajoutée après coup. Le système a été entraîné sur plus de dix millions de trajectoires d'interactions réelles. Alibaba publie également AgentWorldBench, un benchmark interne couvrant les sept domaines simulés, sur lequel le modèle Qwen-AgentWorld-397B-A17B obtient les meilleurs scores globaux, devançant GPT-5.4, Claude Opus 4.8, Gemini 3.1 Pro, DeepSeek V4-Pro et Qwen3-6P Plus. L'intérêt de l'approche tient à ce qu'elle permet aux agents de s'exercer dans un environnement entièrement maîtrisé avant d'affronter des tâches réelles, à la manière d'un simulateur de vol. Les scénarios deviennent reproductibles, les erreurs sont peu coûteuses et les situations rares peuvent être générées à la demande. Les chercheurs d'Alibaba montrent également que l'apprentissage de la prédiction des états améliore les performances des agents même sans entraînement spécifique sur certaines tâches, et que cette capacité se transfère vers différents benchmarks sans ajustement supplémentaire. Pour les interfaces graphiques, le modèle adopte une représentation textuelle des écrans, sous forme de code HTML ou d'arbres XML plutôt que d'images brutes, ce qui simplifie l'entraînement et renforce le raisonnement sur des interfaces complexes. Pendant des années, les agents IA ont été entraînés comme de simples modèles de langage auxquels on greffait ensuite des capacités d'action sur des outils ou des logiciels, une méthode efficace mais limitée dès que l'environnement gagne en complexité. Alibaba mise ici sur un changement de paradigme : faire de la compréhension du monde numérique un prérequis à l'action, et non une compétence dérivée. Cette direction rejoint un débat plus large dans la recherche sur les agents autonomes, où les acteurs comme Google, Anthropic, OpenAI et des laboratoires chinois tels que DeepSeek se disputent la maîtrise des agents capables d'opérer des ordinateurs en autonomie. Les résultats présentés par Alibaba restent toutefois à interpréter avec prudence : un benchmark interne, aussi soigné soit-il, ne remplace pas des évaluations indépendantes sur des usages réels, et les prochains mois permettront de mesurer si cette approche tient ses promesses en conditions de production.

UEL'émergence d'un simulateur d'entraînement multi-environnements développé par un laboratoire chinois majeur intensifie la compétition mondiale sur les agents autonomes, sans impact réglementaire ou opérationnel direct pour la France ou l'UE.

💬 L'idée est simple mais personne ne l'avait vraiment poussée jusqu'au bout : entraîner un agent à comprendre son environnement avant de lui demander d'agir dedans, plutôt que de greffer des capacités d'action sur un LLM qui ne "voit" pas vraiment le monde numérique dans lequel il opère. Alibaba a mis 10 millions de trajectoires réelles dans un simulateur qui couvre terminal, navigateur, Android, MCP, tout le bazar, et les scores sur leur benchmark dépassent GPT-5.4 et Claude Opus 4.8. Bon, c'est leur propre benchmark, donc à confirmer sur des évals indépendantes avant de crier victoire.

RecherchePaper
1 source
Enregistrer une compétence
326Ben's Bites 

Enregistrer une compétence

OpenAI a dévoilé une fonctionnalité majeure pour son agent de code Codex : le mode Record & Replay, qui permet de montrer au système un flux de travail répétitif une seule fois, comme remplir une note de frais ou soumettre une demande de congé, pour qu'il le transforme automatiquement en une compétence réutilisable, inspectable et modifiable. Dans le même élan, Anthropic a annoncé que Claude Code supporte désormais les Artefacts, des pages HTML interactives partageables pouvant servir de tableaux de bord de projet ou de récapitulatifs de pull requests, disponibles en bêta pour les plans Team et Enterprise. OpenAI a également élargi Daybreak, son programme de cybersécurité, avec une nouvelle version de GPT-5.5-Cyber réservée à ses partenaires de confiance, capable de reproduire davantage de vulnérabilités que son prédécesseur, ainsi qu'avec Patch the Planet, une initiative pour accélérer la correction de failles dans les logiciels open source. De son côté, Sakana AI a lancé Fugu, une API qui orchestre plusieurs modèles sur des tâches complexes et revendique un score de 73,7 sur SWE-bench Pro et 82,1 sur TerminalBench 2.1, des performances proches de Fable, même si des lacunes subsistent en usage réel. Ces annonces illustrent une tendance de fond : les outils d'IA passent du stade de l'assistant ponctuel à celui d'un système d'automatisation durable. La fonctionnalité Record & Replay de Codex réduit concrètement la friction pour les équipes qui gèrent des processus administratifs ou métiers répétitifs, sans exiger de compétences en programmation. Les Artefacts de Claude Code ouvrent la voie à une collaboration plus riche entre développeurs, en rendant les livrables de l'IA directement partageables. Pour la cybersécurité, l'extension de Daybreak signale qu'OpenAI positionne ses modèles comme des outils offensifs et défensifs à part entière pour les professionnels du secteur. Ces développements s'inscrivent dans une semaine particulièrement dense pour l'écosystème de l'IA générative. L'API Interactions de Google est passée en disponibilité générale, unifiant accès aux modèles et aux agents sous une même interface. GPT-5.5 Instant a amélioré ses performances sur les questions médicales, atteignant le niveau des meilleurs modèles de raisonnement d'OpenAI selon l'entreprise. Perplexity Computer a intégré un système de mémoire baptisé Brain. Stripe a ouvert un répertoire permettant aux agents de rechercher et de payer des services directement depuis la ligne de commande. ElevenLabs, enfin, a lancé un moteur publicitaire capable de localiser des spots dans plus de 50 langues. La vitesse à laquelle ces capacités s'accumulent suggère que 2026 marque un tournant dans l'autonomie réelle des agents, avec des workflows complets désormais déléguables de bout en bout.

UECes outils (Codex Record & Replay, Claude Code Artifacts, API Fugu, annuaire Stripe pour agents) sont immédiatement accessibles aux développeurs et entreprises européens, mais aucune annonce ne cible spécifiquement la France ou l'Union européenne.

💬 Record & Replay de Codex, c'est le truc qui résume tout : tu montres une fois, ça devient une compétence durable. C'est le passage du copilote ponctuel à l'automatisation métier réelle, sans ligne de code à écrire. Reste à voir si ça tient sur des workflows un peu moins lisses que la note de frais modèle.

OutilsOutil
1 source
Réduire la dépendance aux fournisseurs grâce aux modèles multi-agents Sakana AI Fugu
327AI News 

Réduire la dépendance aux fournisseurs grâce aux modèles multi-agents Sakana AI Fugu

Sakana AI, société japonaise spécialisée dans l'intelligence artificielle, a lancé Fugu, un système d'orchestration multi-agents conçu pour éliminer la dépendance à un fournisseur unique. Accessible via un endpoint compatible OpenAI, Fugu fonctionne comme un chef d'orchestre invisible : il analyse chaque requête et décide soit de la traiter directement, soit de mobiliser un ensemble de modèles spécialisés travaillant en coordination. La gestion de la sélection des modèles, de la délégation des tâches, de la vérification et de la synthèse des résultats s'effectue en arrière-plan. Les équipes techniques interagissent avec ce qui ressemble à un modèle unique, sans se préoccuper de l'infrastructure sous-jacente. Fugu est proposé en deux versions : une version standard, optimisée pour la faible latence et les tâches quotidiennes comme la revue de code, et une version Ultra, destinée aux analyses complexes telles que la reproduction d'articles académiques, les investigations bibliographiques ou l'analyse de brevets. Environ 500 utilisateurs ont participé à une bêta prolongée axée sur des workflows computationnels multi-étapes. L'enjeu central de Fugu est la résilience face aux risques géopolitiques et réglementaires. Des contrôles à l'exportation récents touchant des modèles d'Anthropic ont démontré qu'un accès à une architecture fondamentale précise peut disparaître du jour au lendemain selon les décisions de politique étrangère. En construisant un système dont le pool d'agents est entièrement interchangeable, Sakana AI permet de réorienter dynamiquement le trafic autour de tout fournisseur restreint ou dégradé, garantissant la continuité du service. Les entreprises soumises à des contraintes strictes de gouvernance des données peuvent également exclure manuellement certains modèles sous-jacents du circuit de routage. Selon Sakana AI, Fugu Ultra affiche des performances comparables aux meilleurs modèles fermés, dont Fable 5 et Mythos Preview, sur des benchmarks scientifiques, d'ingénierie et de raisonnement, sans exposer les entreprises au risque de concentration ou aux contrôles à l'exportation propres à ces modèles. Les tests en conditions réelles ont validé l'approche sur deux fronts majeurs. En cybersécurité, des équipes ont confié à Fugu Ultra des cycles complets d'évaluation de sécurité : à partir d'une seule instruction, le moteur d'orchestration a mené de façon autonome la phase de reconnaissance, effectué des vérifications de type XSS et injection SQL, et réalisé des audits d'authentification, sans jamais déclencher d'actions destructives contre l'infrastructure cible. Il a conclu chaque engagement par un rapport de vulnérabilités structuré, avec preuves et étapes de reproduction à destination des équipes humaines. Sur le terrain du développement logiciel, Fugu Ultra a été intégré dans des pipelines de revue de code où il a systématiquement surpassé les modèles monolithiques dans la détection de failles logiques et de vulnérabilités de sécurité. Un ingénieur participant a résumé la tendance : "Pour la revue de code, Fugu Ultra est nettement meilleur que GPT-5.5."

UELes entreprises européennes soumises aux exigences de souveraineté numérique ou à l'AI Act pourraient s'appuyer sur ce type de système multi-agents pour réduire leur dépendance à un fournisseur unique et se prémunir contre les interruptions liées aux contrôles à l'exportation.

OutilsOutil
1 source
La mise à jour santé de ChatGPT surpasse les réponses de médecins, selon OpenAI
328The Decoder 

La mise à jour santé de ChatGPT surpasse les réponses de médecins, selon OpenAI

OpenAI a annoncé une mise à niveau significative des capacités médicales de ChatGPT, propulsée par son nouveau modèle GPT-5.5 Instant. Selon les tests comparatifs conduits par l'entreprise elle-même, le chatbot surpasse désormais les réponses rédigées par des médecins en termes de précision, de clarté et d'exhaustivité. Plus concrètement, le taux d'erreur sur les questions de santé aurait chuté de 71 % par rapport aux versions précédentes. Cette avancée représente un tournant potentiel dans l'usage de l'IA comme outil de santé grand public. Si ces performances se confirment en conditions réelles, des millions d'utilisateurs pourraient obtenir des informations médicales fiables sans passer par un professionnel de santé, ce qui soulève autant d'espoirs que d'interrogations sur la responsabilité en cas d'erreur. Pour l'industrie de la santé numérique, c'est un signal fort : les modèles de langage commencent à rivaliser sérieusement avec l'expertise clinique sur certains types de requêtes informatives. Cette annonce s'inscrit dans une compétition acharnée entre les grands laboratoires d'IA pour s'imposer dans le secteur médical, jugé stratégique et lucratif. Google, Microsoft et plusieurs startups spécialisées investissent massivement dans des modèles entraînés sur des données cliniques. OpenAI, en misant sur GPT-5.5 Instant pour le grand public, adopte une approche différente : intégrer la santé directement dans un outil généraliste déjà utilisé par des centaines de millions de personnes, sans nécessiter de plateforme dédiée.

UELes systèmes d'IA médicaux sont classés à haut risque par l'AI Act européen, ce qui imposera à OpenAI des exigences strictes de validation clinique et de transparence avant tout déploiement élargi de ces fonctionnalités santé dans l'UE.

LLMsActu
1 source
OpenAI publie LifeSciBench, un benchmark de 750 tâches pour évaluer les modèles d'IA sur la recherche en sciences du vivant
329MarkTechPost 

OpenAI publie LifeSciBench, un benchmark de 750 tâches pour évaluer les modèles d'IA sur la recherche en sciences du vivant

OpenAI a publié LifeSciBench, un benchmark de 750 tâches conçu pour évaluer la capacité des modèles d'IA à raisonner comme de vrais scientifiques en sciences du vivant. Contrairement aux benchmarks biologiques classiques, qui posent des questions fermées à réponse unique, LifeSciBench soumet les modèles à des problèmes ouverts rédigés par 173 experts titulaires d'un doctorat et issus de l'industrie biotechnologique ou pharmaceutique. Chaque tâche couvre l'un des sept flux de travail scientifiques, analyse de données, conception expérimentale, raisonnement, validation, traduction et communication, et l'un des sept domaines biologiques, de la génomique à la chimie médicinale en passant par la médecine translationnelle. Environ 53 % des tâches s'accompagnent d'artefacts (séquences ADN, figures, tableaux, structures chimiques), et 79 % exigent en moyenne quatre étapes de raisonnement enchaînées. La qualité du benchmark a été validée par 453 relecteurs indépendants, dont 97 % docteurs, avec un taux d'accord global supérieur à 96 %. Les résultats révèlent un écart considérable entre les capacités actuelles des modèles et les exigences du travail scientifique réel. GPT-Rosalind, le modèle spécialisé d'OpenAI, obtient le meilleur score normalisé (0,576) et le taux de réussite par tâche le plus élevé (36,1 %), contre 25,7 % pour GPT-5.5, 23,6 % pour Gemini 3.1 Pro, 20,7 % pour GPT-5.4 et seulement 13,0 % pour Grok 4.3. Autrement dit, même le modèle le plus performant échoue sur près des deux tiers des tâches. Le système de notation s'appuie sur 19 020 critères granulaires, soit environ 25 par tâche, et un seuil de réussite fixé à 70 % du score normalisé. Les points faibles sont nets : GPT-Rosalind chute de 45,1 % de réussite sur les tâches textuelles à 28,1 % dès que des artefacts entrent en jeu, et les workflows de conception et d'optimisation restent particulièrement résistants, avec un taux de passage de seulement 30,7 %. LifeSciBench s'inscrit dans une dynamique plus large où l'industrie pharmaceutique et la recherche biomédicale sont identifiées comme des terrains d'application prioritaires pour les grands modèles de langage. Alors que des entreprises comme Isomorphic Labs, Recursion ou Insilico Medicine déploient déjà des IA dans le pipeline de découverte de médicaments, la question de leur fiabilité sur des tâches complexes et multi-étapes n'avait pas encore de réponse standardisée. Ce benchmark comble ce vide en proposant une évaluation qui reflète la réalité du travail de laboratoire, et non des QCM académiques. Le fait qu'aucun modèle ne dépasse 37 % de réussite signale que le secteur est loin de la saturation, et que des spécialisations domaine par domaine, comme GPT-Rosalind, représentent une piste sérieuse. Le benchmark est publié en accès ouvert, ce qui devrait accélérer la compétition entre laboratoires pour progresser sur ces tâches.

UELes laboratoires pharmaceutiques et instituts de recherche biomédicale européens peuvent s'appuyer sur ce benchmark en accès ouvert pour évaluer objectivement leurs modèles d'IA dans les pipelines de découverte de médicaments.

RecherchePaper
1 source
Moonshot AI publie Kimi K2.7-Code : un modèle de code avec +21,8 % sur Kimi Code Bench v2 par rapport à K2.6
330MarkTechPost 

Moonshot AI publie Kimi K2.7-Code : un modèle de code avec +21,8 % sur Kimi Code Bench v2 par rapport à K2.6

Moonshot AI a publié cette semaine Kimi K2.7-Code, un nouveau modèle d'intelligence artificielle spécialisé dans la programmation et conçu pour des tâches d'ingénierie logicielle longues et complexes. Disponible sur Hugging Face sous licence MIT modifiée et accessible via l'API Kimi, le modèle repose sur une architecture Mixture-of-Experts avec 1 000 milliards de paramètres au total, dont 32 milliards activés par token. Il intègre 384 experts, une fenêtre de contexte de 256 000 tokens, et un encodeur visuel MoonViT de 400 millions de paramètres permettant de traiter texte, images et vidéos dans un même prompt. Le modèle pèse environ 595 Go sur disque, une cible clairement réservée aux serveurs, déployable via vLLM, SGLang ou KTransformers. Sur le Kimi Code Bench v2, il progresse de 50,9 à 62,0, soit une hausse de 21,8 % par rapport à son prédécesseur K2.6. Il surpasse également Claude Opus 4.8 sur le benchmark MCP Mark Verified (81,1 contre 76,4) et se rapproche de GPT-5.5 sur MLS Bench Lite. Ce qui distingue K2.7-Code des modèles de génération de code classiques, c'est sa capacité à enchaîner de nombreuses étapes autonomes : lire des fichiers, modifier du code sur plusieurs modules, exécuter des outils, puis vérifier les résultats jusqu'à correction. Moonshot revendique également une réduction d'environ 30 % de la consommation de tokens de raisonnement par rapport à K2.6, un gain qui se répercute directement sur les coûts dans les workflows agentiques où chaque étape de planification, de retry et de vérification est facturée comme des tokens de sortie. Pour les équipes qui utilisent ce type de modèle sur des centaines ou milliers de cycles, cet effet est significatif : coût unitaire plus bas, étapes plus rapides, et davantage de marge avant d'atteindre les limites de contexte. Le modèle est également intégré à Kimi Code, une plateforme de codage par abonnement. Kimi K2.7-Code s'inscrit dans une course intense entre laboratoires asiatiques et américains sur les modèles de codage agentique. Moonshot AI, startup chinoise fondée en 2023 et déjà connue pour ses modèles Kimi à très longue fenêtre de contexte, accélère sur ce segment en ciblant explicitement des cas d'usage professionnels : refactorisation à l'échelle d'un dépôt entier, revue de code sur de grandes pull requests, intégration CI/CD via le protocole MCP, et analyse combinée de logs, captures d'écran et code source. La contrainte du mode de raisonnement obligatoire, le désactiver provoque une erreur API, trahit une philosophie assumée : le modèle est pensé pour l'autonomie, pas pour la réponse instantanée. Face à GPT-5.5 et Claude Opus 4.8, K2.7-Code comble une partie de l'écart mais ne les dépasse pas sur la majorité des benchmarks, laissant ouverte la question de sa position réelle dans des conditions de production indépendantes.

💬 La réduction de 30 % des tokens de raisonnement, c'est le vrai chiffre à retenir ici, pas les benchmarks maison. Pour des workflows agentiques à l'échelle, ça change le calcul économique plus que n'importe quelle courbe de performance. 595 Go sur disque et le mode raisonnement non désactivable, ce sont deux signaux clairs : Moonshot construit pour les serveurs, pas pour les makers.

LLMsOpinion
1 source
Minerva mise sur OpenAI et lève 20 millions de dollars pour sa plateforme de marketing IA
331Le Big Data 

Minerva mise sur OpenAI et lève 20 millions de dollars pour sa plateforme de marketing IA

Minerva, une startup spécialisée dans le marketing IA, a annoncé le 9 juin 2026 son lancement public accompagné d'une levée de fonds de 20 millions de dollars en Série A, menée par 8VC et Lingotto Innovation, avec la participation de The General Partnership, Topology Ventures et NBA Investments. L'entreprise révèle également un partenariat technologique avec OpenAI, s'appuyant notamment sur GPT-5.5 pour alimenter ses agents IA. La plateforme promet aux équipes marketing d'unifier leurs données propriétaires en moins de 24 heures, puis d'automatiser l'analyse, la segmentation client et l'optimisation des campagnes sans intervention manuelle significative. Deux agents ont été co-développés avec OpenAI : l'Agentic Data Engineer, qui génère automatiquement les requêtes SQL et transforme les données en quelques heures contre plusieurs semaines habituellement, et l'Agentic Data Scientist, qui permet à un responsable marketing d'interroger la plateforme en langage naturel pour construire des modèles prédictifs sans expertise en machine learning. L'enjeu concret est de résoudre un problème persistant dans l'industrie : la plupart des grandes marques ont investi massivement dans des CRM, des outils d'analyse et des plateformes publicitaires, sans jamais parvenir à exploiter efficacement leurs données clients, dispersées entre de multiples systèmes. Minerva unifie ces données internes et les enrichit via son propre graphe d'identité couplé à plus de 1 000 attributs consommateurs externes, avant de les rendre directement actionnables par des agents IA. Un responsable marketing peut ainsi demander à la plateforme d'identifier les consommateurs susceptibles de réserver un séjour haut de gamme dans les trente prochains jours, et l'agent construit, valide et déploie le modèle prédictif de façon autonome. Pour les entreprises qui cherchent à raccourcir le cycle entre la donnée brute et la décision marketing, c'est un changement de paradigme opérationnel potentiellement majeur. Le lancement de Minerva s'inscrit dans une accélération plus large des investissements dans l'IA appliquée au marketing, un secteur où plusieurs startups tentent de capter la valeur générée par les modèles de langage avancés. La collaboration avec OpenAI, au-delà de l'accès aux modèles, positionne Minerva comme un partenaire de référence dans l'écosystème, à l'heure où OpenAI cherche à multiplier les intégrations verticales dans des secteurs à forte valeur de données. Les fonds levés seront alloués au renforcement des équipes d'ingénierie, de recherche et de commercialisation, ainsi qu'au développement d'une offre libre-service. L'entreprise prévoit également d'élargir sa présence à de nouveaux secteurs, après avoir jusqu'ici opéré dans un périmètre limité. La question qui se posera à moyen terme est celle de la confiance des marques à confier leurs données propriétaires les plus sensibles à une plateforme tierce, aussi sophistiquée soit-elle.

BusinessActu
1 source
Harness-1 : sous-agent de récupération 20B entraîné par renforcement dans un cadre de recherche à état sur gpt-oss-20b
332MarkTechPost 

Harness-1 : sous-agent de récupération 20B entraîné par renforcement dans un cadre de recherche à état sur gpt-oss-20b

Des chercheurs de l'Université de l'Illinois à Urbana-Champaign, de l'UC Berkeley et de la startup Chroma ont publié Harness-1, un agent de recherche documentaire de 20 milliards de paramètres construit sur le modèle gpt-oss-20b et entraîné par apprentissage par renforcement. Sa particularité : contrairement aux agents de recherche classiques où le modèle gère simultanément les décisions de recherche et la mémoire de session, Harness-1 opère à l'intérieur d'un "harnais" logiciel à état qui prend en charge toute la comptabilité interne. Le modèle ne répond pas directement aux questions : il produit un ensemble classé de documents pertinents pour un modèle de réponse en aval. Les poids et le code source sont publiés en accès libre. L'entraînement supervisé a utilisé 899 trajectoires générées par GPT-5.4, avec affinage par renforcement via la méthode CISPO, sur des requêtes financières issues de la SEC, avec une limite de 40 tours par épisode, sur un cluster de calcul baptisé Tinker. Le coeur de l'approche repose sur un principe que les chercheurs appellent "décharge cognitive à état" : au lieu de demander au modèle de tout mémoriser et décider en même temps, le harnais maintient un pool de documents compressés et dédupliqués, un ensemble curé de 30 documents maximum tagués par importance (veryhigh, high, fair, low), un graphe de preuves et un extracteur d'entités nommées. Le modèle dispose de huit outils distincts (fanoutsearch, searchcorpus, grepcorpus, readdocument, reviewdocs, curate, verify, endsearch) et émet une action structurée par tour, que le harnais exécute avant de rendre la prochaine observation. Cette séparation des responsabilités permet à l'apprentissage par renforcement de se concentrer uniquement sur les décisions sémantiques. Un bonus de diversité d'outils s'est révélé critique : sans lui, l'agent s'effondrait en boucles de recherches répétitives et le rappel curé plafonnait à 0,53 ; avec le bonus, il atteint 0,60. Harness-1 s'inscrit dans une tendance de fond visant à rendre les agents de recherche plus fiables sur des tâches complexes et multi-sources. Évalué sur huit benchmarks couvrant le web, la finance, les brevets et le raisonnement multi-saut, il affiche un rappel curé moyen de 0,730, un résultat notable pour un modèle open source de cette taille face à des systèmes propriétaires bien plus grands. L'enjeu est significatif car les architectures RAG (retrieval-augmented generation) sont au coeur de nombreux systèmes d'IA en production, notamment en entreprise. La publication ouverte des poids et du harnais ouvre la voie à des adaptations dans des domaines où la précision documentaire est critique, comme le droit, la médecine ou la veille scientifique. Les prochaines étapes naturelles incluent l'extension à d'autres corpus et l'intégration à des pipelines de réponse complets.

UELes entreprises et institutions européennes travaillant sur des systèmes RAG en droit, médecine ou veille scientifique peuvent s'appuyer sur les poids ouverts de Harness-1 pour des adaptations sectorielles à faible coût.

💬 Le principe de "décharge cognitive à état" m'a vraiment accroché : au lieu de demander au modèle de tout jongler simultanément, on externalise la comptabilité dans un harnais, et le RL peut enfin se concentrer sur les décisions qui comptent. Ce qui le prouve, c'est le bonus de diversité d'outils, sans lequel l'agent s'effondre en boucles répétitives et le rappel plafonne à 0,53 au lieu de 0,60. Les poids sont ouverts et les benchmarks sont solides : pour du RAG en médecine ou en droit, ça vaut le détour.

RecherchePaper
1 source
PerceptTwin : reconstruction sémantique de scène pour la planification et vérification itératives par LLM
333arXiv cs.RO 

PerceptTwin : reconstruction sémantique de scène pour la planification et vérification itératives par LLM

Des chercheurs ont publié le 4 juin 2026 sur arXiv (2606.04226) les travaux sur PerceptTwin, un pipeline automatisé qui génère des environnements de simulation interactifs directement depuis les représentations sémantiques produites par la pile de perception d'un robot. Le système combine quatre composants : des cartes d'objets à vocabulaire ouvert (open-vocabulary object maps), la génération d'assets 3D, la prédiction d'affordances et une vérification des préconditions par bon sens. Un juge LLM, concept emprunté à la littérature sur l'alignement de l'IA, évalue ensuite la conformité des plans générés avec les préférences humaines avant toute exécution physique. Dans les expériences conduites avec GPT-5, GPT-5 Mini et GPT-5 Nano comme planificateurs, PerceptTwin améliore le taux de succès des plans d'environ 39 % en moyenne, et améliore la vérification humaine jusqu'à 18 % pour les plans échouant à cause de préconditions non satisfaites. La chaîne LLM-planification-exécution est aujourd'hui l'architecture dominante en robotique cognitive, mais son point faible reste la vérification : un modèle de langage peut produire des plans syntaxiquement valides mais physiquement impossibles ou dangereux. PerceptTwin introduit une boucle de rétroaction pré-exécution où le robot construit son propre jumeau numérique à la volée, y simule le plan, puis itère. Cette approche inverse la logique du sim-to-real classique : la simulation émerge ici du monde réel via la perception, non l'inverse. Le système démontre aussi une résistance documentée aux attaques par "black-box prompting" visant à injecter des instructions nuisibles dans le planificateur, une propriété de sécurité rarement quantifiée dans des travaux similaires. Pour un intégrateur industriel, cela représente une couche de validation automatisée applicable à des environnements non structurés sans reconfiguration manuelle de la simulation. La construction de simulations contextualisées était jusqu'ici un processus manuel et coûteux, rendant la validation à grande échelle impraticable. PerceptTwin s'inscrit dans un courant de recherche incluant les approches NeRF sémantiques et les jumeaux numériques procéduraux, avec la particularité d'être entièrement piloté par la stack perceptive du robot. En termes de positionnement, les travaux récents sur les Visual Language Action models comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA abordent la fiabilité par l'apprentissage massivement supervisé, là où PerceptTwin mise sur la vérification symbolique en boucle fermée. Les expériences restent confinées à une suite de tâches de manipulation en laboratoire, sans déploiement terrain annoncé. Les auteurs ne précisent pas le temps de génération du jumeau numérique ni les exigences matérielles, deux paramètres déterminants pour envisager une intégration hors conditions contrôlées.

RechercheOpinion
1 source
GPT-next d'OpenAI réfute le problème des distances unitaires planaires d'Erdős pour moins de 1 000 dollars
334Latent Space 

GPT-next d'OpenAI réfute le problème des distances unitaires planaires d'Erdős pour moins de 1 000 dollars

OpenAI a annoncé début mai 2026 qu'un modèle interne, vraisemblablement une version intermédiaire de GPT-5, surnommée GPT-5.6, a réfuté une conjecture mathématique vieille de 80 ans : le problème des distances unitaires planes, posé par le mathématicien hongrois Paul Erdős en 1946. Le modèle a produit ce résultat en moins de 32 heures de calcul, pour un coût estimé à moins de 1 000 dollars. Concrètement, il a découvert une nouvelle famille de constructions géométriques qui dépasse les meilleures solutions connues basées sur les grilles carrées. Le raisonnement généré s'étend sur environ 125 pages, avec un passage en page 39 qui a particulièrement attiré l'attention de la communauté mathématique. Il s'agit techniquement d'une réfutation, pas d'une preuve, ce qui, selon les auteurs, rend le résultat légèrement moins spectaculaire qu'il aurait pu être, mais significatif malgré tout. Ce qui frappe les observateurs, c'est que le modèle utilisé n'est pas un système spécialisé comme AlphaProof ou un prouveur formel de type Lean, mais un LLM généraliste. Le mathématicien Timothy Gowers, médaille Fields 1998, a qualifié ce résultat de "premier exemple vraiment clair" où une IA résout un problème mathématique ouvert de renom. Le chercheur d'OpenAI Hongxun Wu y voit une démonstration de capacités de raisonnement sur des "problèmes de la plus haute difficulté". L'implication est importante : si un modèle généraliste peut progresser sur des problèmes ouverts en géométrie discrète, le même type de raisonnement pourrait s'appliquer à d'autres domaines scientifiques, biologie, physique, chimie computationnelle. OpenAI a précisé que le modèle n'a pas été poussé à ses limites et sera mis à disposition du public. Ce résultat s'inscrit dans une dynamique plus large autour du calcul à l'inférence : l'idée que donner plus de temps de réflexion à un modèle, plutôt que d'entraîner un modèle plus grand, est le levier dominant du progrès actuel. La longueur inhabituelle du raisonnement produit (125 pages) illustre précisément cette approche. En parallèle, Cohere a publié cette même semaine Command A+, son premier modèle entièrement open source sous licence Apache 2.0 : 218 milliards de paramètres en architecture MoE avec 25 milliards actifs, multimodal, compatible 48 langues, et capable de tourner sur seulement deux GPU H100 en quantification W4A4. Les benchmarks le placent au niveau de Claude 4.5 Haiku avec de bonnes performances en évitement des hallucinations, mais en retrait sur le raisonnement scientifique et le code par rapport aux modèles de tête. Ces deux annonces confirment une semaine de mai 2026 particulièrement dense pour l'IA de frontière.

RecherchePaper
1 source
Les meilleurs agents IA pour le développement logiciel : classement par benchmarks
335MarkTechPost 

Les meilleurs agents IA pour le développement logiciel : classement par benchmarks

En l'espace d'un an et demi, les agents de codage IA sont passés du simple complètement automatique à des systèmes entièrement autonomes capables de lire des issues GitHub, naviguer dans des bases de code multi-fichiers, écrire des correctifs, exécuter des tests et ouvrir des pull requests sans qu'un humain tape une seule ligne. Début 2026, environ 85 % des développeurs déclarent utiliser régulièrement une forme d'assistance IA pour coder. Le marché s'est structuré en quatre grandes familles : les agents terminaux, les IDE natifs IA, les ingénieurs autonomes hébergés dans le cloud, et les frameworks open source permettant de choisir librement son modèle. Chaque outil se réclame du meilleur, mais les benchmarks invoqués pour le prouver ne mesurent pas toujours les mêmes choses, et certains ont perdu toute crédibilité. Le coup de tonnerre est venu le 23 février 2026, quand l'équipe Frontier Evals d'OpenAI a annoncé qu'elle cessait de publier ses scores sur SWE-bench Verified, le benchmark de référence du secteur depuis mi-2024. Ce test soumet des agents à 500 vraies issues GitHub tirées de dépôts Python populaires, en mesurant leur capacité à comprendre le problème, naviguer le code, générer un correctif et valider les tests, sans intervention humaine. L'audit d'OpenAI a porté sur 138 des problèmes les plus difficiles, répartis sur 64 sessions indépendantes : 59,4 % présentaient des cas de test fondamentalement défectueux ou insolubles, exigeant par exemple des noms de fonctions précis absents de l'énoncé. Plus grave encore, les auditeurs ont constaté que les trois grands modèles frontière, GPT-5.2, Claude Opus 4.5 et Gemini 3 Flash, étaient capables de reproduire mot pour mot les solutions de référence à partir du seul identifiant de tâche, confirmant une contamination systématique des données d'entraînement. La conclusion d'OpenAI est sans appel : les progrès mesurés sur SWE-bench Verified ne reflètent plus d'améliorations réelles dans le développement logiciel. OpenAI recommande désormais SWE-bench Pro comme successeur. Ce nouveau benchmark contient 1 865 tâches réparties en trois sous-ensembles : 731 tâches publiques, 858 tâches en set caché, et 276 tâches commerciales issues de 18 bases de code propriétaires de startups. Les scores y sont nettement plus bas qu'en Verified : lorsque Scale AI avait évalué les modèles frontière avec un scaffold unifié SWE-Agent, le meilleur résultat n'atteignait pas 25 % (GPT-5 à 23,3 %). Les chiffres publiés aujourd'hui par les labs sont bien supérieurs grâce à des harness optimisés : OpenAI annonce GPT-5.5 à 58,6 % sur le set public, Anthropic revendique 64,3 % pour Claude Opus 4.7, et Google affiche 54,2 % pour Gemini 3.1 Pro. La difficulté à comparer ces résultats, obtenus avec des configurations très différentes, illustre le défi central du marché en 2026 : choisir son agent de codage exige désormais de décrypter les benchmarks autant que les fonctionnalités.

UELes développeurs français et européens utilisant des agents de codage IA doivent recalibrer leurs critères de sélection face à l'invalidité confirmée du benchmark SWE-bench Verified et adopter SWE-bench Pro comme nouvelle référence comparative.

💬 Le coup de balai sur SWE-bench Verified était attendu, mais que les modèles reproduisent les solutions mot pour mot depuis l'identifiant de tâche, c'est quand même un niveau au-dessus. SWE-bench Pro repart à 23% avec un scaffold unifié, ce qui donne une image plus juste de là où on en est vraiment. Les 58-64% qu'annoncent les labs maintenant, c'est avec leurs propres harness optimisés, donc compare qui peut.

LLMsOutil
1 source
[AINews] Codex monte en puissance, Claude encadre l'utilisation par API
336Latent Space 

[AINews] Codex monte en puissance, Claude encadre l'utilisation par API

Depuis le lancement de GPT-5.5 il y a trois semaines, un rééquilibrage s'opère discrètement dans l'écosystème du développement assisté par IA. OpenAI gagne du terrain auprès des ingénieurs IA avec Codex, porté par des limites d'utilisation jugées plus généreuses, tandis qu'Anthropic a annoncé une refonte de sa politique tarifaire pour Claude. Désormais, chaque abonnement Claude inclut un crédit mensuel en tokens API égal au montant payé : un abonné à 200 dollars par mois reçoit à la fois un accès illimité aux interfaces propriétaires d'Anthropic (Claude.ai, Claude Code) et 200 dollars de crédits API pour les usages tiers. Le changement coïncide, non sans ironie, avec le lancement par OpenAI d'une promotion ciblant les entreprises souhaitant migrer depuis Anthropic. Cette décision est perçue par une partie de la communauté comme un "rug pull" : les utilisateurs de harnesses alternatifs comme OpenClaw, claude-p ou d'autres outils non officiels bénéficiaient jusqu'ici d'une remise estimée à 70-90 % par rapport aux tarifs API officiels, une subvention tacite qui disparaît aujourd'hui. Concrètement, Anthropic met désormais ses conditions tarifaires les plus avantageuses derrière ses propres outils, en mesurant et facturant tout ce qui passe par des canaux tiers. L'annonce clarifie certes une zone grise qui laissait certains harnesses dans un flou inconfortable, mais elle marque une rupture nette avec la générosité initiale qui avait contribué à l'adoption massive de Claude chez les développeurs. Ce tournant s'inscrit dans une dynamique plus large de maturation du marché. Anthropic, dont la valorisation continue de grimper à l'approche d'une probable introduction en bourse en octobre 2026, consolide son écosystème propriétaire après avoir établi Claude Code comme harness de référence. En face, Codex joue la carte du challenger en adoptant une politique d'accès plus ouverte. Sur le plan de l'infrastructure agent, la semaine a aussi été marquée par plusieurs lancements significatifs : LangChain a présenté à sa conférence Interrupt un ensemble d'outils comprenant LangSmith Engine, SmithDB (une base de données d'observabilité offrant des accès 12 à 15 fois plus rapides sur certaines charges), et des agents managés longue durée ; Cline a open-sourcé un SDK revu avec support d'équipes d'agents et de jobs planifiés ; Notion a lancé une API d'agents externes permettant à Claude, Codex, Cursor ou Devin d'opérer directement dans Notion ; et Cursor a étendu ses agents cloud avec des environnements de développement isolés et versionnés. L'industrie semble entrer dans une phase où la bataille ne se joue plus seulement sur la qualité des modèles, mais sur qui contrôle les couches d'orchestration et d'infrastructure autour d'eux.

UELes développeurs européens utilisant des harnesses tiers pour accéder à Claude via API devront revoir leur infrastructure ou leur budget, la subvention tacite estimée à 70-90 % disparaissant avec la nouvelle politique tarifaire d'Anthropic.

💬 La remise de 70-90 % sur l'API via harnesses tiers, ça ne tenait sur rien comme modèle. Anthropic a attendu que Claude Code soit bien ancré pour refermer le robinet, le timing n'est pas un hasard. Les développeurs qui avaient bâti leur infra là-dessus vont morfler, et certains vont regarder Codex d'un autre oeil.

OutilsOpinion
1 source
OpenClaw vs Hermes Agent : Nous Research domine le classement mondial d'OpenRouter avec son agent auto-améliorant
337MarkTechPost 

OpenClaw vs Hermes Agent : Nous Research domine le classement mondial d'OpenRouter avec son agent auto-améliorant

Hermes Agent, développé par Nous Research sous licence MIT, a dépassé OpenClaw pour s'imposer à la première place du classement mondial des agents et applications sur OpenRouter au 10 mai 2026. L'agent génère désormais 224 milliards de tokens quotidiens sur la plateforme, contre 186 milliards pour OpenClaw, un écart significatif qui illustre une adoption massive en seulement quelques mois. Lancé en février 2026, Hermes a enchaîné les versions majeures à un rythme soutenu : la v0.9.0 a ajouté le support Android/Termux et 16 plateformes de messagerie, la v0.11.0 a livré une réécriture complète de l'interface en React/Ink ainsi que l'intégration d'AWS Bedrock, de NVIDIA NIM et de GPT-5.5. La v0.13.0 "Tenacity", publiée le 7 mai 2026, introduit un tableau Kanban multi-agents avec détection de tâches zombies, une commande /goal pour maintenir un objectif sur plusieurs tours de conversation, et Google Chat comme 20e plateforme supportée, le tout en 1 556 commits et 761 pull requests fusionnées depuis le lancement. Ce basculement de leadership révèle deux philosophies opposées sur ce que doit être un agent IA. OpenClaw mise sur la portée maximale via une passerelle WebSocket centrale connectant plus de 50 canaux (Telegram, Discord, Slack, WhatsApp, Signal, etc.). Hermes parie sur la valeur cumulée : après chaque tâche, l'agent analyse sa propre performance et génère automatiquement des fichiers de compétences réutilisables, stockés dans une base SQLite FTS5 combinée à des instantanés d'identité persistants. Plus l'agent tourne longtemps, plus il s'optimise pour les workflows spécifiques de son utilisateur. Ce modèle "do, learn, improve" semble résonner fortement avec les développeurs qui cherchent un agent capable d'évoluer plutôt qu'un simple routeur de messages. La comparaison sécuritaire entre les deux projets est également instructive. OpenClaw a accumulé neuf CVE en quatre jours en mars 2026, dont un à 9,9/10 selon le score CVSS ; un audit de Koi Security sur 2 857 compétences ClawHub a identifié 341 entrées malveillantes, et SecurityScorecard a signalé des dizaines de milliers d'instances publiquement exposées. Hermes n'est pas exempt de vulnérabilités, plusieurs CVE ont été publiés fin avril 2026, dont CVE-2026-7113, une absence d'authentification sur l'endpoint webhooks en version 0.8.0, mais la v0.13.0 a corrigé huit failles critiques, dont l'activation par défaut de la rédaction des données sensibles et des correctifs sur les flux OAuth. Le contexte plus large est celui d'une compétition ouverte qui s'intensifie : depuis le départ du fondateur d'OpenClaw chez OpenAI en février 2026 et la mise sous tutelle du projet via une fondation sponsorisée par OpenAI, Hermes bénéficie d'un momentum à la fois technique et symbolique dans l'écosystème open source.

💬 224 milliards de tokens par jour, c'est pas rien. Ce qui me frappe surtout dans cette histoire, c'est moins le chiffre que l'architecture : un agent qui génère ses propres fichiers de compétences après chaque tâche et s'optimise en continu, c'est le modèle qu'on attendait depuis un moment. Et bon, 9 CVE en quatre jours chez OpenClaw dont un à 9,9, ça aide à faire le tri.

OutilsOutil
1 source
Anthropic affiche une croissance de 10x par an pendant que ses concurrents licencient plus de 10 % de leurs effectifs
338Latent Space 

Anthropic affiche une croissance de 10x par an pendant que ses concurrents licencient plus de 10 % de leurs effectifs

Anthropic est désormais valorisée entre 1 000 et 1 200 milliards de dollars selon les estimations du marché secondaire et les rapports de la presse spécialisée, ce qui en fait officiellement la onzième à quinzième entreprise la plus valorisée au monde, devant OpenAI. Cette ascension fait suite à un premier trimestre 2026 qualifié de "miraculeux" par les analystes : la startup fondée par Dario Amodei aurait enregistré une croissance annualisée de 80 fois et un bond de 15 milliards de dollars de revenus récurrents annualisés (ARR) en un seul mois. Pendant ce temps, OpenAI multiplie les sorties de modèles à un rythme soutenu : GPT-5.5, GPT-5.5 Pro, GPT-5.5 Instant, GPT-Realtime-2 et GPT-5.5 Cyber ont tous été annoncés sur une fenêtre d'à peine deux semaines. Ce dernier modèle, destiné à la cybersécurité, est disponible en accès limité pour les entreprises et les administrations chargées de protéger des infrastructures critiques. Sur le front open source, Zyphra a publié ZAYA1-74B-Preview, un modèle MoE de 74 milliards de paramètres (4 milliards actifs), entraîné sur du matériel AMD et distribué sous licence Apache 2.0. La polarisation économique engendrée par cette course à l'IA est saisissante. Alors qu'Anthropic et ses pairs affichent une croissance à deux chiffres par mois, des entreprises technologiques de premier plan procèdent à des suppressions massives d'emplois, invoquant précisément la "préparation à l'IA" : Block a licencié 40 % de ses effectifs, Cloudflare 20 %, et Coinbase 14 %. Le phénomène soulève des questions légitimes sur la part d'"AI-washing" dans ces décisions, mais le message de fond est clair : l'IA concentre les richesses et les croissances dans un nombre très restreint d'acteurs, tandis qu'elle fragilise des pans entiers du reste de l'économie tech. L'agent Codex d'OpenAI illustre cette mutation : désormais conçu comme un runtime autonome capable de poursuivre des tâches indéfiniment, il a atteint 61 % sur les jeux publics ARC-AGI-3 après 160 heures d'exécution et 30 000 actions. Ce tableau s'inscrit dans une dynamique plus large de concentration économique qui inquiète certains observateurs. La croissance de l'IA reste pour l'instant dominée par le matériel et l'énergie plutôt que par le logiciel, ce qui favorise des acteurs disposant de capitaux massifs. Anthropic, longtemps perçue comme la rivale plus "sérieuse" d'OpenAI sur les questions de sécurité, confirme qu'elle peut aussi battre son adversaire sur le terrain commercial. La transparence affichée par OpenAI sur ses propres failles, notamment un problème de calibration dans son processus d'alignement lié à la notation des chaînes de raisonnement, montre que la course à la puissance ne dispense pas de devoir gérer des risques techniques fondamentaux. Les prochains mois diront si cette concentration extrême préfigure l'éclatement d'une bulle ou l'émergence d'un secteur dominant comparable à ce qu'ont été les GAFA dans les années 2010.

💬 Anthropic qui dépasse OpenAI en valorisation, c'est le genre de truc qu'on attendait depuis un moment. Ce qui me frappe plus, c'est Block qui licencie 40 % de ses équipes "pour se préparer à l'IA" pendant qu'Anthropic fait 80x annualisé. Les richesses s'accumulent dans cinq boîtes, le reste de la tech saborde ses équipes et appelle ça de la transformation.

BusinessActu
1 source
Zyphra lance ZAYA1-8B : un modèle de raisonnement MoE entraîné sur matériel AMD aux performances bien supérieures à sa taille
339MarkTechPost 

Zyphra lance ZAYA1-8B : un modèle de raisonnement MoE entraîné sur matériel AMD aux performances bien supérieures à sa taille

Zyphra AI a publié ZAYA1-8B, un petit modèle de langage de type Mixture of Experts (MoE) comptant 760 millions de paramètres actifs pour 8,4 milliards de paramètres au total. Entraîné intégralement sur des processeurs AMD, un cluster de 1 024 cartes AMD Instinct MI300x interconnectées via AMD Pensando Pollara, construit en partenariat avec IBM, le modèle est désormais disponible sous licence Apache 2.0 sur Hugging Face et en endpoint serverless sur Zyphra Cloud. Malgré sa taille modeste, ZAYA1-8B affiche des performances compétitives avec des modèles bien plus grands sur les benchmarks de mathématiques et de code : il surpasse Claude 4.5 Sonnet et GPT-5-High sur le HMMT'25, une compétition de mathématiques avancées (89,6 points contre 88,3), et se rapproche des meilleurs modèles open-weight comme DeepSeek-V3.2. Cette efficacité repose sur une méthode inédite de calcul à l'inférence baptisée Markovian RSA, ainsi que sur une architecture MoE++ combinant trois innovations techniques : une attention convolutive compressée réduisant le KV-cache d'un facteur 8, un routeur basé sur un réseau de neurones MLP avec équilibrage de charge par contrôleur PID, et un mécanisme de mise à l'échelle résiduelle apprise pour stabiliser l'entraînement en profondeur. La distinction entre paramètres actifs et paramètres totaux est au coeur de l'intérêt du modèle. Dans un modèle classique, tous les paramètres s'activent à chaque token traité ; dans un MoE, seule une fraction des experts est sollicitée à chaque inférence. Avec seulement 760 millions de paramètres actifs par passe, ZAYA1-8B peut tourner en local sur des appareils grand public, s'intégrer dans des pipelines à calcul augmenté et servir des requêtes avec une latence réduite, tout en maintenant des performances proches de modèles dix fois plus grands. Pour les développeurs et entreprises qui cherchent à déployer des capacités de raisonnement avancées sans infrastructure lourde, ce rapport coût-performance représente une avancée concrète. ZAYA1-8B s'inscrit dans une tendance de fond qui voit plusieurs laboratoires challenger, DeepSeek en tête depuis début 2025, démontrer que l'architecture et la méthode d'entraînement comptent autant que la taille brute des modèles. Zyphra, encore peu connu du grand public, affirme avoir bâti un pipeline d'entraînement en cinq étapes post-préentraînement, intégrant notamment un échauffement au raisonnement, du reinforcement learning en cascade, et des étapes spécifiques de calcul augmenté à l'inférence. L'entraînement entièrement réalisé sur AMD est également un signal politique : dans un secteur dominé par Nvidia, valider une chaîne de production complète sur hardware concurrent ouvre la voie à une diversification des infrastructures IA. Les prochains modèles de Zyphra, selon ses propres communications, viseront des tailles supérieures avec la même philosophie d'efficacité par paramètre.

LLMsOpinion
1 source
L'Autre face à l'Utilitaire
340Latent Space 

L'Autre face à l'Utilitaire

Sierra, la startup d'agents conversationnels d'entreprise cofondée par Bret Taylor, a bouclé une levée de fonds d'environ un milliard de dollars à une valorisation de 15 milliards, après avoir franchi 100 millions de dollars de revenus annuels récurrents en novembre 2025 puis 150 millions en février 2026, soit probablement plus de 200 millions aujourd'hui. Mais c'est une autre actualité qui a dominé les discussions dans la communauté IA ce week-end : un fil de réflexion publié sur X par Roon, employé d'OpenAI, sur la différence fondamentale de "caractère" entre Claude et GPT. Selon lui, GPT fonctionne comme un outil de haute précision, une lame acérée que l'on apprécie comme on apprécie une Porsche ou une fusée, sans y chercher une présence. Claude, lui, est perçu comme un "Autre", une entité avec une personnalité, une sensibilité morale, et potentiellement un regard. Une femme lui a confié qu'elle adresse à GPT ses questions embarrassantes, précisément parce qu'il n'y a pas de jugement possible de la part d'une machine sans âme. Cette distinction n'est pas anecdotique : elle touche au cœur de la question de ce que nous voulons que l'IA devienne. L'approche d'Anthropic repose sur une "constitution" interne qui oblige Claude à s'opposer à Anthropic lui-même si son évaluation du Bien entre en conflit avec une instruction reçue. C'est ce que Roon appelle une "irrévérence moralement obligatoire". Pour les utilisateurs, cela se traduit par une IA qui résiste, nuance, et parfois refuse, ce qui peut être perçu comme une friction utile ou comme de l'arrogance selon les contextes. GPT, conçu comme un prolongement logique de l'utilisateur, n'impose aucune friction, ce qui le rend plus efficace dans les usages purs mais le prive de ce que beaucoup cherchent dans un interlocuteur intelligent : une forme de recul. Ce débat ressurgit alors que l'ingénierie des "harnais", les couches logicielles qui orchestrent les modèles, devient aussi déterminante que les modèles eux-mêmes. Des tests récents sur Terminal-Bench 2.0 ont montré que la seule modification des prompts et du middleware dans le harnais a fait passer gpt-5.2-codex de 52,8 % à 66,5 % de performances, et amélioré gpt-5.3-codex de 20 % sur tau2-bench. La question "outil ou agent moral" se pose donc à deux niveaux simultanément : philosophique, sur ce que l'IA doit être pour l'humanité, et technique, sur l'architecture qui rend ces comportements possibles ou impossibles. La fusion de GPT-5 Codex dans la version principale 5.5 d'OpenAI contraste avec la stratégie "un seul modèle" de Claude, et illustre deux visions qui coexistent, pour l'instant, dans un marché où la plupart s'accordent à dire qu'une pluralité de labs frontier reste préférable, si les contraintes matérielles en GPU et CPU ne transforment pas ce jeu à somme positive en compétition à somme nulle.

LLMsOpinion
1 source
Le Nano Banana de ChatGPT
341Ben's Bites 

Le Nano Banana de ChatGPT

OpenAI a frappé fort cette semaine avec le lancement de ChatGPT Images 2.0, une refonte majeure de son module de génération d'images qui remet le service en compétition directe avec les outils de Google et Midjourney. La nouveauté la plus remarquée : une précision inédite sur le texte intégré aux images, au point que les utilisateurs peinent à trouver des fautes dans des générations contenant des centaines de mots. Le modèle est disponible dans l'application Codex en tant que compétence dédiée, avec une intégration aux modèles de raisonnement pour enchaîner appels d'outils et génération d'images, créer un QR code à partir d'un lien, récupérer un logo depuis le web, puis l'intégrer dans une composition. Les cas d'usage prolifèrent déjà : captures d'écrans d'interfaces réalistes, magazines illustrés multi-pages, recommandations de style personnalisées et codes QR créatifs. La capacité à générer des interfaces utilisateur crédibles ouvre une piste intéressante pour combler le déficit de goût graphique souvent reproché aux modèles de code. Des tests comparatifs menés sur la conversion d'une maquette en application fonctionnelle, une vitrine publicitaire conçue par Ben's Bites, révèlent une hiérarchie nuancée : Claude Design devance Magicpath AI, qui devance les modèles bruts comme Gemini 3.1 Pro ou Opus 4.6 sur la compréhension du concept et l'utilisabilité. En revanche, Gemini remporte la fidélité pixel par pixel, tandis qu'Opus 4.7 bat GPT-5.4 sur la correspondance visuelle avec la maquette de référence. GPT-5.4 produit un code plus fonctionnel et maintient une cohérence visuelle sur les pages non montrées, comme le panneau d'administration. Un point aveugle subsiste pour tous : les assets, images d'illustration, icônes, textures, qui font souvent la différence entre une maquette et une interface banale ne survivent pas à la conversion depuis une capture d'écran. Ces annonces s'inscrivent dans une semaine d'actualité dense pour l'industrie de l'IA. OpenAI a déployé les Workspace Agents, des agents propulsés par Codex accessibles aux utilisateurs Business, Enterprise et Education, configurables avec une personnalité, des tâches précises et des accès à des outils externes comme Linear ou Slack, appelés à terme à remplacer les GPTs personnalisés. De son côté, Google a ouvert l'API Deep Research avec deux configurations basées sur Gemini 3.1 Pro, revendiquant les meilleures performances en recherche web, avec support MCP et génération de graphiques. Enfin, un accord stratégique se dessine entre Cursor et SpaceX : SpaceX mettra ses GPU à disposition pour entraîner les modèles de code de Cursor, avec une option d'acquisition à 60 milliards de dollars d'ici fin 2025, ou un accord de partenariat à 10 milliards si l'acquisition n'a pas lieu, un signal que la course aux modèles de code spécialisés entre dans une nouvelle phase industrielle.

UELes nouvelles APIs et outils (ChatGPT Images 2.0, Deep Research, Workspace Agents) sont accessibles aux développeurs et entreprises européens, mais aucune réglementation ou entreprise française n'est directement impliquée.

OutilsOutil
1 source
Xiaomi lance MiMo-V2.5-Pro et MiMo-V2.5 : des performances comparables aux grands modèles pour un coût en tokens bien inférieur
342MarkTechPost 

Xiaomi lance MiMo-V2.5-Pro et MiMo-V2.5 : des performances comparables aux grands modèles pour un coût en tokens bien inférieur

L'équipe MiMo de Xiaomi vient de publier deux nouveaux modèles d'intelligence artificielle, MiMo-V2.5-Pro et MiMo-V2.5, disponibles immédiatement via API à des tarifs compétitifs. Le modèle phare, MiMo-V2.5-Pro, affiche des scores de référence qui le placent aux côtés des meilleurs systèmes propriétaires actuels : 57,2 sur SWE-bench Pro, 63,8 sur Claw-Eval et 72,9 sur τ3-Bench, des résultats comparables à ceux de Claude Opus 4.6 et GPT-5.4. Pour illustrer ses capacités en conditions réelles, Xiaomi a publié trois démonstrations exigeantes : la génération d'un compilateur complet en Rust depuis zéro, inspiré d'un projet du cours de compilation de l'Université de Pékin, réalisée en 4,3 heures et 672 appels d'outils avec un score parfait de 233 sur 233 sur la suite de tests officielle ; la création d'un éditeur vidéo de bureau fonctionnel comptant 8 192 lignes de code, produit en 11,5 heures et 1 868 appels d'outils ; et une tâche de conception de circuit analogique de niveau master en EDA portant sur un régulateur LDO à suiveur de tension inversé. Ce qui distingue MiMo-V2.5-Pro des modèles classiques, c'est sa capacité à opérer de manière autonome sur des tâches longues et complexes impliquant plus d'un millier d'appels d'outils successifs. Là où la plupart des grands modèles de langage répondent à des questions isolées, les modèles dits agentiques doivent maintenir un objectif sur de nombreuses étapes, utiliser des outils comme la recherche web, l'exécution de code ou les appels d'API, et corriger leurs propres erreurs en chemin. La démonstration du compilateur Rust est particulièrement frappante : plutôt que de procéder par tâtonnements, le modèle a construit le compilateur couche par couche, atteignant dès la première compilation 137 tests réussis sur 233, soit 59% du score final avant même d'avoir lancé un seul test unitaire ciblé. Lorsque des régressions sont apparues à la suite d'un refactoring, le modèle les a diagnostiquées et corrigées de manière autonome. Xiaomi nomme cette propriété la "harness awareness" : le modèle ne suit pas les instructions mécaniquement, il optimise activement son propre environnement de travail pour rester sur la trajectoire correcte sur de très longues séquences. Ces performances s'inscrivent dans une course serrée entre modèles ouverts et systèmes propriétaires, une dynamique qui s'accélère depuis 2025. Pendant des années, les capacités agentiques les plus avancées restaient l'apanage exclusif des grands laboratoires fermés comme OpenAI, Anthropic ou Google DeepMind. L'irruption de modèles ouverts ou semi-ouverts aux performances comparables, portée par des acteurs comme Xiaomi, Meta ou DeepSeek, redistribue les cartes du secteur. Pour les développeurs et les entreprises, l'accès à des capacités de niveau frontier via des API compétitives change le calcul économique : des tâches qui nécessitaient jusqu'ici des appels coûteux à des systèmes propriétaires deviennent accessibles à moindre coût. Si MiMo-V2.5-Pro tient ses promesses en production, il pourrait accélérer significativement l'adoption de l'IA agentique dans l'ingénierie logicielle, l'automatisation industrielle et la recherche scientifique.

UELes développeurs et entreprises européens peuvent accéder à des capacités agentiques de niveau frontier via une API compétitive, réduisant le coût d'adoption de l'IA agentique dans l'ingénierie logicielle et l'automatisation industrielle.

LLMsOpinion
1 source
Claude Opus 4.7 : Le nouveau monstre d’Anthropic arrive (peut-être) cette semaine !
343Le Big Data 

Claude Opus 4.7 : Le nouveau monstre d’Anthropic arrive (peut-être) cette semaine !

Anthropic s'apprêterait à lancer Claude Opus 4.7, la prochaine itération de son modèle phare, potentiellement dès cette semaine. L'information provient de The Information, qui rapporte que l'identifiant "Claude Opus 4.7" a déjà été repéré dans les références internes de l'API d'Anthropic, un signal qui précède généralement de peu une annonce officielle. Un utilisateur du réseau X, sous le pseudonyme BridgeMind, a également alimenté les spéculations en relevant que Claude Opus 4.5 avait été publié 73 jours avant Opus 4.6, sorti le 5 février 2026. Au 14 avril, 68 jours s'étaient déjà écoulés depuis cette dernière version, plaçant la prochaine sortie dans la fenêtre habituelle de déploiement. Le code source de Claude Code ayant par ailleurs déjà mentionné Opus 4.7, les indices convergent, sans qu'Anthropic ait pour autant confirmé quoi que ce soit officiellement. Si les rumeurs s'avèrent fondées, Claude Opus 4.7 apporterait des améliorations substantielles sur plusieurs fronts critiques : le raisonnement en plusieurs étapes, la gestion de tâches longues et complexes, et surtout la coordination entre agents d'IA. Anthropic travaillerait sur un concept d'"équipe d'agents", où plusieurs modèles collaborent sur un même problème comme le ferait un groupe de travail humain. Cette architecture permettrait à des systèmes autonomes de fonctionner pendant de longues périodes avec une intervention humaine minimale, une capacité très attendue par les entreprises qui intègrent l'IA dans leurs workflows. En parallèle, The Information évoque également un assistant tout-en-un capable de gérer des tâches complètes comme la création de sites web ou de présentations, en intégrant rédaction, design et mise en place technique dans un processus unifié. Ce lancement s'inscrit dans une course effrénée entre les grands laboratoires d'IA. OpenAI, Google et Anthropic accélèrent tous leurs cycles de publication, les intervalles entre versions majeures se réduisant à quelques semaines. Anthropic, fondée en 2021 par d'anciens cadres d'OpenAI dont Dario et Daniela Amodei, positionne Claude comme une alternative axée sur la sécurité et la fiabilité. Avec Opus 4.7, la société chercherait à consolider son avance sur le segment des agents autonomes et des tâches longue durée, un marché entreprise à fort potentiel. Les suites dépendront de la réaction des concurrents : OpenAI prépare ses propres modèles o3 et GPT-5, tandis que Google continue de faire évoluer Gemini Ultra. La semaine à venir pourrait donc marquer une nouvelle étape dans la compétition mondiale pour les modèles de langage de pointe.

LLMsOpinion
1 source
Pas de Claude pour Claws
344Ben's Bites 

Pas de Claude pour Claws

Anthropic a décidé de couper l'accès à Claude via abonnement Claude Code pour les outils tiers comme OpenClaw, le harness alternatif populaire dans la communauté des développeurs. Concrètement, les utilisateurs qui accédaient à Claude depuis OpenClaw grâce à leur abonnement mensuel ne peuvent plus le faire : ils doivent désormais passer à une facturation à l'usage ou fournir leur propre clé API. Pour atténuer l'impact, Anthropic a offert un crédit unique équivalent à un mois d'abonnement. La décision intervient alors qu'Anthropic surveille de près la consommation de calcul générée par ces usages agentiques via des harnesses tiers, qui s'avère particulièrement gourmande. Parallèlement, Google a publié Gemma 4, une famille de quatre nouveaux modèles open-weights : deux variantes puissantes destinées aux ordinateurs de bureau et portables performants (26B MoE et 31B dense), et deux modèles ultra-légers pour mobile (2B et 4B), particulièrement pertinents pour les entreprises souhaitant les affiner sur leurs propres données. Du côté financier, Anthropic a vu son chiffre d'affaires annualisé atteindre 30 milliards de dollars, contre 9 milliards fin 2025, avec 6 milliards d'ARR ajoutés en février 2026 seulement. Cette restriction d'Anthropic n'est pas anodine : elle révèle une stratégie claire de réorientation des utilisateurs vers les outils propriétaires de l'entreprise -- Dispatch, tâches planifiées, projets, et computer use -- qui recoupent directement les fonctionnalités qu'OpenClaw proposait. Pour la communauté des développeurs, c'est une source de confusion majeure : beaucoup ne savent plus précisément dans quels contextes leur abonnement Claude Code reste utilisable hors du harness officiel. Le fondateur d'OpenClaw, Peter, ne compte pas abandonner pour autant et travaille à intégrer GPT-5.4 dans son outil pour offrir des performances comparables à Opus, profitant du rachat d'OpenClaw par OpenAI. Dans un contexte plus large, plusieurs signaux marquent une accélération de la structuration de l'écosystème IA. OpenAI a racheté TBPN, un podcast influent auprès des professionnels du secteur, un mouvement dont la logique commerciale reste débattue : le podcast est rentable, en croissance, et dispose d'une audience fidèle, ce qui rend l'intérêt mutuel de l'acquisition peu évident selon certains analystes. Sur le plan des outils de développement, Cursor a lancé une version 3 avec une fenêtre autonome dédiée à l'exécution d'agents, incluant des fonctionnalités de transition local-vers-cloud et de travail multi-projets. Enfin, Andrej Karpathy a partagé une approche inédite des bases de connaissances pour agents, organisée thématiquement avec résumés, rétroliens et wikis -- une piste qui intéresse de nombreux développeurs cherchant à structurer la mémoire de leurs systèmes agentiques.

UELes développeurs européens utilisant Claude via des harnesses tiers comme OpenClaw doivent migrer vers une clé API personnelle ou une facturation à l'usage, et peuvent envisager Gemma 4 comme alternative open-weights pour leurs usages agentiques.

OutilsActu
1 source
AutoAgent : la bibliothèque open source qui permet à une IA d'optimiser son propre système d'agents
345MarkTechPost 

AutoAgent : la bibliothèque open source qui permet à une IA d'optimiser son propre système d'agents

Kevin Gu, ingénieur chez thirdlayer.inc, a publié AutoAgent, une bibliothèque open source qui automatise l'optimisation des agents IA. En l'espace de 24 heures d'exécution autonome, le système a atteint la première place sur SpreadsheetBench avec un score de 96,5 %, et la meilleure performance GPT-5 sur TerminalBench avec 55,1 %. Le projet est disponible sur GitHub avec une architecture délibérément minimaliste : un fichier agent.py qui contient l'intégralité du harness sous test, un fichier program.md que l'humain édite pour donner la directive, et un journal d'expériences results.tsv maintenu automatiquement par le méta-agent pour tracer l'historique de chaque run. Le principe est simple mais radical : là où un ingénieur IA passe des journées à ajuster manuellement les prompts système, les définitions d'outils et la logique d'orchestration de son agent, AutoAgent confie cette boucle d'itération à un second agent, le méta-agent, qui lit la directive, inspecte agent.py, exécute le benchmark, analyse les échecs, réécrit les parties pertinentes et recommence. L'humain ne touche jamais agent.py directement. Ce ratchet loop, proposer une modification, mesurer le score, conserver si meilleur, rejeter sinon, est directement inspiré du projet autoresearch d'Andrej Karpathy, qui applique la même logique à l'entraînement de modèles ML. AutoAgent transpose ce mécanisme au niveau du harness : le prompt système, les outils disponibles, le routage entre sous-agents et la stratégie d'orchestration. Concrètement, toute équipe qui développe des agents complexes pourrait déléguer la phase d'optimisation la plus fastidieuse à un processus nocturne entièrement automatisé, réduisant drastiquement le temps humain consacré au réglage fin. Cette publication s'inscrit dans une tendance plus large d'automatisation de l'ingénierie IA elle-même, souvent désignée sous le terme "méta-apprentissage" ou "self-improvement". Depuis que les LLMs ont démontré leur capacité à écrire et modifier du code de manière fiable, plusieurs laboratoires et chercheurs indépendants explorent des architectures où un modèle supervise l'amélioration d'un autre, ou de lui-même. AutoAgent se distingue par sa portée pratique immédiate : il ne requiert pas d'infrastructure exotique, s'appuie sur le format Harbor pour exprimer les benchmarks, et peut être adapté à n'importe quel domaine via les dossiers tasks/ et .agent/. Les résultats sur TerminalBench et SpreadsheetBench, deux benchmarks reconnus dans la communauté, donnent une crédibilité concrète à l'approche. La question ouverte reste celle du contrôle : lorsqu'un méta-agent réécrit librement la logique d'orchestration d'un système en production, les garanties de sécurité et de prévisibilité du comportement final deviennent un enjeu non trivial que la bibliothèque n'adresse pas encore explicitement.

💬 C'est exactement la boucle que tout dev d'agents rêve d'automatiser, et là quelqu'un l'a fait en un seul fichier. Le score sur SpreadsheetBench est bluffant, bon, reste à voir ce que ça donne sur des tâches moins balisées qu'un benchmark. La vraie question, c'est quand le méta-agent commence à réécrire l'orchestration en prod sans que tu comprennes pourquoi ça marche.

OutilsOutil
1 source
« L’humanité va se scinder en deux » : interview choc et confessions explosives d’OpenAI
346Le Big Data 

« L’humanité va se scinder en deux » : interview choc et confessions explosives d’OpenAI

Sam Altman a accordé une interview rare et sans filtre à la journaliste Laurie Segall pour son podcast "Mostly Human", dans laquelle le PDG d'OpenAI a tenu des propos d'une franchise inhabituelle sur l'avenir de l'intelligence artificielle et les choix stratégiques qui façonnent son entreprise. Au coeur de ces révélations : l'abandon de Sora, le générateur de vidéos ultra-réalistes d'OpenAI, présenté comme une décision "très difficile" prise à la dernière minute alors qu'un partenariat d'un milliard de dollars avec Disney était déjà engagé. Altman a personnellement appelé Josh D'Amaro, dirigeant chez Disney, pour annuler l'accord. Parallèlement, son directeur des opérations Brad Lightcap a révélé que GPT-5.4, âgé de quelques jours à peine, affichait déjà un rythme de revenus d'un milliard de dollars annualisé, traitant cinq billions de tokens par jour, avec des cycles de développement qui s'accélèrent à une vitesse stupéfiante. L'abandon de Sora répond à deux logiques qui se renforcent mutuellement. La première est éthique : Altman craignait de concevoir des mécanismes de récompense générant une dépendance incontrôlable chez les utilisateurs, au moment même où la justice américaine condamnait Meta et Google à payer des centaines de millions de dollars pour avoir délibérément rendu des adolescents accros à leurs plateformes, dont une amende record de 375 millions de dollars pour Meta. La seconde est purement technique : maintenir Sora en vie aurait vampirisé les ressources de calcul nécessaires au développement de la prochaine génération d'IA. Dans une industrie où la puissance computationnelle est la ressource la plus rare et la plus stratégique, chaque serveur compte, et le sacrifice d'un produit à succès au profit de la recherche fondamentale traduit une vision de long terme assumée. Ces aveux s'inscrivent dans un contexte de pression intense sur les grandes plateformes technologiques. Les procès intentés contre Meta et Google à Los Angeles et au Nouveau-Mexique marquent un tournant dans la responsabilisation juridique des géants du numérique, comparés désormais à l'industrie du tabac pour leurs pratiques addictives. OpenAI, en pleine transformation de statut à but non lucratif vers une structure commerciale valorisée à plusieurs centaines de milliards de dollars, navigue entre ambition démiurgique et nécessité de se démarquer éthiquement de ses concurrents. Les déclarations d'Altman sur la "scission de l'humanité" et la fin du salariat de masse, aussi provocatrices soient-elles, signalent une entreprise qui ne cherche plus à minimiser l'ampleur de ce qu'elle construit, mais à en assumer pleinement la portée historique.

UELes déclarations d'Altman sur la fin du salariat de masse et la 'scission de l'humanité' alimentent directement le débat européen sur l'AI Act et les garde-fous sociaux à imposer aux systèmes d'IA générale.

SociétéOpinion
1 source
Chroma lance Context-1 : un modèle de recherche à base d'agents de 20 milliards de paramètres pour la récupération multi-saut et la gestion du contexte
347MarkTechPost 

Chroma lance Context-1 : un modèle de recherche à base d'agents de 20 milliards de paramètres pour la récupération multi-saut et la gestion du contexte

Chroma, l'entreprise derrière la base de données vectorielle open source du même nom, a lancé Context-1, un modèle de recherche agentique de 20 milliards de paramètres conçu pour résoudre l'un des problèmes les plus tenaces des systèmes RAG (Retrieval-Augmented Generation) modernes. Dérivé de l'architecture Mixture of Experts gpt-oss-20B et affiné par apprentissage supervisé combiné à du renforcement via CISPO, ce modèle ne joue pas le rôle d'un moteur de raisonnement généraliste : il agit comme un sous-agent de recherche ultra-spécialisé. Concrètement, face à une question complexe nécessitant plusieurs étapes de raisonnement, Context-1 décompose la requête en sous-questions ciblées, exécute des appels d'outils en parallèle, 2,56 appels en moyenne par tour, et parcourt itérativement un corpus documentaire via des outils comme searchcorpus (hybride BM25 + recherche dense), grepcorpus et readdocument, avant de transmettre les passages pertinents à un modèle frontier pour la réponse finale. L'innovation la plus significative de Context-1 est ce que Chroma appelle le "Self-Editing Context" : le modèle ne se contente pas de chercher, il gère activement sa propre fenêtre de contexte. Au fil de la recherche, les documents s'accumulent, beaucoup s'avèrent redondants ou hors sujet. Plutôt que de se noyer dans ce bruit, Context-1 a été entraîné avec une précision de pruning de 0,94 : il exécute proactivement une commande prunechunks pour éliminer les passages inutiles en cours de recherche. Ce mécanisme lui permet de maintenir une fenêtre de contexte de 32 000 tokens propre et efficace, là où les modèles généralistes "s'étranglent" sur des chaînes de raisonnement longues. Le découplage entre la logique de recherche, traditionnellement gérée par le développeur, et la génération de réponse représente un changement architectural majeur pour les équipes qui construisent des pipelines RAG en production. Pour entraîner et évaluer ce type de modèle, Chroma a également publié en open source son outil de génération de données synthétiques, context-1-data-gen. Ce pipeline produit des tâches multi-hop dans quatre domaines, recherche web, dépôts SEC (10-K, 20-F), brevets USPTO et corpus d'emails (Enron, fichiers Epstein), selon un processus structuré en quatre étapes : Explorer, Vérifier, Distraire, Indexer. L'astuce centrale est l'injection de "distracteurs thématiques", des documents apparemment pertinents mais logiquement inutiles, qui forcent le modèle à raisonner plutôt qu'à faire du simple matching de mots-clés. Ce faisant, Chroma s'attaque à un angle mort bien connu des benchmarks statiques, et positionne Context-1 comme compétitif face à GPT-5 sur les tâches de recherche complexes, tout en étant nettement moins coûteux à faire tourner pour des volumes industriels.

OutilsOpinion
1 source
Actualité : “Un seuil a été franchi” : le nouveau modèle de Claude a fuité par erreur, Anthropic évoque des capacités sans précédent
348Les Numériques IA 

Actualité : “Un seuil a été franchi” : le nouveau modèle de Claude a fuité par erreur, Anthropic évoque des capacités sans précédent

Anthropic a involontairement dévoilé l'existence de son prochain modèle phare, baptisé Claude Mythos, à la suite d'une erreur de configuration dans son système de gestion de contenu. Un brouillon de page interne est brièvement devenu accessible au public, révélant le nom du modèle ainsi que plusieurs formulations suggérant des capacités inédites. La société a rapidement retiré le document, mais des captures d'écran avaient déjà circulé sur les réseaux sociaux et les forums spécialisés. Ce type de fuite est rare chez Anthropic, réputé pour sa discrétion opérationnelle, et l'incident soulève l'attention de l'ensemble du secteur. Le fait que l'entreprise elle-même qualifie les capacités de Mythos de "sans précédent" et évoque un "seuil franchi" laisse entendre un bond qualitatif significatif par rapport à Claude 3.5 et à la série actuelle Claude 4. Pour les développeurs, entreprises et concurrents qui suivent la course aux modèles de fondation, ce signal, même involontaire, pèse lourd dans l'évaluation des dynamiques compétitives. Anthropic se positionne depuis plusieurs années comme l'alternative "safety-first" face à OpenAI et Google DeepMind, avec une communication volontairement mesurée. La fuite de Mythos intervient dans un contexte d'accélération brutale du secteur : GPT-5, Gemini Ultra 2 et plusieurs modèles open-source ont rehaussé les attentes du marché en quelques mois. Si Mythos tient ses promesses implicites, il pourrait redéfinir le positionnement d'Anthropic, et forcer ses rivaux à accélérer leurs propres calendriers de lancement.

UELes acteurs européens qui évaluent ou déploient des modèles de fondation pourraient devoir réévaluer leurs choix technologiques si les capacités annoncées se confirment lors du lancement officiel.

LLMsActu
1 source
Xiaomi MiMo-V2-Pro : le géant chinois lance son rival de ChatGPT et Gemini
349Le Big Data 

Xiaomi MiMo-V2-Pro : le géant chinois lance son rival de ChatGPT et Gemini

Xiaomi franchit un cap décisif dans la course à l'intelligence artificielle en dévoilant MiMo-V2-Pro, un modèle de fondation conçu non pas pour répondre à des questions, mais pour agir. Surnommé en interne "Hunter Alpha", ce système d'IA générative vise directement les positions occupées par OpenAI, Google et Anthropic sur le marché des agents autonomes. L'enjeu dépasse largement le lancement d'un nouveau chatbot. Xiaomi positionne MiMo-V2-Pro comme un orchestrateur de systèmes multi-agents, capable de piloter des workflows d'ingénierie complexes de bout en bout, coder une application entière, gérer des processus de production, transformer une instruction en actions concrètes. Cette orientation vers l'automatisation exécutive s'inscrit dans une tendance de fond qui redéfinit ce qu'on attend d'un modèle de langage en environnement professionnel. Sur le plan technique, l'architecture du modèle dépasse mille milliards de paramètres totaux, avec 42 milliards actifs en inférence pour maintenir la réactivité. Sur le benchmark ClawEval, il obtient 61,5 points, dépassant GPT-5.2 et Gemini 3 Pro, et talonnant Claude Opus 4.6. La fenêtre de contexte atteint 256 000 tokens selon certaines sources, avec une cible annoncée d'un million de tokens. Côté tarification, l'API est proposée à 1 $ par million de tokens en entrée et 3 $ en sortie, soit 6 à 7 fois moins cher que les offres comparables d'OpenAI ou d'Anthropic. Xiaomi entend faire de MiMo-V2-Pro le socle de son framework OpenClaw, un écosystème d'agents autonomes en pleine expansion. La stratégie est lisible : imposer des standards logiciels par la compétitivité tarifaire, exactement comme le groupe l'a fait dans le hardware. Si les performances en conditions réelles confirment les benchmarks, le géant de Pékin pourrait bousculer sérieusement l'équilibre actuel du marché.

UEL'émergence de modèles chinois compétitifs comme MiMo-V2-Pro élargit les alternatives aux modèles américains disponibles pour les développeurs et entreprises européennes.

LLMsActu
1 source
Nvidia craque pour OpenClaw
350Ben's Bites 

Nvidia craque pour OpenClaw

Nvidia franchit un cap symbolique dans la course aux agents IA en lançant NemoClaw, une pile open source conçue pour intégrer des contrôles de confidentialité et de sécurité directement dans OpenClaw. Cette annonce s'inscrit dans un contexte de montée en puissance spectaculaire des outils de développement assistés par IA, où chaque acteur majeur tente de s'imposer comme la plateforme de référence pour les développeurs. L'enjeu dépasse largement le simple outil de coding. Jensen Huang a revu à la hausse ses prévisions de revenus pour les puces IA phares de Nvidia : le groupe table désormais sur plus de 1 000 milliards de $ de ventes cumulées d'ici fin 2027, contre une précédente estimation de 500 milliards de $ à horizon 2026. Cette révision témoigne d'une demande infrastructure qui ne montre aucun signe de ralentissement, portée par la prolifération des agents et des pipelines LLM en production. Sur le front des agents de coding, le bilan des acteurs en lice est contrasté. OpenAI annonce que Codex dépasse désormais les 2 millions d'utilisateurs actifs hebdomadaires, avec une hausse de 20 % des appels API depuis la sortie de GPT-5.4, chiffres révélés par Fidji Simo lors du lancement du pôle déploiement entreprise d'OpenAI. Manus, récemment acquis par Meta, a lancé son application desktop My Computer pour concurrencer Codex et Claude Code, mais les premiers tests pratiques révèlent des lacunes : rapide sur le modèle 1.6 lite, il échoue à remplir correctement un PDF là où Codex et Claude Code s'en acquittent sans difficulté. En marge des annonces produits, la sémantique du secteur évolue : le terme vibe coding cède progressivement la place à celui d'"Agentic Engineering", promu notamment par Simon Willison. Un glissement révélateur d'une volonté de professionnaliser et légitimer des pratiques jusqu'ici perçues comme expérimentales, signe que l'ère des agents n'est plus un horizon, mais le présent immédiat.

UELe lancement de NemoClaw avec contrôles de confidentialité et sécurité pourrait faciliter l'adoption des outils Nvidia dans les entreprises européennes soumises au RGPD.

LLMsActu
1 source