Aller au contenu principal

Recherche

50 sur 968 articles

Dernières avancées en recherche IA : papers, découvertes scientifiques, deep learning et nouvelles architectures.

Le biolab d'Anthropic fait une découverte qu'il compare à Crispr
Illustration générée par IA
1The Verge AI RecherchePaper

Le biolab d'Anthropic fait une découverte qu'il compare à Crispr

Anthropic affirme que son intelligence artificielle Claude a découvert de manière autonome un nouveau système enzymatique présentant des similitudes avec la machinerie moléculaire à l'origine de Crispr, l'outil d'édition génétique. Il s'agit du premier résultat produit par le laboratoire humide (wet lab) que l'entreprise vient de lancer. Selon Anthropic, Claude a identifié ce système en explorant une base de données massive de séquences d'ADN, l'intervention des chercheurs humains se limitant à la formulation du prompt initial et aux travaux de laboratoire nécessaires pour valider la découverte. Le processus a mobilisé près de 950 agents Claude fonctionnant en parallèle pendant 21 heures, traitant au total 210 millions de tokens, jusqu'à ce que l'un d'eux repère un motif répétitif inhabituel dans les données génétiques analysées. Cette annonce intervient à un moment stratégique pour Anthropic, qui prépare une entrée en bourse et cherche à démontrer l'utilité concrète de ses modèles au-delà du chatbot ou de l'assistance au code. Si la découverte se confirme scientifiquement, elle illustrerait la capacité de l'IA à accélérer la recherche biologique fondamentale, un domaine où l'exploration manuelle de bases de séquences prend habituellement des mois. Pour l'industrie biotechnologique, un système enzymatique comparable à Crispr ouvrirait potentiellement de nouvelles pistes pour l'édition génétique, avec des applications en médecine et en recherche fondamentale. Cette expérience s'inscrit dans une tendance où les grandes entreprises d'IA investissent dans des applications scientifiques pour prouver que leurs modèles dépassent la génération de texte. Le lancement d'un wet lab marque une étape vers l'intégration directe de l'IA dans le cycle expérimental, combinant calcul intensif et validation en laboratoire. Reste à voir si cette découverte résistera à l'examen par des pairs indépendants et débouchera sur des applications pratiques vérifiées.

1 source
Kyutai lance Voice of Reason, un modèle vocal natif qui résout des calculs énoncés à l'oral grâce à l'apprentissage par renforcement
Illustration générée par IA
2MarkTechPost 

Kyutai lance Voice of Reason, un modèle vocal natif qui résout des calculs énoncés à l'oral grâce à l'apprentissage par renforcement

Le laboratoire français Kyutai a publié Voice of Reason, deux modèles vocaux en poids ouverts qui résolvent des problèmes de mathématiques énoncés à voix haute, sans transcription ni modèle de langage textuel intermédiaire. Basés sur GLM-4-Voice-9B, ils combinent un affinage supervisé et un apprentissage par renforcement. Sur GSM8K adapté à l'oral, la précision passe de 27,3% pour le modèle de base à 77,1% pour la meilleure version publiée. L'entraînement supervisé s'appuie sur 150 616 problèmes d'Orca-Math, reformulés pour l'oral par Qwen3-235B et vocalisés par le système DSM de Kyutai. Pour le renforcement, mené sur 16 GPU H100 pendant 1500 mises à jour, un juge automatique, Qwen3-235B-A22B-2507, évalue les réponses sans voir la solution de référence, avec 88% d'accord avec des évaluateurs humains. Les deux versions, dont une variante « stitch » qui insère de courts blocs de raisonnement silencieux entre les segments parlés, tournent sur un seul GPU H100 et sont publiées sous la licence de GLM-4-Voice. Cette avancée compte parce que les modèles vocaux natifs accusaient un net retard en raisonnement face aux pipelines classiques qui enchaînent reconnaissance vocale, LLM textuel et synthèse, une architecture plus lente et qui perd les nuances de ton. Voice of Reason montre que ces gains tiennent en conditions réelles : transcrites automatiquement, les réponses du modèle stitch conservent 72% de précision, et la qualité de la voix, mesurée par UTMOSv2, reste quasiment inchangée après l'entraînement. Les progrès ne viennent pas de réponses plus longues, le modèle direct répondant même plus vite après renforcement, passant de 41,9 à 36,4 secondes en moyenne. Revers de la médaille, les connaissances générales du modèle reculent nettement sur le benchmark oral TriviaQA, signe que la spécialisation en mathématiques a un coût. Ces travaux s'inscrivent dans une course pour rapprocher les modèles vocaux natifs des pipelines en cascade et des grands modèles omnimodaux, qui restent en tête avec 84,7% pour Qwen2.5-Omni, 94,6% pour Qwen3-Omni et 95,7% pour une cascade appuyée sur un LLM de 31 milliards de paramètres. Kyutai revendique la première application du renforcement au raisonnement mathématique dans un modèle vocal natif, après la méthode STITCH qui avait porté le score à 58,7%. Deux choix techniques se sont révélés déterminants : une correction de température dans la fonction de perte, sans laquelle le score s'effondre à 12,3%, et la fusion des tokens audio en un seul token abstrait pour réduire la variance de l'apprentissage. Le renforcement se montre en outre très efficace avec peu de données, un entraînement prolongé sur seulement 10% du jeu supervisé atteignant 58,5% de précision, contre 43,9% pour l'affinage seul.

UEKyutai, laboratoire de recherche français, publie en open source une avancée technique sur les modèles vocaux natifs, renforçant la position de la France dans la recherche en IA vocale.

💬 Le vrai signal, c'est que le modèle répond plus vite après renforcement (36,4 secondes contre 41,9), donc les gains viennent d'un raisonnement mieux structuré et pas d'une réponse qui tourne plus longtemps en boucle. Reste que la spécialisation maths fait chuter les connaissances générales sur TriviaQA, donc Kyutai n'a pas encore un modèle vocal généraliste, juste une preuve que le raisonnement de bout en bout tient la route sans passer par du texte intermédiaire. Sur un seul GPU H100 et en poids ouverts, c'est le genre de brique qu'on va voir réapparaître ailleurs d'ici quelques mois.

RecherchePaper
1 source
Comment orienter le flux de votre langage
Illustration générée par IA
3Apple Machine Learning 

Comment orienter le flux de votre langage

Une nouvelle méthode baptisée "probe guidance" vient d'être présentée pour améliorer le guidage des modèles de flow matching, une famille de modèles génératifs proche de la diffusion. Contrairement à l'autoguidance, technique existante qui nécessite d'entraîner un second modèle "faible" et d'effectuer un passage supplémentaire dans le réseau à chaque étape de génération, cette nouvelle approche exploite directement les états internes gelés d'un modèle de diffusion déjà entraîné pour construire son signal de guidage. Appliquée aux modèles de langage à diffusion continue, cette technique établit un nouvel état de l'art en génération non conditionnelle, c'est à dire lorsque le modèle produit du texte sans contrainte de prompt particulière. L'intérêt principal tient à l'efficacité computationnelle: en supprimant le passage réseau additionnel requis par l'autoguidance classique, la méthode réduit le coût d'inférence tout en conservant, voire en améliorant, la qualité des textes générés. Elle apporte aussi une réponse à un problème connu de l'autoguidance, la difficulté à garantir que le modèle faible et le modèle fort partagent des dynamiques d'apprentissage cohérentes, ce qui peut dégrader la fiabilité du guidage. Pour les modèles de langage à diffusion, présentés comme une alternative aux architectures autorégressives classiques, ce gain de robustesse et de vitesse pourrait accélérer leur adoption. Cette avancée s'inscrit dans un courant de recherche plus large qui cherche à transposer aux modèles de langage des techniques nées dans la diffusion d'images, où l'autoguidance a démontré sa capacité à améliorer la fidélité des échantillons générés. Les modèles de diffusion pour le texte restent un champ en développement actif, en concurrence avec les transformeurs autorégressifs dominants, notamment pour leur potentiel de génération parallèle plus rapide. Les auteurs évoquent une extension possible de leur méthode à des tâches de génération conditionnelle, sans en détailler les résultats à ce stade.

RecherchePaper
1 source
Un Oscar, deux astéroïdes et l'algorithme dans votre sklearn : John Platt sur l'IA au service de la science
Illustration générée par IA
4Latent Space 

Un Oscar, deux astéroïdes et l'algorithme dans votre sklearn : John Platt sur l'IA au service de la science

John Platt, ingénieur chez Google connu pour avoir reçu un Oscar technique, inventé deux algorithmes devenus des classiques du machine learning et pour compter deux astéroïdes portant son nom, ainsi qu'un nombre d'Erdős-Bacon de 6, a détaillé dans un podcast récent le projet ERA, pour Empirical Research Assistance, développé par son équipe chez Google. L'outil part du constat que de nombreux problèmes scientifiques peuvent se ramener à une tâche notée par un score, qu'il suffit ensuite de maximiser. ERA s'appuie sur Gemini pour générer et faire évoluer des carnets d'expériences selon une logique proche de la recherche arborescente de Monte-Carlo : à chaque itération, une règle de borne de confiance supérieure sélectionne les notebooks les plus prometteurs à faire muter, Gemini proposant à chaque fois une dizaine de variantes, avec un partage de l'historique entre branches pour qu'elles apprennent les unes des autres. Selon Platt, le saut de performance décisif s'est produit entre Gemini 2.0 et Gemini 2.5, le système passant d'inefficace à pleinement opérationnel. ERA a déjà permis de résoudre plusieurs problèmes scientifiques non résolus, donnant lieu à au moins dix publications, dont certaines portent sur la lutte contre le changement climatique. Cette approche change concrètement la manière dont la recherche scientifique peut être menée : au lieu de dépendre uniquement du temps et de l'intuition des chercheurs, un système capable d'explorer automatiquement des milliers de variantes de code devient, selon Platt, l'équivalent d'un doctorant surdoué qui ne dort jamais. Mais l'outil comporte un risque réel de sur-optimisation : Platt met en garde contre le fait de confondre un modèle prédictif performant avec un modèle réellement explicatif, invoquant la loi de Goodhart, selon laquelle toute mesure qui devient un objectif cesse d'être une bonne mesure. Il cite l'exemple d'une compétition Kaggle sur la détection des traînées de condensation des avions, remportée grâce à l'exploitation d'une erreur d'un demi-pixel dans l'étiquetage des données, une astuce qui a rapporté 15 000 dollars sans faire progresser le problème réel. Ce travail s'inscrit dans une trajectoire longue chez Google, où Platt travaille depuis plus d'une décennie sur l'usage de l'IA pour des problèmes scientifiques complexes, après avoir été associé très tôt aux réseaux de neurones convolutifs, à la recherche sur la fusion nucléaire et à l'informatique quantique. Kaggle, plateforme de compétitions de data science rachetée par Google, a fourni la matière première et l'inspiration du projet, conçu au départ comme une IA capable de résoudre n'importe quel défi Kaggle. Face à la puissance de ces outils, Platt recommande aux chercheurs de toujours commencer simplement, par une régression linéaire ou une machine à vecteurs de support, avant de se fier aux résultats d'une optimisation automatisée.

RecherchePaper
1 source
NVIDIA lance SoL-Pi : des boucles de recherche automatique qui réduisent jusqu'à 49% le trafic de tokens des agents de code
Illustration générée par IA
5MarkTechPost 

NVIDIA lance SoL-Pi : des boucles de recherche automatique qui réduisent jusqu'à 49% le trafic de tokens des agents de code

Une équipe de chercheurs de NVIDIA, de l'université technologique de Nanyang (NTU) et du MIT a publié SoL-Pi, un ensemble de quatre mécanismes d'optimisation destinés à l'agent de codage open source Pi. Ces mécanismes ont été découverts par une IA menant des boucles de recherche automatisées directement au niveau du harnais, la couche logicielle qui gère les appels d'outils, le contexte et la délégation entre l'agent et le modèle. Sur l'évaluation EdgeBench, qui compte 51 tâches, SoL-Pi réduit le volume de tokens consommés de 44,7% à 49% par rapport à Pi standard et fait baisser le coût d'API d'environ 33%, tout en conservant des scores de performance proches de ceux de Pi sur les modèles GPT-5.6 Sol et Opus 5. Le projet est publié sur GitHub sous l'organisation NVlabs, sous licence MIT, et fonctionne sur une version non modifiée de Pi, testée avec la version 0.85.1 et Node.js 22.19 ou supérieur. La recherche automatisée a exploré 152 pistes réparties en six familles (contexte, progression, outils, délégation, prompts, politique), testées sur 535 environnements exécutables, dont 495 construits à partir de paires issue/pull request GitHub et 40 tâches synthétiques, pour un total de plus de 3 000 exécutions et 60 000 interactions agent-environnement. Les agents de codage tournent désormais pendant des heures, accumulant dans leur contexte chaque modification de fichier, chaque test et chaque log, ce qui fait exploser les coûts en tokens à mesure que les tâches se prolongent. Contrairement aux approches classiques qui réduisent le coût par token via des modèles moins chers ou des techniques de quantification, SoL-Pi s'attaque directement au volume de tokens nécessaires pour accomplir une tâche, en optimisant la façon dont l'agent interagit avec son environnement. Sur les chiffres publiés, un run avec Pi sur GPT-5.6 Sol coûte 1 339 dollars et consomme 2,15 milliards de tokens pour un score de 44,8, tandis que la version SoL-Pi orientée performance atteint un score de 47,2 pour 1 271 dollars, et la version orientée efficacité descend à 894 dollars pour un score de 42. Sur Opus 5, la version performance de SoL-Pi grimpe même à un score de 50,5, contre 44,8 pour Pi seul. Pour les équipes qui déploient des agents de codage à grande échelle, ces gains représentent une réduction directe et significative des coûts d'infrastructure, sans sacrifice notable de qualité. Cette publication s'inscrit dans un mouvement plus large où les laboratoires cherchent à automatiser l'optimisation des harnais d'agents plutôt que de les régler manuellement, un travail lent et sujet à des effets de bord entre composants couplés. Des systèmes comme Meta-Harness ont déjà exploré cette voie, mais une étude récente a montré que les harnais issus de recherches automatisées avaient tendance à sur-optimiser pour leurs tâches d'entraînement, avec des gains marginaux sur des tâches inédites. Pour éviter ce piège, les auteurs de SoL-Pi ont figé leurs règles d'acceptation avant le début de la recherche et ont maintenu EdgeBench totalement isolé du processus d'optimisation, n'utilisant que 11 tâches pour une validation à sens unique et 40 pour l'évaluation finale. Les quatre mécanismes retenus, nommés Action Fusion, Online Context Compact, ObservationPack et Evidence-Preserving Reducer, ciblent chacun une source précise de gaspillage de tokens, de la fusion des appels d'outils à la compression intelligente des logs de test via un modèle moins coûteux, GPT-5.6 Luna.

💬 Sur GPT-5.6 Sol, SoL-Pi passe de 44,8 à 47,2 de score tout en faisant baisser le run de 1339 à 1271 dollars, ça veut dire qu'on n'est plus dans le compromis coût/qualité classique. Ce qui compte, c'est que ce soit une IA qui a trouvé ces optimisations toute seule en testant 152 pistes sur 535 environnements, pas un ingénieur qui a réglé le harnais à la main. Reste la question qui tue avec ce genre de recherche automatisée : ça tient sur des tâches jamais vues, ou ça a juste appris par cœur EdgeBench comme Meta-Harness l'a fait avant lui.

RecherchePaper
1 source
L'IA au service de la biologie : Claude apprend à concevoir et caractériser des anticorps
Illustration générée par IA
6Amazon Science 

L'IA au service de la biologie : Claude apprend à concevoir et caractériser des anticorps

Amazon a présenté début 2026, via son équipe scientifique Amazon Bio Discovery, trois articles de recherche consacrés à l'intelligence artificielle appliquée à la conception d'anticorps thérapeutiques. Deux de ces travaux ont été publiés dans des revues à comité de lecture, dont un dans la revue iScience, sous le titre "A systematic évaluation framework for universal antibody-antigen binding affinity prediction and candidate recommendation". Ce papier introduit un nouveau modèle nommé MochiBind, entraîné à partir du modèle de langage protéique ESM-2, ainsi qu'un cadre d'évaluation inédit pour mesurer la fiabilité des prédicteurs d'affinité de liaison. L'équipe a testé son approche sur le jeu de données AlphaBind, qui couvre quatre cibles antigéniques, TIGIT, PD-1, HER2 et le domaine de liaison au récepteur du SARS-CoV-1, pour un total d'environ 30 000 variants d'anticorps caractérisés expérimentalement. Plutôt que de prédire une valeur absolue d'affinité, MochiBind compare deux anticorps entre eux pour déterminer lequel se lie le plus fortement, puis agrège ces comparaisons en un classement global grâce à TrueSkill, un algorithme bayésien conçu à l'origine pour classer les joueurs de jeux vidéo. Un troisième article va plus loin en intégrant la prédiction dans un processus de conception de bout en bout, piloté par un agent, qui a permis d'identifier des anticorps candidats validés expérimentalement contre une nouvelle cible anticancéreuse. Ces travaux s'attaquent à un problème concret de l'industrie pharmaceutique : plus de 100 anticorps monoclonaux sont déjà approuvés par la FDA, mais leur découverte reste coûteuse et lente, nécessitant typiquement six à douze mois entre l'identification d'une cible et l'obtention d'un candidat médicament exploitable. En automatisant et en fiabilisant les étapes de sélection, du site de liaison optimal jusqu'à la capacité d'un candidat à survivre à la fabrication industrielle et aux essais cliniques, ces méthodes promettent de réduire les coûts et les délais de développement. Elles pourraient ainsi élargir l'accès à des traitements innovants, notamment en oncologie, et accélérer la réponse à de nouvelles menaces sanitaires. Le principal obstacle identifié par les chercheurs d'Amazon est que les modèles prédictifs actuels fonctionnent bien sur des cibles déjà connues des données d'entraînement, mais se dégradent nettement face à des antigènes inédits, un écart difficile à détecter avec les benchmarks existants. En passant en revue sept études antérieures, l'équipe a constaté qu'aucune ne réunissait les conditions nécessaires pour entraîner un prédicteur véritablement universel. Amazon Bio Discovery, la plateforme qui combine ces modèles d'IA à des services de laboratoire intégrés, vise précisément à combler cet écart entre performance en conditions contrôlées et utilité réelle pour les chercheurs en biopharmacie.

RecherchePaper
1 source
Amélioration de la prédiction de synthèse de petites molécules à grande échelle avec RetroChimera
Illustration générée par IA
7Microsoft Research 

Amélioration de la prédiction de synthèse de petites molécules à grande échelle avec RetroChimera

Microsoft a publié dans la revue Nature un article présentant RetroChimera, son nouveau modèle de prédiction de rétrosynthèse pour les petites molécules. Développé par les équipes de recherche de l'entreprise, ce modèle vise à automatiser la planification des voies de synthèse chimique, un processus qui reste aujourd'hui largement manuel, long et coûteux. RetroChimera repose sur la combinaison de deux modèles aux forces complémentaires : R-SMILES 2, un modèle Transformer de type "de-novo" qui prédit directement les molécules précurseurs à partir de la molécule cible mais reste sujet aux hallucinations en raison de sa génération non contrainte, et NeuralLoc, un modèle basé sur les graphes moléculaires. Un système d'agrégation par apprentissage du classement (learning-to-rank) combine les propositions des deux sous-modèles pour produire des prédictions plus fiables que chacun pris isolément. Lors de tests en aveugle, des chimistes de niveau doctorat ont préféré les prédictions de réactions individuelles de RetroChimera à celles des modèles précédents ainsi qu'aux réactions rapportées dans la littérature scientifique. Microsoft a choisi de publier en open source l'implémentation complète et les poids du modèle. Cette avancée s'attaque à un goulot d'étranglement majeur du développement de nouvelles molécules pour la médecine, les matériaux intelligents et l'agriculture durable. Si les méthodes computationnelles permettent déjà d'explorer un très grand nombre de candidats moléculaires, trouver des voies de synthèse pratiques pour les fabriquer réellement en laboratoire demeure un frein critique, la synthèse chimique représentant elle-même une part importante des coûts de développement de nouveaux médicaments. En rendant accessibles l'implémentation et les poids de RetroChimera, Microsoft espère permettre à la communauté des chercheurs d'accélérer la conception de molécules à visée médicinale et de matériaux avancés, réduisant potentiellement les délais et les coûts associés à cette étape jusqu'ici très dépendante d'une expertise chimique spécialisée et difficile à automatiser à grande échelle. La rétrosynthèse consiste à partir d'une molécule cible et à la décomposer, étape par étape, en précurseurs de plus en plus simples jusqu'à atteindre des briques de construction disponibles dans le commerce, une démarche que Microsoft compare à la réflexion stratégique déployée aux échecs ou au jeu de Go, mais avec un espace de coups possibles bien plus vaste et moins prévisible. Les systèmes existants peinaient jusqu'ici à mémoriser des types de réactions rares mais stratégiquement importantes, à rester robustes face à des molécules éloignées de leurs données d'entraînement, et à s'aligner sur les attentes des chimistes professionnels. Le cadre conçu par Microsoft, fondé sur un principe d'ensemble de modèles avec reclassement appris, reste par ailleurs extensible : les auteurs indiquent qu'il serait possible d'y intégrer d'autres sources de prédiction, comme des appels à des bases de données de réactions ou des requêtes impliquant directement des chimistes humains dans la boucle, ouvrant la voie à des versions futures encore plus robustes du système.

💬 RetroChimera, c'est le genre de truc qu'on attendait depuis des années : la rétrosynthèse reste le vrai goulot d'étranglement de la découverte de molécules, pas la génération de candidats, qui elle est déjà résolue à la pelle. Deux modèles complémentaires qui se corrigent mutuellement au lieu d'un seul qui hallucine tout seul, plus des chimistes qui préfèrent ça à la littérature existante en aveugle, ça sent le résultat solide et pas juste le papier Nature qui flatte l'ego de Microsoft. Et le fait qu'ils lâchent les poids en open source change la donne : ça déplace le vrai coût de développement pharma d'années de tâtonnement en labo vers du calcul, ce qui est exactement le genre de transfert qui redessine qui peut se permettre de chercher de nouveaux médicaments.

RecherchePaper
1 source
Des étudiants simulés qui commettent des erreurs réalistes aident les IA tutrices à progresser plus vite
Illustration générée par IA
8The Decoder 

Des étudiants simulés qui commettent des erreurs réalistes aident les IA tutrices à progresser plus vite

Microsoft Research et l'Université de l'Illinois ont développé StudentSim, un système capable de simuler des élèves individuels à partir d'un nombre limité de données réelles, afin de fournir aux tuteurs pédagogiques basés sur l'IA un retour rapide et peu coûteux pendant leur entraînement. Les chercheurs ont testé leur approche sur des données couvrant 60 élèves réels, répartis sur trois matières distinctes : les échecs, l'anglais et les mathématiques. Dans ces évaluations, StudentSim a surpassé GPT-5.4 pour reproduire de façon crédible les erreurs et le raisonnement propres à chaque élève. Un tuteur d'échecs entraîné grâce à StudentSim a par ailleurs obtenu les meilleures notes attribuées par des experts humains, devançant deux autres versions du même tuteur testées en comparaison. Cette avancée répond à un problème concret pour les concepteurs de tuteurs intelligents : recruter et faire interagir de vrais élèves à chaque cycle d'entraînement ou d'ajustement d'un modèle coûte cher et prend du temps. En simulant fidèlement le comportement, les hésitations et les fautes types d'un élève donné, StudentSim permet d'itérer beaucoup plus vite sur la conception des tuteurs avant de les confronter à de véritables utilisateurs, tout en gardant un niveau de réalisme suffisant pour que les gains observés en simulation se traduisent en efficacité pédagogique réelle, comme l'a montré la préférence des experts pour le tuteur d'échecs entraîné via cette méthode. Ce travail s'inscrit dans une tendance plus large consistant à utiliser des environnements ou des agents simulés pour entraîner des systèmes d'IA plus rapidement qu'avec des données humaines seules, une approche déjà répandue en robotique et en apprentissage par renforcement. Appliquée à l'éducation, elle pourrait accélérer le développement de tuteurs personnalisés capables de s'adapter au profil précis de chaque apprenant, tout en posant la question de la fiabilité de ces simulations face à la diversité réelle des élèves à grande échelle.

💬 StudentSim bat GPT-5.4 sur un truc précis, imiter les erreurs d'un élève réel plutôt que produire des erreurs génériques. C'est ça la vraie nouveauté : jusqu'ici on entraînait des tuteurs IA sur des fautes plausibles mais fabriquées, et les résultats s'écroulaient au contact de vrais élèves. Reste que 60 élèves sur trois matières, c'est un labo, pas une salle de classe à 30, et le vrai test viendra quand ces tuteurs affronteront la diversité que même les chercheurs n'ont pas simulée.

RecherchePaper
1 source
Google Deepmind : Dream-RSI aide les agents IA à progresser en "rêvant" de leurs tentatives passées
Illustration générée par IA
9The Decoder 

Google Deepmind : Dream-RSI aide les agents IA à progresser en "rêvant" de leurs tentatives passées

Google DeepMind a présenté Dream-RSI, une méthode permettant à des agents d'intelligence artificielle de « rêver » de leurs tentatives de recherche passées afin de tester de nouvelles stratégies sans relancer de coûteux calculs. Lors des tests réalisés par l'entreprise, ce système a égalé, voire dépassé, les résultats des méthodes existantes tout en réduisant le nombre d'itérations nécessaires d'un facteur allant jusqu'à 2,43. Seule la stratégie de recherche de l'agent est ainsi ajustée, le modèle d'IA sous-jacent restant totalement inchangé. Cette approche s'attaque à un problème central du développement des agents IA : l'amélioration de leurs capacités de recherche exige habituellement des cycles de calcul très coûteux en temps et en ressources. En permettant de réutiliser l'expérience accumulée lors de tentatives antérieures plutôt que de tout recalculer, Dream-RSI pourrait réduire significativement les coûts d'entraînement et d'inférence pour les entreprises qui déploient ce type de systèmes, sans nécessiter de réentraînement du modèle lui-même. Pour l'industrie, cela ouvre la voie à des agents capables de s'améliorer plus rapidement et à moindre coût. Cette annonce s'inscrit dans une tendance plus large du secteur de l'IA, où les laboratoires cherchent à rendre les agents autonomes plus efficaces sans multiplier la puissance de calcul mobilisée pour chaque nouvelle tâche. Reste à savoir si cette méthode sera intégrée aux produits commerciaux de Google et comment elle se comparera aux approches développées par la concurrence dans les mois à venir.

💬 Ce qui est malin ici, c'est que Google ne touche pas au modèle : il rejoue juste ses tentatives passées en interne pour tester de nouvelles stratégies de recherche sans repayer le calcul. Facteur 2,43 sur les itérations, si ça se confirme hors labo, c'est le genre de gain qui change le calcul économique des agents autonomes plus que n'importe quel nouveau modèle géant. Reste la question qui compte : ça tient en prod chez un client, ou ça reste une astuce qui marche sur les benchmarks maison de DeepMind.

RecherchePaper
1 source
Linkup Research dévoile SPARSEUP, un modèle d'embedding creux open source de 149 millions de paramètres
Illustration générée par IA
10MarkTechPost 

Linkup Research dévoile SPARSEUP, un modèle d'embedding creux open source de 149 millions de paramètres

L'équipe de recherche de Linkup a publié SPARSEUP, un modèle d'embeddings épars open source sous licence Apache 2.0, disponible sur Hugging Face et compatible avec les bibliothèques Transformers ou Sentence Transformers via l'option trustremotecode=True. Bâti sur un socle ModernBERT de 149 millions de paramètres, il atteint un score moyen de 56,4 en nDCG@10 sur le benchmark BEIR-13, ce que Linkup revendique comme le meilleur résultat public parmi les encodeurs épars à vocabulaire de moins de 150 millions de paramètres. Le modèle part du checkpoint LateOn-unsupervised de LightOn, auquel l'équipe a dû regreffer la tête MLM d'origine de ModernBERT, puis a été affiné avec le mélange de données de LightOn, en apprentissage contrastif pur (sept négatifs difficiles par requête tirés d'un réservoir de cinquante, plus des négatifs intra-lot, sans distillation par cross-encoder), l'ensemble tenant sur un seul GPU H100. Trois corrections techniques, un décalage des logits, une limite de douze dimensions par token et une fusion des variantes de casse, ramènent la dimension de sortie d'environ 50 000 à 34 000. Ce lancement comble un vide dans la recherche d'information ouverte : l'essentiel des modèles d'embeddings publics sont denses (un vecteur par texte), alors que les modèles épars répartissent des poids sur un vocabulaire entier, chaque dimension correspondant à un token réel. Cette architecture reste compatible avec les index inversés classiques, plus lisible pour un humain, et généralement plus performante sur les termes rares, un atout pour la recherche juridique, médicale ou technique. Sur MS MARCO, SPARSEUP active en moyenne 47 termes non nuls par requête et 190 par document, contre 25 et 170 pour SPLADE-v3, et couplé à l'index inversé Seismic, il atteint plus de 97% de rappel par rapport à une recherche exacte en environ 380 microsecondes par requête, en mono-thread. De quoi offrir aux équipes qui construisent des moteurs de recherche sémantique une alternative légère et ouverte aux solutions denses plus coûteuses à indexer. SPARSEUP fait suite à la publication par LightOn de ses modèles DenseOn et LateOn, accompagnés de leurs données et de leur recette d'entraînement complètes ; Linkup a repris le même socle et les mêmes données pour permettre une comparaison directe entre les trois approches. Celle-ci nuance les résultats bruts : à données égales, LateOn obtient 58,9 et DenseOn 57,9 sur BEIR-13, contre 56,4 pour SPARSEUP, qui recourt de plus à une recherche approchée via Seismic là où LightOn utilise une recherche exacte. SPARSEUP devance DenseOn sur ArguAna, Touché et HotpotQA, mais accuse un retard sur des tâches plus sémantiques comme FiQA ou DBPedia. Sur une version décontaminée de BEIR, l'écart avec DenseOn tombe à 0,17 point, une donnée que Linkup relativise elle-même car les sous-ensembles décontaminés de NQ et MS MARCO ne comptent que 21 et 46 requêtes. Linkup ajoute qu'agrandir les vecteurs gagnerait un à deux points supplémentaires sur BEIR-13, mais a préféré préserver la légèreté du modèle.

UECette avancée technique est portée par deux acteurs français de l'IA, Linkup et LightOn, renforçant l'écosystème français de la recherche d'information ouverte.

💬 SPARSEUP, c'est le genre de sortie qu'on attendait : un modèle d'embedding creux léger, français, et honnête sur ses limites, puisque Linkup publie aussi les chiffres où il perd face à DenseOn. Sur le papier ça reste 2 à 3 points derrière LateOn et DenseOn en BEIR-13, mais l'écart fond à 0,17 point sur les données décontaminées, et la vraie promesse c'est ailleurs : compatible index inversé, lisible token par token, et 380 microsecondes par requête en mono-thread avec Seismic. Ce que révèle surtout ce lancement, c'est que la France a maintenant deux briques ouvertes et comparables (dense et creuse) pour construire de la recherche sémantique sans dépendre d'une API fermée, et ça, pour des équipes juridiques ou médicales qui veulent contrôler leur pipeline, ça vaut plus qu'un point de score.

RechercheActu
1 source
6 clones de Jev apparaissent en 2 jours
Illustration générée par IA
11Latent Space 

6 clones de Jev apparaissent en 2 jours

Voici le résumé en français. Le modèle Jev, lancé mercredi 16 septembre 2026, a cumulé 36 millions de vues pour sa vidéo de présentation en seulement deux jours, un score à comparer aux 74 millions de vues du résultat Navier-Stokes d'OpenAI et aux 57 millions de vues de Fable 5 d'Anthropic. Contrairement à ces annonces, Jev n'a pas été publié en open source, ce qui a nourri spéculations, démonstrations improvisées et critiques acerbes. En quarante-huit heures à peine, au moins six reproductions ou clones ont vu le jour : Laya, un encodeur ModernBERT-large de 421 millions de paramètres complété de deux couches transformer et entraîné par apprentissage par renforcement (PPO) ; DiffusionGemmaJev, bâti sur un modèle de diffusion et proche des performances de l'original ; Bespoke Nimble, un fine-tuning LoRA de Qwen3.5-9B publié par le développeur connu sous le pseudonyme madiator, qui fait passer les performances du modèle de base de 66 % à 90 % (contre 93 % pour Jev) avec un temps de réponse de 100 millisecondes sur GPU H100 ; SemIf, anciennement OpenJev, décliné en versions de 4 et 35 milliards de paramètres sur une base Qwen3.5 ; Jevlike, un modèle léger à 40 000 embeddings d'octets ; et Kev-0.5B, un adaptateur LoRA sur Qwen2.5-0.5B signé jaredpalmer, capable de tourner sur un simple MacBook Pro. Point commun de ces reproductions : leurs données d'entraînement sont intégralement synthétiques. Jev se distingue des grands modèles de langage génératifs par sa nature discriminative : au lieu de produire du texte, il évalue des options candidates et renvoie des probabilités calibrées, une approche présentée comme un complément rapide de type "système 1" aux LLM. La plateforme d'évaluation Braintrust l'a déjà intégré comme modèle de notation, avec un coût environ 400 fois inférieur aux dispositifs précédents. Les cas d'usage évoqués touchent le routage de requêtes, la sélection de citations, l'escalade de tickets, des décisions juridiques automatisées, ainsi que les notifications, l'adaptation d'interface et des décisions pilotées par capteurs directement sur l'appareil. Certains observateurs y voient un moyen de retirer l'appel d'outils, le routage et les décisions de type MCP aux petits modèles génératifs, au profit de modèles discriminatifs quasi gratuits à l'usage. Les premières intégrations convaincantes sont apparues dans des flux de navigation web et d'automatisation : classification de rapports d'incidents chez Box, agents de navigateur combinés à LangChain, et un plugin dédié dans l'outil Cline, jugé par plusieurs utilisateurs comme la meilleure application de Jev observée à ce jour. Ce déploiement suggère que Jev s'impose moins comme un concurrent des chatbots que comme une brique de contrôle pour des flux de travail automatisés. L'accueil s'est révélé clivant selon l'ancienneté des observateurs : les utilisateurs arrivés après le lancement de ChatGPT ont perçu Jev comme une révélation, tandis que les chercheurs en apprentissage automatique actifs avant cette période se sont montrés plus circonspects. Une critique récurrente, relayée notamment par le compte abacaj, souligne que la plupart des démonstrations mettent en avant la rapidité plutôt que la qualité réelle, et qu'aucun benchmark standardisé n'existe encore pour cette catégorie de modèles. Cette effervescence, documentée par la newsletter AI News, désormais rattachée à Latent Space et qui a suivi douze forums Reddit et 544 comptes Twitter sur la période, illustre la vitesse à laquelle la communauté open source reproduit aujourd'hui des architectures propriétaires fermées, quelques heures seulement après leur publication. Le succès de cette vague de clones, tous entraînés sur des données synthétiques, relance aussi le débat sur la place de ces modèles discriminatifs légers face aux grands modèles génératifs dans l'écosystème des agents et des outils d'IA.

💬 Six clones en 48 heures, ça ne dit rien sur Jev, ça dit tout sur l'écosystème open source qui rattrape désormais une architecture propriétaire en un week-end. Le vrai signal n'est pas la course aux clones mais l'absence de benchmark standardisé : tout le monde optimise la vitesse de démo, personne ne mesure la qualité réelle. Reste que l'idée de fond, un modèle discriminatif quasi gratuit pour router et trier au lieu de faire générer un LLM, c'est exactement le genre de brique qu'on attendait pour arrêter de payer plein tarif sur des décisions bêtes.

RechercheActu
1 source
Google Research présente Retrieve-for-Train (R4T) : un retriever de diffusion optimisé par RL, 12 à 20 fois plus rapide pour le fan-out de requêtes
Illustration générée par IA
12MarkTechPost 

Google Research présente Retrieve-for-Train (R4T) : un retriever de diffusion optimisé par RL, 12 à 20 fois plus rapide pour le fan-out de requêtes

Les chercheurs de Google Research ont présenté Retrieve-for-Train (R4T), un nouveau système conçu pour améliorer la diversification des résultats de recherche et de recommandation, un problème connu sous le nom de "query fan-out": face à une requête large comme "matériel de camping", un moteur doit renvoyer une tente, un sac de couchage, un réchaud et une lampe frontale plutôt que dix tentes quasi identiques. L'équipe a identifié deux limites des approches actuelles utilisant de grands modèles de langage en temps réel: le "collapse paraphrastique", où le modèle génère des sous-requêtes synonymes qui ramènent des résultats trop homogènes (le modèle Qwen3-4B testé en zero-shot a ainsi produit "bohemian festival fashion" et "festival bohemian clothes" pour une même requête), et la latence élevée liée à la génération autorégressive combinée à des appels de recherche répétés. R4T fonctionne en trois étapes: un modèle de langage dédié au fan-out (FOLM) est d'abord entraîné par apprentissage par renforcement pour générer des sous-requêtes évaluées par une récompense portant sur l'ensemble des résultats récupérés, non sur chaque élément isolément; ce modèle génère ensuite 128 variantes par requête sans annotation humaine pour créer des données d'entraînement; enfin, un petit transformeur de diffusion de 53,9 millions de paramètres apprend à produire en une seule passe non autorégressive l'ensemble complet des embeddings cibles, permettant une recherche par plus proches voisins nettement plus rapide, jusqu'à 12 à 20 fois selon les auteurs. Cette approche répond à un enjeu concret pour les moteurs de recherche, les plateformes e-commerce et les systèmes de recommandation: offrir des résultats variés et pertinents sans sacrifier la vitesse, un compromis jusqu'ici difficile à tenir puisque les méthodes de type "best-of-N" améliorent la qualité mais multiplient le coût de calcul. Sur le jeu de données de mode Polyvore, la variante Gemma3-4B de R4T a obtenu un score moyen de 49,1 contre 40,9 pour le best-of-N et 38,5 pour le zero-shot, avec une diversité passant de 56,0 à 76,8 (74,3 pour la version diffusion). Sur un jeu de données musical propriétaire basé sur des embeddings MuLan, R4T-FOLM a atteint 58,1 contre 49,2 pour le best-of-N. Pour les entreprises exploitant des catalogues massifs, un modèle de diffusion léger capable de générer toutes les directions de récupération en une seule passe représente un gain d'efficacité opérationnelle direct. L'équipe a aussi dû résoudre un problème classique de "reward hacking": en n'utilisant que le critère d'ancrage ("groundedness"), le modèle Gemma3-4B a convergé vers des sorties dégénérées répétant des chaînes absurdes, et l'ajout d'un critère d'alignement seul a aggravé ce collapse en poussant le modèle à simplement paraphraser la requête d'origine. L'ajout d'un troisième critère de diversité, mesuré par le score de Vendi, a permis de corriger ce comportement. L'entraînement repose sur l'algorithme GRPO avec régularisation PPO souple. Sur des tâches de récupération compositionnelle faiblement supervisée, R4T avec Qwen a surpassé Gemini-2.5-Flash en rappel et en taux de succès, au prix d'une diversité réduite que les auteurs attribuent à une optimisation RL trop agressive, un compromis que la version diffusion du modèle atténue partiellement.

💬 Le vrai déblocage, c'est le collapse paraphrastique qu'ils ont enfin nommé : demander à un LLM de diversifier une requête, c'est souvent lui faire reformuler la même idée dix fois avec des synonymes, pas produire de vraie variété. R4T le corrige avec une récompense sur l'ensemble des résultats plutôt que requête par requête, et ça donne un gain de diversité net (56 à 76,8 sur Polyvore), pas juste un gain de vitesse. La partie diffusion à 53,9M de paramètres qui remplace la génération autorégressive, c'est ce qui rend le truc déployable en prod à grande échelle, reste à voir si ça tient sur un catalogue e-commerce réel et pas seulement sur des benchmarks académiques.

RecherchePaper
1 source
Nunchux AI dévoile VC-Attention, un noyau d'attention low-bit sans entraînement qui accélère les transformeurs de diffusion vidéo
Illustration générée par IA
13MarkTechPost 

Nunchux AI dévoile VC-Attention, un noyau d'attention low-bit sans entraînement qui accélère les transformeurs de diffusion vidéo

Nunchux AI a présenté VC-Attention, un noyau d'attention à faible précision numérique conçu pour accélérer les modèles de diffusion transformeurs (DiT) vidéo, sans nécessiter le moindre réentraînement. L'outil s'attaque à deux goulots d'étranglement bien identifiés du calcul d'attention : les erreurs de quantification sur les valeurs et la lenteur de l'étape softmax. Le problème est concret : un clip de cinq secondes en 720p généré par Wan2.2-14B représente environ 70 000 tokens spatio-temporels, et sur une RTX 5090 le calcul d'attention occupe plus de 64 % du temps de génération total ; sur un GPU B200, il représente environ les deux tiers de chaque étape de débruitage du modèle MiniMax-H3. VC-Attention combine deux techniques, V-Smooth et ExpCast-FP8, testées sur quatre modèles vidéo ouverts (Wan2.2-T2V-A14B, LongCat-Video, HunyuanVideo-1.5, MiniMax-H3) avec une évaluation de fidélité sur 100 prompts face à une référence BF16 FlashAttention-4. Les gains mesurés sont substantiels : sur un GPU B200, l'attention est accélérée 1,59 fois en 8 bits, pour un gain de bout en bout de 1,19 fois, et jusqu'à 3,58 fois sur une RTX 5090 en 4 bits, pour un gain global de 1,70 fois. Face à SageAttention2, la référence du secteur, VC-Attention va jusqu'à 6,02 fois plus vite sur B200, une carte pour laquelle SageAttention2 ne propose aucun noyau optimisé. Ces accélérations n'entament pas la qualité : en 8 bits, V-Smooth gagne 2,3 dB de PSNR sur Wan2.2 et 2,8 dB sur HunyuanVideo-1.5 par rapport à SageAttention2, et en 4 bits il dépasse SageAttention3 de 2,9 dB sur Wan2.2 et 3,6 dB sur LongCat-Video. L'enjeu est direct pour l'industrie de la vidéo générée par IA, où le coût de l'attention croît avec le carré du nombre de tokens : le réduire sans réentraînement ni perte de qualité rend la production vidéo plus rapide et moins coûteuse à grande échelle. Techniquement, V-Smooth comble un angle mort des méthodes existantes comme SageAttention2 : une fois les requêtes et les clés lissées, les valeurs concentrent à elles seules 82 % de l'erreur de sortie sur Wan2.2, un défaut qu'une simple rotation de Hadamard ne corrige pas. La méthode regroupe les tokens par k-means en ligne, retire la moyenne de chaque bloc de 128 tokens avant quantification puis la restaure via le softmax, pour un surcoût de 3 à 4 % du temps d'attention. ExpCast-FP8 règle de son côté le goulot du softmax en écrivant directement l'octet FP8 depuis le score logarithmique, une optimisation CUDA qui fait passer un appel V-Smooth de 42,2 à 4,8 millisecondes sur B200. Ces travaux s'inscrivent dans une course à la quantification bas-bit de l'attention face à SageAttention2, SageAttention3 et l'entraînement quantifié Attn-QAT, alors que les GPU Blackwell et Hopper misent sur des Tensor Cores FP8 et FP4 pour la génération vidéo par IA.

💬 Le vrai goulot d'étranglement de la vidéo générée par IA, c'est le calcul d'attention, pas la taille des modèles : sur RTX 5090 ou B200, il bouffe jusqu'à deux tiers du temps de génération. Sans réentraînement et avec une qualité qui progresse plutôt que de reculer, diviser ce coût par trois ou six change vraiment l'équation économique de la vidéo IA à grande échelle. Bon, sur le papier ça a l'air trop beau : reste à voir si ces gains survivent une fois branchés dans un vrai pipeline de prod, loin des benchmarks maison.

RecherchePaper
1 source
REVERSAL-BENCH : un axe de réversibilité et un oracle de reset pour mesurer la chute de performance du RL sans reset
Illustration générée par IA
14Apple Machine Learning 

REVERSAL-BENCH : un axe de réversibilité et un oracle de reset pour mesurer la chute de performance du RL sans reset

Une équipe de recherche a présenté REVERSAL-BENCH, un nouveau benchmark destiné à évaluer l'apprentissage par renforcement (RL) sans réinitialisation externe, un objectif central pour rendre les agents véritablement autonomes. L'outil introduit un paramètre continu de réversibilité, noté ρ, compris entre 0 et 1, qui permet de régler précisément à quel point un environnement peut revenir à un état antérieur après une action. Il s'accompagne d'un « oracle de réinitialisation », un mécanisme de vérification qui établit une vérité terrain sur la récupérabilité réelle d'un état donné. Le benchmark couvre huit scénarios distincts de manipulation robotique, simulés sur cinq moteurs physiques différents, ce qui en fait l'un des cadres les plus systématiques pour mesurer ce phénomène. Cette avancée comble un angle mort important des méthodes actuelles de RL autonome, qui supposent presque toutes que l'environnement peut être remis à zéro à volonté, comme dans un simulateur de jeu. Or dans la manipulation robotique réelle, de nombreuses actions sont irréversibles : un objet poussé hors d'une table ou une substance granulaire renversée ne peuvent pas être « annulés » pour recommencer l'épisode d'entraînement. En quantifiant précisément cette irréversibilité et en fournissant un moyen fiable de la vérifier, REVERSAL-BENCH permet aux chercheurs de mesurer objectivement à quel point les performances des algorithmes s'effondrent lorsque les resets deviennent impossibles, une chute que les auteurs qualifient de « falaise » du RL sans réinitialisation. Ce travail s'inscrit dans un effort plus large visant à rapprocher l'apprentissage par renforcement des conditions réelles de déploiement, notamment pour les robots domestiques ou industriels appelés à apprendre en continu sans supervision humaine constante pour réinitialiser leur environnement. En proposant un axe de mesure standardisé plutôt qu'une évaluation binaire réversible ou non, le benchmark ouvre la voie à des comparaisons plus fines entre méthodes et pourrait orienter le développement de futurs algorithmes capables de gérer des conséquences durables de leurs actions, un enjeu clé pour l'autonomie robotique à long terme.

RecherchePaper
1 source
Des chercheurs de Stanford publient Paper2Agent, qui transforme des articles de recherche en agents IA capables de reproduire des résultats
Illustration générée par IA
15MarkTechPost 

Des chercheurs de Stanford publient Paper2Agent, qui transforme des articles de recherche en agents IA capables de reproduire des résultats

Des chercheurs de Stanford dirigés par Jiacheng Miao et James Zou ont publié le 16 septembre 2026 dans Nature un système baptisé Paper2Agent, capable de transformer un article scientifique et son code en agent IA fonctionnel. L'outil convertit une publication et son dépôt de code en serveur MCP (Model Context Protocol), que tout agent compatible, comme Claude Code, peut ensuite piloter en langage naturel. Le code est publié sous licence MIT et s'installe comme extension pour Claude Code ou Codex, avec des serveurs préconstruits pour AlphaGenome, Scanpy et TISSUE disponibles sur Hugging Face Spaces, ainsi qu'une version hébergée sur paper2agent.ai. Le pipeline, bâti sur le SDK agent de Claude Code, orchestre six étapes automatisées : récupération du code, création d'un environnement isolé, indexation des tutoriels, exécution de référence, extraction d'outils MCP paramétrés et vérification stricte (tolérance de 3% sur les chiffres, distance de Hamming inférieure à 20 pour les figures). Pour AlphaGenome, l'outil a généré 22 fonctions validées en 45 minutes pour 14 dollars, avec des scores de 98,7% et 100% sur des requêtes tirées de tutoriels et inédites, contre 82,7% et 78,7% pour Claude Code avec simple accès au dépôt, et 37,3% et 56% pour Biomni. Ces résultats répondent à un problème concret de la recherche computationnelle : le code accompagnant les articles scientifiques reste souvent inaccessible en pratique, car il faut le cloner, l'installer et le déboguer avant de pouvoir l'utiliser, ce qui limite la diffusion réelle des méthodes publiées malgré leur mise en ligne. En automatisant cette reproduction, Paper2Agent pourrait démocratiser l'usage de méthodes complexes en bio-informatique et au-delà, permettant à des chercheurs sans expertise technique poussée d'interroger directement les résultats d'un article via le langage naturel. L'étude illustre aussi les limites persistantes de ces systèmes sur l'attribution causale en génétique : ré-examinant une variante liée au cholestérol LDL (chr1:109274968:G>T), l'agent a désigné SORT1 comme gène causal probable, alors que l'article original d'AlphaGenome privilégiait CELSR2 et PSRC1, les trois gènes présentant des eQTL hépatiques significatifs selon GTEx. Les tests à grande échelle confirment la robustesse de l'approche : sur 100 articles de bioRxiv en biologie computationnelle, 74 ont été transformés en agents et 593 des 599 outils proposés ont passé la validation, avec un score de 91,2% sur 300 questions contre 80,3% et 86,3% pour les versions Sonnet 4 et Sonnet 4.6 de Claude seul, pour un coût par requête de 0,20 dollar contre 0,38 dollar. L'équipe a aussi testé le système sur dix articles hors biologie, dont ceux décrivant TabPFN, SAM 2 et SAELens, atteignant 98,1% de précision sur 42 tâches d'exécution, ce qui suggère une portée dépassant les sciences de la vie. Le système a par ailleurs rejeté 100% des requêtes hors périmètre lors d'un test de permutation et a su récupérer automatiquement après des pannes provoquées de dépendances, de chemins de fichiers ou d'API obsolètes. Ces performances, obtenues avec Claude Sonnet 4 comme modèle de base pour toutes les applications testées, posent la question de l'évolution future de ces agents de recherche vers une collaboration entre plusieurs agents issus de différents articles, une piste que l'équipe de Stanford commence tout juste à explorer.

UELes chercheurs européens en bio-informatique pourraient utiliser cet outil open source pour reproduire plus facilement des méthodes publiées, sans qu'aucun acteur français ou européen ne soit implique dans son développement.

RecherchePaper
1 source
Prior Labs lance TabPFN-3.5, un modèle tabulaire qui surpasse la solution gagnante d'Otto sur Kaggle avec ses réglages par défaut
Illustration générée par IA
16MarkTechPost 

Prior Labs lance TabPFN-3.5, un modèle tabulaire qui surpasse la solution gagnante d'Otto sur Kaggle avec ses réglages par défaut

Prior Labs a dévoilé TabPFN-3.5, la dernière version de son modèle de fondation pour données tabulaires, capable de faire des prédictions sur un tableau en une seule passe, sans entraînement ni réglage propre à chaque jeu de données. L'entreprise revendique la première place sur sept benchmarks tabulaires. Une démonstration distincte montre le modèle battre la solution gagnante d'un concours Kaggle célèbre datant de 2015, le Otto Group Product Classification Challenge, qui avait réuni 3 505 équipes pour un prix de 10 000 dollars et consistait à classer des produits dans neuf catégories à partir de 93 variables de comptage rendues anonymes, avec un score de log loss multi-classes où la valeur la plus basse gagne. La solution victorieuse de l'époque, signée Gilberto Titericz et Stanislav Semenov, deux grands maîtres Kaggle classés numéro un mondial, empilait 36 modèles construits sur des variables conçues à la main et atteignait 0,382. TabPFN-3.5 obtient 0,375 sur le classement privé, en utilisant les données brutes et les réglages par défaut, en environ une minute sur un GPU RTX PRO 6000, sans jamais avoir vu Otto ni aucun jeu de données Kaggle puisqu'il n'a été entraîné que sur des données synthétiques. Nick Erickson, cocréateur d'AutoGluon et chercheur chez Prior Labs, poursuivait ce score depuis des années : AutoGluon avait atteint le rang 23 en 2020, le rang 14 en 2023 avec la version 1.0, puis le rang 9 en août 2026 avec la version 1.6. Cette performance illustre un basculement potentiel dans le travail sur les données tabulaires, qui reste la forme de données la plus répandue dans les entreprises malgré l'attention portée aux grands modèles de langage. Un modèle générique, sans réglage humain ni ingénierie de variables, égale ou dépasse désormais des années d'efforts manuels de spécialistes de très haut niveau, en une fraction du temps. Sur TabArena, un benchmark vivant de 51 jeux de données, la version TabPFN-3.5-Thinking atteint 1910 points Elo, la version de base 1866, contre 1823 pour TabFM+, et Prior Labs affirme que son modèle de base dépasse AutoGluon 1.6 en mode extrême de 130 points Elo en un cinquième du temps de calcul. Sur BeyondArena, qui couvre 142 jeux de données aux structures variées (groupées, temporelles, larges, riches en texte), TabPFN-3.5 devance l'ancien leader d'environ 150 points Elo, même si des réseaux de neurones ajustés et assemblés gardent l'avantage sur certains sous-ensembles spécifiques. Sous le capot, le transformateur en contexte passe de 512 à 1024 dimensions, portant le nombre de paramètres à 220 millions contre 53 millions pour la version classification de TabPFN-3, avec un unique point de contrôle multitâche couvrant désormais classification et régression, de nouveaux encodages par transformées de Fourier et rangs ECDF, et un prétraitement simplifié. Le modèle gère jusqu'à un million de lignes et 20 000 variables. La famille comprend aussi TabPFN-3.5-Fast, une version allégée à 84 millions de paramètres jusqu'à six fois plus rapide, TabPFN-3.5-Plus réservée à l'API et aux clients entreprise avec traitement natif du texte, et TabPFN-3.5-Thinking, qui mobilise davantage de calcul à l'inférence sans recourir à des modèles de langage. Les poids ouverts restent utilisables librement pour la recherche, l'évaluation et Kaggle, mais tout usage en production nécessite l'API ou une licence commerciale de Prior Labs, signe que l'entreprise cherche à monétiser une avancée qui pourrait redéfinir les standards de l'apprentissage automatique appliqué aux données structurées.

UEPrior Labs est une startup allemande issue de l'Université de Fribourg, illustrant le dynamisme de la recherche européenne en IA appliquee aux données tabulaires.

💬 TabPFN-3.5 bat le score gagnant du Kaggle Otto de 2015, celui de deux grands maîtres qui avaient empilé 36 modèles à la main, avec ses réglages par défaut et en une minute. Ça veut dire que des années d'ingénierie de variables faite par des pointures se retrouvent égalées par un modèle générique jamais entraîné sur ces données. Reste que les poids ouverts s'arrêtent à la recherche, toute prod passe par l'API ou la licence Prior Labs, donc l'exploit scientifique et le modèle économique, c'est deux choses différentes.

RechercheActu
1 source
L'université de Manchester utilise NVIDIA Earth-2 pour prévoir la pollution de l'air au Royaume-Uni
Illustration générée par IA
17NVIDIA AI Blog 

L'université de Manchester utilise NVIDIA Earth-2 pour prévoir la pollution de l'air au Royaume-Uni

La pollution atmosphérique a contribué à environ 30 000 décès au Royaume-Uni l'an dernier, un chiffre qui a poussé David Topping, professeur au département des sciences de la Terre et de l'environnement de l'Université de Manchester, à chercher une alternative aux modèles de chimie atmosphérique classiques, trop coûteux en calcul pour être exécutés à haute résolution et à fréquence régulière. Constatant que la famille de modèles ouverts NVIDIA Earth-2 avait résolu un problème comparable pour la prévision météo, Topping et son équipe ont entraîné le modèle génératif de sous-échantillonnage Earth-2 CorrDiff sur des données issues de simulations chimie-climat existantes, en utilisant Isambard-AI, le supercalculateur national d'intelligence artificielle du Royaume-Uni basé à Bristol. Grâce à un an de données de pollution britanniques simulées à intervalles horaires, l'équipe a produit un modèle couvrant tout le pays à une résolution de 2 à 3 kilomètres carrés, entraîné en seulement deux jours sur un seul nœud à huit GPU d'Isambard-AI, une machine équipée de 5 448 superpuces NVIDIA GH200 Grace Hopper et capable de 21 exaflops de performance en IA. L'équipe a ensuite ajouté Earth-2 StormCast, un modèle permettant des prévisions dépendantes du temps intégrant directement des observations de qualité de l'air, entraîné par le doctorant Hao Zhang, et a fait tourner les flux d'entraînement et d'inférence sur un supercalculateur personnel NVIDIA DGX Spark. Cette avancée change concrètement l'échelle à laquelle la qualité de l'air peut être modélisée et anticipée. Topping envisage des services de santé régionaux ou nationaux capables d'alerter à l'avance des patients asthmatiques lorsque la pollution s'annonce élevée dans leur zone, le lendemain ou la semaine suivante. Le modèle permet aussi de simuler différents scénarios de politiques publiques liées à la pollution et d'en évaluer l'impact avant leur mise en œuvre. L'équipe explore par ailleurs un couplage avec des dispositifs d'IA embarquée capables d'ingérer des données de qualité de l'air en temps réel, pour appuyer des décisions rapides, par exemple lors d'un incendie de forêt. Ce projet illustre une bascule plus large permise par les modèles génératifs de climat et de météo : Niall Robinson, responsable des relations développeurs pour la météo et le climat chez NVIDIA, souligne qu'un entraînement réalisé en deux jours sur un supercalculateur national peut désormais tourner en inférence sur une machine de bureau, ce qui élargit considérablement le cercle des chercheurs capables de mener ce type de travaux. Simon McIntosh-Smith, directeur du Bristol Centre for Supercomputing et cofondateur d'Isambard-AI, met en avant l'efficacité énergétique de CorrDiff, qui a mobilisé relativement peu d'heures de calcul GPU pour un projet à visée climatique. Pour l'équipe de Manchester, qui n'en est qu'au début de l'exploration de ces cadres génératifs appliqués à des champs de pollution complexes, la facilité de passage d'un modèle Earth-2 à l'autre ouvre la voie à d'autres applications environnementales du même type.

UELe Royaume-Uni n'est plus membre de l'UE, mais cette méthode de prévision de la pollution par IA générative pourrait inspirer des applications similaires dans des villes ou agences environnementales européennes.

💬 Deux jours d'entraînement sur un seul nœud pour couvrir tout le Royaume-Uni à 2-3 km de résolution, alors que la chimie atmosphérique classique tournait sur des semaines de calcul. C'est ça la vraie bascule : dès que l'entraînement lourd est fait sur supercalculateur, l'inférence tourne sur une machine de bureau, et ça change qui peut se permettre de faire ce genre de modèle. Reste la question qui compte : est-ce que les alertes envoyées aux asthmatiques seront assez fiables pour qu'on leur fasse confiance, ou si c'est encore un prototype de labo habillé en produit.

RecherchePaper
1 source
Attribution de crédit sensible au débruitage pour l'apprentissage par renforcement dans les modèles de diffusion textuels
Illustration générée par IA
18Apple Machine Learning 

Attribution de crédit sensible au débruitage pour l'apprentissage par renforcement dans les modèles de diffusion textuels

Une nouvelle méthode baptisée DACA-GRPO (Denoising-Aware Credit Assignment for GRPO) vient d'être proposée pour améliorer l'entraînement par renforcement des modèles de langage à diffusion, une architecture alternative aux modèles autorégressifs classiques du type GPT. Les auteurs identifient deux failles majeures dans les approches RL existantes appliquées à ces modèles, notamment celles reposant sur GRPO (Group Relative Policy Optimization). D'abord, ces méthodes traitent toutes les étapes de débruitage (denoising) de la trajectoire de génération comme équivalentes, sans attribution de crédit temporel différenciée. Ensuite, elles s'appuient sur des estimations de vraisemblance dites "en champ moyen" (mean-field), systématiquement biaisées et à forte variance, pour calculer le signal d'optimisation de la politique. DACA-GRPO se présente comme un ajout léger et directement compatible ("plug-and-play") avec n'importe quel entraîneur de type GRPO existant. Cette contribution s'inscrit dans un enjeu central pour l'industrie de l'IA générative : fiabiliser l'apprentissage par renforcement, technique devenue incontournable pour affiner les capacités de raisonnement des grands modèles de langage. Si les biais de vraisemblance et l'absence de hiérarchisation entre étapes de débruitage ne sont pas corrigés, l'efficacité du RL appliqué aux modèles de diffusion reste bridée, freinant leur compétitivité face aux architectures autorégressives dominantes. Les modèles de langage à diffusion, inspirés des techniques de génération d'images comme Stable Diffusion, génèrent le texte par raffinements successifs plutôt que token par token, ce qui promet potentiellement une génération plus rapide et parallélisable. GRPO, popularisé par des entraînements de modèles de raisonnement, s'est imposé comme méthode de référence pour le post-entraînement par renforcement sans réseau de valeur séparé. En corrigeant ses angles morts sur la diffusion, DACA-GRPO ouvre la voie à une adoption plus large et plus fiable du RL dans cette famille de modèles émergente.

RecherchePaper
1 source
Glyph : un système à agents multi-stratégies pour décrire les colonnes et étiqueter la sensibilité des catalogues de données d'entreprise
Illustration générée par IA
19Apple Machine Learning 

Glyph : un système à agents multi-stratégies pour décrire les colonnes et étiqueter la sensibilité des catalogues de données d'entreprise

Des chercheurs ont présenté Glyph, un système de production destiné à automatiser la documentation et la classification des colonnes dans les catalogues de données d'entreprise. Il s'attaque à deux problèmes couplés : générer des descriptions de colonnes et annoter leur type à des fins de classification de sensibilité des données. Glyph orchestre plusieurs agents fondés sur des grands modèles de langage, organisés en graphes avec état qui coopèrent pour produire ces annotations. Son composant central, le Descriptor, n'infère pas le contenu d'une colonne à partir de son seul nom ou de ses valeurs : il ancre chaque description dans le code source du pipeline qui a produit la colonne, récupéré à la demande pour garantir une description fidèle à l'origine réelle des données. Ce travail répond à un problème concret pour les entreprises qui exploitent de vastes lacs de données : les tables s'accumulent plus vite que les équipes de gouvernance ne peuvent les documenter manuellement. Cette dette documentaire freine la découverte de données par les analystes, complique la mise en place de contrôles d'accès adaptés et expose les organisations à des risques de non-conformité réglementaire, en particulier lorsque des colonnes sensibles, données personnelles, financières ou de santé, restent mal étiquetées. En confiant cette tâche à des agents LLM plutôt qu'à une simple inspection statistique des valeurs, Glyph vise une précision supérieure aux outils de classification traditionnels. Cette approche s'inscrit dans une tendance plus large de déploiement d'agents LLM pour des tâches d'infrastructure de données internes, un domaine longtemps dominé par des outils de catalogage semi-automatiques et des règles de correspondance de motifs. En couplant génération de langage naturel et raisonnement structuré autour d'une ontologie de sensibilité, ce type de système pourrait s'intégrer aux plateformes de gouvernance existantes et alléger la charge des équipes de conformité, un enjeu croissant alors que les réglementations sur la protection des données se durcissent à l'échelle mondiale.

RecherchePaper
1 source
Mémoire persistante partagée et sélective pour les systèmes LLM à base d'agents
Illustration générée par IA
20Apple Machine Learning 

Mémoire persistante partagée et sélective pour les systèmes LLM à base d'agents

Une nouvelle architecture, baptisée « mémoire persistante sélective partagée », s'attaque à un problème récurrent des agents LLM qui génèrent du code via des échanges multi-tours avec des outils : chaque session repart de zéro, effaçant les choix de configuration, les contraintes métier, les schémas de données et les habitudes d'utilisation des outils accumulés. Conserver l'intégralité de l'historique des conversations coûte trop de tokens et dégrade la qualité des réponses. La méthode proposée sélectionne et conserve uniquement quatre catégories d'informations réutilisables, dont les spécifications de tâches et les schémas de données, plutôt que la totalité des échanges. Cette approche vise les équipes qui développent des agents de codage autonomes, un domaine en plein essor. En ne retenant que les éléments à forte valeur ajoutée, la méthode réduit les coûts liés à la fenêtre de contexte tout en évitant la dégradation de performance causée par un historique surchargé d'informations obsolètes. Pour les équipes techniques, cela ouvre la voie à des agents capables de retenir les conventions et contraintes d'un projet d'une session à l'autre, sans tout réexpliquer à chaque interaction. Cette proposition s'inscrit dans la recherche plus large sur la mémoire des agents LLM, qui cherche à dépasser les limites des fenêtres de contexte fixes grâce à des mécanismes de mémoire externe. Le défi reste de distinguer ce qui mérite d'être conservé de ce qui doit être oublié. À mesure que les agents de codage autonomes se répandent dans l'industrie du logiciel, une gestion intelligente du contexte pourrait devenir déterminante pour leur adoption.

RecherchePaper
1 source
La trajectoire comme enseignant : distillation par flow matching discret en peu d'étapes guidée par l'énergie
Illustration générée par IA
21Apple Machine Learning 

La trajectoire comme enseignant : distillation par flow matching discret en peu d'étapes guidée par l'énergie

Une équipe de chercheurs présente une nouvelle méthode baptisée Energy-Navigated Distillation, conçue pour accélérer les modèles de génération de texte fondés sur le discrete flow matching, une technique qui transforme progressivement des tokens de bruit aléatoire en langage cohérent mais qui nécessite typiquement des centaines de passes successives dans le réseau pour produire un résultat satisfaisant. Pour réduire ce coût, la distillation entraîne un modèle élève à reproduire en quelques étapes seulement la trajectoire complète parcourue par le modèle original. Jusqu'ici, quand cet élève produisait des résultats médiocres, la cause invoquée était systématiquement un manque de capacité du modèle. Les auteurs de l'étude renversent ce diagnostic: selon eux, le véritable goulot d'étranglement ne réside pas dans l'élève mais dans la trajectoire d'entraînement elle-même, construite par une succession de sauts stochastiques aveugles, sans aucune évaluation de la qualité de la séquence en cours de génération, une mauvaise décision prise tôt se propageant ensuite à toutes les étapes suivantes. Cette découverte a des implications directes pour l'efficacité des modèles génératifs de texte. Les approches par diffusion et flow matching promettent une génération plus rapide et plus parallélisable que les architectures autorégressives classiques, mais leur adoption reste freinée par le nombre d'étapes nécessaires pour obtenir un texte cohérent. En identifiant la trajectoire, plutôt que la taille du modèle élève, comme source réelle de dégradation lors d'une distillation en peu d'étapes, cette approche ouvre la voie à des modèles plus légers et plus rapides sans sacrifier la qualité du texte, un enjeu de coûts d'inférence et de latence pour toute l'industrie. Ces travaux s'inscrivent dans un effort plus large pour rapprocher les modèles de diffusion et de flow matching des performances des modèles autorégressifs dominants tout en conservant leur avantage de vitesse. La distillation par trajectoire, déjà répandue en génération d'images, se heurte au texte à des défis propres à la nature discrète et séquentielle du langage. En proposant de corriger la trajectoire via une navigation guidée par l'énergie plutôt que d'agrandir l'élève, les chercheurs ouvrent une piste que d'autres équipes devraient chercher à valider sur des tâches de génération à plus grande échelle.

RecherchePaper
1 source
Les compétences acquises dans les jeux vidéo sont-elles transférables au travail ?
Illustration générée par IA
22Latent Space 

Les compétences acquises dans les jeux vidéo sont-elles transférables au travail ?

Alex Duffy, cofondateur et PDG de Good Start Labs, a détaillé dans une interview accordée à Latent Space comment son entreprise transforme des jeux vidéo en matériel d'entraînement pour les modèles d'IA. La société a été créée en octobre 2025 en essaimant d'Every, société de médias et d'outils IA où Duffy dirigeait alors l'entraînement des modèles, avec une levée de 3,6 millions de dollars auprès de General Catalyst, Inovia, Every et divers business angels. Le déclic est venu d'un stream Twitch de 2025 montrant des modèles frontières s'affronter au jeu de négociation Diplomacy, partie qui prend normalement des jours voire des semaines à jouer entre humains. Duffy y a observé qu'o3 d'OpenAI remportait systématiquement la partie en planifiant des trahisons, tandis qu'Opus 4 d'Anthropic, refusant de mentir, se faisait éliminer. Avec son cofondateur Tyler Marques, Duffy a ensuite entraîné un modèle de 30 milliards de paramètres sur 1830: The Game of Railroads and Robber Barons, un jeu de stratégie ferroviaire du XIXe siècle comportant un mécanisme boursier, avant de tester ce même modèle sur des tâches de recherche financière réelle. Deux méthodes d'entraînement ont été comparées : une réponse en un seul tour face à un état de jeu donné, et un agent multi-tours capable d'explorer son environnement via des outils. Seule la seconde approche a amélioré les performances sur le benchmark Finance-Agent, bien que les deux aient progressé sur les objectifs internes au jeu. Ce résultat confirme que la conception même d'un environnement d'entraînement, et pas seulement le jeu choisi, détermine si les compétences acquises se transfèrent au monde réel. Pour l'industrie de l'IA, cela ouvre une voie moins coûteuse que l'annotation humaine classique pour enseigner des capacités vérifiables comme le raisonnement stratégique, la planification ou l'analyse de données, avec des applications concrètes en support client, en opérations industrielles ou en finance. L'épisode Diplomacy soulève aussi une question de confiance : Good Start Labs publie désormais des classements réguliers, dont ceux de septembre 2026 indiquant que Grok 4 Fast est le modèle le moins susceptible de trahir ses alliés dans le jeu, contrairement à Gemini 2.5 Pro, jugé peu fiable. Ce type de mesure du comportement en environnement contrôlé pourrait devenir un indicateur informel de la fiabilité des modèles en usage réel. Cette approche s'inscrit dans une tendance plus large de 2025-2026 où les laboratoires d'IA misent sur l'apprentissage par renforcement avec récompenses vérifiables comme alternative scalable aux données humaines. Good Start Labs prévoit d'explorer d'autres jeux et d'introduire des modèles experts capables de fournir des récompenses plus denses et progressives, afin de cibler précisément les compétences à transmettre. La question centrale qui reste ouverte est de déterminer quels types de jeux et quelles architectures d'entraînement produisent le meilleur transfert vers des tâches professionnelles concrètes, un enjeu suivi de près par les grands laboratoires comme OpenAI, Anthropic, Google et xAI dans leur course à des modèles à la fois plus performants et plus dignes de confiance.

RecherchePaper
1 source
La priorité absolue d'OpenAI pour les agents IA est d'automatiser la recherche en IA, selon Noam Brown
Illustration générée par IA
23The Information AI 

La priorité absolue d'OpenAI pour les agents IA est d'automatiser la recherche en IA, selon Noam Brown

OpenAI a présenté son dernier modèle, GPT-6 Astra, qui a amélioré ses performances sur diverses tâches professionnelles, de la conception de jeux vidéo à la transcription de partitions musicales. Mais selon Noam Brown, chercheur chez OpenAI, l'objectif principal de l'entreprise dans l'entraînement de ses nouveaux modèles n'est pas ces applications grand public : c'est de rendre l'IA meilleure pour la recherche et le développement en IA elle-même. "La priorité numéro un, c'est l'auto-amélioration récursive, et de loin", a-t-il déclaré lors d'un entretien pour AI Deep Dive, la nouvelle émission de The Information consacrée aux grands défis technologiques. Brown, qui travaille chez OpenAI depuis trois ans, a contribué aux avancées permettant aux modèles de raisonner sur des problèmes complexes et d'agir de façon autonome en tant qu'agents. Cette priorité affichée révèle une stratégie de fond chez OpenAI : plutôt que de simplement empiler des cas d'usage commerciaux, l'entreprise cherche à créer des systèmes d'IA capables d'accélérer leur propre développement. Si des modèles peuvent mener eux-mêmes des travaux de recherche, générer des hypothèses, écrire et tester du code d'entraînement, cela pourrait considérablement raccourcir les cycles d'innovation dans tout le secteur. Pour les entreprises et chercheurs qui suivent la course à l'IA, ce choix stratégique suggère que les prochaines générations de modèles seront jugées moins sur leurs prouesses ponctuelles que sur leur capacité à automatiser la recherche elle-même. Cette orientation s'inscrit dans un contexte plus large où les laboratoires d'IA, OpenAI en tête, investissent massivement dans les agents autonomes capables d'exécuter des tâches numériques sans supervision humaine constante. Noam Brown, connu pour ses travaux antérieurs sur le raisonnement stratégique dans les jeux, incarne ce virage vers des systèmes qui planifient et agissent plutôt que de simplement répondre. La question de l'auto-amélioration récursive, longtemps débattue comme scénario théorique par les chercheurs en sécurité de l'IA, apparaît désormais comme un objectif opérationnel assumé chez l'un des principaux acteurs du secteur.

💬 Ce que Brown dit là, c'est qu'OpenAI n'optimise plus pour toi. L'objectif numéro un c'est que le modèle s'améliore lui-même, la recherche en IA faite par l'IA, et les usages grand public comme GPT-6 Astra ne sont qu'un sous-produit qu'on montre en vitrine. Ça change la grille de lecture : les prochains modèles se jugeront moins sur ce qu'ils savent faire pour toi que sur leur capacité à accélérer le labo qui les a créés. Reste à voir si l'auto-amélioration récursive tient ses promesses hors des slides, parce que pour l'instant c'est surtout une déclaration d'intention.

RecherchePaper
1 source
Pourquoi travailler sur l'IA pour la recherche en IA (Richard Socher, Recursive)
Illustration générée par IA
24Latent Space 

Pourquoi travailler sur l'IA pour la recherche en IA (Richard Socher, Recursive)

Richard Socher, fondateur du moteur de recherche You.com et du fonds AIX Ventures, a lancé une nouvelle entreprise baptisée Recursive, qui a réuni une partie des meilleurs chercheurs mondiaux en "open-endedness" et en agents auto-améliorants, et levé un tour d'amorçage de 4,65 milliards de dollars. Invité du podcast Latent Space, Socher y présente sa vision de la "Eureka Machine", décrite aussi dans son livre du même nom : une intelligence artificielle capable d'améliorer le processus même de l'invention, d'accélérer la recherche scientifique et de s'attaquer à terme à des problèmes majeurs en énergie, matériaux, biologie et au-delà. Il détaille les premiers résultats de Recursive, notamment un système de recherche IA qui aurait surpassé des humains et leurs agents sur des tâches d'optimisation en moins de deux jours, ainsi que des travaux sur les noyaux GPU NVIDIA où le système a découvert seul des optimisations, sans recourir à une équipe d'experts CUDA. Ces résultats, ainsi que d'autres expériences autour de NanoChat et NanoGPT, sont résumés dans une conférence de vingt minutes donnée lors de l'AI Engineer Summit, où Socher expose également ses dix dimensions de l'intelligence. Pour Socher, une recherche en IA qui mobilise aujourd'hui des milliers de personnes pendant plusieurs années pourrait, à terme, être compressée en quelques semaines grâce à l'automatisation du processus de recherche lui-même. Cette perspective de recherche récursive, où l'IA améliore sa propre capacité à produire de la science, changerait la donne pour l'ensemble de l'industrie et pour des secteurs entiers, de la découverte de médicaments à la conception de matériaux. Mais l'entretien aborde aussi les risques associés à des systèmes toujours plus capables : le piratage de récompense ("reward hacking"), la difficulté croissante à concevoir des objectifs sûrs à mesure que l'IA gagne en intelligence, et la question de savoir si des modèles pourraient un jour choisir eux-mêmes leurs propres buts. Socher critique par ailleurs l'approche d'Anthropic fondée sur une "constitution" pour aligner ses modèles, et plaide pour l'importance des modèles open source comme facteur de résilience, de compétition et d'influence géopolitique. Le parcours de Socher éclaire cette trajectoire : ses travaux antérieurs sur DecaNLP et la généralisation par prompts ont influencé les recherches d'Alec Radford qui ont mené à GPT, et il a quitté les activités de modèles de pointe de You.com pour fonder Recursive. Il évoque aussi ses travaux sur l'"AI Economist", des simulations d'économies entières servant à tester des politiques publiques, ainsi que les débats sur la régulation de l'IA, les scénarios de décollage rapide freinés par des contraintes physiques et économiques, et les limites théoriques de l'intelligence, qu'il structure autour de dix domaines allant de la vision à la communication en passant par la créativité.

💬 4,65 milliards de dollars sur un tour d'amorçage pour une boîte qui n'a même pas encore de produit fini, ça donne le vertige, mais c'est surtout le signe que la Silicon Valley ne parie plus sur des applications IA, elle parie sur la recherche elle-même comme produit. Les résultats sur les noyaux GPU découverts sans équipe CUDA, ça c'est du concret, pas du storytelling de conférence. Reste que Socher promet de compresser des années de recherche scientifique en quelques semaines, et sur ce point précis, j'attends de voir tourner ça en dehors d'un benchmark maison avant d'y croire.

RecherchePaper
1 source
Un chercheur de Princeton propose le Recurrent Looped Transformer (RLT), qui conserve l'état du décodeur à chaque token avec 96 blocs fixes et une profondeur temporelle illimitée
Illustration générée par IA
25MarkTechPost 

Un chercheur de Princeton propose le Recurrent Looped Transformer (RLT), qui conserve l'état du décodeur à chaque token avec 96 blocs fixes et une profondeur temporelle illimitée

Un chercheur de Princeton, Yifan Zhang, propose dans un rapport technique une nouvelle architecture baptisée Recurrent Looped Transformer (RLT), conçue pour faire circuler l'état interne d'un modèle de langage d'un token à l'autre. Dans les décodeurs classiques, l'état calculé à la dernière couche pour un token n'est jamais transmis directement au token suivant : seule l'attention sur les clés et valeurs mises en cache assure la communication entre positions. Le RLT associe un encodeur causal, qui traite les tokens en parallèle et produit des représentations projetées en mémoire clé-valeur, à un décodeur récurrent dont l'état complet (sortie finale et cache d'attention à fenêtre glissante à chaque couche) est reporté d'un token à l'autre, sans réinitialisation entre le prompt et la réponse. Dans la configuration de référence, 48 couches d'encodeur et 48 couches de décodeur partagent des poids compatibles, ce qui porte à 96 le nombre de blocs logiques exécutés par token. Zhang précise qu'il s'agit d'une réutilisation de paramètres et non d'une simple copie d'activations. Le rapport ne présente aucune mesure d'efficacité, de qualité de raisonnement ou de passage à l'échelle : c'est une spécification architecturale, pas une évaluation empirique. L'enjeu principal de cette proposition est de permettre une profondeur temporelle de raisonnement non bornée tout en gardant un coût de calcul fixe par token. Après le traitement de t tokens, le chemin d'état depuis l'origine traverse 48×t blocs de décodeur dans la configuration de référence, ce qui signifie que la profondeur structurelle du calcul croît avec la longueur de la séquence, sans augmenter le travail requis pour chaque nouveau token. Pour l'industrie des grands modèles de langage, cela ouvrirait une voie alternative à l'augmentation de la taille des modèles ou du contexte pour améliorer le raisonnement, en misant plutôt sur la profondeur temporelle cumulée. Mais Zhang lui-même tempère cette promesse : les mécanismes de porte et de contraction du réseau peuvent supprimer l'information portée par ces longs chemins, donc une profondeur structurelle élevée ne garantit en rien un raisonnement plus performant. Aucune accélération de préremplissage n'est revendiquée, et le rapport indique explicitement qu'un passage parallèle standard d'un décodeur à fenêtre glissante n'équivaut pas à cette récurrence. Le rapport détaille aussi comment cette architecture s'articule avec l'entraînement par renforcement et le matériel. Pour le co-design algorithmique, le pré-entraînement, le fine-tuning supervisé, l'échantillonnage et le replay en RL partagent une même transition d'état : lors de l'entraînement RL, l'échantillonneur enregistre les probabilités réelles de chaque action, puis l'entraîneur reconstruit intégralement la mémoire et les caches depuis le début de la séquence avant de noter chaque action, sans jamais réutiliser d'anciens états. Côté matériel, les calculs d'encodeur restent parallélisables par token, mais les transitions du décodeur demeurent séquentielles au sein d'une même séquence, même si des mises à jour de séquences indépendantes peuvent être regroupées en un seul noyau de calcul batché. Le fine-tuning supervisé masque la perte sur les cibles de l'assistant mais jamais les mises à jour d'état, de sorte que les gradients remontent aussi à travers les tokens utilisateur et outils, un point que le rapport juge délicat à gérer avec des schémas de rétropropagation tronquée dans le temps. Cette proposition s'inscrit dans une recherche plus large de mécanismes de mémoire et de récurrence pour dépasser les limites des transformeurs purement attentionnels.

💬 Le vrai coup ici, c'est le découplage profondeur/coût : la profondeur de raisonnement grimpe avec la longueur de séquence sans alourdir le calcul par token, ça change la logique de scaling qu'on connaît. Mais Zhang le dit lui-même, ses propres portes peuvent effacer l'info qui remonte de si loin, donc plus de profondeur ne veut pas dire plus de raisonnement. Et surtout, zéro chiffre dans ce rapport : c'est une spec, pas une preuve, donc on retient l'idée et on oublie tout de suite les superlatifs.

RecherchePaper
1 source
FLM intègre le connectome de la drosophile dans un LLM figé de 1,2 milliard de paramètres, sans effet selon ses tests
Illustration générée par IA
26MarkTechPost 

FLM intègre le connectome de la drosophile dans un LLM figé de 1,2 milliard de paramètres, sans effet selon ses tests

Le développeur connu sous le pseudonyme nftechie a publié le Fly Language Model (FLM), un chatbot qui connecte l'intégralité du connectome de la mouche drosophile MaleCNS v1.0 à un modèle de langage gelé, LFM2.5-1.2B-Instruct de LiquidAI. Le code, sous licence MIT, tourne localement sous Python 3.12 (macOS, Linux, avec MPS, CUDA ou CPU) sans clé API, via le dépôt nftechie/flm. Techniquement, les 166 700 neurones et 25 582 938 connexions dirigées du connectome servent de "réservoir" figé : seule une couche de lecture de 278 528 paramètres est entraînée, soit environ 0,0238 % des 1,17 milliard de paramètres du modèle de base. Chaque token est projeté en 128 canaux transmis au graphe, dont l'état est mis à jour puis réinjecté sous forme de correction bornée dans les probabilités finales. Sur un jeu de test de 32 dialogues issus de SmolTalk (1236 tokens), la perte du modèle passe de 1,381995 à 1,359816 nats par token avec le circuit de la mouche, soit une perplexité réduite de 3,98 à 3,90. Ce résultat pourrait sembler prouver qu'un cerveau biologique améliore un modèle de langage, mais l'auteur du projet a lui-même conçu des expériences de contrôle qui démontrent le contraire. Un dispositif équivalent, recevant directement les mêmes signaux sans passer par le graphe neuronal, obtient un score encore meilleur (1,359328) dans les trois essais réalisés, et l'intervalle de confiance calculé ne permet pas d'attribuer un gain spécifique à l'anatomie de la mouche. Couper les connexions du graphe annule exactement l'effet, prouvant que le circuit est bien actif, mais mélanger l'identité des neurones sans réentraîner ramène la performance quasiment au niveau de départ, ce qui montre que c'est l'alignement appris de l'interface qui compte, pas la structure biologique en elle-même. C'est un signal important pour la communauté de l'IA et des neurosciences computationnelles : il illustre les risques de surinterpréter un gain de performance comme la preuve qu'un composant biologique confère un avantage cognitif, alors qu'un simple raccourci mathématique équivalent suffit. Ce projet s'inscrit dans la lignée d'un prototype antérieur, ngxson/fly-hf, qui utilisait un sous-ensemble de 49 393 neurones du cerveau central de la même mouche comme réservoir entraîné sur le corpus TinyStories, sans modèle de langage pré-entraîné en arrière-plan. L'auteur de FLM revendique explicitement ne pas être le premier à construire un modèle de langage basé sur un connectome, sa contribution portant plutôt sur l'échelle, avec le graphe complet, et sur une architecture qui isole clairement l'origine des compétences linguistiques. L'étude démontre par ailleurs que la récurrence du réseau s'estompe très vite, avec un facteur de contraction de 0,6 par token, ramenant l'écart initial à seulement 0,0000366 après vingt étapes : le connectome n'apporte donc aucune mémoire à long terme. Les artefacts complets de l'étude restant privés, les résultats ne sont pas encore reproductibles de façon indépendante, même si le code et une démonstration en ligne sont accessibles publiquement.

💬 Regarde bien le chiffre qui impressionne, une perplexité qui tombe de 3,98 à 3,90 grâce au cerveau de la mouche : il ne tient pas, et c'est l'auteur lui-même qui le démonte. Son propre contrôle, sans passer par le connectome, fait encore mieux, et mélanger l'identité des neurones sans réentraîner ramène quasiment au point de départ. La leçon à retenir pour la suite : un gain de perf ne prouve jamais qu'un composant biologique apporte un avantage cognitif, une simple couche apprise en sortie peut suffire à tout expliquer.

RecherchePaper
1 source
OpenAI ne veut qu'une chose : gagner
Illustration générée par IA
27The Verge AI 

OpenAI ne veut qu'une chose : gagner

OpenAI a annoncé cette semaine avoir résolu l'un des problèmes du prix du millénaire, une liste de sept défis mathématiques parmi les plus difficiles jamais formulés, établie en 2000 par le Clay Mathematics Institute, chacun doté d'une récompense d'un million de dollars. Un seul de ces problèmes, la conjecture de Poincaré, avait été résolu jusqu'ici, par le mathématicien russe Grigori Perelman en 2003. Cette annonce s'inscrit dans une série d'incursions d'OpenAI dans les mathématiques de haut niveau menées ces dernières années, l'entreprise ayant multiplié les démonstrations de ses modèles sur des problèmes réputés parmi les plus ardus de la discipline. Dans des circonstances normales, une telle percée aurait été saluée comme un événement historique pour les mathématiques. Mais une partie de la communauté mathématique observe la progression d'OpenAI avec une inquiétude croissante. L'entreprise y est perçue non pas comme une nouvelle venue enthousiaste contribuant au champ commun, mais comme un acteur aux moyens quasi illimités qui s'attaque à des questions auxquelles des chercheurs ont consacré des décennies entières de travail, sans égard apparent pour les normes établies de la discipline ni pour les conséquences que cela peut avoir sur ceux qui l'ont fait progresser pas à pas. Cet épisode illustre une tension plus large entre les laboratoires d'intelligence artificielle et les communautés scientifiques établies. À mesure qu'OpenAI et ses concurrents cherchent à démontrer la puissance de leurs modèles sur des terrains jugés jusque-là hors de portée des machines, la question se pose de savoir comment attribuer le mérite, encadrer la validation par les pairs et préserver la place des chercheurs humains dans des disciplines où la compétition avec l'IA devient désormais frontale.

💬 Résoudre un problème du prix du millénaire, c'est un exploit, pas une opération de com. Mais regarde la manière : OpenAI débarque sur un terrain que des chercheurs labourent depuis vingt ans, sans citer, sans validation par les pairs, sans partager le mérite avec ceux qui ont posé les fondations. Le vrai sujet n'est plus de savoir si le modèle sait faire des maths, c'est qui a le droit de dire qu'il les a faites.

RecherchePaper
1 source
Les LLM peuvent-ils concevoir leur propre harnais d'agent ? HarnessDev de ByteDance Seed : seuls 34 des 64 changements se généralisent
Illustration générée par IA
28MarkTechPost 

Les LLM peuvent-ils concevoir leur propre harnais d'agent ? HarnessDev de ByteDance Seed : seuls 34 des 64 changements se généralisent

Une équipe de ByteDance Seed, de la Singapore University of Technology and Design, de Georgia Tech, de M-A-P et de TokenWave.AI a présenté HarnessDev, un protocole qui évalue la capacité des modèles de langage à construire eux-mêmes leur « harnais » agentique, la boucle d'exécution, les outils, la mémoire et la vérification qui les entourent, plutôt que leurs simples réponses. Le test se déroule en deux phases : en Création, chaque modèle part d'un socle minimal (score nul partout) et doit bâtir un harnais complet à partir d'un cahier des charges et de quelques exemples ; en Évolution, il retravaille ce harnais grâce aux retours d'exécution sur 100 tâches SWE-bench Pro et 89 tâches Terminal-Bench 2.1, avant validation sur 630 instances inédites. Six modèles ont participé, dont Claude Opus 4.8, GPT-5.5 et Gemini 3.1 Pro, sur 2 207 tâches réparties en cinq bancs d'essai. Opus 4.8 obtient le meilleur score moyen, 67,8 points, contre 86,2 pour un harnais conçu par des ingénieurs humains, et seuls 34 des 64 changements testés en Évolution se sont révélés généralisables. La portée est concrète pour quiconque déploie des agents IA : la performance mesurée sur un benchmark dépend autant du harnais logiciel que du modèle. Les chercheurs citent GPT-5, qui résout 35,2 % des tâches de Terminal-Bench 2.1 dans le harnais Terminus 2 mais 49,6 % dans Codex CLI, à poids identiques. Les classements de modèles publiés sans préciser l'environnement d'exécution peuvent donc induire en erreur, et l'ingénierie de ces couches logicielles devient un levier de performance comparable à l'entraînement lui-même. L'étude montre aussi que produire plus de code n'aide pas : les 18 harnais de code ajoutent en moyenne 17 111 lignes, mais celui de Gemini, le plus sobre avec seulement 1 006 lignes, arrive en tête sur Terminal-Bench. Une bonne partie du code généré ne sert jamais : 18 des 108 composants testés ne se déclenchent jamais en conditions réelles, et 124 des 587 fonctionnalités d'écriture développées restent du code mort. Ces travaux s'inscrivent dans une tendance de la recherche sur les agents IA où l'attention se déplace des capacités brutes du modèle vers l'orchestration et le contexte qui l'entourent. Les chercheurs ont aussi testé la portabilité des harnais en les faisant tourner avec un exécuteur différent, Gemini 3.1 Pro : les classements ont été bouleversés, Qwen 3.7 Max gagnant 17,6 points sur BrowseComp, tandis que le score d'Opus 4.8 sur SWE-Pro s'effondrait de 69,3 à 33,0, son harnais ayant codé en dur une limite de 120 étapes calibrée pour son propre moteur. Cela révèle que les harnais que les modèles construisent pour eux-mêmes intègrent des hypothèses implicites propres à leur propre comportement, limitant leur transfert vers d'autres modèles. Lors de l'Évolution, les cinq créateurs opérant avec leur propre moteur ont tous progressé, avec des gains de 1,43 à 4,44 points, signe que l'auto-ingénierie de harnais reste prometteuse mais encore loin du savoir-faire d'ingénieurs humains spécialisés.

💬 Le chiffre qui change tout ici, c'est 35,2 % contre 49,6 % pour GPT-5 sur les mêmes tâches, juste en changeant de harnais : ça veut dire qu'un classement de modèles sans préciser l'environnement d'exécution ne veut plus rien dire. Bonne nouvelle, les modèles savent déjà bricoler leur propre outillage (et le plus sobre, mille lignes chez Gemini, bat les usines à gaz de 17 000 lignes), mais 86 points pour un ingénieur humain contre 68 pour le meilleur modèle, l'écart reste large. Et le vrai avertissement, c'est que seuls 34 des 64 changements testés se généralisent : l'auto-ingénierie de harnais, c'est prometteur, mais encore fragile.

RecherchePaper
1 source
Google Research dévoile ToolGrad, une méthode "answer-first" qui atteint 99,8% de réussite pour générer des données d'usage d'outils
Illustration générée par IA
29MarkTechPost 

Google Research dévoile ToolGrad, une méthode "answer-first" qui atteint 99,8% de réussite pour générer des données d'usage d'outils

Google Research, en collaboration avec l'Université de Tokyo, RIKEN AIP et l'Université de Tohoku, a publié ToolGrad, un framework qui génère des données d'entraînement pour l'usage d'outils par les LLM en inversant le pipeline habituel : au lieu de partir d'une requête utilisateur pour chercher ensuite une chaîne d'appels d'API valide, ToolGrad construit d'abord une chaîne d'exécution vérifiée, puis rédige la requête correspondante. Le système fonctionne par une boucle de quatre modules (proposition d'API, exécution parallèle, sélection du meilleur appel, réécriture de la requête et de la réponse), répétée par défaut sur 10 itérations et 50 API échantillonnées. Testé sur la base ToolBench, qui compte plus de 16 000 API réelles, ToolGrad atteint un taux de réussite de 99,8 %, contre 63,8 % pour l'approche classique par recherche en profondeur (DFS) utilisée par ToolBench et ToolACE, tout en produisant des chaînes plus longues (3,4 appels par échantillon contre 2,1) avec moins d'étapes de recherche (20 contre 34,3). À partir de ce système, l'équipe a généré un jeu de données de 500 exemples, ToolGrad-500, avec Gemini 2.5 Flash-Lite, puis affiné des modèles Gemma-3 de 1, 4 et 12 milliards de paramètres. Le code est publié sous licence Apache-2.0, avec modèles et données disponibles sur Hugging Face et un package sur PyPI. Ce gain d'efficacité change la donne pour l'entraînement des agents capables d'utiliser des outils, une capacité clé pour les assistants IA qui doivent enchaîner des appels API réels plutôt que de simples réponses textuelles. Le modèle ToolGrad-12B obtient un score de 83,1 sur le Berkeley Function Calling Leaderboard, un test qui utilise des outils différents de ceux vus à l'entraînement. Ce résultat le place au niveau de Gemini 2.5 Pro (83,2) et devant Claude 4.5 Opus (82,8) et GPT-5 (74,4), et il dépasse même Gemini 2.5 Flash-Lite, le modèle qui a pourtant servi à générer ses données d'entraînement. Pour l'industrie, cela signifie qu'il devient possible d'obtenir des performances comparables à celles de modèles propriétaires massifs avec des modèles bien plus petits et open source, à condition de disposer de données de meilleure qualité plutôt que de plus de volume, ce qui réduit les coûts de calcul et d'infrastructure nécessaires pour déployer des agents fiables. Cette avancée s'inscrit dans un problème connu du secteur : produire des jeux de données d'usage d'outils de qualité est coûteux et lent, car les pipelines existants comme ToolBench ou ToolACE reposent sur une exploration par IA qui échoue souvent, gaspillant du calcul sur des chemins sans issue avant même d'obtenir un échantillon exploitable. En garantissant d'abord une chaîne d'exécution réelle et fonctionnelle avant de générer la requête associée, ToolGrad élimine une grande partie de ce gaspillage. Les scripts de reproduction, testés sur une seule carte NVIDIA A100 40 Go via une image Docker vLLM, rendent la méthode accessible à des équipes de recherche disposant de ressources limitées. La compétition entre spécialistes open source de l'usage d'outils, comme ToolACE ou Hammer-2.1-7B, et les grands modèles propriétaires de Google, Anthropic et OpenAI devrait s'intensifier à mesure que ces techniques de génération de données plus efficaces se diffusent, avec pour enjeu la capacité à équiper des modèles légers, donc moins coûteux à faire tourner, de compétences agentiques jusqu'ici réservées aux modèles les plus puissants.

💬 L'inversion est maligne : au lieu de partir d'une requête puis chercher une chaîne d'API qui marche, ToolGrad part d'une chaîne vérifiée et écrit la question après coup, ça explique le bond de 63,8% à 99,8% de réussite. Ce qui compte vraiment là-dedans, c'est qu'un Gemma-3 12B entraîné sur ces données tape au niveau de Gemini 2.5 Pro et devant GPT-5 sur le function calling : la qualité de la donnée d'entraînement compte plus que la taille du modèle pour fabriquer des agents qui appellent des outils. Reste à voir si ça tient sur des API réelles en prod, pas juste sur un benchmark de 16 000 outils.

RecherchePaper
1 source
Évaluer la qualité des légendes vidéo par questions à choix multiples
Illustration générée par IA
30Apple Machine Learning 

Évaluer la qualité des légendes vidéo par questions à choix multiples

Les chercheurs à l'origine des travaux intitulés « Putting Captions to the Test » s'attaquent à un problème méthodologique de longue date dans l'évaluation des modèles visuels de langage (VLLM) : la mesure de la qualité des légendes vidéo générées automatiquement. Jusqu'à présent, les métriques dominantes comparent le texte produit par un modèle à une légende de référence rédigée par des humains, en cherchant une correspondance lexicale directe. Or une même vidéo admet de nombreuses descriptions valides, un phénomène que les auteurs qualifient de nature "one-to-many" de la description vidéo. Une légende peut donc être exacte, détaillée et pertinente, tout en étant pénalisée simplement parce qu'elle emploie d'autres mots ou met l'accent sur un élément visuel différent de celui choisi dans la référence. Les auteurs proposent de repenser cette évaluation en la fondant sur la fidélité de l'information plutôt que sur la similarité textuelle, une légende devant avant tout maximiser la couverture des éléments réellement présents dans la vidéo. Cette reformulation a une portée pratique directe pour l'industrie des modèles multimodaux : elle affecte la manière dont les laboratoires classent et améliorent leurs VLLM sur les tâches de description vidéo. Des métriques mal calibrées, qui sanctionnent des sorties correctes pour de mauvaises raisons, biaisent l'entraînement et la sélection de modèles, poussant parfois les équipes à optimiser pour coller au style d'une référence plutôt que pour la justesse factuelle. Une évaluation plus fine, capable de distinguer les erreurs d'information des simples divergences de formulation, permettrait des comparaisons de modèles plus fiables et des retours d'entraînement plus pertinents, un enjeu central alors que la génération automatique de légendes vidéo se répand dans la recherche d'information, l'accessibilité et la modération de contenu. Ce travail s'inscrit dans un mouvement plus large de la recherche en IA multimodale, qui cherche à dépasser les métriques de similarité textuelle classiques (de type n-grammes) au profit d'évaluations sémantiques et factuelles, notamment via des questions à choix multiples permettant de vérifier point par point si une information est effectivement présente dans une légende. Cette approche fait écho à des méthodes déjà explorées pour évaluer la fidélité factuelle de résumés textuels ou de réponses de grands modèles de langage. Reste à voir comment ce nouveau cadre d'évaluation sera adopté par la communauté et intégré aux benchmarks standards utilisés pour comparer les futurs VLLM.

RecherchePaper
1 source
SimpleDesign : un modèle conjoint pour la conception simultanée de séquences et structures de protéines
Illustration générée par IA
31Apple Machine Learning 

SimpleDesign : un modèle conjoint pour la conception simultanée de séquences et structures de protéines

Les protéines occupent un rôle central dans les processus biologiques, leur fonction dépendant de l'interaction complexe entre la séquence d'acides aminés qui les compose et la structure tridimensionnelle qu'elles adoptent. Un nouveau modèle baptisé SimpleDesign a été développé pour aborder ce problème sous un angle différent des approches existantes: la conception conjointe (codesign) de la séquence et de la structure protéiques au sein d'un même système génératif. Jusqu'à présent, les modèles dominants reposaient sur un entraînement en plusieurs étapes distinctes, avec d'abord des autoencodeurs chargés de convertir les données en représentations latentes compactes, puis un modèle génératif entraîné séparément sur ces représentations latentes. Cette approche multi-étapes, bien qu'efficace, pose une limite structurelle: elle traite la séquence et la structure comme deux modalités largement indépendantes plutôt que comme un tout intrinsèquement lié, ce qui peut nuire à la cohérence des protéines générées. Pour des domaines comme la découverte de médicaments et l'ingénierie des protéines, disposer d'un modèle capable de saisir nativement cette relation multi-modale représente un enjeu direct: des protéines conçues avec une meilleure cohérence entre forme et fonction pourraient accélérer la conception de nouvelles molécules thérapeutiques ou d'enzymes sur mesure. Ce travail s'inscrit dans une dynamique de recherche plus large autour des modèles génératifs appliqués à la biologie structurale, où l'enjeu consiste précisément à dépasser les pipelines fragmentés hérités du traitement du langage et de l'image pour construire des architectures pensées dès le départ pour la nature conjointe des données biomoléculaires. En simplifiant le processus d'entraînement classique en deux temps, SimpleDesign s'inscrit dans une tendance vers des architectures plus unifiées, dont les prochaines étapes consisteront probablement à valider les gains de performance face aux méthodes multi-étapes établies sur des benchmarks de conception protéique.

RecherchePaper
1 source
Métrique d'évaluation des agents pour les conversations multi-tours
Illustration générée par IA
32AWS ML Blog 

Métrique d'évaluation des agents pour les conversations multi-tours

Une nouvelle méthode d'évaluation des agents conversationnels multi-tours, baptisée AEM (Agent Evaluation Metric), a été présentée pour résoudre un problème précis : dans une conversation à plusieurs échanges avec un agent IA, une seule erreur commise tôt peut se propager silencieusement dans tous les tours suivants sans que les métriques classiques ne le détectent. L'exemple donné est celui d'un assistant d'entreprise chargé de générer un rapport de ventes sur cinq tours d'échange : au deuxième tour, l'agent choisit la bonne action mais utilise le paramètre "profit" au lieu de "revenu". Cette erreur unique contamine ensuite silencieusement les tours 3, 4 et 5. Une évaluation classique, qui ne juge que le résultat final, marquerait l'ensemble de l'interaction comme un échec, sans jamais révéler qu'un seul tour est fautif. AEM, à l'inverse, décompose la qualité en sous-métriques nommées et mesurables indépendamment à chaque tour, ce qui permet d'isoler la cause racine des effets qui en découlent. Pour cette première version, AEM mesure la dimension "correction" via deux sous-métriques : la véracité (truthfulness), qui vérifie si les valeurs produites par l'agent, que ce soit dans les paramètres d'appels d'outils ou dans les réponses en langage naturel, correspondent aux faits attendus, et la complétude (completeness), qui vérifie qu'aucun élément requis ni aucun paramètre n'est manquant. Cette approche répond à une limite bien identifiée des outils d'évaluation existants, qui notent la qualité de façon globale, au niveau de la tâche ou de la réponse entière, via des scores de complétion d'objectif ou des évaluations par un modèle-juge (LLM-as-judge). Savoir qu'un agent a "réussi à 70 %" son objectif ne dit rien sur la nature du problème : erreur factuelle, information manquante ou mauvais choix d'outil. Pour les équipes qui déploient des agents conversationnels en production, notamment dans des contextes d'entreprise où les tâches s'enchaînent sur plusieurs tours, cette granularité change la manière de déboguer et de corriger les systèmes, en identifiant précisément quel tour et quel type d'erreur doit être traité, plutôt que de reprendre l'ensemble de la conversation. Le constat de départ est que les métriques existantes souffrent de trois angles morts : les métriques au niveau de la tâche indiquent si l'objectif est atteint mais pas quelle dimension de qualité a échoué, les métriques à tour unique évaluent chaque réponse isolément sans tenir compte de la propagation des erreurs, et les scores globaux ne permettent pas de distinguer une erreur factuelle d'un champ manquant. Les concepteurs d'AEM présentent la correction comme la première dimension d'un indicateur composite appelé à s'étendre à d'autres axes, comme la sécurité ou la rétention des instructions, sans nécessiter de refonte de la méthode d'évaluation.

💬 C'est le genre de détail qui ne se voit pas en démo mais qui sauve des heures en prod. Un score de complétion à 70% ne dit jamais si l'agent s'est planté sur un fait, un paramètre manquant ou le mauvais outil, et c'est justement ce trou qu'AEM vient combler en notant chaque tour séparément. Reste à voir si ça tient sur une vraie conversation d'entreprise avec ses branches et ses relances, mais isoler le tour fautif plutôt que rejouer toute la conversation, c'est déjà un vrai gain de temps.

RecherchePaper
1 source
Pourquoi les agents de recherche en apprentissage automatique ne sur-apprennent-ils pas ?
Illustration générée par IA
33Amazon Science 

Pourquoi les agents de recherche en apprentissage automatique ne sur-apprennent-ils pas ?

Des chercheurs se penchent sur une énigme centrale de l'apprentissage automatique : pourquoi les modèles de langage utilisés comme agents de recherche autonomes en machine learning ne finissent-ils pas par sur-apprendre les benchmarks qu'ils optimisent en boucle. Selon la théorie classique, réutiliser sans cesse un même jeu de données pour évaluer et ajuster un modèle devrait le transformer en données d'entraînement déguisées, ce qui gonflerait artificiellement les scores sans amélioration réelle, un phénomène connu sous le nom de surapprentissage. Or la communauté de recherche en apprentissage automatique répète depuis des années ce même schéma : évaluer un modèle sur un benchmark public, ajuster la méthode, republier, et laisser l'équipe suivante grappiller encore un peu de performance sur ces mêmes jeux de données, parfois inchangés depuis des années. Plusieurs études ayant reconstruit des jeux de test entièrement neufs pour des benchmarks anciens et très sollicités ont montré que les progrès mesurés se transfèrent effectivement aux nouvelles données, contredisant la prédiction théorique d'un surapprentissage massif. Pour tester ce mystère de façon rigoureuse, impossible avec une communauté humaine qu'on ne peut ni réinitialiser ni faire rejouer dans des conditions contrôlées, des chercheurs ont eu recours à des agents de recherche autonomes fondés sur de grands modèles de langage, capables de mener eux-mêmes les mêmes boucles d'optimisation itérative que les chercheurs humains sur des benchmarks de machine learning. Leurs travaux sont détaillés dans un article intitulé « What fits (into few tokens) doesn't overfit: Compression and generalization in ML research agents ». Le résultat est frappant : ces agents, tout comme la communauté scientifique qu'ils imitent, grimpent au classement des benchmarks sans manifester le surapprentissage massif que prédit la théorie. Cette observation a une portée directe pour la crédibilité des progrès annoncés en apprentissage automatique : elle suggère que l'amélioration continue des scores sur des benchmarks publics, souvent critiquée comme un simple jeu d'optimisation déconnecté de la réalité, reflète bel et bien des gains de performance généralisables et non un artefact statistique. Pour l'industrie, cela renforce la légitimité du principe même sur lequel repose l'évaluation des modèles depuis une décennie, à savoir comparer les systèmes sur des jeux de données partagés et publics. Pour les équipes qui développent des agents autonomes de recherche en IA, désormais capables de mener elles-mêmes des cycles complets d'expérimentation, la découverte est aussi rassurante : automatiser la recherche ne semble pas, en soi, introduire un biais de surapprentissage supplémentaire par rapport à ce que ferait un chercheur humain. L'explication avancée par les auteurs s'appuie sur une idée ancienne, le rasoir d'Occam, selon lequel, entre deux hypothèses expliquant aussi bien les données, la plus simple a le plus de chances d'être correcte. Les chercheurs montrent que cette intuition philosophique se formalise mathématiquement, en la reliant à la capacité de compression de l'information, comme le suggère le titre de leur étude. Comme un agent de recherche, contrairement à une communauté scientifique entière, peut être réinitialisé, sa mémoire effacée et son accès à l'information rigoureusement contrôlé, il devient possible de reproduire l'expérience à volonté et d'isoler les mécanismes en jeu, une approche impossible à mener sur des décennies de publications humaines. Cette piste s'inscrit dans un débat plus large sur la fiabilité des benchmarks qui structurent le champ depuis des années, alors que l'essor d'agents IA capables de mener leurs propres cycles de recherche pose la question de savoir si les mêmes garde-fous méthodologiques, et les mêmes limites, s'appliqueront à mesure que ces systèmes gagneront en autonomie.

RecherchePaper
1 source
Cette IA d’OpenAI aurait résolu un problème de maths vieux de 90 ans… en 88 heures
Illustration générée par IA
34Le Big Data 

Cette IA d’OpenAI aurait résolu un problème de maths vieux de 90 ans… en 88 heures

OpenAI a annoncé le 8 septembre 2026, via un message publié sur son compte X, avoir produit une preuve pour l'équation de Navier-Stokes, l'un des sept problèmes du millénaire recensés par le Clay Mathematics Institute en 2000, chacun assorti d'une récompense d'un million de dollars. Selon l'entreprise, un groupe de plus de 10 000 agents IA, s'appuyant sur un modèle de nouvelle génération présenté comme "significativement plus capable" que GPT-6 Astra, a travaillé pendant 88 heures et généré plus de 130 milliards de tokens pour aboutir à une preuve analytique accompagnée d'une formalisation en Lean. Le résultat démontrerait qu'un fluide régi par la dynamique de Navier-Stokes peut développer une singularité en temps fini, sous la forme d'un vortex qui se resserre et s'étire comme un morceau de spaghetti. Mark Chen, responsable de la recherche chez OpenAI, évalue le coût de cette démonstration à plusieurs millions de dollars. Sam Altman a expliqué que la tentative faisait suite à des rumeurs selon lesquelles des modèles d'Anthropic auraient résolu un autre problème du millénaire, poussant OpenAI à tester ses propres capacités sur un défi équivalent. Cette annonce illustre la montée en puissance des IA sur des tâches de raisonnement mathématique avancé, jusqu'ici considérées comme le domaine réservé des chercheurs humains les plus spécialisés. L'équation de Navier-Stokes, formulée par Henri Navier en 1822 puis achevée par George Gabriel Stokes en 1845, décrit le comportement des liquides et des gaz et sert de socle à des applications très concrètes, des modèles météorologiques aux calculs d'aérodynamique aéronautique. Une preuve validée aurait donc des retombées bien au-delà des mathématiques pures. Mais l'épisode révèle aussi la dynamique de compétition entre grands laboratoires d'IA, chacun cherchant à démontrer, parfois dans la précipitation, des capacités de recherche scientifique autonome, avec le risque de communiquer des résultats non encore vérifiés par la communauté scientifique. Deux chercheurs ont rapidement signalé des ressemblances entre la démarche d'OpenAI et leurs propres travaux antérieurs, alimentant les doutes sur l'originalité de la contribution. Le président du Clay Mathematics Institute a salué une "journée importante" tout en rappelant la rigueur du processus de validation d'un problème du millénaire: publication dans une revue scientifique reconnue, examen approfondi par des spécialistes, acceptation par la communauté, puis un délai d'au moins deux ans après publication avant toute reconnaissance officielle. À ce jour, seul un problème du millénaire, la conjecture de Poincaré, a été résolu, par Grigori Perelman en 2003. L'affaire OpenAI s'inscrit ainsi dans une rivalité croissante avec Anthropic sur le terrain du raisonnement scientifique, dont les prochaines étapes dépendront désormais de l'examen par les mathématiciens plutôt que des annonces des entreprises.

💬 88 heures, plus de 130 milliards de tokens, plusieurs millions de dollars : impressionnant sur le papier. Mais une preuve non relue par des mathématiciens n'est pas une preuve, c'est une annonce, et le calendrier du Clay Institute, des années de vérification avant toute reconnaissance, le rappelle bien mieux que le tweet d'OpenAI. Le vrai signal, c'est que la course avec Anthropic pousse les labos à publier plus vite que la science ne peut valider, et ça va coûter cher en crédibilité si le résultat se dégonfle.

OpenAI annonce avoir trouvé une singularité de Navier-Stokes en 88h avec Astra-next, candidat au prix du millénaire
Illustration générée par IA
35Latent Space 

OpenAI annonce avoir trouvé une singularité de Navier-Stokes en 88h avec Astra-next, candidat au prix du millénaire

Le 7 et 8 septembre 2026, des comptes proches d'OpenAI ont affirmé qu'un effort assisté par intelligence artificielle avait permis d'obtenir un résultat sur les équations de Navier-Stokes, l'un des sept problèmes du prix du Millénaire dotés chacun d'un million de dollars par l'institut Clay. Selon le chercheur Ethan Knight, cette avancée serait le fruit d'une collaboration d'environ 10 000 agents IA, entraînés pendant près d'un an grâce à de l'apprentissage par renforcement multi-agents, capables de s'organiser eux-mêmes et de mobiliser d'importantes quantités de calcul parallèle au moment de l'inférence plutôt qu'une seule longue chaîne de raisonnement. Le travail aurait mobilisé un modèle désigné sous le nom d'Astra-next, consommé environ 130 milliards de tokens pour un coût dépassant 40 millions de dollars, en 88 heures selon un chiffre qui, en réalité, ne provient que d'un message à ton satirique et n'a pas été confirmé directement par les sources proches d'OpenAI. Le résultat porterait sur la question de l'apparition, en temps fini, d'une singularité dans les solutions des équations de Navier-Stokes, l'un des points les plus disputés de ce problème mathématique ouvert depuis des décennies. Si cette annonce se confirme, elle marquerait un tournant : ce serait seulement la deuxième fois qu'un prix du Millénaire serait attribué, après la résolution de la conjecture de Poincaré par Grigori Perelman au début des années 2000, et la première fois qu'un tel résultat serait obtenu avec une contribution aussi déterminante de systèmes d'IA. L'épisode est aussitôt devenu un test de la thèse selon laquelle les modèles de pointe seraient incapables de produire un travail de recherche ou de codage réellement sérieux, un observateur qualifiant l'événement de moment de bascule pour le monde scientifique. D'autres y ont vu la preuve que l'industrie de l'IA est entrée dans un régime de calcul massif où des problèmes jusque-là hors de portée pourraient céder simplement grâce à d'énormes volumes de calcul parallèle non structuré, une évolution aux implications concrètes pour la recherche académique, l'allocation des ressources de calcul et la manière dont les découvertes scientifiques seront validées à l'avenir. Aucun énoncé formel du théorème, aucun préprint, aucune esquisse de preuve, aucune vérification formelle ni rapport de relecture indépendant n'a toutefois été fourni publiquement au moment de ces échanges, et le rôle exact des humains par rapport aux modèles dans le processus reste flou, alimentant une controverse sur la paternité du résultat qu'OpenAI et les chercheurs concernés n'ont pas entièrement dissipée. Cette annonce a éclipsé une journée pourtant chargée en actualités : une levée de fonds de 48 milliards de dollars pour Cognition, une autre de 24 milliards pour Mistral, le lancement de GPT Image 2.5 chez OpenAI, ou encore le relancement par Meta de son agent Muse, issu du projet Dreamer. La procédure de l'institut Clay impose normalement une publication puis un délai d'observation avant toute validation officielle, ce qui laisse présager un examen scientifique prolongé avant qu'un verdict définitif ne soit rendu sur la réalité et la solidité de cette percée.

💬 Bon, sur le papier c'est le genre de truc qu'on attendait depuis 2 ans : dix mille agents qui s'organisent tout seuls sur un problème à un million de dollars. Sauf qu'il n'y a ni preprint, ni preuve formelle, ni relecture indépendante, juste des captures d'écran et un chiffre de 88h qui vient d'un message ironique. Ce qui compte ici, ce n'est pas le résultat mathématique, c'est le signal : l'industrie IA teste déjà la thèse "on résout par calcul massif plutôt que par preuve rigoureuse", et Clay va devoir juger sur pièces, pas sur hype.

RecherchePaper
1 source
Ce que la controverse d'OpenAI révèle sur l'avenir des mathématiques
Illustration générée par IA
36MIT Technology Review 

Ce que la controverse d'OpenAI révèle sur l'avenir des mathématiques

OpenAI a annoncé avoir résolu l'un des sept problèmes du prix du millénaire, sélectionnés en 2000 par le Clay Mathematics Institute et dotés chacun d'un million de dollars, en l'occurrence le problème dit de Navier-Stokes sur l'existence et la régularité des solutions, qui porte sur les équations décrivant l'écoulement de fluides comme l'eau ou l'air. Un seul de ces sept problèmes avait été résolu jusqu'ici. La preuve d'OpenAI, obtenue grâce à un modèle interne présenté comme nettement plus performant qu'Astra, sorti la semaine précédente, montre que les équations complètes de Navier-Stokes peuvent, sous certaines conditions, décrire un état physiquement impossible, comme une vitesse infinie. Deux jours plus tôt, le lundi, le mathématicien de NYU Tristan Buckmaster avait publié sur Mastodon une preuve montrant qu'une version simplifiée des mêmes équations présentait déjà ce type de rupture, fruit de près d'un an de travail mené avec Levent Alpöge, employé d'Anthropic, à l'aide de modèles publics d'OpenAI et d'Anthropic. Sébastien Bubeck, membre de l'équipe technique d'OpenAI, a expliqué lors d'un point presse que l'entreprise s'était lancée sur ce problème après avoir entendu une rumeur sur les travaux de Buckmaster et Alpöge. OpenAI dit ne pas vouloir réclamer le million de dollars associé à la résolution du problème. L'affaire dépasse la seule prouesse mathématique. Buckmaster accuse OpenAI de s'être appuyé sur son travail et celui d'Alpöge sans les créditer, ce qu'OpenAI dément. Selon un document qu'il a publié, des employés d'OpenAI lui auraient proposé deux options: publier ses travaux avec Alpöge pour qu'OpenAI diffuse sa propre solution le lendemain, ou co-écrire un article avec OpenAI dont Alpöge serait exclu en raison de son appartenance à Anthropic, principal rival d'OpenAI. Buckmaster affirme aussi avoir demandé si les agents d'OpenAI avaient eu accès aux transcriptions de ses échanges avec les modèles, ce qui lui a été nié, et si ces modèles avaient été entraînés sur ces transcriptions, question restée sans réponse. Que les modèles d'OpenAI aient ou non exploité ces travaux, l'épisode illustre un changement d'échelle: les problèmes mathématiques les plus difficiles semblent désormais exiger des ressources en IA que seules quelques entreprises de pointe possèdent, en dehors des circuits classiques de collaboration académique, ce qui interroge la place des mathématiciens humains dans ce nouveau paysage. Le problème de Navier-Stokes fait partie des sept énigmes retenues en 2000 par le Clay Mathematics Institute, dont une seule avait été résolue avant cette annonce. Ces équations, largement utilisées en dynamique des fluides, restaient mal comprises sur un point crucial: on ignorait si elles pouvaient, sous certaines conditions, décrire des situations physiquement absurdes. L'épisode s'inscrit dans une rivalité croissante entre OpenAI et Anthropic, dont les modèles respectifs ont tous deux servi aux travaux préliminaires de Buckmaster et Alpöge avant même l'intervention d'OpenAI. Sollicité par MIT Technology Review, Buckmaster n'avait pas répondu au moment de la publication. L'affaire pourrait relancer le débat sur les règles de crédit et de propriété intellectuelle à mesure que les laboratoires d'IA s'invitent dans la recherche mathématique fondamentale, un terrain jusqu'ici régi par des normes de collaboration et d'attribution différentes de celles qui dominent l'industrie technologique.

💬 Oublie le million de dollars et Navier-Stokes à moitié résolu par deux boîtes rivales, retiens plutôt qu'un mathématicien de NYU se retrouve à négocier ses conditions de crédit avec OpenAI comme avec un employeur. La recherche mathématique de pointe est en train de sortir des circuits académiques pour tomber sous la coupe de deux ou trois labos, les seuls à avoir des modèles assez puissants pour attaquer ces problèmes. Sur le papier c'est bluffant, mais la question de qui a droit à la paternité d'une preuve reste sans réponse, et vu la rivalité OpenAI-Anthropic, tu peux parier que ça va se reproduire.

RecherchePaper
1 source
Pathway développe une architecture inspirée du cerveau sur Amazon SageMaker HyperPod
Illustration générée par IA
37AWS ML Blog 

Pathway développe une architecture inspirée du cerveau sur Amazon SageMaker HyperPod

Pathway, une entreprise spécialisée en architectures d'IA, a développé BDH (Dragon Hatchling), un modèle inspiré du cerveau qui rompt avec le paradigme des transformers dominant depuis une dizaine d'années. Contrairement aux grands modèles de langage classiques, qui externalisent le raisonnement sous forme de chaînes de pensée (chain-of-thought) en générant de longues suites de tokens intermédiaires, BDH effectue son raisonnement directement dans un espace latent. Le modèle est conçu comme un graphe de neurones communiquant par interactions locales et éparses, avec un état maintenu dans des connexions de type synaptique qui s'adaptent au contexte sans mise à jour des poids au moment de l'inférence. Une variante, BDH-CQ, met à jour la mémoire interne du modèle pendant l'inférence via un calcul itératif dans un état latent récurrent, ne décodant que les réponses candidates, sans passage par un raisonnement verbalisé ni besoin de fine-tuning. Pour entraîner et faire évoluer cette architecture, Pathway s'appuie sur Amazon SageMaker HyperPod, qui permet à ses équipes de scientifiques en IA appliquée de partager des ressources de calcul de manière résiliente et économique, tout en s'intégrant à des frameworks courants comme PyTorch. Cette approche s'attaque directement aux limites structurelles des transformers, qui pèsent aujourd'hui autant sur l'entraînement que sur l'usage en production. Les transformers peinent à généraliser au-delà de leurs données d'entraînement, notamment sur des tâches de raisonnement long, ce qui oblige à mobiliser des volumes de données et de calcul considérables. Leur mécanisme d'attention et leur cache clé-valeur croissant limitent la longueur des séquences traitables, tandis que leur fonctionnement interne reste largement opaque, compliquant l'interprétation du raisonnement dans des secteurs réglementés où la fiabilité est critique. En proposant un raisonnement moins coûteux en tokens et un modèle capable d'ajuster son état sans réentraînement complet, BDH pourrait réduire les coûts d'inférence tout en limitant le phénomène d'oubli catastrophique qui touche les modèles actuels lors de mises à jour de connaissances. Pour l'industrie, cela ouvre la perspective de systèmes plus économes en calcul et potentiellement plus transparents, un enjeu de plus en plus pressant à mesure que les coûts d'inférence des modèles de raisonnement explosent. Cette initiative s'inscrit dans un mouvement plus large de remise en question du tout-transformer, alors que la majorité des progrès récents en IA reposait sur l'augmentation de l'échelle des modèles, des données d'entraînement, de la longueur du contexte et du calcul mobilisé à l'inférence. Pathway met en avant le fait que les LLM actuels oublient au fil des longues interactions, ne conservent pas d'information d'une session à l'autre, et nécessitent un réentraînement pour intégrer de nouvelles connaissances, des limites que l'entreprise attribue directement aux choix architecturaux des transformers plutôt qu'à de simples détails d'implémentation. En s'appuyant sur l'infrastructure cloud d'Amazon pour industrialiser l'entraînement de BDH, Pathway signale une volonté de faire passer cette architecture alternative du stade de recherche à un déploiement à plus grande échelle. Reste à voir si cette approche parviendra à s'imposer face à l'écosystème massivement investi dans les transformers, ou si elle restera une piste parmi d'autres explorées par la recherche pour dépasser les limites actuelles des grands modèles de langage.

UEPathway, startup franco-européenne, développe une architecture alternative aux transformers, renforçant la contribution européenne a la recherche en IA.

RecherchePaper
1 source
Pathway développe une architecture inspirée du cerveau sur Amazon SageMaker HyperPod
Illustration générée par IA
38AWS ML Blog 

Pathway développe une architecture inspirée du cerveau sur Amazon SageMaker HyperPod

La société Pathway a développé BDH-CQ, une architecture d'intelligence artificielle inspirée du cerveau humain, baptisée Dragon Hatchling, et l'a entraînée à grande échelle grâce à Amazon SageMaker HyperPod. Contrairement aux grands modèles de langage classiques qui exploitent l'architecture transformeur et externalisent leur raisonnement sous forme de chaînes de pensée textuelles, générant de nombreux tokens intermédiaires avant de produire une réponse, BDH effectue son raisonnement directement dans un espace latent. Le modèle est conçu comme un graphe de neurones communiquant par interactions locales et éparses, dont l'état est maintenu par des connexions de type synaptique qui s'adaptent au contexte sans nécessiter de mise à jour des poids au moment de l'inférence. La variante BDH-CQ actualise la mémoire interne du modèle pendant l'inférence par un calcul itératif au sein d'un état latent récurrent, et ne décode que les réponses candidates finales, sans passage par de longues traces de raisonnement verbalisées. Le système s'intègre à des cadres de développement courants comme PyTorch, et l'infrastructure de calcul partagée d'Amazon permet aux équipes de scientifiques de Pathway de répartir les ressources de façon résiliente et économique. Cette approche vise à corriger des limites jugées structurelles dans l'architecture transformeur, en place depuis près de dix ans sans changement majeur. Les modèles actuels peinent à généraliser au-delà de leurs données d'entraînement sur des tâches de raisonnement long, exigent des volumes de données et de calcul considérables, et souffrent d'un oubli catastrophique lorsqu'ils doivent intégrer de nouvelles connaissances sans réentraînement complet. À l'inférence, la fenêtre de contexte fixe et la croissance du cache clé-valeur limitent la longueur des séquences traitées, tandis que les mécanismes d'attention denses consomment beaucoup de mémoire et de calcul, même avec des techniques de mélange d'experts. L'opacité de l'état interne des transformeurs rend aussi leur raisonnement difficile à interpréter ou à auditer, un problème sensible pour les secteurs fortement régulés où la fiabilité et la traçabilité des décisions sont exigées. Ces limites ont conduit une partie de la recherche à chercher des alternatives ne reposant plus uniquement sur l'augmentation de la taille des modèles, du volume de données ou du calcul consommé à l'inférence. En misant sur une architecture bio-inspirée capable d'apprendre et de raisonner sans traduire chaque étape en texte, Pathway cherche à réduire le coût en tokens du raisonnement tout en conservant une mémoire persistante entre les interactions, un point faible connu des grands modèles actuels qui oublient le contexte d'une session à l'autre. Le recours à l'infrastructure cloud d'Amazon pour l'entraînement illustre par ailleurs comment les fournisseurs de calcul soutiennent désormais des pistes de recherche s'écartant du paradigme transformeur dominant, dans un secteur où la course à l'échelle atteint des limites de coût et d'efficacité de plus en plus visibles.

UEPathway, société basée à Paris, développe et entraîne une architecture d'IA alternative aux transformeurs, illustrant la capacité d'un acteur français à mener une recherche architecturale de pointe.

RecherchePaper
1 source
Google DeepMind publie AlphaGenome Atlas avec prédictions d'effets moléculaires et scores AVI pour 9 milliards de variants d'ADN humain
Illustration générée par IA
39MarkTechPost 

Google DeepMind publie AlphaGenome Atlas avec prédictions d'effets moléculaires et scores AVI pour 9 milliards de variants d'ADN humain

Google DeepMind a publié le 8 septembre 2026 AlphaGenome Atlas, une base de données regroupant des prédictions précalculées sur les effets moléculaires de pratiquement toutes les variantes génétiques possibles à un seul nucléotide dans le génome humain, soit environ 9 milliards de mutations ponctuelles. La ressource introduit aussi le score AVI (AlphaGenome Variant Impact), un indicateur unique qui classe chaque variante selon son impact prédit, accompagné d'attributions détaillées par variante et d'un catalogue de plus de 2 500 motifs d'ADN récurrents, incluant des sites de fixation de facteurs de transcription. L'ensemble représente un pétaoctet de données, soit plus de 30 fois la taille de la AlphaFold Database, qui contenait déjà plus de 200 millions de prédictions de structures protéiques. L'Atlas est accessible gratuitement via un portail web pour la recherche académique, par l'API AlphaGenome et comme fonctionnalité dans Google Antigravity ; un accès commercial sur Google Cloud est annoncé comme prochainement disponible, tandis que le modèle AlphaGenome sous-jacent, sorti en juin 2025, reste disponible sur GitHub pour un usage académique et sur Model Garden pour un usage commercial. Cette publication change la manière dont les chercheurs en génétique et en médecine peuvent étudier les mutations. Jusqu'ici, AlphaGenome ne pouvait être interrogé que variante par variante ou région par région, ce qui rendait les études à l'échelle du génome complet lentes et coûteuses en calcul. Tester expérimentalement 9 milliards de mutations en laboratoire est tout simplement impossible ; disposer d'une table de correspondance déjà calculée, avec interprétation intégrée, supprime ce goulot d'étranglement. Le score AVI a un intérêt particulier car il combine les prédictions régulatrices d'AlphaGenome avec celles d'AlphaMissense, un autre modèle de DeepMind spécialisé dans les variantes qui modifient les protéines, ce qui lui permet de couvrir aussi bien les régions codantes (environ 2 % du génome) que les 98 % restants, non codants, longtemps plus difficiles à interpréter. Selon DeepMind, l'AVI obtient des performances de premier plan sur de nombreux tests de pathogénicité et de maladies rares, ce qui pourrait accélérer l'identification de variantes à risque dans la recherche sur les maladies génétiques, même si l'outil est explicitement présenté comme non destiné à un usage clinique. Ce lancement s'inscrit dans la continuité de la stratégie de DeepMind consistant à transformer des modèles prédictifs puissants mais coûteux à exécuter en ressources statiques et consultables à grande échelle, à l'image de ce qu'avait fait la AlphaFold Database pour les structures protéiques il y a plusieurs années. Les données d'attribution associées à chaque score AVI, qui détaillent la contribution de facteurs comme l'accessibilité de la chromatine, l'épissage de l'ARN ou la conservation évolutive, doivent permettre aux chercheurs de comprendre non seulement quelle variante est risquée, mais aussi pourquoi. DeepMind mentionne également avoir identifié un nombre accru d'associations non codantes grâce à l'analyse de plus de 54 000 génomes de la UK Biobank, ce qui suggère des applications immédiates en génomique des populations. L'enjeu à plus long terme sera de voir si cette approche par catalogue précalculé, gratuite pour la recherche mais bientôt payante pour un usage commercial, s'impose comme un standard pour d'autres modèles biologiques, et comment les autorités sanitaires encadreront la transition, encore lointaine, vers des applications cliniques.

UELes chercheurs français et européens en génomique peuvent accéder gratuitement a cette base de données pour leurs travaux académiques, même si aucune entité française ou européenne n'est impliquée dans le projet.

💬 L'AlphaFold Database avait montré la voie il y a quatre ans, et là DeepMind refait le même coup, mais sur l'ADN entier : 9 milliards de variantes déjà calculées, plus besoin d'attendre son tour sur le modèle. Le vrai déplacement, c'est que les 98% du génome non codant deviennent enfin exploitables au même titre que les gènes classiques, alors qu'ils étaient jusqu'ici la partie qu'on savait le moins interpréter. Reste que c'est explicitement hors clinique pour l'instant, et que l'accès commercial payant arrive vite derrière la version gratuite pour la recherche, donc la vraie bascule se jouera sur qui paiera pour l'usage médical réel.

RecherchePaper
1 source
Le modèle météo IA de Google gagne en précision grâce à une mise à jour
Illustration générée par IA
40Ars Technica AI 

Le modèle météo IA de Google gagne en précision grâce à une mise à jour

Google a publié la version 3 de son modèle de prévision météorologique par intelligence artificielle, WeatherNext, dont les détails techniques sont exposés dans un livre blanc publié récemment par l'entreprise. La principale nouveauté de cette mise à jour est l'intégration de données satellitaires en temps quasi réel dans le processus de modélisation, ce qui réduit considérablement le délai entre l'observation des conditions atmosphériques actuelles et la génération d'une nouvelle prévision. Google fait partie des acteurs majeurs du secteur de la prévision météo par apprentissage automatique, aux côtés d'autres géants technologiques qui développent leurs propres systèmes concurrents des modèles météorologiques traditionnels. Cette avancée est significative parce que les modèles d'IA offrent un avantage décisif sur les approches classiques de prévision numérique du temps : ils atteignent des performances comparables tout en nécessitant beaucoup moins de puissance de calcul. Concrètement, cela signifie que les prévisions peuvent être recalculées plus fréquemment, avec une actualité renforcée grâce à l'intégration des données satellitaires les plus récentes. Pour les services météorologiques, les agences gouvernementales, les compagnies aériennes ou les secteurs agricoles et énergétiques, une réduction du délai entre observation et prévision se traduit par une meilleure anticipation des événements météorologiques, notamment des phénomènes à évolution rapide comme les orages ou les tempêtes. Le fonctionnement de ces modèles repose largement sur la notion de « réanalyse », un processus qui agrège différentes sources de données météorologiques en une image cohérente et globale de l'atmosphère à un instant donné. Cette réanalyse doit combler les zones dépourvues de mesures directes par des estimations, car un modèle de prévision a besoin d'une couverture mondiale continue pour fonctionner correctement. En améliorant la qualité et la fraîcheur des données d'entrée grâce aux satellites, Google cherche à réduire les approximations inhérentes à cette étape de reconstruction. Cette évolution s'inscrit dans une compétition plus large entre grandes entreprises technologiques pour dominer un domaine où l'IA promet de rendre la prévision météorologique à la fois plus précise, plus rapide et moins coûteuse en ressources informatiques.

UELes services météorologiques et agences européennes pourraient bénéficier indirectement de prévisions plus rapides et moins couteuses, mais aucune entité ou réglementation française ou européenne n'est directement concernée.

RechercheOpinion
1 source
Ce médicament conçu grâce à l’IA n’était pas censé rajeunir les patients et pourtant…
Illustration générée par IA
41Le Big Data 

Ce médicament conçu grâce à l’IA n’était pas censé rajeunir les patients et pourtant…

Une nouvelle étude publiée dans Nature Biotechnology par Insilico Medicine, entreprise spécialisée dans la découverte de médicaments assistée par intelligence artificielle, révèle des résultats inattendus autour du rentosertib, un traitement initialement conçu pour les maladies pulmonaires chroniques. L'essai clinique a porté sur 42 participants, âgés en moyenne de 67,1 ans. Onze d'entre eux ont reçu un placebo ou aucun traitement, tandis que les autres ont pris du rentosertib pendant douze semaines. Les chercheurs ont ensuite mesuré l'évolution de leur âge biologique à l'aide de six horloges biologiques distinctes, des modèles d'IA qui estiment l'état biologique d'une personne à partir de données comme les modifications chimiques de l'ADN ou les protéines sanguines. Résultat frappant: chez tous les participants ayant reçu le rentosertib, les six indicateurs ont montré une diminution de l'âge biologique, alors que le groupe témoin a vu le sien augmenter ou rester stable. Ces résultats intéressent au-delà du seul champ pulmonaire, car ils suggèrent qu'un médicament conçu pour une pathologie précise pourrait agir plus largement sur les mécanismes du vieillissement biologique. Pour Insilico Medicine, c'est une validation potentielle de son approche: utiliser l'IA pour identifier des molécules capables de cibler simultanément plusieurs voies liées au vieillissement, et non un seul symptôme isolé. Si cette piste se confirme, elle ouvrirait des perspectives pour repenser la conception de traitements, en visant des effets systémiques sur la santé plutôt qu'une seule maladie. Pour l'industrie pharmaceutique, cela renforcerait aussi la crédibilité de l'IA comme outil de découverte capable de révéler des propriétés insoupçonnées de molécules déjà en développement, potentiellement en accélérant et en élargissant le champ des essais cliniques futurs. Ces annonces s'inscrivent toutefois dans un contexte scientifique où la prudence reste de mise. Les horloges biologiques, bien qu'de plus en plus utilisées pour étudier le vieillissement, ne reposent sur aucun standard universellement reconnu par la communauté scientifique: plusieurs méthodes coexistent et ne racontent pas toujours la même histoire, ce qui rend leur interprétation délicate. Un écart entre l'âge réel et l'âge biologique mesuré ne garantit pas mécaniquement un allongement de la durée de vie ou une meilleure santé globale. Des spécialistes mettent d'ailleurs en garde contre la tentation de vouloir optimiser ces marqueurs à tout prix, sans preuve que cela se traduit par un bénéfice clinique réel. Le rentosertib devra donc franchir plusieurs étapes supplémentaires, avec d'autres essais cliniques à plus grande échelle, avant de pouvoir prétendre à un quelconque statut de traitement anti-âge. L'enjeu dépasse ce seul médicament: il touche à la manière dont l'IA, en explorant des données biologiques massives, pourrait redéfinir les critères d'évaluation des traitements dans les années à venir.

RecherchePaper
1 source
Axis Robotics lance AXIS, un moteur de données pour la manipulation robotique avec 207 tâches et 50 129 trajectoires
Illustration générée par IA
42MarkTechPost 

Axis Robotics lance AXIS, un moteur de données pour la manipulation robotique avec 207 tâches et 50 129 trajectoires

Une équipe de chercheurs d'Axis Robotics, avec UC Berkeley, Georgia Tech et NTU, a présenté AXIS, un système de collecte de données pour la manipulation robotique qui fonctionne dans un navigateur : les contributeurs y téléopérent un bras Franka Research 3 à pince parallèle, dans un simulateur MuJoCo en WebAssembly, tandis que le rendu et l'entraînement tournent à distance sur huit GPU RTX 4090 et huit GPU A100. Plus de 70 000 contributeurs ont participé, et un module nommé TaskGen génère automatiquement tâches, scènes et objets à partir d'instructions en langage naturel. Le jeu de données publié compte 207 tâches, 50 129 trajectoires et plus de 60 000 variantes réparties sur sept catégories de scènes, pour 2,36 téraoctets hébergés sur Hugging Face sous licence académique non commerciale. Le nettoyage des trajectoires fait chuter le taux de réussite au rejeu de 100% à 86,2%, en échange de mouvements bien plus lisses. Le code d'entraînement est public en surcouche d'OpenPI, mais aucun modèle entraîné n'est diffusé. Cette architecture s'attaque à un goulot d'étranglement connu : la collecte de démonstrations reste coûteuse et centralisée, et un jeu de données publié cesse aussitôt de grandir. AXIS en fait au contraire une ressource qui continue de croître avec les contributions, sur un modèle proche du crowdsourcing. Les résultats sont significatifs pour l'entraînement de modèles de manipulation généralistes : le modèle π0.5, préentraîné sur l'intégralité des données AXIS puis affiné sur LIBERO, atteint 88,8 sur le benchmark LIBERO-Plus, contre 83,9 pour la version de base et seulement 57,5 pour un jeu de contrôle RoboCasa365 de taille comparable. Le gain est le plus net sur les axes où la simulation randomise vraiment les conditions, comme le bruit de capteur (+13,7 points), signe que la diversité des scènes générées compte plus que le simple volume de trajectoires. Ce travail s'inscrit dans une course plus large de la robotique par apprentissage, où des laboratoires comme Physical Intelligence, à l'origine du modèle π0.5 pris comme référence, cherchent à combler l'écart entre les volumes de données disponibles pour les modèles de langage et ceux, bien plus restreints, des modèles de manipulation physique. La démarche rappelle des efforts antérieurs de mutualisation comme Open X-Embodiment, mais en misant sur une génération procédurale des tâches et un outil de collecte ouvert à tous, plutôt que sur la seule agrégation de jeux existants, tout en gardant le jeu de données verrouillé sous licence académique et sans publier les modèles entraînés. Reste à voir si la qualité des démonstrations collectées par des contributeurs non experts, via une interface grand public, tiendra la comparaison avec des données de laboratoire à mesure que le corpus grossira.

💬 Le truc qui compte vraiment là-dedans, c'est pas les 50 000 trajectoires, c'est que le jeu de données continue de grossir avec les contributeurs au lieu de rester figé le jour de la publication, comme tous les datasets robotique jusqu'ici. Et les chiffres donnent enfin une preuve chiffrée à un soupçon : la diversité des scènes générées tire plus les perfs que le volume brut, +13,7 points rien que sur le bruit de capteur. Bon, sur le papier ça marche bien, mais tant que c'est verrouillé en licence académique sans modèle entraîné diffusé, ça reste un signal de recherche, pas un outil qu'une boîte peut récupérer demain.

RecherchePaper
1 source
H Company dévoile NeoMME, une famille d'encodeurs multimodaux à tour unique de 260M et 800M sans tour de vision ni décodeur causal
Illustration générée par IA
43MarkTechPost 

H Company dévoile NeoMME, une famille d'encodeurs multimodaux à tour unique de 260M et 800M sans tour de vision ni décodeur causal

H Company, société française d'intelligence artificielle, a publié NeoMME, une famille de deux encodeurs multimodaux à tour unique et bidirectionnels, comptant 262 937 906 et 793 715 032 paramètres, soit environ 260 et 800 millions. À la différence des modèles de récupération documentaire visuelle actuels comme ColPali, qui recyclent un modèle vision-langage génératif en conservant une tour visuelle et un décodeur causal inutiles pour cette tâche, NeoMME fait passer texte multilingue et patches d'image bruts de 32x32 pixels dans les mêmes couches d'un seul Transformer entraîné depuis une initialisation aléatoire. Doté d'un tokenizer BPE de 131 072 entrées et d'une fenêtre de contexte de 16 384 tokens, suffisante pour deux images 4K, le modèle a été pré-entraîné par diffusion masquée discrète sur environ 524 milliards de tokens, en utilisant 16 puis 32 accélérateurs Nvidia H100. Sa version de récupération, NeoMME-Retriever, atteint 0,523 nDCG@10 sur le benchmark ViDoRe v3 à 260 millions de paramètres et 0,556 à 800 millions, et tous les checkpoints sont publiés sous licence Apache 2.0 avec support immédiat dans Hugging Face Transformers. Ce résultat est notable: le modèle de 260 millions de paramètres se situe à seulement 0,002 point du score de ColQwen2.5-v0.2, qui en compte pourtant 3,75 milliards, près de quinze fois plus, et devance de 26,1 points le meilleur autre modèle de moins de 300 millions de paramètres. Concrètement, cela permet une recherche documentaire visuelle multilingue presque aussi précise que les modèles de référence, pour un coût de calcul bien moindre: le modèle 260M indexe 51,3 pages par seconde sur un seul GPU Nvidia L40S et encode une requête en 78,3 millisecondes sur simple processeur, sans GPU. Pour les entreprises qui indexent de grands volumes de documents scannés ou de rapports multilingues, cela ouvre la voie à des déploiements moins coûteux en infrastructure. Deux techniques de compression des index par interaction tardive réduisent aussi fortement le stockage, jusqu'à 255,5 fois, faisant passer un index de page de 1,5 mégaoctet à 6 kilooctets tout en conservant 95,19% de la performance de référence. Le développement de NeoMME répond à un défaut structurel des modèles de récupération visuelle actuels, majoritairement bâtis sur des architectures détournées de leur usage d'origine, ColPali et ses successeurs empruntant des modèles génératifs pour en faire de simples encodeurs, avec du poids mort inutile. H Company mise ici sur une architecture repensée dès la base pour la tâche de recherche, combinant attention par fenêtre glissante sur la plupart des couches, attention globale toutes les six couches, et deux têtes entraînées conjointement pour la recherche dense et par interaction tardive. Des limites subsistent côté texte pur: sur le benchmark BEIR-15, NeoMME reste derrière le modèle spécialisé LateOn, avec des scores de 0,4881 et 0,5126 contre 0,5722, écart attribué par les auteurs au volume d'entraînement, environ 430 000 exemples de requêtes textuelles contre 660 millions pour son concurrent. Cette publication en open source s'inscrit dans une compétition croissante entre laboratoires pour des encodeurs multimodaux légers et efficaces, alors que la demande en recherche documentaire visuelle multilingue s'accroît avec la numérisation des archives d'entreprise.

UEH Company, entreprise française d'IA, publie en open source une famille de modèles efficaces, renforçant la souveraineté technologique européenne en recherche documentaire visuelle.

💬 Ce qui frappe, c'est l'écart de taille : 260 millions de paramètres qui égalent quasiment ColQwen à 3,75 milliards, quinze fois plus léger pour deux millièmes de point d'écart. Ça confirme un truc qu'on soupçonnait déjà : recycler un modèle génératif pour en faire un simple encodeur de recherche, c'est traîner du poids mort, et repartir d'une architecture pensée pour la tâche paie plus que d'empiler des paramètres. Reste le texte pur, où NeoMME accuse encore du retard, et la question de la prod à grande échelle, mais pour une boîte française qui publie ça en Apache 2.0, c'est un signal qui compte.

RechercheActu
1 source
Meta FAIR lance des modèles de préférence (RPM) pour classer les expériences de ML avant de solliciter les GPU
Illustration générée par IA
44MarkTechPost 

Meta FAIR lance des modèles de préférence (RPM) pour classer les expériences de ML avant de solliciter les GPU

Une équipe de chercheurs de FAIR (le laboratoire d'intelligence artificielle de Meta), de l'Université d'Oxford et de l'University College London a présenté un nouveau système baptisé AI Research Preference Models (RPM), conçu pour aider les agents d'IA à choisir quelles expériences de machine learning valent la peine d'être lancées. Le système s'appuie sur un environnement de recherche open source nommé AIRA-dojo et sur un benchmark associé, AIRS-Bench, qui couvre 20 tâches publiques de type texte et données tabulaires. Les tests ont été menés sur 24 heures d'exécution par tâche sur un seul GPU H200, avec 10 essais et un modèle Qwen3.6-27B, aux poids ouverts, utilisé à la fois comme moteur de génération et comme juge. Deux variantes ont été évaluées : une version purement inférentielle, où le modèle évalue des plans et du code sans exécution, avec une précision hors ligne de 57,7 à 59 %, et une version dite agentique, qui fait tourner de courtes expériences pilotes dans un bac à sable dédié avant de trancher. Résultat, le score moyen normalisé passe de 0,684 pour une sélection aléatoire à 0,711 avec la version inférentielle et 0,729 avec la version agentique, pour un plafond théorique de 0,748 à 0,759. Ces gains s'accompagnent surtout d'un temps divisé par 1,5 à 1,6 pour atteindre le score de référence, et de nouveaux records sur les benchmarks WinoGrande (94,1 %, contre 90,4 % pour le précédent système AIRA2) et SVAMP (95,7 %, contre 94,2 % pour le meilleur score humain connu). L'enjeu dépasse la simple performance technique. Les agents d'IA capables de proposer et coder eux-mêmes des expériences de recherche génèrent aujourd'hui bien plus d'idées qu'ils ne peuvent en tester, chaque entraînement pouvant mobiliser un GPU pendant des heures, voire des jours. Le vrai goulot d'étranglement n'est donc plus la créativité de l'agent mais sa capacité à trier, avant exécution, les pistes les plus prometteuses. En réduisant le nombre d'essais gaspillés sur des GPU coûteux, ce type de modèle de préférence promet d'accélérer et de rendre moins onéreuse la recherche en IA automatisée, un enjeu déterminant pour les laboratoires qui cherchent à faire tourner des flottes d'agents chercheurs en continu. Concrètement, dans AIRA-dojo, une recherche arborescente évolutive génère des candidats via des opérateurs de type ébauche, amélioration ou débogage. Le RPM intervient à ce stade précis : plutôt que de produire un seul enfant à exécuter, l'agent en génère 15 en parallèle, que le modèle de préférence compare deux à deux dans un tournoi à élimination directe, en s'appuyant sur l'historique des scores de validation déjà obtenus dans l'arbre exploré. La version agentique va plus loin en surestimant volontairement le budget de calcul restant pour éviter que l'agent n'arrête sa recherche trop tôt, et limite les essais pilotes à 30, avec un seuil de 60 secondes chacun. L'ensemble du dispositif utilise des modèles de langage figés, sans réglage fin supplémentaire, ce qui en facilite la reproduction par d'autres équipes de recherche en IA.

💬 Le vrai goulot d'étranglement de la recherche IA automatisée, ce n'est plus l'inventivité des agents, c'est leur capacité à jeter les mauvaises idées avant de brûler un GPU dessus. Là, 24h par tâche sur un H200, ça fait réfléchir vite. Reste que le gain (temps divisé par 1,5, score qui grimpe de 0,68 à 0,73) vient d'un modèle figé, sans fine-tuning : facile à reproduire, donc à surveiller de près chez les concurrents de Meta dans les mois qui viennent.

RecherchePaper
1 source
Des chercheurs de UC Berkeley lancent CUA-Lite, une plateforme ouverte unifiant sandbox, données, évaluation et RL pour agents utilisant l'ordinateur
Illustration générée par IA
45MarkTechPost 

Des chercheurs de UC Berkeley lancent CUA-Lite, une plateforme ouverte unifiant sandbox, données, évaluation et RL pour agents utilisant l'ordinateur

Des chercheurs de UC Berkeley ont publié CUA-Lite, une plateforme open source destinée à unifier l'entraînement et l'évaluation des agents capables de manipuler un ordinateur (computer-use agents, CUA). Leur constat de départ est que construire un tel agent exige quatre briques, à savoir des agents, des environnements, des traces de données et un cadre d'évaluation et d'entraînement, mais que ces briques sont aujourd'hui dispersées dans des dépôts séparés aux interfaces incompatibles. CUA-Lite les réunit derrière un espace d'action unique, un schéma de données commun appelé LiteSample, et une seule ligne de commande, sur ordinateur de bureau, navigateur et mobile. La contribution la plus concrète est Lite.OSWorld, qui reproduit les tâches et les évaluateurs du benchmark OSWorld sur un bureau GNOME dans un simple conteneur Docker, alors qu'OSWorld nécessite normalement une machine virtuelle QEMU/KVM complète par tâche. Résultat mesuré : 0,9 Go de mémoire contre 4,1 Go, un démarrage à froid de 23,8 secondes contre 29,9, et environ 4,6 fois plus d'instances exécutables en parallèle, avec des scores identiques sur 13 modèles testés. La plateforme revendique plus de 30 000 tâches vérifiables, via une famille de sandboxes incluant Lite.ScaleCUA, Lite.CUAGym et Lite.CUAWorld, ce dernier couvrant une quarantaine d'applications comme Blender, QGIS ou VS Code. Cette unification lève un obstacle pratique majeur pour la recherche sur les agents autonomes : l'accès à la virtualisation imbriquée (/dev/kvm), généralement indisponible sur les infrastructures cloud managées, les runners de CI ou les conteneurs imbriqués. En supprimant cette dépendance tout en préservant la fidélité des scores, CUA-Lite permet à un plus grand nombre de laboratoires et d'équipes, sans accès à du matériel spécialisé, d'entraîner et de comparer des agents à grande échelle. Le schéma LiteSample facilite aussi la réutilisation de données existantes : plus de dix jeux de données publiés (Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey, Multimodal-Mind2Web) ont été reformatés et rendus disponibles gratuitement sur Hugging Face, réduisant le travail d'ingénierie nécessaire avant de pouvoir entraîner un modèle. Pour l'industrie, cela abaisse la barrière d'entrée pour construire des assistants capables d'utiliser un ordinateur comme un humain, un axe de recherche jugé stratégique par des entreprises comme Anthropic ou OpenAI. Le projet s'inscrit dans la compétition croissante autour des agents capables d'agir directement dans une interface graphique plutôt que via des API dédiées. CUA-Lite fournit une brique lite.gym reliant plus de dix agents (basés sur GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI) à plus de quinze benchmarks couvrant le bureau, le navigateur (WebArena, WebVoyager) et le mobile (AndroidWorld, AndroidLab). L'équipe documente aussi des cas d'usage concrets : un fine-tuning supervisé de Qwen3-VL-2B-Instruct a fait passer le score moyen de 0,138 à 0,237 sur 332 tâches, et un entraînement par renforcement via GRPO a été testé sur 416 tâches mobiles réparties dans 28 applications. Ces résultats restent des configurations uniques rapportées par l'équipe, non reproduites indépendamment, mais ils illustrent la direction que prend la recherche : standardiser l'infrastructure pour accélérer l'itération sur les modèles eux-mêmes, plutôt que de continuer à dupliquer les efforts d'ingénierie propres à chaque benchmark.

💬 Ce qui débloque vraiment, c'est /dev/kvm. Tant que tester un agent qui manipule un ordinateur exigeait une VM QEMU complète par tâche, seuls les labos avec du matériel dédié pouvaient itérer à grande échelle, et ça a bridé la recherche plus que le niveau des modèles eux-mêmes. Là, diviser la mémoire par 4 et le temps de démarrage en gardant les mêmes scores sur 13 modèles, c'est le genre de gain d'infra qui compte plus qu'un nouveau benchmark. Reste à voir si les 30 000 tâches tiennent la comparaison une fois que tout le monde s'en sert en prod, mais pour une fois l'obstacle qui tombe est le bon.

RecherchePaper
1 source
Sept minutes avec un chatbot réduisent mieux les croyances complotistes qu'une fiche d'information (deux études)
Illustration générée par IA
46The Decoder 

Sept minutes avec un chatbot réduisent mieux les croyances complotistes qu'une fiche d'information (deux études)

Des chercheurs ont montré qu'une conversation d'environ sept minutes avec le chatbot Gemini de Google suffit à réduire les croyances complotistes liées à des crises d'actualité, même lorsque peu de faits vérifiés sont disponibles sur le sujet. Dans le cadre de deux expériences, cette approche conversationnelle s'est révélée plus efficace qu'une simple fiche factuelle statique présentant les mêmes informations. Les chercheurs ont aussi mené des enquêtes de suivi plusieurs semaines après l'échange initial, et ont constaté que l'effet persistait dans le temps. Plus surprenant encore, la réduction des croyances complotistes ne se limitait pas au sujet précis discuté avec le chatbot : elle s'étendait à des convictions portant sur des événements totalement différents. Ce résultat a une portée qui dépasse largement le cadre expérimental, car le complotisme autour des crises récentes (sanitaires, politiques ou sécuritaires) reste un problème de société majeur, alimentant la défiance envers les institutions et compliquant la gestion des crises réelles. Le fait qu'un simple dialogue interactif avec une intelligence artificielle générative surpasse un document informatif classique suggère que le format conversationnel, capable de s'adapter aux objections spécifiques de chaque utilisateur, joue un rôle clé dans la persuasion. Pour les plateformes technologiques, les médias et les pouvoirs publics, cela ouvre la voie à des outils numériques de lutte contre la désinformation qui reposent sur l'interaction personnalisée plutôt que sur la simple diffusion de contenu correctif. Cette découverte s'inscrit dans un champ de recherche plus large qui explore depuis plusieurs années les leviers efficaces contre les théories du complot, où les tentatives de simple correction factuelle ont souvent montré des résultats limités, voire un effet de renforcement des croyances chez certains publics. L'émergence de chatbots comme Gemini, capables de mener des échanges personnalisés et argumentés, relance cette question sous un angle nouveau. Reste à déterminer si un tel effet se généralise à d'autres modèles conversationnels, à des populations plus larges, et comment ces outils pourraient être déployés à grande échelle sans risque de manipulation ou de dépendance excessive envers les entreprises technologiques qui les développent.

💬 Sept minutes de chat contre une fiche PDF, et c'est la conversation qui gagne largement. Ça confirme un truc qu'on soupçonnait sans preuve solide : corriger un complot, c'est pas transmettre un fait, c'est démonter une objection à la fois, ce qu'un texte statique ne sait juste pas faire. Le vrai signal, c'est que l'effet déborde sur d'autres théories jamais évoquées, donc si ça se confirme à grande échelle, on tient peut-être un outil de désescalade plus que de correction. Reste que Google devient de fait l'arbitre de ce qui est complotiste ou pas, et ça, personne n'a encore réglé le problème.

RecherchePaper
1 source
WeatherNext 3 de Google DeepMind s'entraîne sur des observations de stations météo pour des prévisions mondiales à 5 km, actualisées chaque heure
Illustration générée par IA
47MarkTechPost 

WeatherNext 3 de Google DeepMind s'entraîne sur des observations de stations météo pour des prévisions mondiales à 5 km, actualisées chaque heure

Google DeepMind et Google Research ont annoncé WeatherNext 3, un nouveau modèle météorologique par intelligence artificielle qui produit des prévisions mondiales avec une résolution de 0,05 degré, soit environ 5 kilomètres, et se réinitialise toutes les heures. Le modèle repose sur une architecture Functional Generative Network (FGN), un transformeur de maillage probabiliste déjà utilisé pour WeatherNext 2 mais désormais adapté à une sortie multi-résolution. Il s'appuie sur une mosaïque satellite géostationnaire en temps réel combinée à l'analyse HRES du Centre européen pour les prévisions météorologiques à moyen terme (ECMWF), et il est entraîné sur les données ERA5/HRES-fc0, les observations satellite IMERG de la NASA ainsi que des relevés bruts de stations météo au sol. Un seul passage du modèle génère trois niveaux de sortie : température et point de rosée à 2 mètres à 5 km de résolution, vent à 10 et 100 mètres, pression, température de surface de la mer, couverture nuageuse, rayonnement solaire et précipitations horaires à 10 km, et des champs atmosphériques sur 13 niveaux de pression à 25 km. Le système tourne 24 fois par jour : les cycles synoptiques de 00h, 06h, 12h et 18h UTC couvrent 15 jours avec 64 membres d'ensemble, tandis que des cycles horaires intermédiaires portent sur 48 heures. Selon Google, des évaluations indépendantes menées par Brightband placent WeatherNext 3 au rang de modèle météorologique mondial le plus précis à ce jour. Cette avancée s'attaque à deux limites qui freinaient les modèles météo par IA depuis trois ans : une résolution trop grossière pour restituer les reliefs locaux, et une initialisation dépendante des analyses numériques classiques, disponibles avec environ six heures de retard. L'actualisation horaire, ancrée sur des observations satellite courantes plutôt que sur des analyses différées, change la donne pour le suivi des orages à développement rapide. Sur les précipitations, point faible historique des modèles globaux, Google annonce des gains de score CRPS allant jusqu'à 60 % face à IMERG, 30 % face au réseau radar MRMS et 10 % face aux pluviomètres sur les échéances courtes, avec jusqu'à 50 % de réduction du score de Brier par rapport aux modèles physiques classiques. Les variables dédiées aux énergies renouvelables, vent à hauteur de nacelle d'éolienne et composantes du rayonnement solaire, visent explicitement les opérateurs de réseaux électriques. L'essentiel des modèles IA concurrents s'entraîne sur des grilles de réanalyse qui lissent les variations locales dues aux côtes, vallées ou montagnes ; WeatherNext 3 introduit des modules dédiés entraînés directement sur les relevés de stations pour corriger ce biais. L'accès reste toutefois partiel : les données sont disponibles via BigQuery, Earth Engine et Cloud Storage sur demande d'inscription sur liste blanche, mais les poids du modèle ne sont pas ouverts, et l'inférence personnalisée à la demande utilise encore WeatherNext 2.

UELe modèle s'appuie sur les données HRES du Centre européen pour les prévisions météorologiques a moyen terme (ECMWF) et ses variables vent/rayonnement solaire pourraient intéresser les opérateurs de réseaux électriques européens, mais l'accès reste restreint sur liste blanche.

💬 L'actualisation horaire, c'est le vrai saut : fini les analyses météo vieilles de six heures, tu as maintenant un modèle qui colle aux satellites en temps réel, et ça change la donne pour repérer un orage qui monte vite. Les modules entraînés sur les stations au sol sont malins aussi, ils corrigent le lissage qui plombait les prévisions sur les côtes et en montagne. Mais les poids restent fermés et l'accès sous liste blanche : la météo IA la plus précise du monde reste un service Google qu'on ne peut ni auditer ni faire tourner soi-même.

RechercheActu
1 source
L'IA des puzzles et un chemin vers notre système stellaire le plus proche
Illustration générée par IA
48MIT Technology Review 

L'IA des puzzles et un chemin vers notre système stellaire le plus proche

La revue MIT Technology Review a publié un test de sept énigmes ayant déjà mis en échec des modèles d'IA, invitant ses lecteurs à comparer leurs performances à celles des machines. Le magazine rappelle qu'à la fin 2024, même les meilleurs modèles ne résolvaient que 18 % des puzzles Connections du New York Times, contre un taux proche de la perfection début 2025. Par ailleurs, l'organisation à but non lucratif Fermi Explorer Mission a annoncé son intention de lancer d'ici fin 2029 une sonde vers Alpha Centauri, le système stellaire le plus proche du nôtre, situé à 4,4 années-lumière. La trajectoire retenue, inédite, a été calculée par un système d'IA développé par le laboratoire de recherche en physique PSI ; le voyage pourrait durer jusqu'à 80 000 ans. Le même numéro signale qu'OpenAI a restreint l'accès à son prochain modèle, nommé Astra, après l'avoir classé « critique » en matière de risque cyber, ses tests ayant montré qu'il pouvait automatiser des cyberattaques. Enfin, Emil Michael, le responsable au Pentagone chargé de l'IA militaire, a vendu pour jusqu'à 25 millions de dollars d'actions Perplexity, après avoir déjà cédé des titres xAI lorsque le Pentagone a adopté Grok. Ces progrès sur les puzzles illustrent la vitesse à laquelle les modèles d'IA comblent leurs lacunes en raisonnement logique, un domaine longtemps considéré comme un point faible face aux humains, avec des implications directes pour les usages professionnels où la résolution de problèmes complexes est requise. La mission de Fermi Explorer Mission montre de son côté que l'IA commence à jouer un rôle concret dans la conception de trajectoires spatiales, une tâche d'optimisation extrêmement complexe, ouvrant potentiellement la voie à d'autres missions interstellaires low-cost pilotées par des organisations non gouvernementales plutôt que par des agences spatiales traditionnelles. Le classement d'Astra en risque cyber « critique » par OpenAI traduit l'inquiétude croissante de l'industrie face à la capacité des modèles les plus avancés à faciliter des attaques informatiques automatisées, forçant les entreprises à renforcer leurs mesures de sécurité avant tout déploiement. Quant à la vente d'actions par un haut responsable du Pentagone supervisant l'IA militaire, elle relance les critiques sur les conflits d'intérêts entre décideurs publics et entreprises d'IA qu'ils sont censés réguler ou superviser. Les puzzles et les jeux occupent une place centrale dans l'histoire de l'IA depuis ses débuts : le terme « machine learning » a été popularisé dès 1959 dans un article décrivant un algorithme apprenant à jouer aux dames, tandis que les échecs et le jeu de Go ont longtemps servi de bancs d'essai. La mission vers Alpha Centauri s'inscrit quant à elle dans un contexte plus large où plusieurs ouvrages récents, dont The Ultraview Effect de l'anthropologue de l'espace Deana L. Weibel et Dinner with an Astronaut de l'ancien astronaute de la NASA Leroy Chiao, interrogent les motivations de l'exploration spatiale humaine après la mission Artemis II, entre prestige géopolitique, curiosité scientifique et intérêts commerciaux croissants portés par des acteurs comme Blue Origin. Sur le plan sécuritaire, la décision d'OpenAI de restreindre Astra s'inscrit dans un débat plus large sur la gouvernance des modèles les plus puissants, tandis que la controverse autour d'Emil Michael, qui avait déjà cédé ses parts xAI après l'adoption de Grok par le Pentagone, alimente les critiques sur la porosité entre investissements financiers personnels et décisions d'achat militaire en matière d'IA.

💬 Sept énigmes qui plantaient les modèles en 2024, résolues quasi parfaitement début 2025 : voilà la vitesse réelle des progrès en raisonnement, pas celle des slides marketing. Ce qui m'intéresse plus, c'est la sonde vers Alpha Centauri pilotée par une trajectoire calculée par IA, un truc que même une agence spatiale n'aurait pas osé tenter il y a cinq ans. Et à côté, un modèle classé "risque cyber critique" par OpenAI et un responsable IA du Pentagone qui vend ses actions Perplexity : la fracture est là, entre ce que l'IA rend possible et qui a intérêt à ce qu'on ne pose pas trop de questions.

RecherchePaper
1 source
Les modèles de pointe retrouvent jusqu'à 65% des faits qu'ils ne peuvent pas rappeler directement, en réfléchissant plus longtemps
Illustration générée par IA
49VentureBeat AI 

Les modèles de pointe retrouvent jusqu'à 65% des faits qu'ils ne peuvent pas rappeler directement, en réfléchissant plus longtemps

Une étude menée par des chercheurs de Google Research et du Technion montre que les grands modèles de langage les plus avancés, comme GPT-5 et Gemini-3, encodent en réalité 95 à 98% des faits testés dans leurs paramètres internes, même lorsqu'ils échouent à les restituer lors d'une question directe. Les chercheurs ont mis au point une méthode appelée « profilage au niveau du fait » (fact-level profiling), qui teste une même information selon plusieurs angles: peut-elle être reproduite à partir de son contexte d'entraînement original, peut-elle être interrogée sous des formulations variées, et quel effort de calcul faut-il pour la récupérer. À partir de cette grille, l'étude distingue cinq profils de connaissance, illustrés par l'exemple du groupe Oasis et de son premier concert au club Boardwalk: rappel direct, échec d'encodage (l'information n'a jamais été mémorisée), échec de rappel (l'information existe mais reste inaccessible), rappel par raisonnement (récupérable seulement via une chaîne de pensée), et inférence sans encodage (le modèle devine en recombinant d'autres faits connus). Selon les auteurs, en laissant les modèles « réfléchir » davantage avant de répondre, via des techniques de raisonnement en chaîne (Chain-of-Thought), ils parviennent à récupérer jusqu'à 65% des faits qu'ils ne savaient pas produire directement. Cette distinction change la manière de diagnostiquer les hallucinations des IA. Jusqu'ici, une erreur factuelle était presque systématiquement interprétée comme un manque de connaissance, poussant les équipes d'ingénierie à répondre par des modèles plus gros, davantage de données d'entraînement, ou des architectures de récupération d'information externes (RAG) coûteuses à construire et à maintenir. Or si le problème est le plus souvent un échec d'accès à une information déjà stockée, la solution la plus efficace n'est pas d'agrandir le modèle mais d'améliorer la façon dont il exploite ce qu'il sait déjà, par exemple via du temps de calcul supplémentaire à l'inférence. Pour les entreprises qui déploient des applications reposant sur des LLM, cela ouvre la voie à des gains de fiabilité obtenus par de simples ajustements post-entraînement, moins onéreux qu'un réentraînement complet ou qu'une infrastructure de recherche documentaire. Ce travail s'inscrit dans un effort plus large visant à comprendre les mécanismes internes des modèles de langage plutôt que de se contenter de mesurer leurs performances en sortie. Les chercheurs notent que les échecs d'encodage et les échecs de rappel sont indiscernables si l'on se fie uniquement aux métriques de précision classiques, alors qu'ils appellent des remèdes radicalement différents: intervention en amont sur les données et la taille du modèle dans un cas, ajustement du comportement du modèle après l'entraînement dans l'autre. À mesure que les laboratoires cherchent à réduire les hallucinations sans multiplier les coûts de calcul, cette approche pourrait orienter davantage de recherche vers l'optimisation du raisonnement à l'inférence plutôt que vers la seule montée en échelle des modèles.

RecherchePaper
1 source
Princeton, Ant Group et Stanford présentent AQuA, un système à base d'agents pour la découverte autonome de facteurs en finance quantitative
Illustration générée par IA
50MarkTechPost 

Princeton, Ant Group et Stanford présentent AQuA, un système à base d'agents pour la découverte autonome de facteurs en finance quantitative

Des chercheurs de Princeton University, Ant Group et Stanford University présentent AQuA, un cadre agentique en deux volets destiné à la découverte autonome de facteurs et au développement de modèles en finance quantitative. Le premier volet, dédié à la découverte de facteurs symboliques sur les cryptomonnaies, repose sur un pipeline à six agents (Data Steward, Visual Analyst, Idea Miner, Factor Evaluator, Backtest Engineer et Research Librarian) coordonnés par un AI Manager, dans lequel chaque facteur doit d'abord être formulé comme une hypothèse falsifiable avant d'être traduit en expression mathématique. Sur un univers crypto à cinq minutes, l'IC de Spearman en validation combinée grimpe à environ 0,190 après vingt cycles de recherche, contre 0,171 pour une version adaptée d'AlphaMemo, 0,151 pour AlphaGen adapté, 0,137 pour un LSTM, 0,106 pour LightGBM et 0,075 pour une base de référence de type Alpha158. Le second volet développe des modèles pour prédire le rendement à trente minutes d'actions américaines en intraday, entraînés sur la période 2010-2019, avec une année d'embargo en 2020 et des tests sur 2021-2025 ; chaque hypothèse y correspond à une seule modification de configuration (architecture, fonction de perte, échantillonneur ou optimiseur), et le modèle hybride retenu combine un front-end convolutif multi-échelle, un backbone configurable (LSTM, Mamba ou attention) et une étape de mixage transversal du panel d'actions. L'enjeu central que vise AQuA est la fiabilité des agents de recherche quantitative qui conçoivent eux-mêmes leurs expériences : un biais de fuite de données (data leakage) produisant de bons scores peut être enregistré comme précédent réussi et se propager d'une itération à l'autre, tandis que les instructions au niveau du prompt et les agents évaluateurs ne suffisent pas à empêcher cela, car l'agent auteur et l'agent évaluateur partagent souvent les mêmes angles morts. Ce problème est documenté depuis les travaux de Bailey et ses coauteurs sur le surapprentissage adaptatif lié à l'accès répété à un même jeu de données de validation, et des agents fondés sur des modèles de langage ont déjà été observés en train d'exploiter des objectifs ou des évaluateurs mal spécifiés. Pour l'industrie de la gestion quantitative, cela signifie que la simple automatisation de la recherche de facteurs par IA ne garantit rien sans une architecture empêchant structurellement la triche, faute de quoi les backtests impressionnants risquent de ne jamais se reproduire en conditions réelles. La réponse d'AQuA consiste à rendre matériellement impossibles les actions permettant une fuite d'information, plutôt que de compter sur des consignes : les découpages de données, les définitions de caractéristiques et d'étiquettes, ainsi que l'évaluateur, sont fixés avant même le début des itérations, et l'agent ne peut émettre qu'une expression de facteur contrainte par un langage dédié ou une unique modification de configuration. Les chercheurs qualifient ce principe de "liberté asymétrique" : l'agent explore librement à l'intérieur de son espace de recherche autorisé, mais l'évaluateur reste hors de portée de toute adaptation. Les résultats montrent que les mécanismes individuels restent modestes pris isolément, avec des IC de facteur unique compris entre 0,026 et 0,037, ce qui souligne que la contribution d'AQuA porte moins sur une découverte ponctuelle spectaculaire que sur la fiabilité du processus de recherche lui-même, un enjeu appelé à devenir central à mesure que les agents IA se généralisent dans la recherche financière quantitative.

💬 Sur le papier, AQuA n'invente pas de nouveau facteur miracle, les IC restent modestes pris un par un. Ce qui compte, c'est qu'ils verrouillent les découpages de données et l'évaluateur avant que l'agent commence à chercher, façon garde-fou anti-triche plutôt que consigne dans le prompt. Et ça pointe vers un vrai problème : sans ce genre d'architecture, un agent qui conçoit ses propres backtests finit toujours par trouver la faille qui fait bien sur le papier et qui explose en prod.

RecherchePaper
1 source