Aller au contenu principal
Un médaillé Fields : ChatGPT 5.5 Pro a produit une recherche niveau doctorat en moins de deux heures sans aide humaine
LLMsThe Decoder · 1 min de lecture

Un médaillé Fields : ChatGPT 5.5 Pro a produit une recherche niveau doctorat en moins de deux heures sans aide humaine

Source originale ↗·

Le mathématicien Timothy Gowers, lauréat de la médaille Fields en 1998 et l'une des figures les plus respectées des mathématiques contemporaines, a soumis ChatGPT 5.5 Pro à une série de problèmes ouverts en théorie des nombres. En moins d'une heure, le modèle d'OpenAI a transformé une borne exponentielle en borne polynomiale, une avancée non triviale dans ce domaine. Un chercheur du MIT impliqué dans l'évaluation a qualifié l'idée centrale trouvée par le modèle de "complètement originale". L'ensemble du travail a été accompli en moins de deux heures, sans aucune intervention humaine.

Cette performance marque un tournant dans la perception des capacités des grands modèles de langage en mathématiques de haut niveau. Jusqu'ici, les LLMs excellaient à résoudre des exercices connus ou à vérifier des démonstrations existantes, mais produire une idée originale en recherche pure était considéré hors de portée. Si un modèle peut désormais contribuer à des problèmes ouverts au niveau doctorat, cela remet en question la définition même de la contribution mathématique humaine.

La réflexion de Gowers est particulièrement révélatrice : selon lui, le nouveau critère pour évaluer une contribution mathématique sera désormais de prouver quelque chose qu'un LLM ne peut pas faire. Ce déplacement de la référence illustre une transformation profonde du rapport entre l'IA et la recherche fondamentale. OpenAI, qui avait déjà annoncé des ambitions en mathématiques formelles avec des outils comme le prover interne, franchit ici une étape qualitative qui devrait accélérer les débats sur la co-authorship humain-IA dans les publications académiques.

Impact France/UE

Les institutions académiques françaises et européennes devront réviser leurs critères d'évaluation de la contribution scientifique et leurs règles de co-authorship face à des LLMs capables de produire des résultats originaux en mathématiques fondamentales.

💬 L'analyse de Mathieu

Une borne exponentielle transformée en polynomiale en moins d'une heure, sur un problème ouvert, validé par Gowers lui-même. Ce n'est pas un benchmark bidouillé, c'est de la recherche fondamentale originale. Et la réaction de Gowers dit tout : la nouvelle mesure de la contribution mathématique, ça sera désormais de prouver ce qu'un LLM ne peut pas faire.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

OpenAI : selon un chercheur, GPT-5.6 surpasse la plupart des stagiaires humains en recherche en IA
1The Information AI 

OpenAI : selon un chercheur, GPT-5.6 surpasse la plupart des stagiaires humains en recherche en IA

À Séoul, où se tient cette année la conférence internationale sur le machine learning (ICML), le stand d'OpenAI attire une longue file de jeunes docteurs en intelligence artificielle venus du monde entier. Beaucoup espèrent décrocher un entretien avec des chercheurs ou des recruteurs de l'entreprise, ou tenter leur chance à une machine à pinces de type arcade dont les lots incluent des Rubik's Cubes à l'effigie de Codex et des fidget spinners. Mais l'ambiance festive cache une annonce moins réjouissante pour ces candidats : les stages humains pourraient devenir rares chez OpenAI. Interrogé sur les progrès de l'entreprise vers un stagiaire de recherche entièrement automatisé, le chercheur senior Noam Brown a affirmé qu'il préférerait confier la plupart des tâches au dernier modèle de la société, GPT-5.6, plutôt qu'à un stagiaire humain. Cette déclaration fait écho à celle du PDG Sam Altman, qui avait annoncé en octobre dernier son intention de doter l'entreprise d'une IA capable de mener des recherches de façon autonome d'ici septembre de cette année. Cette déclaration illustre à quel point les grands laboratoires d'IA considèrent désormais leurs propres modèles comme des collaborateurs de recherche à part entière, et non plus seulement comme des outils. Pour les jeunes chercheurs qui aspirent à rejoindre OpenAI, le message est clair : la compétition pour les postes ne se joue plus seulement face à d'autres humains, mais aussi face aux systèmes que l'entreprise développe elle-même. Cela pourrait accélérer une automatisation plus large des métiers scientifiques et techniques, où la capacité à générer des hypothèses, écrire du code expérimental et analyser des résultats devient progressivement déléguée à des modèles de langage. Cette ambition s'inscrit dans une course plus large entre les laboratoires d'IA pour automatiser la recherche elle-même, considérée comme une étape clé vers des systèmes toujours plus performants. En misant sur des modèles capables de surpasser des stagiaires humains, OpenAI cherche à accélérer son propre rythme d'innovation, tout en alimentant le débat sur l'avenir des carrières scientifiques face à des IA de plus en plus autonomes.

💬 Une IA qui bat un stagiaire sur du code expérimental, ça se voit venir depuis un moment. Mais Noam Brown qui le dit noir sur blanc, ça acte un truc : la porte d'entrée dans la recherche IA, c'était les stages, et cette porte est en train de se refermer plus vite que prévu. Selon Le Fil IA, OpenAI ne recrute plus des juniors pour les former, il les remplace avant même l'entretien.

LLMsActu
1 source
« GPT-5.6 Sol aurait résolu en 90 minutes une conjecture statistique vieille de 30 ans que les humains n'avaient pas percée »
2The Decoder 

« GPT-5.6 Sol aurait résolu en 90 minutes une conjecture statistique vieille de 30 ans que les humains n'avaient pas percée »

Le procès de Benjamini-Hochberg, méthode statistique vieille de trente ans, vient de perdre l'une de ses conjectures les plus tenaces. Un professeur de statistiques de l'Université de Pennsylvanie a utilisé GPT-5.6 Sol Pro, le nouveau modèle d'OpenAI, pour réfuter cette conjecture centrale en environ 90 minutes de travail. Le point de comparaison est frappant: la version précédente, GPT-5.5, avait planché sur le même problème pendant 20 heures sans jamais aboutir à une solution. La démonstration produite par le modèle ne repose pas sur une méthode inédite, mais sur une combinaison originale de techniques déjà connues, assemblées d'une manière que les chercheurs humains n'avaient pas explorée. Cette percée relance un débat déjà vif dans la communauté scientifique et technologique sur la nature réelle des capacités de raisonnement des grands modèles de langage. Pour les statisticiens, la conjecture Benjamini-Hochberg touchait à des fondements du contrôle du taux de faux positifs, un enjeu central dans des domaines aussi variés que la recherche médicale, la génomique ou l'apprentissage automatique. Qu'un modèle d'IA parvienne à trancher une question ouverte depuis des décennies, là où des experts humains avaient échoué, illustre un potentiel concret pour accélérer la recherche fondamentale, à condition que ces résultats soient fiables et vérifiables par la communauté scientifique. Reste la question de fond, non résolue par cet épisode: l'IA a-t-elle réellement produit une connaissance nouvelle, ou s'est-elle contentée de recombiner intelligemment des éléments déjà présents dans son entraînement. Cette distinction n'est pas anecdotique, elle conditionne la portée qu'on peut accorder à ce genre de résultat et la confiance à placer dans les futures démonstrations mathématiques assistées par IA. Le cas s'inscrit dans une série croissante d'exemples où des modèles de pointe s'attaquent à des problèmes mathématiques non résolus, ravivant les spéculations sur le rôle que ces outils pourraient jouer dans la recherche scientifique des prochaines années.

💬 Le vrai signal, c'est pas le résultat, c'est le delta : 20 heures dans le mur avec GPT-5.5, 90 minutes avec Sol Pro sur le même problème. Ça, c'est mesurable, et ça compte plus que la conjecture elle-même. Reste la question qu'on n'a toujours pas tranchée : recombinaison brillante ou vraie génération de connaissance, la nuance change tout pour la suite.

LLMsPaper
1 source
ChatGPT revoit sa mémoire et devient plus humain… même free
3Le Big Data 

ChatGPT revoit sa mémoire et devient plus humain… même free

OpenAI a déployé une mise à jour significative du système de mémoire de ChatGPT, reposant sur une architecture interne baptisée Dreaming V3. Contrairement aux versions précédentes, l'assistant ne se limite plus à enregistrer des souvenirs explicitement demandés par l'utilisateur : il peut désormais relier automatiquement des éléments issus de conversations passées pour adapter ses réponses au contexte actuel. Le déploiement est progressif, les abonnés Plus et Pro aux États-Unis sont servis en priorité, les comptes Free et Go devant suivre dans les prochaines semaines. L'avancée technique clé est une réduction d'environ cinq fois de la puissance de calcul nécessaire pour faire tourner ce système, ce qui rend l'extension aux comptes gratuits économiquement viable pour la première fois. Concrètement, un utilisateur intensif pourrait voir ChatGPT retenir un projet récurrent, un style de rédaction préféré ou une contrainte professionnelle sans avoir besoin de la réexpliquer à chaque nouvelle conversation. C'est un changement de nature plus que de degré : l'assistant passe d'un outil qui répond à des instructions de mémorisation à un système qui construit progressivement un profil d'usage. Pour des millions d'utilisateurs gratuits jusqu'ici exclus de ces fonctionnalités, l'accès à une personnalisation continue représente un gain d'usage réel. Pour OpenAI, c'est un levier de rétention face à une concurrence qui s'intensifie sur ce même terrain. La mémoire dans les assistants IA est devenue un enjeu stratégique majeur pour l'ensemble du secteur, et OpenAI n'est pas seul à y investir. Google, Anthropic et d'autres acteurs travaillent à des systèmes similaires, la personnalisation étant perçue comme le prochain différenciateur clé après les capacités brutes de génération. Mais la question du contrôle reste centrale : plus un assistant retient, plus il devient utile, et plus la surface de données personnelles qu'il accumule est large. OpenAI affirme laisser aux utilisateurs la possibilité de consulter, modifier, supprimer ou désactiver les souvenirs enregistrés, et de revenir à un mode de fonctionnement plus classique. La crédibilité de ces garanties dans la durée, et leur lisibilité réelle pour un utilisateur lambda, seront déterminantes. Une IA qui devine les préférences sans les expliquer clairement franchit une frontière psychologique que les utilisateurs, et bientôt les régulateurs, auront du mal à ignorer.

UELes comptes gratuits européens accéderont prochainement à cette mémoire persistante, mais la constitution automatique de profils d'usage sans consentement explicite pourrait entrer en tension avec le RGPD, ouvrant la voie à un examen réglementaire.

LLMsOutil
1 source
DeepSeek-V4 : performances proches du meilleur niveau pour un sixième du coût d'Opus 4.7 et GPT-5.5
4VentureBeat AI 

DeepSeek-V4 : performances proches du meilleur niveau pour un sixième du coût d'Opus 4.7 et GPT-5.5

DeepSeek, la startup chinoise d'intelligence artificielle issue du fonds de trading quantitatif High-Flyer Capital Management, a publié DeepSeek-V4, un modèle de langage aux capacités proches des meilleurs systèmes mondiaux. Avec 1 600 milliards de paramètres organisés selon une architecture Mixture-of-Experts (MoE), ce modèle est disponible gratuitement sous licence MIT commercialement permissive, sur la plateforme Hugging Face et via l'API de DeepSeek. Son tarif d'accès : 1,74 dollar par million de tokens en entrée et 3,48 dollars par million en sortie, soit environ 5,22 dollars pour une utilisation combinée standard. Avec les entrées mises en cache, ce coût descend à 3,63 dollars. À titre de comparaison, GPT-5.5 d'OpenAI coûte 35 dollars pour la même transaction, et Claude Opus 4.7 d'Anthropic 30 dollars. Une version allégée, DeepSeek-V4-Flash, est proposée à seulement 0,42 dollar combiné, au prix d'une baisse de performance. Deli Chen, chercheur chez DeepSeek, a décrit cette sortie sur X comme "un travail d'amour", réalisé 484 jours après le lancement du V3, avec cette formule : "L'AGI appartient à tout le monde." L'impact économique est immédiat et brutal pour les acteurs américains du secteur. DeepSeek-V4-Pro coûte environ six fois moins cher que Claude Opus 4.7 et sept fois moins que GPT-5.5 en conditions normales, et jusqu'à dix fois moins avec les entrées en cache. La version Flash, elle, revient à moins de 1 % du tarif des modèles premium américains. Pour les entreprises traitant de gros volumes de requêtes, cette différence de coûts transforme radicalement le calcul de rentabilité : des tâches d'automatisation jugées trop onéreuses avec les modèles fermés américains deviennent soudainement viables. Développeurs et directions techniques sont contraints de réévaluer leurs choix d'infrastructure, et les fournisseurs positionnés sur le haut de gamme voient leur argument tarifaire sérieusement fragilisé. Ce lancement s'inscrit dans la continuité du "moment DeepSeek" de janvier 2025, quand le modèle R1 avait stupéfait la communauté internationale en rivalisant avec les meilleurs systèmes propriétaires américains à une fraction de leur coût de développement. Depuis, la startup avait publié plusieurs mises à jour de ses séries R1 et V3, mais la communauté attendait un successeur de grande envergure. Ce DeepSeek-V4 est d'ores et déjà qualifié de "deuxième moment DeepSeek", et il ravive les débats sur la pérennité commerciale des modèles fermés face aux alternatives open source chinoises. Il soulève également des questions sur la capacité de DeepSeek à maintenir cette trajectoire malgré les restrictions américaines sur l'exportation de puces haut de gamme, contraintes que l'entreprise semble contourner avec une efficacité croissante grâce à des optimisations architecturales poussées.

UEL'écart de prix, jusqu'à six fois inférieur aux modèles premium américains, permet aux entreprises européennes de rentabiliser des projets d'automatisation IA jusqu'ici jugés trop coûteux.

💬 Six fois moins cher qu'Opus 4.7, performances comparables, licence MIT. C'est exactement le scénario que les équipes produit chez OpenAI et Anthropic essayaient de ne pas avoir à gérer, et il arrive quand même. "L'AGI appartient à tout le monde", dit DeepSeek, bon, sur le papier c'est beau, mais le vrai truc c'est que des automatisations qu'on refusait de budgéter il y a six mois deviennent rentables dès ce soir.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic