OpenAI affirme que son modèle interne a résolu plus de 100 problèmes mathématiques non résolus après un mois d'entraînement
OpenAI affirme qu'un de ses modèles d'intelligence artificielle internes, pas encore rendu public, a résolu plus de 100 problèmes mathématiques non résolus depuis longtemps, et ce après seulement un mois d'entraînement. L'entreprise n'a pas détaillé la nature précise de ces problèmes ni publié de preuves vérifiables par la communauté scientifique. Cette annonce survient alors que des mathématiciens critiquent de plus en plus la façon dont OpenAI communique sur les performances de ses modèles en mathématiques, jugées difficiles à vérifier de manière indépendante.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Si elle se confirme, une telle capacité marquerait une étape importante pour l'usage de l'IA dans la recherche mathématique fondamentale, un domaine où la vérification rigoureuse des démonstrations est essentielle et où les erreurs subtiles restent fréquentes. Pour l'industrie de l'IA, l'épisode illustre la tension croissante entre la course aux annonces spectaculaires et l'exigence de transparence scientifique : sans preuves publiques ni évaluation externe, de telles affirmations demeurent invérifiables et risquent d'alimenter la méfiance des chercheurs envers les grandes entreprises technologiques. Pour la communauté mathématique, la question posée est aussi celle de la confiance : qui peut certifier qu'un résultat produit par une IA est réellement correct et inédit.
Pour tenter d'apaiser ces tensions, OpenAI a annoncé qu'elle soutiendrait un groupe consultatif indépendant hébergé à l'Institute for Advanced Study de Princeton, chargé d'examiner les progrès de l'IA en mathématiques. L'entreprise a toutefois précisé que le rythme de ses propres travaux de recherche resterait en dehors du champ d'évaluation de ce comité, une limite qui a suscité des interrogations sur la portée réelle de cette initiative de supervision. L'épisode s'inscrit dans une compétition plus large entre laboratoires d'IA, qui multiplient les annonces sur les capacités de raisonnement mathématique de leurs modèles tout en peinant à mettre en place des mécanismes de vérification indépendants largement acceptés par la communauté scientifique.
Pas d'impact direct sur la France/UE