Aller au contenu principal
Une méta-analyse sur les effets positifs de ChatGPT dans l’éducation rétractée 1 an après
RechercheNext INpact · 2 min de lecture

Une méta-analyse sur les effets positifs de ChatGPT dans l’éducation rétractée 1 an après

Source originale ↗·

Une méta-analyse publiée dans la revue Humanities and Social Sciences Communications, éditée par le géant de l'édition scientifique Springer Nature, a été officiellement rétractée le 22 avril 2025, près d'un an après sa parution initiale. Signée par les chercheurs chinois Jin Wang et Wenxiang Fan, l'étude affirmait que l'utilisation de ChatGPT par les élèves avait « un impact positif considérable sur l'amélioration des résultats scolaires ». La note de rétractation, publiée par l'éditeur de la revue, invoque « des incohérences dans la méta-analyse » qui « remettent en cause la validité de l'analyse et les conclusions qui en découlent ». Les auteurs n'ont pas répondu aux communications de la revue à ce sujet.

Le problème dépasse largement cette seule étude : selon Google Scholar, la méta-analyse a été citée plus de 500 fois dans des travaux scientifiques, soumis à révision par les pairs ou non. Certains de ces travaux pourraient désormais reposer sur des fondations fragilisées, ce qui impose à leurs auteurs de réévaluer leurs propres conclusions. Un article publié en février 2025 dans Scientific Reports, autre revue de Springer Nature, la citait encore. Cette situation illustre l'effet en cascade qu'une étude défectueuse peut produire dans la littérature académique, surtout lorsqu'elle porte sur un sujet aussi médiatisé que l'IA en éducation.

Les signaux d'alerte avaient pourtant émergé rapidement. Dès juillet 2024, des commentaires critiques étaient visibles sur PubPeer, la plateforme collaborative qui permet aux chercheurs de relever des problèmes dans des articles déjà publiés. Des chercheurs norvégiens ont également sonné l'alarme. La revue a donc mis près d'un an à agir, malgré ces avertissements précoces. Ce délai pose des questions sur les processus de contrôle post-publication des grandes revues scientifiques, à l'heure où la recherche sur l'IA génère un volume considérable de publications souvent précipitées. Le cas s'inscrit dans une tendance plus large : face à l'engouement autour de ChatGPT depuis fin 2022, de nombreuses études sur ses usages pédagogiques ont été produites à grande vitesse, parfois au détriment de la rigueur méthodologique. La communauté scientifique devra désormais examiner avec plus de scepticisme les méta-analyses qui concluent à des effets largement positifs des outils d'IA sur l'apprentissage.

Impact France/UE

Les travaux scientifiques européens qui citaient cette méta-analyse rétractée devront être réévalués, fragilisant potentiellement des recommandations pédagogiques sur l'usage de l'IA en éducation adoptées dans l'UE.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Un quart des citations dans les réponses des chatbots IA provient du journalisme, selon une étude Muckrack
1The Decoder 

Un quart des citations dans les réponses des chatbots IA provient du journalisme, selon une étude Muckrack

Une étude publiée par Muckrack, plateforme spécialisée dans les relations presse, a analysé 15 millions de citations produites par les trois principaux chatbots d'intelligence artificielle, ChatGPT, Claude et Gemini. Résultat : une référence sur quatre renvoie à une source journalistique. Les publications spécialisées et les journalistes sectoriels sont les plus cités, tandis que les grands médias généralistes apparaissent moins fréquemment dans les réponses des modèles. Ce constat a des implications concrètes pour l'industrie des médias. Les publications de niche et les titres spécialisés, tech, santé, finance, droit, semblent tirer un bénéfice disproportionné de la montée en puissance des assistants IA, qui les utilisent comme sources de référence fiables. Pour les annonceurs et les équipes de relations presse, cela signifie que la visibilité dans les chatbots passe désormais par la presse spécialisée autant que par les grands portails d'information. Cette étude s'inscrit dans un débat plus large sur la relation entre les modèles de langage et le journalisme. Plusieurs grands groupes de presse, dont The New York Times, ont engagé des poursuites judiciaires contre OpenAI pour utilisation non autorisée de leurs contenus à des fins d'entraînement. D'autres éditeurs ont préféré signer des accords de licence avec les laboratoires d'IA. La question de savoir si cette exposition dans les réponses des chatbots constitue une forme de valeur compensatoire, ou au contraire un détournement de trafic, reste au coeur des négociations en cours entre médias et acteurs de l'IA générative.

UELes éditeurs de presse français et européens, déjà engagés sur les droits voisins, peuvent s'appuyer sur ces données pour renforcer leurs positions dans les négociations de licences avec les labs d'IA.

RecherchePaper
1 source
Quantification de l'incertitude pour l'appel de fonctions dans les LLM
2Apple Machine Learning 

Quantification de l'incertitude pour l'appel de fonctions dans les LLM

Les modèles de langage (LLM) sont de plus en plus déployés pour accomplir de manière autonome des tâches concrètes, notamment grâce au paradigme dit du "function calling", qui leur permet d'appeler des outils externes pour agir sur le monde réel. Ce mécanisme est aujourd'hui largement utilisé pour doter les LLM de capacités d'usage d'outils, que ce soit pour interroger une base de données, exécuter du code ou déclencher une action dans une application tierce. Le problème soulevé par des chercheurs est qu'un appel de fonction incorrect peut avoir des conséquences graves, en particulier lorsque l'action déclenchée est irréversible, comme un virement bancaire ou la suppression de données. Face à ce risque, les auteurs proposent d'évaluer la confiance du modèle dans la justesse d'un appel de fonction avant même de l'exécuter, via des méthodes de quantification de l'incertitude, ou "Uncertainty Quantification" (UQ). Cette approche change la donne pour les entreprises qui intègrent des agents IA autonomes dans leurs systèmes de production. Plutôt que de laisser un modèle exécuter aveuglément chaque action qu'il génère, la quantification de l'incertitude permettrait de détecter en amont les appels de fonction douteux et de les soumettre à une validation humaine ou de les bloquer purement et simplement. Pour les secteurs sensibles comme la finance, la santé ou la gestion de données critiques, ce type de garde-fou pourrait devenir un prérequis avant tout déploiement à grande échelle d'agents capables d'agir sans supervision constante. Cette recherche s'inscrit dans un mouvement plus large de la communauté IA visant à rendre les agents autonomes plus fiables et plus sûrs, alors que leur adoption s'accélère dans les entreprises. Les mécanismes de function calling, bien que puissants, restent une source de fragilité: un modèle peut mal interpréter une requête, halluciner des paramètres ou choisir le mauvais outil. En couplant ces systèmes à des méthodes de quantification de l'incertitude, les chercheurs espèrent ouvrir la voie à des agents capables d'évaluer eux-mêmes leur propre fiabilité, une étape jugée essentielle avant de leur confier des tâches à fort enjeu.

RecherchePaper
1 source
L’IA rend l’édition scientifique « plus lente, de moins bonne qualité et plus chère »
3Next INpact 

L’IA rend l’édition scientifique « plus lente, de moins bonne qualité et plus chère »

L'IA générative dégraderait la qualité et alourdirait les coûts de l'édition scientifique, selon Holden Thorp, rédacteur en chef de la revue Science et responsable éditorial de l'ensemble des publications de l'éditeur du même nom. Dans un édito publié dans la revue phare, il explique que la multiplication des articles rédigés ou assistés par IA pousse le secteur vers une forme de « taylorisme », où la vérification humaine doit compenser les failles des machines, ralentissant et renchérissant tout le processus. Il s'appuie sur des travaux récents montrant que les grands modèles de langage peinent encore face à un jugement clinique nuancé, à un raisonnement expérimental complexe ou à une synthèse approfondie en biologie, et rappelle que même les chercheurs d'OpenAI reconnaissent ne pas être venus à bout du problème des hallucinations. Un autre article mis en ligne sur arXiv, qu'il cite, va plus loin en affirmant que certains agents IA seraient plus enclins que les humains à des pratiques comparables à des fautes professionnelles en recherche, comme le cherry picking de données ou la manipulation d'analyses statistiques jusqu'à obtenir le résultat espéré. Fin 2025, la plateforme de prépublication arXiv, submergée de soumissions générées par IA, avait déjà durci sa modération et instauré une suspension d'un an pour les chercheurs soumettant des articles erronés produits par ces outils. Pour Holden Thorp, l'enjeu dépasse la seule qualité des textes publiés : il s'agit de la crédibilité même de la science face à ce qu'il appelle l'« AI slop », ces contenus de mauvaise qualité générés par IA qui envahissent aussi bien la littérature scientifique que l'ensemble d'Internet. Il pointe la responsabilité de certains grands éditeurs, citant Elsevier, qui laisseraient passer des erreurs qu'il juge impardonnables faute de contrôle suffisant. Concrètement, cela signifie des revues débordées par un afflux de soumissions plus rapide que leur capacité de relecture, des comités éditoriaux contraints de renforcer leurs procédures de vérification, et un risque accru que des résultats erronés ou biaisés se retrouvent validés et diffusés dans le corpus scientifique mondial, avec des conséquences potentielles sur des travaux ultérieurs qui s'appuieraient dessus. Le parallèle avec le taylorisme n'est pas anodin : Holden Thorp rappelle que Frederick Winslow Taylor avait promu la surveillance accrue des salariés pour les pousser à travailler plus, au prix d'un épuisement généralisé et d'un transfert du pouvoir décisionnel des travailleurs vers la direction. Il y voit un écho à la situation actuelle des relecteurs et éditeurs scientifiques, sommés de redoubler de vigilance face à des soumissions toujours plus nombreuses. Ironie relevée par certains observateurs, l'édito de Thorp contient lui-même des liens vers arXiv assortis de paramètres UTM trahissant un passage par ChatGPT, signe que même les critiques les plus sévères de l'IA générative dans la recherche s'appuient parfois sur ces mêmes outils pour préparer leurs textes.

💬 Le détail qui tue dans l'édito de Thorp, c'est les liens arXiv avec des paramètres UTM de ChatGPT planqués dedans : même le rédacteur en chef de Science qui dézingue l'IA générative écrit avec elle. La promesse de vitesse se retourne contre elle-même, les comités de relecture doivent vérifier deux fois plus pour rattraper les hallucinations, du coup les revues finissent plus lentes et plus chères qu'avant l'IA. Le cherry picking par les agents m'inquiète plus que le style bancal des textes : une machine qui bidouille des stats pour plaire au chercheur, c'est un problème de recherche, pas de rédaction.

RecherchePaper
1 source
Aurora 1.5 : extension des modèles de fondation ouverts pour la météo et le système terrestre
4Microsoft Research 

Aurora 1.5 : extension des modèles de fondation ouverts pour la météo et le système terrestre

Microsoft Research a dévoilé Aurora 1.5, une extension majeure de son modèle de fondation Aurora pour l'étude du système terrestre, développé initialement par Microsoft Research AI for Science et présenté pour la première fois en 2024, avant sa publication dans la revue Nature en 2025. Cette nouvelle version, portée par la division Microsoft Weather, ajoute 22 nouvelles variables météorologiques aux quatre variables d'origine, couvrant notamment les champs de surface, les niveaux de pression, le vent, la température, l'humidité, les précipitations et le rayonnement. Le modèle passe également à une résolution temporelle horaire, contre des intervalles plus larges auparavant, et intègre désormais la prévision d'ensemble probabiliste, une fonctionnalité très demandée par les utilisateurs. Cette technique consiste à exécuter plusieurs simulations simultanément pour évaluer l'éventail des résultats possibles et leur probabilité, plutôt que de produire une seule prévision déterministe. Le modèle est publié en open source sur GitHub, avec les poids disponibles sur Hugging Face, permettant à chercheurs et développeurs de l'évaluer, de l'adapter et de le déployer librement. Cette mise à jour élargit considérablement le champ d'application d'Aurora, qui dépassait déjà la simple météo pour couvrir les vagues océaniques, la chimie atmosphérique et certaines applications climatiques via un réglage fin. Avec ses nouvelles variables et sa granularité horaire, le modèle devient pertinent pour des secteurs entiers qui dépendent de signaux terrestres intégrés : énergie, agriculture, transport et gestion des risques climatiques et de résilience des infrastructures. La résolution horaire permet par exemple d'anticiper précisément le début d'un épisode de précipitations, d'éclairer des décisions commerciales sensibles au climat, ou de suivre la trajectoire d'un cyclone tropical au moment de son atterrissage. Pour les organisations exposées aux aléas climatiques, ce niveau de précision peut directement améliorer la préparation opérationnelle et la prise de décision, dans un contexte où les risques liés au climat pèsent de plus en plus sur les communautés, les infrastructures et les économies à l'échelle mondiale. Aurora 1.5 illustre une stratégie plus large de Microsoft consistant à faire passer la recherche de pointe vers un usage élargi : garder le modèle ouvert pour la communauté scientifique tout en construisant, autour de lui, une couche produit avec infrastructure cloud, accès géré et outils d'aide à la décision destinés aux entreprises. Cette architecture à deux niveaux, fondation ouverte d'un côté et services commerciaux Microsoft Weather de l'autre, vise à connecter les avancées de recherche aux données, à l'infrastructure et aux flux de travail opérationnels dont les organisations ont besoin. La démarche s'inscrit dans une tendance plus vaste de l'industrie vers des modèles de fondation ouverts pour l'observation de la Terre, où plusieurs acteurs technologiques cherchent désormais à concilier recherche académique publiable et exploitation commerciale à grande échelle des mêmes modèles.

UELes agences météorologiques et acteurs européens de l'énergie, l'agriculture ou la gestion des risques climatiques pourraient exploiter ce modèle open source, mais aucune entité française ou européenne n'est directement impliquée dans cette annonce.

RechercheActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic