Une étude Pew confirme la forte hausse des textes rédigés par IA sur le web depuis le lancement de ChatGPT
Le Pew Research Center a analysé près de 500 000 pages web en anglais afin d'y détecter la présence de contenu généré par intelligence artificielle. Selon cette étude, plus d'un tiers des pages publiées depuis le lancement de ChatGPT fin 2022 présentent des signes de rédaction automatisée. Les chercheurs ont utilisé des outils de détection pour repérer les marqueurs linguistiques typiques des textes produits par des modèles de langage. Fait notable, les sites commerciaux en .com affichent une probabilité dix fois plus élevée de contenir du texte généré par IA que les domaines universitaires en .edu ou gouvernementaux en .gov.
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Ces résultats confirment une transformation rapide et massive de l'écosystème informationnel en ligne, où une part croissante du contenu consulté par les internautes n'est plus rédigée par des humains. Pour les utilisateurs, moteurs de recherche et plateformes publicitaires, cela pose un défi de taille en matière de fiabilité et de traçabilité de l'information. Les sites commerciaux, souvent motivés par des logiques de référencement et de volume de production, apparaissent comme les principaux moteurs de cette vague de contenu automatisé, ce qui alimente les inquiétudes sur la qualité et l'originalité du web.
Cette étude s'inscrit dans un contexte où l'essor des grands modèles de langage depuis le lancement de ChatGPT a bouleversé les pratiques de production de contenu, notamment dans le marketing et le référencement naturel. Les domaines institutionnels comme les universités et administrations semblent avoir mieux résisté à cette vague, probablement en raison d'exigences éditoriales plus strictes. La question de la détection et de l'étiquetage du contenu IA devrait continuer à mobiliser chercheurs, régulateurs et plateformes dans les mois à venir.
Les moteurs de recherche et plateformes européennes sont confrontes au même phénomène de contenu génère par IA, ce qui pose des questions de fiabilité de l'information pour les internautes français et européens.