Ex-chercheur d'OpenAI parie que 100 milliards de dollars vont être investis dans les données d'entraînement, car la mise à l'échelle seule ne suffira pas
Un ancien chercheur d'OpenAI, Andrew Ho, quitte l'entreprise pour fonder une startup consacrée aux données d'entraînement spécialisées. Avec le chercheur de Cambridge Adam Hunt, il pointe une dérive inquiétante des grands modèles de langage: plutôt que de gagner en polyvalence, ceux-ci se spécialisent toujours davantage, excellant en programmation et en mathématiques tout en stagnant, voire en régressant, sur d'autres tâches. Selon Ho, les laboratoires d'IA devront investir plus de 100 milliards de dollars dans la collecte ciblée de données pour corriger cette tendance et retrouver des modèles réellement généralistes.
Ce constat bouscule le récit dominant selon lequel il suffit d'ajouter davantage de puissance de calcul et de données génériques pour obtenir des modèles toujours meilleurs sur tous les plans. Si la spécialisation s'accentue, les assistants conversationnels grand public pourraient devenir moins fiables hors des domaines techniques, même en progressant sur le code ou le calcul. Pour les entreprises et les utilisateurs qui attendent des IA polyvalentes, cela signifie potentiellement des résultats plus inégaux selon les usages, et ouvre un nouveau front concurrentiel autour de la qualité et de la diversité des jeux de données.
Ce mouvement s'inscrit dans un débat plus large sur les limites des lois d'échelle qui ont guidé la course à l'IA ces dernières années. Alors qu'OpenAI, Anthropic ou Google ont massivement investi dans le calcul brut, les signes de rendements décroissants en dehors de domaines étroits comme le code suggèrent que la nature des données compte désormais autant que leur volume. Le départ de Ho illustre un pari sur un basculement des investissements, du calcul pur vers l'acquisition ciblée de données, qui pourrait redessiner l'économie de la donnée dans l'IA.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




