Aller au contenu principal
Les lois d'échelle, examinées avec rigueur
RechercheLilian Weng · 1 min de lecture

Les lois d'échelle, examinées avec rigueur

Source originale ↗·

Les lois d'échelle (scaling laws) constituent l'une des découvertes empiriques les plus déterminantes de l'apprentissage profond moderne. Le principe est d'une élégante simplicité : la perte d'entraînement L d'un modèle diminue de manière prévisible lorsque l'on augmente simultanément trois paramètres, la taille du modèle N, la quantité de données d'entraînement D, et la puissance de calcul C. Cette relation suit une courbe en loi de puissance, qui se traduit par une droite sur un graphe log-log. En d'autres termes, plus on investit en calcul, en données et en paramètres, plus le modèle s'améliore, et ce de façon quantifiable à l'avance.

L'enjeu pratique est considérable : ces lois permettent aux équipes de recherche d'allouer leur budget de calcul de façon optimale entre deux leviers, augmenter la taille du modèle ou augmenter le volume de données. Pour des entraînements qui coûtent des dizaines ou centaines de millions de dollars, la capacité à prédire les gains avant même de lancer un run est une information stratégique de premier ordre.

Ce cadre théorique a été formalisé par les chercheurs d'OpenAI autour de Jared Kaplan en 2020, puis significativement révisé par DeepMind avec le papier Chinchilla en 2022, qui démontrait que la plupart des grands modèles étaient sous-entraînés en données par rapport à leur taille. Aujourd'hui, alors que les entreprises approchent de limites physiques et économiques, la question centrale est de savoir si ces lois continueront de tenir, ou si l'ère du scaling pur touche à sa fin.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Mise à l'échelle des cartes de flux catégorielles
1Apple Machine Learning 

Mise à l'échelle des cartes de flux catégorielles

Les modèles de diffusion continue et de flow matching pourraient constituer une alternative sérieuse aux approches autorégressives utilisées aujourd'hui pour la modélisation du langage. Des travaux de recherche récents montrent qu'il est possible de générer des données discrètes, comme du texte, par un processus continu de flow matching reliant une distribution gaussienne à la distribution des données encodées en one-hot. Cette approche a permis de développer les Categorical Flow Maps (CFM), une technique qui accélère l'échantillonnage tout en produisant des résultats de qualité comparable aux méthodes existantes. L'enjeu de ces travaux est désormais de faire passer cette technique à l'échelle, c'est-à-dire de vérifier qu'elle reste efficace et compétitive lorsqu'elle est appliquée à des modèles de langage de grande taille, au-delà des démonstrations initiales à plus petite échelle. Cette avancée compte parce qu'elle pourrait transférer au traitement du texte des avantages jusqu'ici réservés aux modalités continues comme l'image ou la vidéo, notamment une génération beaucoup plus rapide et un meilleur contrôle du contenu produit, ce que les chercheurs appellent le tilting. Pour l'industrie, cela ouvrirait la voie à des modèles de langage capables de produire du texte en moins d'étapes de calcul que les architectures autorégressives classiques, réduisant les coûts d'inférence tout en conservant la flexibilité nécessaire pour orienter finement les sorties générées, un enjeu central pour les applications commerciales des grands modèles. Ces recherches s'inscrivent dans un mouvement plus large qui cherche à unifier les techniques de génération entre modalités continues et discrètes. Les modèles de diffusion dominent déjà la génération d'images et de vidéos, tandis que les architectures autorégressives de type transformeur restent la norme pour le texte. En démontrant que le flow matching catégoriel peut rivaliser avec ces dernières tout en accélérant l'échantillonnage, ces travaux alimentent un débat en cours sur l'avenir architectural des modèles de langage, avec des implications potentielles pour la prochaine génération de systèmes conversationnels à grande échelle.

RecherchePaper
1 source
Meta modifie l'architecture de classement des publicités pour passer des séquences utilisateur aux lois d'échelle
2Meta Engineering ML 

Meta modifie l'architecture de classement des publicités pour passer des séquences utilisateur aux lois d'échelle

Meta a présenté une nouvelle architecture de modélisation de séquences pour son système de classement publicitaire, conçue pour traiter les milliards d'interactions quotidiennes générées par ses plateformes. L'entreprise s'appuie sur des travaux publiés en 2024, qui montraient déjà l'intérêt de modéliser l'ordre et le timing des actions des utilisateurs plutôt que de s'appuyer sur des caractéristiques éparses conçues manuellement. Meta introduit désormais deux avancées architecturales majeures : un modèle de séquence multi-étapes qui sépare la modélisation lourde des utilisateurs, effectuée hors ligne, du classement léger réalisé en temps réel, ainsi qu'une technique d'apprentissage fondée sur une tokenisation dense et un mécanisme d'attention ciblée sur la cible, qui apprend directement les interactions entre caractéristiques à partir des données. Combinées à d'autres innovations de modèle, ces avancées ont permis un gain cumulé de 6% des conversions sur Instagram, 3% des conversions sur Facebook et 3,5% des clics publicitaires sur Facebook. Cette plateforme unifiée constitue un composant central du Generative Ads Recommendation Model (GEM) de Meta. Ces gains, bien que mesurés en points de pourcentage, représentent un impact considérable à l'échelle de Meta, qui traite des millions de candidats publicitaires par seconde et doit classer des milliers d'annonces en quelques millisecondes. Pour les annonceurs, un classement plus précis signifie des campagnes plus performantes et un meilleur retour sur investissement publicitaire, sans coût supplémentaire en infrastructure de diffusion. Pour les utilisateurs de Facebook et Instagram, cela se traduit par des publicités mieux ciblées, reflétant plus fidèlement leurs centres d'intérêt réels. L'enjeu dépasse la seule performance immédiate : en établissant une loi d'échelle prévisible, à la manière des grands modèles de langage, Meta peut désormais anticiper les gains obtenus en augmentant la taille du modèle ou la puissance de calcul, ce qui facilite la planification des investissements en infrastructure IA. Cette avancée répond à une limite structurelle des approches hybrides utilisées jusqu'ici, où un modèle traitait les séquences d'événements utilisateurs pendant qu'un autre gérait les interactions entre caractéristiques éparses. Ce montage souffrait d'un transfert de connaissances imparfait entre les deux composants, d'une dépendance persistante à l'ingénierie manuelle des caractéristiques et d'un plafond de performance dû aux interférences entre les modules de classement et de séquence. La nouvelle architecture à deux étages, où un modèle transformeur hors ligne traite les longs historiques utilisateurs de façon asynchrone pour produire des représentations mises en cache, ensuite combinées en temps réel avec les signaux des candidats publicitaires, lève ce plafond. Elle s'inscrit dans une course plus large entre grandes plateformes publicitaires pour exploiter les architectures transformeurs à grande échelle, alors que la personnalisation publicitaire devient un terrain de différenciation technique majeur.

UELes annonceurs et utilisateurs français et européens de Facebook et Instagram beneficient indirectement d'un meilleur ciblage publicitaire, sans qu'aucune entreprise ou institution europeenne ne soit directement impliquee.

RecherchePaper
1 source
Les propriétés de mise à l'échelle des métriques aval dans l'entraînement des grands modèles de langage
3Apple Machine Learning 

Les propriétés de mise à l'échelle des métriques aval dans l'entraînement des grands modèles de langage

Une équipe de chercheurs remet en question une croyance bien ancrée dans le domaine des grands modèles de langage : la performance sur les tâches réelles serait imprévisible à partir du budget d'entraînement. Leur étude propose un cadre direct pour modéliser la progression des benchmarks en fonction des ressources investies, et les résultats sont convaincants. L'enjeu est considérable pour l'industrie. Jusqu'ici, les équipes s'appuyaient sur des métriques intermédiaires comme la perte de pré-entraînement (pretraining loss) pour estimer les capacités futures d'un modèle, sans pouvoir prédire directement ce que ce modèle ferait sur des tâches concrètes. Cette incertitude complique les décisions d'investissement : faut-il entraîner un modèle plus grand, ou sur plus de données ? La réponse restait floue. Les chercheurs démontrent que pour un ratio tokens/paramètres fixé, une simple loi de puissance (power law) suffit à décrire avec précision l'évolution du logarithme de l'accuracy sur plusieurs benchmarks populaires. Contrairement à la procédure en deux étapes proposée précédemment dans la littérature, qui consiste à prédire la loss, puis à convertir cette loss en performance, leur approche directe extrapole mieux et de façon plus fiable. Ces résultats pourraient changer la façon dont les laboratoires planifient leurs runs d'entraînement. Pouvoir anticiper directement la performance sur des tâches aval (downstream tasks), sans passer par une métrique proxy, permettrait d'allouer les budgets de calcul avec plus de précision, de réduire les expériences coûteuses à l'aveugle, et d'accélérer les cycles de développement des futurs LLMs.

RecherchePaper
1 source
ParaRNN : RNNs non linéaires à grande échelle, entraînables en parallèle
4Apple Machine Learning 

ParaRNN : RNNs non linéaires à grande échelle, entraînables en parallèle

Des chercheurs d'Apple ont publié ParaRNN, une méthode qui permet d'entraîner en parallèle des réseaux de neurones récurrents (RNN) non linéaires à grande échelle. Historiquement, les RNN se heurtaient à un obstacle fondamental : leur calcul séquentiel rendait impossible de les entraîner efficacement sur des milliards de paramètres, contrairement aux architectures basées sur l'attention comme les Transformers. ParaRNN contourne cette limitation en débloquant la parallélisation de l'entraînement, ouvrant pour la première fois la voie à des RNN comparables en taille aux grands modèles de langage actuels. L'enjeu est considérable pour l'industrie de l'IA. Les RNN ont un avantage majeur à l'inférence : ils consomment beaucoup moins de mémoire et de calcul que les Transformers, ce qui les rend particulièrement attractifs pour les déploiements sur appareils contraints, smartphones, wearables, systèmes embarqués. Jusqu'ici, cette efficacité à l'inférence était contrebalancée par l'impossibilité de les entraîner à l'échelle. ParaRNN change cette équation et élargit concrètement le choix d'architectures disponibles aux praticiens qui conçoivent des LLM pour des environnements à ressources limitées. Ce travail s'inscrit dans un effort plus large de l'industrie pour trouver des alternatives aux Transformers, dont les coûts computationnels explosent avec la taille. Des architectures comme Mamba, RWKV ou les modèles d'état linéaires (SSM) ont déjà relancé l'intérêt pour les approches séquentielles. Qu'Apple s'engage sur ce terrain avec une contribution de recherche fondamentale signale un intérêt stratégique évident pour des modèles embarqués performants, en cohérence avec son positionnement autour de l'IA on-device dans ses produits.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic