
Meta double l'efficacité de son modèle publicitaire IA à grande échelle avec l'entraînement GEM
Meta a dévoilé les détails techniques de GEM (Generative Ads Recommendation Model), le modèle de fondation qui alimente les recommandations publicitaires sur Instagram et Facebook. Ce modèle s'entraîne désormais à l'échelle des grands modèles de langage, sur plusieurs milliers de GPU de dernière génération. Au cours des douze derniers mois, l'équipe d'ingénierie de Meta a doublé l'efficacité globale de l'entraînement, atteignant un taux d'utilisation des FLOPs du modèle (MFU) de 20 à 25 %, tout en multipliant par quatre le volume total de calcul consacré à l'entraînement. Ce résultat repose sur une conception conjointe des noyaux de calcul, de la précision numérique, du parallélisme, du réseau et de la mémoire. GEM combine une architecture hybride associant des milliers de milliards de paramètres d'embeddings épars à des milliards de paramètres denses, entraînés sur des données de contenu publicitaire et d'engagement utilisateur, réparties entre caractéristiques séquentielles comme l'historique d'activité et caractéristiques non séquentielles comme la localisation ou la représentation des créations publicitaires.
Cette prouesse technique compte parce que les infrastructures d'IA optimisées pour les grands modèles de langage classiques ne s'appliquent pas directement aux systèmes de recommandation, dont le profil de données diffère fondamentalement. Les séquences d'activité utilisateur ont des longueurs très variables, et un simple remplissage jusqu'à la longueur maximale peut gaspiller jusqu'à 50 % de la puissance de calcul. Les tâches de prédiction publicitaire, comme le taux de clic ou de conversion, sont en outre extrêmement sensibles aux changements de précision numérique, ce qui rend risqué le recours naïf à des formats basse précision sans dégrader la qualité des prédictions. En résolvant ces contraintes propres aux systèmes de recommandation à grande échelle, Meta améliore directement l'efficacité économique de son moteur publicitaire, un enjeu majeur pour un groupe dont l'essentiel des revenus provient de la publicité ciblée sur Facebook et Instagram.
Pour surmonter ces obstacles, les ingénieurs de Meta ont développé une bibliothèque de noyaux de calcul dédiée aux systèmes de recommandation, comprenant des mécanismes comme Jagged Flash Attention, Generalized Dot-Product Attention et BlockAttention, combinés à un entraînement en précision ultra-basse mixte, notamment au format MXFP8 pour les couches d'attention et les réseaux denses. Côté mise à l'échelle, l'équipe a mis en place un parallélisme à cinq dimensions tenant compte de la topologie réseau, associant du FSDP bidimensionnel et du parallélisme d'experts pour les paramètres denses à un parallélisme de modèle entièrement partitionné pour les paramètres épars, le tout aligné sur la hiérarchie réseau multi-niveaux de Meta. Cette approche illustre une tendance plus large de l'industrie où les géants technologiques réutilisent les innovations issues de l'entraînement des grands modèles de langage pour d'autres charges de travail critiques, ouvrant la voie à de nouvelles optimisations matérielles et logicielles spécifiques aux systèmes de recommandation à très grande échelle.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



