Améliorer la conversion à chaque étape du tunnel d'acquisition grâce à la personnalisation par bandits contextuels sur AWS
Amazon Payments a appliqué une personnalisation fondée sur l'IA à l'un de ses parcours d'acquisition de produit, en s'appuyant sur un bandit manchot contextuel multi-objectifs déployé sur Amazon SageMaker AI. Lors d'un test A/B de sept semaines, l'équipe observe un gain relatif de conversion en fin de parcours de l'ordre de plusieurs points (un chiffre à un seul chiffre élevé) pour une population de clients. Une autre population n'a connu aucune amélioration par rapport à l'expérience existante. Selon les auteurs, le problème venait du contenu proposé et non du modèle. L'équipe a retenu l'algorithme UCB (Upper Confidence Bound), qui choisit le bras dont la récompense estimée, augmentée d'un bonus d'incertitude, est la plus élevée. Pour la personnalisation, elle a opté pour Linear UCB (LinUCB), introduit par Li et ses collègues en 2010. Chaque client est représenté par un vecteur de signaux comportementaux, comme ses habitudes de paiement ou la composition de ses transactions. L'identifiant de l'entité sert uniquement à renvoyer la recommandation au bon visiteur et n'entre jamais dans le modèle. Un dépôt de code permet de tester la méthode sur des données synthétiques.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Un bandit manchot est une méthode d'apprentissage par renforcement conçue pour les situations où les options sont nombreuses et le trafic limité. Chaque variante de contenu est un « bras » testé sur du trafic réel. Les impressions sont progressivement orientées vers les variantes les plus performantes, tandis qu'une fraction du trafic continue d'explorer les autres. Ce compromis entre exploitation et exploration permet d'apprendre en continu, sans attendre la fin d'un test. Les bandits classiques apprennent un seul meilleur bras pour toute l'audience. Les bandits segmentés, eux, font tourner une instance par groupe défini à la main. Ces groupes sont arbitraires et chacun réclame son propre trafic. Le bandit contextuel conditionne sa décision directement sur un vecteur de caractéristiques, si bien qu'un schéma appris dans un contexte profite à toutes les visites similaires. Le choix d'UCB répond aussi à un impératif d'auditabilité. Sa règle de sélection déterministe produit une décision reproductible et explicable pour chaque impression.
Cette approche répond à un problème né de l'IA générative, qui permet de produire très vite et à faible coût de grandes quantités de contenu personnalisé. Dans un article précédent, Amazon avait montré comment Amazon Bedrock génère ce contenu à grande échelle tout en respectant les chartes de marque et les garde-fous. Le défi est désormais celui de la sélection : parmi toutes ces variantes, laquelle montrer à chaque client, et en combien de temps l'apprendre. Les tests A/B/n gardent leur utilité, mais leur lenteur devient pénalisante quand le nombre de variantes explose. Les auteurs s'attendent donc à un rôle croissant des bandits. Ils citent d'autres stratégies de sélection, comme epsilon-greedy ou l'échantillonnage de Thompson. L'article détaille aussi une extension de la méthode qui optimise l'ensemble de l'entonnoir de conversion, ainsi que l'architecture AWS qui la porte. Le résultat nul observé sur la seconde population rappelle que la qualité des variantes proposées plafonne le gain qu'un algorithme de sélection peut obtenir.
Pas d'impact direct sur la France/UE