Créer un flux ML sans code avec Snowflake, Amazon SageMaker Canvas et Amazon Quick (partie 2 : préparation des données et création du modèle)
AWS a publié la deuxième partie d'une série technique consacrée à la construction d'un flux de travail de machine learning sans code combinant Snowflake, Amazon SageMaker Canvas et Amazon Quick. Ce second volet, qui fait suite à un premier article consacré à la configuration de la base de données Snowflake, détaille le processus complet de préparation des données et de construction d'un modèle de détection de fraude à l'aide de l'algorithme XGBoost. Amazon SageMaker Canvas est un service de machine learning visuel et sans code qui permet aux analystes métier et aux experts non techniques de créer des modèles prédictifs. Le tutoriel décrit la création d'un « domaine » SageMaker, l'unité organisationnelle de base qui héberge les profils utilisateurs, les configurations de stockage et les paramètres de sécurité, via une configuration rapide en mode « utilisateur unique ». Une fois le domaine créé, l'utilisateur lance Canvas, dont l'espace de travail met entre trois et cinq minutes à se préparer. L'article détaille ensuite l'utilisation d'Amazon SageMaker Data Wrangler, l'outil intégré de préparation des données, pour se connecter directement à un entrepôt de données Snowflake, importer un jeu de données tabulaire et appliquer des transformations visuelles avant de passer à la construction du modèle.
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette approche répond à un enjeu central pour les entreprises qui manipulent de grands volumes de données dans le cloud : réduire la friction entre le stockage des données et leur exploitation pour le machine learning. En permettant une connexion directe entre Snowflake et SageMaker Canvas, sans export manuel ni duplication de données, AWS élimine une étape traditionnellement chronophage et source d'erreurs, tout en garantissant que les modèles sont entraînés sur les données les plus récentes. Ce type d'intégration démocratise l'accès au machine learning : des analystes métier ou des experts sectoriels, dans des secteurs allant des services financiers à la santé, peuvent désormais préparer et transformer leurs données puis construire des modèles prédictifs sans écrire une ligne de code ni dépendre d'une équipe de data scientists. Pour les organisations, cela représente un gain de temps significatif entre la donnée brute et l'insight exploitable, tout en conservant les mécanismes de gouvernance et de sécurité propres à l'environnement AWS. L'exemple choisi, un modèle de détection de fraude bâti avec XGBoost, illustre un cas d'usage à forte valeur pour les institutions financières, où la rapidité de mise en œuvre d'un modèle fiable peut avoir un impact direct sur les pertes évitées.
Cette publication s'inscrit dans la stratégie plus large d'AWS visant à combiner ses propres outils de machine learning, comme SageMaker, avec des plateformes de données tierces largement adoptées en entreprise, à commencer par Snowflake, l'un des principaux entrepôts de données cloud utilisés par les grandes organisations. Elle fait aussi référence à Amazon Quick, mentionné dans le titre de la série sans être encore détaillé dans cette deuxième partie, ce qui laisse penser qu'un futur volet abordera la restitution ou l'exploitation des résultats du modèle via cet outil. Ce mouvement vers le no-code pour le machine learning s'inscrit dans une tendance plus générale du secteur, où les fournisseurs cloud cherchent à réduire la dépendance aux compétences techniques pointues pour élargir le nombre d'utilisateurs capables de produire des modèles prédictifs opérationnels. Reste à voir, dans les prochains volets de cette série, comment AWS articule la phase de déploiement et de restitution des prédictions générées par SageMaker Canvas, une étape clé pour transformer ces modèles en décisions concrètes au sein des entreprises utilisatrices.
Pas d'impact direct sur la France/UE