Synthèse efficace en mémoire par transformers de diffusion à profondeur temporelle découplée
Apple a publié une étude technique détaillant l'architecture audio qui alimente les « Siri Expressive Voices », un système de synthèse vocale capable de produire une parole riche et configurable en temps réel, entièrement sur l'appareil, sans passer par le cloud. Cette fonctionnalité s'appuie sur AFM 3 Core Advanced, le modèle de fondation le plus puissant qu'Apple fait tourner en local. Au cœur du dispositif se trouve un « detokenizer » chargé de convertir les tokens audio sémantiques produits par le modèle en un son haute fidélité, tout en respectant les contraintes très serrées de calcul et de mémoire imposées par le coprocesseur matriciel maison, l'Apple Matrix Coprocessor (AMX). Pour y parvenir, les ingénieurs transforment ces tokens en une représentation par quantification vectorielle résiduelle (RVQ), organisée autour d'une architecture en trois composants, dont un module de diffusion en flux continu destiné à réduire l'empreinte mémoire pendant la génération.
L'enjeu est de taille pour Apple, qui mise depuis plusieurs générations d'iPhone sur le traitement local des données afin de préserver la confidentialité et de réduire la latence. Réussir à générer une voix expressive et naturelle sans dépendre d'un serveur distant permet à Siri de répondre plus vite, même hors ligne, et évite d'exposer les échanges vocaux des utilisateurs à des infrastructures externes. Cette avancée technique illustre aussi la capacité d'Apple à faire tourner des modèles de génération audio sophistiqués sur du matériel grand public, contrainte que ses concurrents cloud n'ont pas.
Cette publication s'inscrit dans l'effort plus large d'Apple pour rattraper son retard perçu dans l'intelligence artificielle générative face à Google, OpenAI et Amazon, en misant sur une stratégie différenciante : le tout sur l'appareil plutôt que le tout cloud. Les Siri Expressive Voices s'appuient sur les avancées de la famille de modèles Apple Foundation Models (AFM), déjà présentée lors des précédentes conférences WWDC, et laissent entrevoir de futures itérations de Siri plus fluides et personnalisables, à mesure qu'Apple consolide son infrastructure d'IA embarquée.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




