Aller au contenu principal
Outils · Outil ·

Perplexity ouvre le code de Lily, un moteur d'inférence Rust + Metal pour Qwen3.6-35B-A3B sur Apple Silicon

Perplexity a mis en open source Lily, le moteur d'inférence local qui alimente la fonction Hybrid Compute de son application Perplexity Computer. Il s'agit d'un runtime mono-processus où une couche Rust charge le checkpoint et pilote la boucle de génération, une API de type chat-complétions compatible OpenAI diffuse les tokens en streaming, et des kernels Metal écrits à la main exécutent le modèle, sans passer ni par PyTorch ni par MLX. Le moteur cible un seul modèle, Qwen3.6-35B-A3B, sur une seule famille de matériel, les Mac Apple Silicon, et une démo autonome est publiée dans le dépôt pplx-garden. Le checkpoint quantifié en 4 bits pèse 19,4 Go, ce qui impose en pratique un Mac disposant d'au moins 32 Go de mémoire unifiée, le produit Hybrid Compute exigeant macOS 15 ou plus récent, 24 Go au minimum et 32 Go pour de meilleures performances. Sur un Mac M5 Max à 40 coeurs et 128 Go de RAM, en traitement par lot unique et sur dix longueurs de contexte allant de 256 à 128 000 tokens, Lily atteint en moyenne 4156 tokens par seconde en préremplissage contre 3388 pour MLX-LM, soit 1,23 fois plus vite, et 170 tokens par seconde en décodage contre 126,4, soit 1,35 fois plus vite.

2 min de lecturePertinence 55

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette spécialisation change la donne pour l'inférence locale sur Mac, un terrain où la pile par défaut MLX plus MLX-LM devait rester générique pour fonctionner sur de multiples architectures de modèles. En abandonnant cette généralité, Perplexity concentre la structure du modèle, les plans d'exécution et le choix des kernels dans un seul runtime dédié, ce qui se traduit par des gains de vitesse concrets pour les utilisateurs faisant tourner de gros modèles en local, sans dépendre du cloud, avec une meilleure latence et un débit plus élevé. Pour l'industrie, cela illustre une tendance à l'ingénierie bas niveau ultra-ciblée pour tirer le maximum d'une puce donnée, une approche que d'autres laboratoires pourraient reproduire pour leurs propres modèles vedettes sur matériel Apple.

Qwen3.6-35B-A3B est un modèle à mélange d'experts totalisant 35 milliards de paramètres, dont environ 3 milliards seulement s'activent par token via un routeur qui évalue 256 experts et en sélectionne huit, plus un expert partagé actif en permanence, le tout combiné à dix couches d'attention complète de type GQA et trente couches récurrentes Gated DeltaNet. Pour exploiter cette structure, Lily reconstruit les poids quantifiés directement dans les calculs matriciels groupés sur le GPU, ce qui a relevé le débit de préremplissage de 77,4% sur un prompt de 512 tokens, et regroupe tout le routage des experts dans un seul lot d'instructions GPU pour un gain de 89% en supprimant les synchronisations avec le processeur. En décodage, où la bande passance mémoire est le facteur limitant, la fusion des kernels et la lecture optimisée du cache ont porté la bande passante des clés de 33,8 à 47,9 Go/s et celle des valeurs de 42 à 61,8 Go/s, avec des gains allant jusqu'à 40,2% à 128 000 tokens de contexte. Ces choix d'ingénierie très spécifiques à Qwen3.6-35B-A3B et à Apple Silicon marquent une divergence assumée avec les moteurs généralistes comme MLX, et posent la question de savoir si Perplexity étendra cette approche à d'autres modèles ou d'autres puces.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Perplexity AI lance un orchestrateur d'inférence hybride pour PC : répartition automatique entre local et cloud45MarkTechPostOutils 02Perplexity lance le calcul hybride sur Mac : les agents cloud délèguent à un modèle local, contrôlé sur l'appareil48MarkTechPostOutils 03Apple Intelligence : le guide complet pour utiliser l’IA sur son iPhone ou Mac48Le Big DataOutils 
Dossier · Perplexity AISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.