Liquid AI publie Pipette en open source : un benchmark reproductible pour modèles embarqués, quantification, runtime et matériel
Liquid AI a annoncé cette semaine la publication en open source de Pipette, une plateforme de benchmarking pour les modèles de fondation déployés sur appareils mobiles, développée en partenariat avec Artificial Analysis, qui a validé la méthodologie de façon indépendante. L'outil, sous licence Apache 2.0, se compose de trois briques logicielles (pipette-mgmt, pipette-clients, pipette-scores), d'un jeu de données public, d'un tableau de bord hébergé et d'applications natives iOS et Android. Le jeu de données de lancement couvre cinq métriques de performance sur plus de 1 000 combinaisons modèle x quantification x runtime x appareil x contexte, portant sur plus de 30 modèles, des builds llama.cpp pour macOS, iOS, Windows et Android, et des longueurs de contexte allant de 256 à 8 192 tokens. Les premiers résultats vérifiés proviennent d'un MacBook Pro équipé d'une puce M5 Max, d'un iPhone 17 Pro et d'un Galaxy S26 Ultra, avec des résultats sur AMD Ryzen AI Max+ 395 et Radeon 8060S annoncés comme à venir. Les scores de qualité, mesurés séparément via IFBench, GPQA Diamond et MATH-500, sont produits lors d'évaluations llama.cpp sur des systèmes de référence Nvidia H100 80 Go, puis associés aux résultats obtenus sur les appareils partageant le même modèle et la même quantification.
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'idée centrale de Pipette est que la performance sur un appareil dépend de l'ensemble de la chaîne déployée, pas seulement du modèle. Les chiffres publiés l'illustrent nettement : à quantification identique et sur le même smartphone, deux modèles de 350 millions de paramètres conservent respectivement 78,4 % et 33,8 % de leur débit de décodage à 4 096 tokens de contexte, un écart qui apparaît entre Granite-4.0-H-350M et Granite-4.0-350M testés sur un Galaxy S26 Ultra. Autre exemple, à 2 048 tokens de contexte sur le même téléphone, le modèle à activation parcimonieuse LFM2.5-8B-A1B décode 2,4 fois plus vite que Qwen3.5-4B, preuve que ce type d'architecture apporte un gain de vitesse sans forcément réduire l'empreinte mémoire. Pour les équipes qui déploient des modèles sur du matériel qu'elles ne maîtrisent pas, ces données permettent de choisir un couple modèle-quantification avant de lancer un développement, de valider un choix de puce, de détecter des régressions après une mise à jour de runtime ou de système, et de vérifier de façon indépendante les promesses de performance des fournisseurs.
Le champ d'application visé est large : électronique grand public, fabricants de smartphones, automobile, robotique industrielle, dispositifs médicaux, services financiers et défense, partout où la latence, la confidentialité ou l'absence de connexion imposent une inférence locale plutôt que dans le cloud. Pipette est pensé pour s'adapter à toutes les tailles d'acteurs, du développeur indépendant utilisant simplement le tableau de bord jusqu'aux grands fabricants et fondeurs de puces capables de faire tourner l'ensemble du pipeline derrière leur propre pare-feu. La publication de résultats soumis par la communauté reste toutefois en version bêta. Cette initiative traduit une tension croissante dans l'industrie de l'IA embarquée : les fiches techniques des modèles, établies dans des conditions serveur en pleine précision, prédisent mal leur comportement réel une fois compressés et exécutés sur un téléphone ou un objet connecté.
Pas d'impact direct sur la France/UE