Liquid AI lance les modèles brouillon LFM2.5-DSpark, jusqu'à 3,18x plus rapides sans changer les résultats
Liquid AI a publié le 20 août 2026 des modèles de brouillon baptisés DSpark pour trois modèles de sa famille LFM2.5 : LFM2.5-1.2B-Instruct, LFM2.5-2.6B et LFM2.5-8B-A1B. Chaque drafter, d'environ 300 millions de paramètres (295,7M pour le modèle 1.2B, 327,7M pour les modèles 2.6B et 8B-A1B), propose un bloc de neuf tokens candidats que le modèle cible vérifie en un seul passage. Le gain de vitesse atteint jusqu'à 3,18x sur une puce H100 de Nvidia et jusqu'à 2,87x sur un MacBook Pro équipé d'une puce M4 Max, sans modifier la sortie du modèle : en décodage greedy, la séquence produite reste identique à celle du modèle cible seul. Les poids sont disponibles au format Safetensors et GGUF, avec un support dès le premier jour dans llama.cpp et SGLang. Le référentiel du drafter 2.6B pèse 655 Mo en BF16. La licence LFM Open License v1.0 autorise un usage commercial gratuit tant que l'entité génère moins de 10 millions de dollars de revenus annuels ; au-delà, une licence commerciale doit être négociée directement avec Liquid AI.
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette annonce cible directement les usages où l'inférence locale prime sur le cloud : assistants de code embarqués, agents fonctionnant sur l'appareil, copilotes hors ligne sur du matériel de type ordinateur portable, et scénarios à un seul utilisateur où la taille de lot reste égale à un. Des secteurs sensibles comme la santé, la finance ou la défense, qui doivent garder leurs données sur site, sont particulièrement visés. L'intérêt principal est que le gain de vitesse ne coûte quasiment rien en précision, puisque les benchmarks restent inchangés. Mais l'accélération dépend fortement du taux d'acceptation des tokens proposés, lui-même lié à la prévisibilité de la tâche : sur MATH500, LFM2.5-8B-A1B accepte 8,27 tokens sur 10 et atteint 3,18x, contre seulement 4,02 sur GSM8K et un gain limité à 1,29x. Sur puce Apple, le modèle à experts mixtes (MoE) 8B-A1B ne gagne que 1,18x en moyenne, un écart que Liquid AI attribue aux limites actuelles du backend Metal de llama.cpp pour les architectures MoE.
Ce lancement s'inscrit dans la course plus large à l'inférence locale efficace, où de jeunes acteurs comme Liquid AI cherchent à réduire la dépendance aux fournisseurs d'inférence hébergée en optimisant directement le matériel grand public. La technique DSpark combine trois éléments : un tronc parallèle inspiré de DFlash conditionné sur le contexte du modèle cible, une tête séquentielle légère modélisant les dépendances entre tokens voisins via une chaîne de Markov de rang 256, et un vérificateur à confiance calibrée qui élague les suffixes peu fiables. Aucun fournisseur d'inférence hébergée ne propose encore ces checkpoints sur Hugging Face, ce qui limite pour l'instant l'adoption aux équipes capables d'auto-héberger l'infrastructure avec SGLang ou llama.cpp.
Les entreprises europeennes de secteurs regules comme la sante, la finance ou la defense pourraient adopter ces modeles pour de l'inference locale sans transfert de donnees vers le cloud.