Liquid AI lance LFM2.5-VL-3B-DSpark : un décodage spéculatif jusqu'à 3,13x plus rapide pour les modèles vision-langage
Liquid AI a dévoilé LFM2.5-VL-3B-DSpark, un modèle de décodage spéculatif expérimental conçu pour accélérer son modèle vision-langage LFM2.5-VL-3B. Ce "drafter" ajoute environ 280 millions de paramètres, ce qui augmente le nombre de paramètres déployés de 8,9 %, mais ne modifie en rien la sortie du modèle principal. Selon l'équipe, le décodage est jusqu'à 3,13 fois plus rapide sur silicium Apple et jusqu'à 2,66 fois plus rapide sur un GPU NVIDIA H100. Les poids sont disponibles sur Hugging Face aux formats Safetensors et GGUF, avec une prise en charge immédiate par SGLang, MLX-VLM et llama.cpp. Le drafter repose sur une architecture simplifiée de quatre couches, uniquement basée sur l'attention, avec un bloc de 8 ou 9 tokens selon le matériel, et a été entraîné pendant dix époques sur du matériel AMD exclusivement. La licence utilisée, LFM Open License v1.0, autorise un usage commercial gratuit uniquement pour les entreprises réalisant moins de 10 millions de dollars de revenus annuels.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette avancée est significative parce qu'elle étend une technique jusqu'ici surtout appliquée aux modèles de texte vers les modèles vision-langage, sans perte de qualité en décodage glouton et en préservant la distribution de sortie du modèle cible même à température non nulle. Pour les entreprises et développeurs qui déploient des VLM sur des appareils aux ressources limitées, comme des MacBook ou des puces mobiles, cela signifie des réponses plus rapides sans changer de modèle ni sacrifier la précision. Les tests menés sur le benchmark MMSpec, couvrant six types de tâches allant du VQA général au raisonnement complexe, montrent des gains de bout en bout allant jusqu'à 2,62 fois sur puce Apple et 2,27 fois sur H100, avec un avantage de débit maintenu même à forte concurrence sur GPU. Toutefois, les gains restent plus limités sur les appareils en périphérie, car l'encodage d'image et le traitement initial du prompt ne bénéficient pas de l'accélération, contrairement à la phase de génération de tokens.
Ce lancement s'inscrit dans la continuité des travaux de Liquid AI sur ses drafters DSpark, initialement conçus pour les modèles textuels, l'entreprise ayant constaté que la modalité importe peu une fois que texte et patches d'image sont convertis en tenseurs dans les couches cachées. L'enjeu plus large touche à la course à l'efficacité inférentielle chez les fournisseurs de modèles multimodaux, alors que la demande croît pour des VLM capables de tourner localement sur des appareils grand public plutôt que dans des centres de données. Liquid AI qualifie toutefois cette sortie d'expérimentale, laissant présager d'autres itérations à venir, notamment sur l'optimisation du prefill, qui reste le principal goulot d'étranglement sur les configurations à faible puissance de calcul.
Pas d'impact direct sur la France/UE