Aller au contenu principal
LLMs · Actu ·

Liquid AI lance LFM2.5-VL-3B, un modèle vision-langage de 3 milliards de paramètres qui lit les écrans et appelle des outils sur l'appareil

Liquid AI a dévoilé LFM2.5-VL-3B, un modèle vision-langage de 3,1 milliards de paramètres conçu pour tourner directement sur des appareils, sans passer par le cloud. Il peut lire des écrans mobiles, web ou desktop, localiser des objets par coordonnées, analyser documents et graphiques, et appeler des outils à partir de texte ou d'images. Sur 28 benchmarks de vision, il obtient une moyenne de 69,4, à égalité avec InternVL-3.5-4B et à seulement 0,7 point de Qwen3.5-4B, deux modèles pourtant plus lourds avec 4,7 milliards de paramètres. Non conçu pour le raisonnement étape par étape, il répond directement, ce qui limite sa latence : il tient dans environ 3 Go de mémoire et décode 228 tokens par seconde sur une puce Apple M5 Max. Le modèle est disponible en quatre formats (natif, GGUF, ONNX, MLX) et compatible dès sa sortie avec llama.cpp, MLX, vLLM, SGLang et ONNX. Sa licence, la LFM Open License v1.0, reprend l'Apache 2.0 avec une exception : l'usage commercial gratuit s'arrête dès qu'une entreprise dépasse 10 millions de dollars de chiffre d'affaires annuel, au-delà desquels une licence payante doit être négociée avec Liquid AI. Recherche, éducation et associations en sont exemptées sans limite.

2 min de lecturePertinence 53
Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Ce lancement cible des secteurs où la confidentialité, la latence et le fonctionnement hors ligne comptent autant que la performance brute : électronique grand public, automobile, industrie et robotique, services financiers, santé et e-commerce, ainsi que les éditeurs d'outils de test logiciel et d'automatisation d'interfaces graphiques. Concrètement, cela ouvre la voie à des agents capables de naviguer seuls dans des applications, de convertir des PDF en texte structuré, de lire factures et reçus, de détecter des objets en temps quasi réel dans un véhicule, ou de traduire hors ligne des menus et panneaux routiers. Pour les développeurs indépendants, startups et PME sous le seuil des 10 millions de dollars, le modèle reste gratuit à exploiter commercialement, ce qui abaisse la barrière d'entrée face aux grands modèles propriétaires facturés à l'usage.

Ce modèle prolonge LFM2-VL-3B avec des progrès marqués sur quatre axes : la compréhension d'écrans, où le score ScreenSpot-v2 grimpe à 80,7 en moyenne ; l'appel de fonctions, nouveauté de la gamme, avec un score ToolSandbox passant de 26,4 à 59,5 ; le repérage d'objets, où la précision RefCOCO bondit de 57,1 à 87,9 points grâce à des données synthétiques de localisation ; et la gestion multi-images, avec BLINK progressant de 50,2 à 61,5. L'architecture combine un socle linguistique LFM2.5-2,6B et un encodeur visuel SigLIP2 de 400 millions de paramètres, entraîné sur environ 34 000 milliards de tokens, avec un vocabulaire doublé à 128 000 pour mieux couvrir les langues non latines. Liquid AI s'inscrit ainsi dans une course croissante aux modèles multimodaux compacts, où Google, Alibaba et d'autres acteurs rivalisent pour équiper appareils mobiles et systèmes embarqués sans dépendre d'une connexion permanente.

Impact France / UEChamp produit par Le Fil IA

Les entreprises et développeurs européens sous le seuil de 10 millions de dollars de chiffre d'affaires peuvent exploiter gratuitement ce modèle, mais aucune entité ou réglementation française/UE n'est directement concernée.

À lire ensuite

01Liquid AI lance LFM2.5-VL-450M : un modèle vision-langage de 450M paramètres avec détection d'objets, support multilingue et inférence en moins de 250ms sur appareils embarqués45MarkTechPostLLMs 02Liquid AI publie LFM2.5-8B-A1B : un modèle MoE embarqué de 8,3 milliards de paramètres dont 1,5 milliard actifs44MarkTechPostLLMs 03L'équipe Qwen publie en open source Qwen3.6-35B-A3B, modèle vision-langage MoE à 3 milliards de paramètres actifs47MarkTechPostLLMs 
Dossier · AlibabaSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.