Aller au contenu principal
Le LFM2.5-230M de Liquid AI surpasse des modèles 4 fois plus grands en extraction de données et tourne partout
LLMsVentureBeat AI2sem· 2 min de lecture

Le LFM2.5-230M de Liquid AI surpasse des modèles 4 fois plus grands en extraction de données et tourne partout

Source originale ↗·

Liquid AI, une startup fondée par d'anciens chercheurs du MIT, a lancé le 26 juin 2026 son modèle de langage le plus compact à ce jour : LFM2.5-230M. Avec seulement 230 millions de paramètres, ce modèle de fondation est conçu pour fonctionner directement sur les appareils, smartphones, ordinateurs portables, systèmes robotiques, sans connexion permanente au cloud. Malgré sa taille réduite, il surpasse à la tâche d'extraction de données des modèles jusqu'à quatre fois plus grands, notamment le Qwen3.5-0.8B d'Alibaba (800 millions de paramètres) et le Gemma 3 1B de Google (1 milliard de paramètres). Sur un Samsung Galaxy S25 Ultra équipé d'un Snapdragon Gen4, il atteint 213 tokens par seconde en décodage ; sur un Raspberry Pi 5, il maintient 42 tokens par seconde. Sa fenêtre de contexte de 32 000 tokens lui permet d'ingérer de longs documents ou des flux continus de données de télémétrie robotique. Son empreinte mémoire reste inférieure à 400 Mo. Le modèle est entraîné sur 19 000 milliards de tokens et proposé sous licence duale : gratuit pour les entreprises générant moins de 10 millions de dollars de revenus annuels, payant au-delà.

Pour les équipes data et les développeurs d'applications embarquées, l'enjeu est concret. Les entreprises s'appuient encore largement sur des pipelines ETL (Extract, Transform, Load) rigides et basés sur des règles fixes, des systèmes qui se brisent dès qu'un document change de format ou qu'un schéma évolue. LFM2.5-230M ouvre la voie à un « AI ETL » capable d'inférer automatiquement les correspondances de données, de détecter les dérives de schéma et de structurer des sources non structurées, PDF, e-mails, formulaires web, en JSON sans intervention humaine. Ce type de flux agentique léger peut désormais s'exécuter localement, sans dépendance au cloud, ce qui réduit la latence, les coûts d'infrastructure et les risques liés à la confidentialité des données.

Cette sortie illustre une fracture croissante dans l'industrie de l'IA. D'un côté, Anthropic, OpenAI, Google, Microsoft et Meta poussent leurs modèles vers des centaines de milliards, voire des milliers de milliards de paramètres pour atteindre les performances dites frontier. De l'autre, une course parallèle s'intensifie autour de l'efficience architecturale pour l'inférence locale. Liquid AI mise sur son architecture LFM2, un système hybride combinant convolutions à courte portée et mécanismes d'attention groupée, qui contourne les coûts quadratiques en mémoire des transformers classiques. Cette approche permet d'obtenir des vitesses d'inférence élevées sur du matériel contraint, là où les transformers purs s'essoufflent. Le positionnement de Liquid AI, efficience plutôt que mise à l'échelle brutale, pourrait séduire un segment d'entreprises que les géants du cloud peinent à servir : celles qui ont besoin d'IA performante sans exposer leurs données ni investir dans une infrastructure coûteuse.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Liquid AI publie LFM2.5-350M : un modèle compact de 350 millions de paramètres entraîné sur 28 000 milliards de tokens avec apprentissage par renforcement
1MarkTechPost 

Liquid AI publie LFM2.5-350M : un modèle compact de 350 millions de paramètres entraîné sur 28 000 milliards de tokens avec apprentissage par renforcement

Liquid AI a publié LFM2.5-350M, un modèle de langage de 350 millions de paramètres entraîné sur 28 000 milliards de tokens — soit un ratio tokens/paramètres de 80 000 pour 1, un record dans cette catégorie de taille. Contrairement aux architectures Transformer classiques, ce modèle repose sur une structure hybride appelée LIV (Linear Input-Varying Systems) : 10 blocs de convolution LIV à double gating et 6 blocs d'attention GQA (Grouped Query Attention). Cette combinaison permet de gérer une fenêtre de contexte de 32 768 tokens tout en maintenant une empreinte mémoire extrêmement réduite — 169 Mo sur un Snapdragon 8 Elite, 81 Mo sur GPU Snapdragon, et 300 Mo sur Raspberry Pi 5. Sur GPU NVIDIA H100, le modèle atteint 40 400 tokens générés par seconde en forte concurrence. Aux benchmarks, il affiche 76,96 sur IFEval (suivi d'instructions), 30,64 sur GPQA Diamond et 20,01 sur MMLU-Pro. Ce modèle s'adresse directement au marché de l'IA embarquée : appareils mobiles, systèmes edge, IoT, environnements à ressources contraintes. Sa capacité à tourner en moins de 300 Mo de RAM le rend déployable sans cloud, sans GPU serveur, directement sur l'appareil de l'utilisateur final. Pour les développeurs qui construisent des agents autonomes, des pipelines d'extraction de données structurées (JSON, appels de fonctions) ou des systèmes de traitement d'instructions complexes, le LFM2.5-350M offre une vitesse d'inférence difficile à atteindre avec des modèles deux fois plus grands. En revanche, Liquid AI est explicite : ce modèle n'est pas recommandé pour les mathématiques avancées, le code complexe ou l'écriture créative — domaines où la densité de paramètres reste déterminante. Liquid AI, startup fondée par des chercheurs du MIT spécialisés dans les réseaux neuronaux liquides, s'inscrit dans un courant croissant qui remet en question le dogme du « toujours plus grand ». Alors que les grands acteurs — OpenAI, Google, Anthropic — continuent de pousser des modèles frontier aux milliards de paramètres, une contre-tendance émerge autour de la densité d'intelligence : faire mieux avec moins, en optimisant radicalement le ratio données/paramètres et l'architecture elle-même. L'abandon partiel du mécanisme d'attention au profit de systèmes LIV réduit le problème du cache KV qui pénalise les Transformers sur les longues séquences. Cette approche ouvre la voie à une IA véritablement locale, souveraine et déployable sans dépendance à l'infrastructure cloud — un enjeu stratégique croissant dans un contexte de régulation des données et de souveraineté numérique.

UELa capacité du modèle à fonctionner sans infrastructure cloud s'aligne avec les enjeux de souveraineté numérique et de conformité RGPD en Europe, où le traitement local des données réduit la dépendance aux serveurs américains.

LLMsOpinion
1 source
IBM publie Granite 4.0 3B Vision : un modèle de langage visuel pour l'extraction de données documentaires en entreprise
2MarkTechPost 

IBM publie Granite 4.0 3B Vision : un modèle de langage visuel pour l'extraction de données documentaires en entreprise

IBM a lancé Granite 4.0 3B Vision, un modèle de langage visuel (VLM) conçu spécifiquement pour l'extraction de données documentaires en entreprise. Contrairement aux grands modèles multimodaux monolithiques, ce modèle adopte une architecture modulaire : il se présente sous forme d'adaptateur LoRA d'environ 0,5 milliard de paramètres, conçu pour se greffer sur le modèle de base Granite 4.0 Micro (3,5 milliards de paramètres). Cette configuration permet un déploiement en « double mode » — le modèle texte fonctionne de manière autonome, et le composant visuel n'est activé qu'en cas de besoin. Pour traiter les images haute résolution, le modèle découpe les documents en tuiles de 384×384 pixels via l'encodeur visuel SigLIP2 de Google, tout en conservant une vue globale réduite de l'image. Les tokens visuels sont ensuite injectés dans le modèle de langage en 8 points d'ancrage distincts grâce à l'architecture DeepStack, assurant un alignement précis entre contenu sémantique et mise en page spatiale. En matière de performances, le modèle atteint 85,5 % de correspondance exacte en extraction de paires clé-valeur sur le benchmark VAREX (zéro-shot), et se classe troisième parmi les modèles de 2 à 4 milliards de paramètres sur ce leaderboard en mars 2026. L'enjeu principal de cette sortie est de permettre aux entreprises d'automatiser l'extraction structurée de données à partir de documents complexes — tableaux financiers, graphiques analytiques, formulaires — avec un modèle compact et déployable localement. Là où les grands modèles généralistes sacrifient la précision structurelle au profit de la polyvalence, Granite 4.0 3B Vision est entraîné spécifiquement sur la conversion de graphiques en CSV ou JSON, la reconnaissance de structures de tableaux en HTML, et l'extraction de paires clé-valeur. IBM a notamment utilisé ChartNet, un dataset multimodal à l'échelle du million d'exemples, ainsi qu'une pipeline d'entraînement « guidée par le code » qui aligne le code de génération d'un graphique, son rendu visuel et la table de données sous-jacente. Cette approche permet au modèle de comprendre la relation structurelle entre une représentation visuelle et sa source, plutôt que de simplement décrire une image. Ce lancement s'inscrit dans la stratégie d'IBM de positionner sa gamme Granite comme une alternative open-source et souveraine aux solutions propriétaires de Microsoft, Google ou Anthropic pour les usages entreprise. La tendance à l'architecture modulaire — un socle texte augmenté d'adaptateurs spécialisés — reflète une évolution plus large du secteur vers des modèles efficaces en ressources, déployables sur des infrastructures maîtrisées plutôt que dans le cloud public. Avec la prolifération des obligations réglementaires autour de la traçabilité des données (RGPD, AI Act européen), des modèles capables de traiter des documents sensibles en local représentent un avantage concurrentiel significatif. La prochaine étape pour IBM sera d'intégrer ce composant dans ses pipelines documentaires Watson et de le rendre accessible via watsonx, sa plateforme d'IA d'entreprise.

UELe déploiement local de Granite 4.0 3B Vision facilite la conformité RGPD et AI Act pour les entreprises européennes traitant des documents sensibles, en évitant tout transfert vers le cloud américain.

LLMsOpinion
1 source
Liquid AI publie LFM2.5-8B-A1B : un modèle MoE embarqué de 8,3 milliards de paramètres dont 1,5 milliard actifs
3MarkTechPost 

Liquid AI publie LFM2.5-8B-A1B : un modèle MoE embarqué de 8,3 milliards de paramètres dont 1,5 milliard actifs

Liquid AI a lancé LFM2.5-8B-A1B, un modèle de langage de type Mixture-of-Experts (MoE) conçu pour fonctionner directement sur des appareils grand public. Le modèle embarque 8,3 milliards de paramètres au total, mais n'en active que 1,5 milliard par token généré, ce qui réduit considérablement la charge de calcul à chaque inférence. Son architecture hybride combine 24 couches : 18 blocs de convolution LIV à double porte et 6 couches GQA. La fenêtre de contexte atteint 131 072 tokens, soit quatre fois plus que son prédécesseur LFM2-8B-A1B (32 768 tokens). Le modèle couvre neuf langues dont l'arabe, le chinois et le japonais. Par rapport à la version précédente, le volume de pré-entraînement est passé de 12 000 à 38 000 milliards de tokens, et le vocabulaire a doublé de 65 536 à 128 000 entrées, améliorant la tokenisation des scripts non-latins comme le hindi, le thaï ou l'arabe. LFM2.5-8B-A1B est également un modèle raisonnant : il produit une chaîne de pensée explicite avant chaque réponse. Les gains sur les benchmarks sont substantiels : le taux de non-hallucination AA-Omniscience bondit de 7,46 à 63,47, le score IFEval passe de 79,44 à 91,84, et MATH500 grimpe de 74,80 à 88,76. Ce modèle ouvre concrètement la voie à des agents IA autonomes capables de tourner sans cloud, directement sur un téléphone, un laptop ou une puce dédiée. Sur un CPU Apple M5 Max, il atteint 253 tokens par seconde en restant sous 6 Go de mémoire ; sur smartphone, le débit tient autour de 30 tokens par seconde. Sur un seul GPU NVIDIA H100, le débit monte à 18 500 tokens par seconde. Pour les développeurs, le modèle est compatible dès le premier jour avec llama.cpp, MLX, vLLM, SGLang et ONNX, ainsi qu'avec la plateforme edge LEAP de Liquid AI. Cette accessibilité technique signifie que des applications d'entreprise ou grand public peuvent intégrer un raisonnement structuré et une exécution d'outils sans dépendre d'une infrastructure cloud coûteuse, ce qui réduit la latence, les coûts et les risques de confidentialité. Liquid AI est une startup fondée par des chercheurs du MIT, connue pour ses architectures alternatives aux transformers classiques. LFM2.5 s'inscrit dans une série de modèles hybrides pensés pour l'inférence en périphérie du réseau (edge). Pour réduire les hallucinations, l'équipe a introduit deux étapes de reinforcement learning : une pour éliminer les boucles de raisonnement infinies via une pénalisation des mots déclencheurs comme "Wait…", une autre basée sur une récompense avg@k pour entraîner le modèle à s'abstenir plutôt qu'à inventer. Dans un secteur où Gemma de Google ou les modèles Qwen d'Alibaba dominent la course aux petits modèles performants, Liquid AI positionne LFM2.5-8B-A1B comme une alternative architecturalement différente, capable de rivaliser avec des modèles bien plus lourds sur les tâches agentiques et l'instruction following.

LLMsActu
1 source
Le réglage fin des modèles Amazon Nova pour une extraction précise des données d'e-mails
4AWS ML Blog 

Le réglage fin des modèles Amazon Nova pour une extraction précise des données d'e-mails

Voici l'article traduit et résumé en français : Parcel Perform, plateforme d'expérience de livraison basée sur l'IA destinée aux entreprises d'ecommerce, a collaboré avec le AWS Generative AI Innovation Center (GenAIIC) pour résoudre un problème concret : extraire des données structurées à partir d'emails aux formats très divers, des simples notifications aux documents HTML complexes truffés d'éléments JavaScript. L'équipe a utilisé Amazon SageMaker AI pour affiner par fine-tuning les modèles Amazon Nova Micro et Nova Lite, en s'appuyant sur l'apprentissage supervisé (SFT) combiné à la technique PEFT (Parameter-Efficient Fine-Tuning) via LoRA (Low-Rank Adaptation), une méthode qui permet de personnaliser un modèle avec peu de données d'entraînement tout en limitant les ressources de calcul nécessaires. Selon Le Vy, responsable de l'équipe IA chez Parcel Perform, le modèle Nova Micro ainsi spécialisé a atteint jusqu'à 94,77 % de précision d'extraction sur le jeu de données de test, soit une amélioration de 16,6 points de pourcentage par rapport au modèle de référence, tout en réduisant la latence d'inférence de plus de 30 % et en divisant les coûts par deux par rapport à la solution précédemment utilisée par l'entreprise. Ces gains ne sont pas anecdotiques pour une entreprise qui traite des millions de messages email par jour : les modèles génériques peinaient à distinguer des champs proches comme les numéros de commande et les numéros de suivi, produisaient des hallucinations, et le traitement d'emails au format HTML faisait exploser les coûts en tokens. En apprenant au modèle à reconnaître les schémas de données propres à Parcel Perform, le fine-tuning a permis de résoudre simultanément trois problèmes distincts, la précision, la latence et le coût, ce qui est rare puisque ces métriques s'améliorent rarement de concert. Résultat concret : la version optimisée de Nova Micro égale ou dépasse les performances de Nova Lite tout en coûtant moins cher, ce qui a permis à Parcel Perform de déployer la solution en production pour ses opérations logistiques. Sur le plan technique, le workflow repose sur la préparation de données d'entraînement au format de conversation Amazon Bedrock, associant le contenu d'un email aux entités à en extraire, hébergées sur Amazon S3 avant le lancement du job de fine-tuning sur SageMaker AI à l'aide d'une configuration LoRA. Le modèle final est ensuite déployé sur Amazon Bedrock en inférence à la demande, facturée au token. Ce projet illustre une tendance plus large chez AWS : pousser les entreprises à personnaliser des modèles de taille réduite, via des "recettes" Nova au format YAML qui standardisent les hyperparamètres d'entraînement, plutôt que de s'appuyer sur des modèles génériques massifs, jugés plus coûteux et moins précis sur des tâches d'extraction très spécifiques au métier.

LLMsTuto
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic