Aller au contenu principal
Liquid AI dévoile LFM2.5-Encoder-230M et LFM2.5-Encoder-350M, des encodeurs bidirectionnels rapides jusqu'à 8K tokens de contexte sur CPU
LLMsMarkTechPost · 2 min de lecture

Liquid AI dévoile LFM2.5-Encoder-230M et LFM2.5-Encoder-350M, des encodeurs bidirectionnels rapides jusqu'à 8K tokens de contexte sur CPU

Résumé IASources croisées · 2Impact UE
Source originale ↗·
Egalement couvert par :HuggingFace Blog

Liquid AI a publié deux encodeurs bidirectionnels en poids ouverts, LFM2.5-Encoder-230M et LFM2.5-Encoder-350M, tous deux construits sur le socle hybride LFM2 et dotés d'une fenêtre de contexte de 8 192 tokens, soit environ 13 à 15 pages de texte en une seule passe. Ces modèles ne partent pas de zéro : ils sont initialisés à partir des backbones décodeurs LFM2.5-230M et LFM2.5-350M, puis convertis en trois étapes. Le masque d'attention causal est remplacé par un masque bidirectionnel permettant à chaque token de regarder dans les deux sens, les convolutions courtes de LFM2 sont rendues non causales grâce à un rembourrage symétrique centré, et l'entraînement utilise un objectif de modélisation de langage masqué avec un taux de masquage de 30 %, nettement plus dense que les 15 % de BERT. L'entraînement se déroule en deux phases : une première sur un contexte court de 1 024 tokens pour établir une compétence linguistique générale sur un vaste corpus web, puis une seconde étendant le contexte à 8 192 tokens sur l'ensemble des données, renforçant les compétences factuelles, juridiques et multilingues. Les deux modèles partagent une taille cachée de 1 024, un vocabulaire de 65 536 tokens, une couverture de 15 langues, et sont publiés sous licence LFM Open License v1.0.

Sur le plan des performances, ces encodeurs se mesurent favorablement face à des modèles bien plus lourds. Évalués sur 17 tâches issues de GLUE, SuperGLUE et de la classification multilingue, aux côtés de 14 autres modèles entièrement affinés pour chaque tâche, LFM2.5-Encoder-350M obtient un score moyen de 81,02 (±1,00), se classant quatrième, juste derrière des modèles bien plus volumineux comme XLM-R XL (3,5 milliards de paramètres, 83,06) ou ModernBERT-large (395 millions, 81,68). LFM2.5-Encoder-230M, avec un score de 79,29 (±1,02), dépasse ModernBERT-base (78,19) ainsi que les modèles EuroBERT-610M (75,87) et EuroBERT-2,1B (72,19), pourtant bien plus gros. Fait notable, les deux nouveaux encodeurs surpassent même les propres modèles de recherche documentaire de Liquid AI, LFM2.5-ColBERT-350M et LFM2.5-Embedding-350M, ce qui justifie selon l'entreprise le développement d'un encodeur généraliste distinct. Cet écart de performance à taille égale, voire inférieure, illustre l'efficacité revendiquée de l'architecture LFM2 face à l'augmentation de la longueur des séquences traitées.

Ce lancement vise trois environnements concrets où la légèreté et la rapidité comptent plus que la puissance brute : les appareils embarqués et en périphérie de réseau, comme le calculateur d'une voiture ou un contrôleur industriel dépourvu de GPU et ne pouvant se permettre un aller-retour vers le cloud ; les systèmes réglementés et sur site dans la finance, la santé et le droit, où les documents sont longs, sensibles et ne peuvent quitter l'infrastructure interne ; et les chaînes de traitement à fort volume où un petit encodeur sert de premier filtre économique avant un modèle plus lourd. Liquid AI a par ailleurs rendu publique sa méthodologie d'évaluation sous licence Apache-2.0, avec des poids maîtres en fp32, un calcul en bf16, une recette d'optimisation AdamW commune à tous les modèles testés et une version figée de la bibliothèque transformers, autant de précautions destinées à garantir des comparaisons rigoureuses entre architectures plutôt qu'entre simples formats numériques.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Le LFM2.5-230M de Liquid AI surpasse des modèles 4 fois plus grands en extraction de données et tourne partout
1VentureBeat AI 

Le LFM2.5-230M de Liquid AI surpasse des modèles 4 fois plus grands en extraction de données et tourne partout

Liquid AI, une startup fondée par d'anciens chercheurs du MIT, a lancé le 26 juin 2026 son modèle de langage le plus compact à ce jour : LFM2.5-230M. Avec seulement 230 millions de paramètres, ce modèle de fondation est conçu pour fonctionner directement sur les appareils, smartphones, ordinateurs portables, systèmes robotiques, sans connexion permanente au cloud. Malgré sa taille réduite, il surpasse à la tâche d'extraction de données des modèles jusqu'à quatre fois plus grands, notamment le Qwen3.5-0.8B d'Alibaba (800 millions de paramètres) et le Gemma 3 1B de Google (1 milliard de paramètres). Sur un Samsung Galaxy S25 Ultra équipé d'un Snapdragon Gen4, il atteint 213 tokens par seconde en décodage ; sur un Raspberry Pi 5, il maintient 42 tokens par seconde. Sa fenêtre de contexte de 32 000 tokens lui permet d'ingérer de longs documents ou des flux continus de données de télémétrie robotique. Son empreinte mémoire reste inférieure à 400 Mo. Le modèle est entraîné sur 19 000 milliards de tokens et proposé sous licence duale : gratuit pour les entreprises générant moins de 10 millions de dollars de revenus annuels, payant au-delà. Pour les équipes data et les développeurs d'applications embarquées, l'enjeu est concret. Les entreprises s'appuient encore largement sur des pipelines ETL (Extract, Transform, Load) rigides et basés sur des règles fixes, des systèmes qui se brisent dès qu'un document change de format ou qu'un schéma évolue. LFM2.5-230M ouvre la voie à un « AI ETL » capable d'inférer automatiquement les correspondances de données, de détecter les dérives de schéma et de structurer des sources non structurées, PDF, e-mails, formulaires web, en JSON sans intervention humaine. Ce type de flux agentique léger peut désormais s'exécuter localement, sans dépendance au cloud, ce qui réduit la latence, les coûts d'infrastructure et les risques liés à la confidentialité des données. Cette sortie illustre une fracture croissante dans l'industrie de l'IA. D'un côté, Anthropic, OpenAI, Google, Microsoft et Meta poussent leurs modèles vers des centaines de milliards, voire des milliers de milliards de paramètres pour atteindre les performances dites frontier. De l'autre, une course parallèle s'intensifie autour de l'efficience architecturale pour l'inférence locale. Liquid AI mise sur son architecture LFM2, un système hybride combinant convolutions à courte portée et mécanismes d'attention groupée, qui contourne les coûts quadratiques en mémoire des transformers classiques. Cette approche permet d'obtenir des vitesses d'inférence élevées sur du matériel contraint, là où les transformers purs s'essoufflent. Le positionnement de Liquid AI, efficience plutôt que mise à l'échelle brutale, pourrait séduire un segment d'entreprises que les géants du cloud peinent à servir : celles qui ont besoin d'IA performante sans exposer leurs données ni investir dans une infrastructure coûteuse.

LLMsOpinion
1 source
Liquid AI publie LFM2.5-350M : un modèle compact de 350 millions de paramètres entraîné sur 28 000 milliards de tokens avec apprentissage par renforcement
2MarkTechPost 

Liquid AI publie LFM2.5-350M : un modèle compact de 350 millions de paramètres entraîné sur 28 000 milliards de tokens avec apprentissage par renforcement

Liquid AI a publié LFM2.5-350M, un modèle de langage de 350 millions de paramètres entraîné sur 28 000 milliards de tokens, soit un ratio tokens/paramètres de 80 000 pour 1, un record dans cette catégorie de taille. Contrairement aux architectures Transformer classiques, ce modèle repose sur une structure hybride appelée LIV (Linear Input-Varying Systems) : 10 blocs de convolution LIV à double gating et 6 blocs d'attention GQA (Grouped Query Attention). Cette combinaison permet de gérer une fenêtre de contexte de 32 768 tokens tout en maintenant une empreinte mémoire extrêmement réduite, 169 Mo sur un Snapdragon 8 Elite, 81 Mo sur GPU Snapdragon, et 300 Mo sur Raspberry Pi 5. Sur GPU NVIDIA H100, le modèle atteint 40 400 tokens générés par seconde en forte concurrence. Aux benchmarks, il affiche 76,96 sur IFEval (suivi d'instructions), 30,64 sur GPQA Diamond et 20,01 sur MMLU-Pro. Ce modèle s'adresse directement au marché de l'IA embarquée : appareils mobiles, systèmes edge, IoT, environnements à ressources contraintes. Sa capacité à tourner en moins de 300 Mo de RAM le rend déployable sans cloud, sans GPU serveur, directement sur l'appareil de l'utilisateur final. Pour les développeurs qui construisent des agents autonomes, des pipelines d'extraction de données structurées (JSON, appels de fonctions) ou des systèmes de traitement d'instructions complexes, le LFM2.5-350M offre une vitesse d'inférence difficile à atteindre avec des modèles deux fois plus grands. En revanche, Liquid AI est explicite : ce modèle n'est pas recommandé pour les mathématiques avancées, le code complexe ou l'écriture créative, domaines où la densité de paramètres reste déterminante. Liquid AI, startup fondée par des chercheurs du MIT spécialisés dans les réseaux neuronaux liquides, s'inscrit dans un courant croissant qui remet en question le dogme du « toujours plus grand ». Alors que les grands acteurs, OpenAI, Google, Anthropic, continuent de pousser des modèles frontier aux milliards de paramètres, une contre-tendance émerge autour de la densité d'intelligence : faire mieux avec moins, en optimisant radicalement le ratio données/paramètres et l'architecture elle-même. L'abandon partiel du mécanisme d'attention au profit de systèmes LIV réduit le problème du cache KV qui pénalise les Transformers sur les longues séquences. Cette approche ouvre la voie à une IA véritablement locale, souveraine et déployable sans dépendance à l'infrastructure cloud, un enjeu stratégique croissant dans un contexte de régulation des données et de souveraineté numérique.

UELa capacité du modèle à fonctionner sans infrastructure cloud s'aligne avec les enjeux de souveraineté numérique et de conformité RGPD en Europe, où le traitement local des données réduit la dépendance aux serveurs américains.

LLMsOpinion
1 source
Moonshot AI dévoile Kimi K3, un modèle open MoE de 2,8 billions de paramètres avec Kimi Delta Attention et un contexte d'1M tokens
3MarkTechPost 

Moonshot AI dévoile Kimi K3, un modèle open MoE de 2,8 billions de paramètres avec Kimi Delta Attention et un contexte d'1M tokens

Moonshot AI a publié le 17 juillet 2026 son nouveau modèle Kimi K3, un système à 2,8 billions de paramètres doté d'une vision native et d'une fenêtre de contexte d'un million de tokens. L'entreprise chinoise le présente comme le premier modèle ouvert à franchir la barre des 3 000 milliards de paramètres, une taille encore inédite en open source. K3 repose sur une architecture Mixture-of-Experts éparse combinant deux innovations : Kimi Delta Attention (KDA), un mécanisme d'attention linéaire hybride qui accélérerait le décodage jusqu'à 6,3 fois sur des contextes d'un million de tokens, et Attention Residuals (AttnRes), qui optimise la circulation de l'information à travers la profondeur du réseau pour un gain d'efficacité d'entraînement d'environ 25 %, moyennant moins de 2 % de coût supplémentaire. Le modèle n'active que 16 de ses 896 experts à la fois grâce à un système baptisé Stable LatentMoE, avec un mécanisme de répartition appelé Quantile Balancing qui élimine les réglages heuristiques habituels. Combinées à d'autres innovations comme Per-Head Muon ou Gated MLA, ces optimisations offrent selon Moonshot une efficacité d'apprentissage 2,5 fois supérieure à celle de son prédécesseur Kimi K2. Pour le déploiement, K3 utilise une quantification en MXFP4 et MXFP8, et Moonshot recommande des configurations d'au moins 64 accélérateurs ; l'entreprise a également contribué une implémentation de KDA au projet vLLM. Sur le plan des performances, Kimi K3 reste globalement en retrait par rapport aux modèles propriétaires les plus puissants du marché, Claude Fable 5 d'Anthropic et GPT 5.6 Sol d'OpenAI, mais il les dépasse sur plusieurs benchmarks spécifiques : Program Bench, SWE Marathon, BrowseComp, Automation Bench et OmniDocBench, ce dernier mesurant l'analyse de documents avec un score de 91,1. Il reste derrière Fable 5 sur les tâches d'ingénierie logicielle complexes (FrontierSWE) et de raisonnement expert (HLE-Full), et derrière GPT 5.6 Sol sur DeepSWE. Pour les développeurs et les entreprises, cela signifie l'arrivée d'une alternative ouverte capable de rivaliser avec les meilleurs modèles fermés sur des cas d'usage concrets comme l'ingénierie logicielle à l'échelle d'un dépôt entier, la recherche automatisée ou le traitement de documents complexes, sans les coûts de licence ni les contraintes d'accès des API propriétaires. Ce lancement s'inscrit dans une course effrénée à la taille et à l'efficacité des modèles ouverts, où Moonshot a occupé neuf des douze derniers mois la position de plus gros modèle disponible en open source. Face à des géants comme Anthropic, OpenAI ou Google, mais aussi face à d'autres acteurs chinois comme Zhipu avec sa gamme GLM, l'entreprise mise sur la sparsité et des architectures d'attention plus efficaces pour compenser l'écart de ressources de calcul. Les cas d'usage mis en avant, agents de codage autonomes fonctionnant sur de longues sessions avec un minimum de supervision humaine, itération entre code et captures d'écran grâce à la vision intégrée, ou encore production de rapports de recherche approfondis s'appuyant sur des milliers de pages consultées, dessinent une trajectoire claire vers des systèmes d'IA capables de mener des tâches complexes en autonomie prolongée. La suite dépendra de l'adoption par la communauté open source et de la capacité de Moonshot à maintenir ce rythme d'innovation architecturale.

💬 Kimi K3 franchit les 2,8 billions de paramètres, mais le chiffre qui compte c'est le 6,3x sur le décodage long contexte, c'est ça qui rend un million de tokens réellement exploitable en prod et pas juste un chiffre marketing. Moonshot tient le rythme depuis neuf mois sur douze en tête de l'open source, et ça commence à ressembler à une stratégie plus qu'à un coup ponctuel. Reste que sur les tâches d'ingénierie complexe, Fable 5 et GPT 5.6 Sol gardent l'avance, l'open source rattrape sur les cas d'usage concrets, pas encore sur le raisonnement pur.

LLMsActu
1 source
Liquid AI lance LFM2.5-2.6B, un modèle embarqué à base d'agents avec contexte 128K, appels d'outils et poids ouverts
4MarkTechPost 

Liquid AI lance LFM2.5-2.6B, un modèle embarqué à base d'agents avec contexte 128K, appels d'outils et poids ouverts

Liquid AI a dévoilé LFM2.5-2.6B, un modèle agentique conçu pour fonctionner entièrement en local, sur téléphones, ordinateurs portables, PC et robots. Le modèle compte 2,69 milliards de paramètres, une fenêtre de contexte de 131 072 tokens et un vocabulaire de 128 000 tokens, pour un pré-entraînement portant sur environ 34 000 milliards de tokens. Deux versions sont publiées sur Hugging Face sous licence lfm1.0 : LFM2.5-2.6B-Base, destinée au fine-tuning, et LFM2.5-2.6B, déjà post-entraînée pour les tâches agentiques. Les poids sont disponibles aux formats natif, GGUF, MLX et ONNX, avec un support dès le premier jour dans llama.cpp, vLLM, SGLang et LM Studio. Côté performances, le modèle atteint 220 tokens par seconde sur une puce M5 Max en utilisant moins de 2,5 Go de mémoire, et environ 30 tokens par seconde sur smartphone. Son architecture repose sur 30 couches combinant 22 blocs de convolution courte à double portail et 8 blocs d'attention par groupes de requêtes. Il couvre 16 langues, en format texte uniquement. L'intérêt principal tient à l'exécution locale : aucune donnée ne quitte l'appareil, et le coût marginal de chaque requête devient quasi nul. Liquid AI affirme que son modèle rivalise, sur l'usage d'outils et le suivi d'instructions, avec des modèles jusqu'à quatre fois plus volumineux. L'entreprise vise en priorité l'automobile, l'électronique grand public, la robotique industrielle, la santé, la finance, le e-commerce et la défense, des secteurs souvent soumis à des contraintes réglementaires ou à des environnements isolés du réseau, où l'absence totale d'appel à une API tierce constitue un avantage décisif. Pour l'auto-hébergement, un seul GPU Nvidia H100 SXM5 peut traiter environ 1,3 milliard de tokens par jour, un fine-tuning via LoRA étant possible avec TRL ou Unsloth. Liquid AI déconseille en revanche ce modèle pour le développement de code agentique ou les tâches à forte densité de connaissances : sur LiveCodeBench, il obtient 59,41 contre 69,86 pour Qwen3.5-9B. Le modèle est né d'un post-entraînement en quatre étapes : deux cycles successifs de fine-tuning supervisé, une spécialisation par domaine via apprentissage par renforcement à récompenses vérifiables, une distillation multi-domaines où le modèle apprend directement sous sa propre politique, puis un apprentissage par renforcement agentique via GRPO au sein d'environnements réels comme Hermes Agent et OpenClaw. Sur les benchmarks, LFM2.5-2.6B devance gemma-4-E4B-it et Qwen3.5-9B sur ToolSandbox (77,83), Multi-IF (80,07), IFStruct (85,49) et IFBench (59,17), ne cédant du terrain que sur BFCLv4 face à Qwen3.5-9B (56,88 contre 60,13). Cette sortie illustre la course engagée par les acteurs de l'IA pour proposer des modèles compacts capables de tourner en continu sur des appareils, sans dépendre des API cloud ni de leurs coûts récurrents par token.

💬 Selon Le Fil IA, LFM2.5-2.6B confirme que la course aux petits modèles agentiques prend le pas sur la course aux gros modèles généralistes, tout simplement parce que tourner en local coûte zéro par requête et ne fuit aucune donnée. 220 tokens/s sur un M5 Max avec moins de 2,5 Go de RAM, c'est le genre de chiffre qui donne enfin envie d'embarquer de l'IA sur un objet plutôt que de l'appeler via une API. Après, faut pas se mentir : sur le code agentique il perd nettement face à Qwen3.5-9B, donc c'est un modèle pour l'auto, la santé ou l'industrie, pas pour remplacer ton Copilot.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic