Aller au contenu principal
Pokee AI lance Pokee-Isaac 28B, un modèle à agents avec un contexte de 10 millions de tokens conçu pour tourner chez le client
LLMsMarkTechPost · 2 min de lecture

Pokee AI lance Pokee-Isaac 28B, un modèle à agents avec un contexte de 10 millions de tokens conçu pour tourner chez le client

Source originale ↗·

La start-up Pokee AI a dévoilé Pokee-Isaac 28B, un modèle de fondation texte de 28 milliards de paramètres doté d'une fenêtre de contexte de 10 millions de tokens, conçu pour tourner à l'intérieur du périmètre informatique du client plutôt que sur un cloud externe. Il atteint 93,3% sur le benchmark RULER à 10 millions de tokens, score maintenu à chaque palier testé, alors que GPT-5.6 Luna et Gemini 3.5 Flash Lite décrochent dès le million de tokens après avoir tenu jusqu'à 512 000. Distribué sous licence et non en poids ouverts, Isaac est accessible via une API compatible OpenAI, déployable en VPC, sur site ou en local, avec support dès le lancement pour vLLM et SGLang, et fonctionnerait sur un seul GPU grand public type RTX 4090, bien que les mesures publiées proviennent uniquement d'un GPU de classe B200. Le tarif annoncé, provisoire, est de 0,15 dollar par million de tokens en entrée et 1 dollar en sortie.

Cette architecture vise les organisations où les données ne peuvent réglementairement pas quitter un périmètre défini : santé et assurance, services financiers, défense et secteur public, cabinets juridiques, recherche pharmaceutique ou semi-conducteurs. Pour ces acteurs, un agent capable de traiter des dizaines de millions de tokens sans passer par une API externe ouvre des usages jusque-là impossibles : revue complète d'un dépôt de code, analyse de contrats sur plusieurs années, ou investigation forensique sur des archives de logs entières, sans recourir au résumé du contexte. Sur les benchmarks agentiques, Isaac affiche une quasi-parité avec les meilleurs modèles cloud, avec 70,94 contre 70,61 pour Luna sur BFCL v4, et enregistre les taux de réussite d'attaques les plus bas de son panel en test de sécurité, tout en restant en retrait sur Terminal-Bench 2.1 avec 56 tâches résolues sur 86 contre 60 pour Luna.

Cette sortie illustre une tension propre aux agents IA à long horizon : plus une tâche s'étire, plus elle accumule d'observations dans la fenêtre de contexte, une contrainte que seuls quelques modèles propriétaires hébergés dans le cloud géraient jusqu'ici à grande échelle, excluant de fait les secteurs régulés et les applications embarquées. En rendant un modèle à contexte massif exploitable sur une seule carte graphique et déployable localement, y compris sur des puces comme l'Intel Arc Pro B70, le Core Ultra Series 3 « Panther Lake » ou le Snapdragon X2 Elite de Qualcomm, Pokee AI cible les entreprises et fabricants d'appareils disposant déjà de leur propre infrastructure plutôt que les développeurs sans matériel sur site. Le rapport reconnaît lui-même une limite : les résultats de sécurité d'Isaac ont été obtenus avec le harnais logiciel propre à Pokee, contrairement aux modèles concurrents testés dans l'environnement standard.

Impact France/UE

Les entreprises europeennes du secteur regule (sante, finance, defense) soumises au RGPD pourraient s'interesser a ce type de modele deployable on-premise pour respecter la localisation des donnees, mais aucun acteur francais ou europeen n'est implique dans cette annonce.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Qwen lance Qwen3.7-Max : un modèle agent de raisonnement avec une fenêtre de contexte d'un million de tokens
1MarkTechPost 

Qwen lance Qwen3.7-Max : un modèle agent de raisonnement avec une fenêtre de contexte d'un million de tokens

Alibaba a présenté officiellement Qwen3.7-Max le 20 mai 2026 lors de l'Alibaba Cloud Summit, bien que deux versions preview du modèle aient discrètement fait leur apparition sur le classement Arena AI quelques jours plus tôt, sans communiqué de presse ni accès API annoncé. Le modèle texte uniquement obtient un score de 56,6 sur l'Intelligence Index d'Artificial Analysis, le plaçant cinquième mondial, devant le Gemini 3.5 Flash de Google (55,3) mais derrière GPT-5.5 (60,2) et Claude Opus 4.7 (57,3). Les gains par rapport à son prédécesseur Qwen3.6 Max Preview (51,8) sont concentrés sur le raisonnement scientifique, les tâches agentiques et le code : le benchmark CritPt a progressé de 9,7 points, Humanity's Last Exam de 9,2 points, et Terminal-Bench Hard de 6,9 points. Le modèle dispose d'une fenêtre de contexte d'un million de tokens, quadruplant la capacité des 256 000 tokens de la version précédente, de quoi ingérer un dépôt de code complet ou une grande pile de documents en une seule requête. Ce qui distingue Qwen3.7-Max des modèles classiques, c'est son architecture orientée agent longue durée. L'équipe Qwen le positionne comme son modèle agentique le plus avancé à ce jour, capable de gérer des tâches s'étendant sur des centaines, voire des milliers d'étapes successives : refactoring de code itératif, automatisation de flux bureautiques, orchestration d'outils sur de longues périodes sans intervention humaine. Le modèle utilise un mode de raisonnement étendu où il génère une chaîne de pensée interne avant de produire une réponse, ce qui se traduit par un volume de tokens considérable : lors des tests d'Artificial Analysis, Qwen3.7-Max a produit environ 97 millions de tokens, contre une moyenne de 24 millions pour les autres modèles du même benchmark. Pour des tâches simples, cette latence supplémentaire n'apporte rien ; pour de la planification complexe ou des pipelines agentiques, c'est précisément là que réside la valeur du modèle. Alibaba s'inscrit dans une course mondiale à l'agent IA autonome, où les grands laboratoires cherchent à dépasser les assistants conversationnels pour atteindre des systèmes capables d'exécuter des projets complets en autonomie. La série Qwen3 illustre la montée en puissance des acteurs chinois dans ce domaine : Alibaba se positionne désormais sixième laboratoire mondial en capacités texte et cinquième en vision selon LM Arena. La tarification de Qwen3.7-Max n'est pas encore annoncée, la version précédente étant facturée 1,30 $/7,80 $ le million de tokens en entrée/sortie sur Alibaba Cloud. Le modèle est propriétaire et fermé, et les tests indépendants sur la fiabilité effective de la fenêtre d'un million de tokens restent à venir, la dégradation du raisonnement sur de très longs contextes étant un problème connu dans l'industrie.

LLMsActu
1 source
Meituan lance LongCat-2.0 : un modele MoE open source de 1 600 milliards de parametres avec contexte natif de 1 million de tokens
2MarkTechPost 

Meituan lance LongCat-2.0 : un modele MoE open source de 1 600 milliards de parametres avec contexte natif de 1 million de tokens

Meituan a dévoilé LongCat-2.0, un modèle de langage à mélange d'experts (MoE) doté de 1 600 milliards de paramètres au total, dont environ 48 milliards sont activés par token. Ce successeur de LongCat-Flash, un modèle de 560 milliards de paramètres sorti en 2025, cible spécifiquement le codage agentique : compréhension, génération et exécution de code au sein de workflows autonomes. Le modèle se distingue par une fenêtre de contexte native d'un million de tokens et par le fait que son entraînement comme son déploiement ont été réalisés entièrement sur des superpods ASIC domestiques, sans recourir au matériel Nvidia. L'entraînement a mobilisé plus de 35 000 milliards de tokens sur des millions d'heures-accélérateur, et Meituan affirme n'avoir subi aucun retour arrière ni pic de perte irrécupérable durant tout le processus. Sur le plan des performances, l'entreprise revendique un score de 59,5 sur SWE-bench Pro, devançant légèrement GPT-5.5 (58,6), ainsi que 70,8 sur Terminal-Bench 2.1 et 77,3 sur SWE-bench Multilingual. Meituan situe également LongCat-2.0 au niveau de Gemini 3.1 Pro de Google en performance globale, tout en reconnaissant qu'il reste en retrait des systèmes de pointe sur des benchmarks d'agents plus généraux comme FORTE et BrowseComp. Ces chiffres proviennent uniquement des tests internes de Meituan et n'ont pas encore été confirmés par des classements indépendants. Cette annonce est importante car elle illustre la capacité croissante des entreprises chinoises à entraîner et servir des modèles de très grande taille sans dépendre des puces Nvidia, un enjeu stratégique majeur dans un contexte de restrictions à l'export américaines. Pour les développeurs et les équipes d'ingénierie, un contexte natif d'un million de tokens change concrètement l'usage possible d'un assistant de code : il devient possible d'analyser des dépôts entiers ou de longues sessions d'agent sans fragmentation artificielle. La stabilité revendiquée pendant l'entraînement sur du matériel non-Nvidia est aussi un signal fort, car l'écosystème logiciel autour des ASIC domestiques est réputé moins mature que celui de Nvidia, ce qui rend ce genre de résultat plus difficile à obtenir. Si les performances en codage agentique se confirment de façon indépendante, LongCat-2.0 pourrait s'imposer comme une alternative crédible aux modèles occidentaux pour les tâches d'ingénierie logicielle automatisée, un segment de plus en plus disputé entre laboratoires. L'architecture de LongCat-2.0 repose sur quatre innovations pensées pour maîtriser le coût d'un modèle de cette taille. Les experts à calcul nul laissent les tokens simples, comme la ponctuation, traverser le modèle sans traitement lourd, tandis qu'un contrôleur PID ajuste dynamiquement l'activation entre 33 et 56 milliards de paramètres selon la complexité du texte. La LongCat Sparse Attention, présentée comme une évolution du DeepSeek Sparse Attention, combine trois méthodes d'indexation, streaming, inter-couches et hiérarchique, pour éviter l'explosion quadratique du coût de calcul liée aux longs contextes. S'y ajoute un module d'embedding par n-grammes de 135 milliards de paramètres, censé mieux capturer les relations locales entre tokens, ainsi qu'un pipeline de post-entraînement baptisé MOPD qui fusionne trois groupes d'experts spécialisés en agents, raisonnement et interaction. Publié sous licence MIT le 30 juin 2026, LongCat-2.0 s'inscrit dans une compétition mondiale où chaque laboratoire cherche à repousser simultanément la taille des modèles, la longueur de contexte et l'efficacité matérielle.

💬 Ce qui compte vraiment ici, c'est pas le score SWE-bench, c'est le "sans Nvidia". Meituan entraîne 1600 milliards de paramètres sur des puces maison sans un seul pic de perte irrécupérable, et ça, ça vaut plus cher que battre GPT-5.5 de quelques points. La vraie question, c'est si le score tient sous un classement indépendant, parce que les benchmarks internes des labos chinois, on sait ce que ça vaut. Reste que la Chine vient de démontrer qu'elle peut scaler sans dépendre de Jensen Huang, et ça, les gens à Washington devraient s'en inquiéter plus que d'un simple leaderboard.

LLMsActu
1 source
Liquid AI lance LFM2.5-2.6B, un modèle embarqué à base d'agents avec contexte 128K, appels d'outils et poids ouverts
3MarkTechPost 

Liquid AI lance LFM2.5-2.6B, un modèle embarqué à base d'agents avec contexte 128K, appels d'outils et poids ouverts

Liquid AI a dévoilé LFM2.5-2.6B, un modèle agentique conçu pour fonctionner entièrement en local, sur téléphones, ordinateurs portables, PC et robots. Le modèle compte 2,69 milliards de paramètres, une fenêtre de contexte de 131 072 tokens et un vocabulaire de 128 000 tokens, pour un pré-entraînement portant sur environ 34 000 milliards de tokens. Deux versions sont publiées sur Hugging Face sous licence lfm1.0 : LFM2.5-2.6B-Base, destinée au fine-tuning, et LFM2.5-2.6B, déjà post-entraînée pour les tâches agentiques. Les poids sont disponibles aux formats natif, GGUF, MLX et ONNX, avec un support dès le premier jour dans llama.cpp, vLLM, SGLang et LM Studio. Côté performances, le modèle atteint 220 tokens par seconde sur une puce M5 Max en utilisant moins de 2,5 Go de mémoire, et environ 30 tokens par seconde sur smartphone. Son architecture repose sur 30 couches combinant 22 blocs de convolution courte à double portail et 8 blocs d'attention par groupes de requêtes. Il couvre 16 langues, en format texte uniquement. L'intérêt principal tient à l'exécution locale : aucune donnée ne quitte l'appareil, et le coût marginal de chaque requête devient quasi nul. Liquid AI affirme que son modèle rivalise, sur l'usage d'outils et le suivi d'instructions, avec des modèles jusqu'à quatre fois plus volumineux. L'entreprise vise en priorité l'automobile, l'électronique grand public, la robotique industrielle, la santé, la finance, le e-commerce et la défense, des secteurs souvent soumis à des contraintes réglementaires ou à des environnements isolés du réseau, où l'absence totale d'appel à une API tierce constitue un avantage décisif. Pour l'auto-hébergement, un seul GPU Nvidia H100 SXM5 peut traiter environ 1,3 milliard de tokens par jour, un fine-tuning via LoRA étant possible avec TRL ou Unsloth. Liquid AI déconseille en revanche ce modèle pour le développement de code agentique ou les tâches à forte densité de connaissances : sur LiveCodeBench, il obtient 59,41 contre 69,86 pour Qwen3.5-9B. Le modèle est né d'un post-entraînement en quatre étapes : deux cycles successifs de fine-tuning supervisé, une spécialisation par domaine via apprentissage par renforcement à récompenses vérifiables, une distillation multi-domaines où le modèle apprend directement sous sa propre politique, puis un apprentissage par renforcement agentique via GRPO au sein d'environnements réels comme Hermes Agent et OpenClaw. Sur les benchmarks, LFM2.5-2.6B devance gemma-4-E4B-it et Qwen3.5-9B sur ToolSandbox (77,83), Multi-IF (80,07), IFStruct (85,49) et IFBench (59,17), ne cédant du terrain que sur BFCLv4 face à Qwen3.5-9B (56,88 contre 60,13). Cette sortie illustre la course engagée par les acteurs de l'IA pour proposer des modèles compacts capables de tourner en continu sur des appareils, sans dépendre des API cloud ni de leurs coûts récurrents par token.

💬 Selon Le Fil IA, LFM2.5-2.6B confirme que la course aux petits modèles agentiques prend le pas sur la course aux gros modèles généralistes, tout simplement parce que tourner en local coûte zéro par requête et ne fuit aucune donnée. 220 tokens/s sur un M5 Max avec moins de 2,5 Go de RAM, c'est le genre de chiffre qui donne enfin envie d'embarquer de l'IA sur un objet plutôt que de l'appeler via une API. Après, faut pas se mentir : sur le code agentique il perd nettement face à Qwen3.5-9B, donc c'est un modèle pour l'auto, la santé ou l'industrie, pas pour remplacer ton Copilot.

LLMsActu
1 source
Moonshot AI dévoile Kimi K3, un modèle open MoE de 2,8 billions de paramètres avec Kimi Delta Attention et un contexte d'1M tokens
4MarkTechPost 

Moonshot AI dévoile Kimi K3, un modèle open MoE de 2,8 billions de paramètres avec Kimi Delta Attention et un contexte d'1M tokens

Moonshot AI a publié le 17 juillet 2026 son nouveau modèle Kimi K3, un système à 2,8 billions de paramètres doté d'une vision native et d'une fenêtre de contexte d'un million de tokens. L'entreprise chinoise le présente comme le premier modèle ouvert à franchir la barre des 3 000 milliards de paramètres, une taille encore inédite en open source. K3 repose sur une architecture Mixture-of-Experts éparse combinant deux innovations : Kimi Delta Attention (KDA), un mécanisme d'attention linéaire hybride qui accélérerait le décodage jusqu'à 6,3 fois sur des contextes d'un million de tokens, et Attention Residuals (AttnRes), qui optimise la circulation de l'information à travers la profondeur du réseau pour un gain d'efficacité d'entraînement d'environ 25 %, moyennant moins de 2 % de coût supplémentaire. Le modèle n'active que 16 de ses 896 experts à la fois grâce à un système baptisé Stable LatentMoE, avec un mécanisme de répartition appelé Quantile Balancing qui élimine les réglages heuristiques habituels. Combinées à d'autres innovations comme Per-Head Muon ou Gated MLA, ces optimisations offrent selon Moonshot une efficacité d'apprentissage 2,5 fois supérieure à celle de son prédécesseur Kimi K2. Pour le déploiement, K3 utilise une quantification en MXFP4 et MXFP8, et Moonshot recommande des configurations d'au moins 64 accélérateurs ; l'entreprise a également contribué une implémentation de KDA au projet vLLM. Sur le plan des performances, Kimi K3 reste globalement en retrait par rapport aux modèles propriétaires les plus puissants du marché, Claude Fable 5 d'Anthropic et GPT 5.6 Sol d'OpenAI, mais il les dépasse sur plusieurs benchmarks spécifiques : Program Bench, SWE Marathon, BrowseComp, Automation Bench et OmniDocBench, ce dernier mesurant l'analyse de documents avec un score de 91,1. Il reste derrière Fable 5 sur les tâches d'ingénierie logicielle complexes (FrontierSWE) et de raisonnement expert (HLE-Full), et derrière GPT 5.6 Sol sur DeepSWE. Pour les développeurs et les entreprises, cela signifie l'arrivée d'une alternative ouverte capable de rivaliser avec les meilleurs modèles fermés sur des cas d'usage concrets comme l'ingénierie logicielle à l'échelle d'un dépôt entier, la recherche automatisée ou le traitement de documents complexes, sans les coûts de licence ni les contraintes d'accès des API propriétaires. Ce lancement s'inscrit dans une course effrénée à la taille et à l'efficacité des modèles ouverts, où Moonshot a occupé neuf des douze derniers mois la position de plus gros modèle disponible en open source. Face à des géants comme Anthropic, OpenAI ou Google, mais aussi face à d'autres acteurs chinois comme Zhipu avec sa gamme GLM, l'entreprise mise sur la sparsité et des architectures d'attention plus efficaces pour compenser l'écart de ressources de calcul. Les cas d'usage mis en avant, agents de codage autonomes fonctionnant sur de longues sessions avec un minimum de supervision humaine, itération entre code et captures d'écran grâce à la vision intégrée, ou encore production de rapports de recherche approfondis s'appuyant sur des milliers de pages consultées, dessinent une trajectoire claire vers des systèmes d'IA capables de mener des tâches complexes en autonomie prolongée. La suite dépendra de l'adoption par la communauté open source et de la capacité de Moonshot à maintenir ce rythme d'innovation architecturale.

💬 Kimi K3 franchit les 2,8 billions de paramètres, mais le chiffre qui compte c'est le 6,3x sur le décodage long contexte, c'est ça qui rend un million de tokens réellement exploitable en prod et pas juste un chiffre marketing. Moonshot tient le rythme depuis neuf mois sur douze en tête de l'open source, et ça commence à ressembler à une stratégie plus qu'à un coup ponctuel. Reste que sur les tâches d'ingénierie complexe, Fable 5 et GPT 5.6 Sol gardent l'avance, l'open source rattrape sur les cas d'usage concrets, pas encore sur le raisonnement pur.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic