Aller au contenu principal
LLMs · Actu ·

Pokee AI lance Pokee-Isaac 28B, un modèle à agents avec un contexte de 10 millions de tokens conçu pour tourner chez le client

La start-up Pokee AI a dévoilé Pokee-Isaac 28B, un modèle de fondation texte de 28 milliards de paramètres doté d'une fenêtre de contexte de 10 millions de tokens, conçu pour tourner à l'intérieur du périmètre informatique du client plutôt que sur un cloud externe. Il atteint 93,3% sur le benchmark RULER à 10 millions de tokens, score maintenu à chaque palier testé, alors que GPT-5.6 Luna et Gemini 3.5 Flash Lite décrochent dès le million de tokens après avoir tenu jusqu'à 512 000. Distribué sous licence et non en poids ouverts, Isaac est accessible via une API compatible OpenAI, déployable en VPC, sur site ou en local, avec support dès le lancement pour vLLM et SGLang, et fonctionnerait sur un seul GPU grand public type RTX 4090, bien que les mesures publiées proviennent uniquement d'un GPU de classe B200. Le tarif annoncé, provisoire, est de 0,15 dollar par million de tokens en entrée et 1 dollar en sortie.

2 min de lecturePertinence 44

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette architecture vise les organisations où les données ne peuvent réglementairement pas quitter un périmètre défini : santé et assurance, services financiers, défense et secteur public, cabinets juridiques, recherche pharmaceutique ou semi-conducteurs. Pour ces acteurs, un agent capable de traiter des dizaines de millions de tokens sans passer par une API externe ouvre des usages jusque-là impossibles : revue complète d'un dépôt de code, analyse de contrats sur plusieurs années, ou investigation forensique sur des archives de logs entières, sans recourir au résumé du contexte. Sur les benchmarks agentiques, Isaac affiche une quasi-parité avec les meilleurs modèles cloud, avec 70,94 contre 70,61 pour Luna sur BFCL v4, et enregistre les taux de réussite d'attaques les plus bas de son panel en test de sécurité, tout en restant en retrait sur Terminal-Bench 2.1 avec 56 tâches résolues sur 86 contre 60 pour Luna.

Cette sortie illustre une tension propre aux agents IA à long horizon : plus une tâche s'étire, plus elle accumule d'observations dans la fenêtre de contexte, une contrainte que seuls quelques modèles propriétaires hébergés dans le cloud géraient jusqu'ici à grande échelle, excluant de fait les secteurs régulés et les applications embarquées. En rendant un modèle à contexte massif exploitable sur une seule carte graphique et déployable localement, y compris sur des puces comme l'Intel Arc Pro B70, le Core Ultra Series 3 « Panther Lake » ou le Snapdragon X2 Elite de Qualcomm, Pokee AI cible les entreprises et fabricants d'appareils disposant déjà de leur propre infrastructure plutôt que les développeurs sans matériel sur site. Le rapport reconnaît lui-même une limite : les résultats de sécurité d'Isaac ont été obtenus avec le harnais logiciel propre à Pokee, contrairement aux modèles concurrents testés dans l'environnement standard.

Impact France / UEChamp produit par Le Fil IA

Les entreprises européennes du secteur régule (santé, finance, défense) soumises au RGPD pourraient s'intéresser a ce type de modèle déployable on-premise pour respecter la localisation des données, mais aucun acteur français ou européen n'est implique dans cette annonce.

Notre lecture

Pokee-Isaac règle un vrai problème, pas un problème de démo : 10 millions de tokens de contexte tenus jusqu'au bout, là où GPT-5.6 et Gemini 3.5 flanchent dès le million. Et le coup malin, c'est le déploiement on-prem sur une seule RTX 4090, ça parle direct à la santé, la finance ou la défense qui ne peuvent pas envoyer leurs données chez OpenAI. Reste que les benchmarks de sécurité tournent sur leur propre harnais maison, pas l'environnement standard, donc avant de crier victoire j'attendrais des tests indépendants.

À lire ensuite

01Qwen lance Qwen3.7-Max : un modèle agent de raisonnement avec une fenêtre de contexte d'un million de tokens42MarkTechPostLLMs 02Z.ai lance GLM-5.3-Flash, un modèle MoE multimodal natif de 320B (18B actifs) avec un contexte d'1 million de tokens44MarkTechPostLLMs 03StepFun lance Step 5 Preview : un modèle MoE de 600 milliards de paramètres, 27 milliards actifs, contexte 1M pour des tâches longues à base d'agents52MarkTechPostLLMs 
Dossier · Agents IASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.