Aller au contenu principal
LLMsThe Decoder · 1 min de lecture

Poolside dévoile Laguna S 2.1, un petit modèle de code à poids ouverts qui surpasse largement sa catégorie

Source originale ↗·

Poolside vient de dévoiler Laguna S 2.1, son troisième modèle de codage en trois mois, mettant l'accent sur des poids ouverts et une taille compacte plutôt que sur la démesure habituelle du secteur. Au lieu de miser sur des paramètres toujours plus nombreux, l'entreprise a entraîné son modèle à vérifier systématiquement son propre travail, à revoir les approches qui échouent et à persévérer plutôt qu'abandonner lors de longues sessions de travail autonome sur du code. Résultat concret: ce modèle de taille réduite dépasse plusieurs concurrents nettement plus volumineux sur les benchmarks de référence. Poolside affirme également que Laguna S 2.1 a résolu un problème mathématique resté ouvert depuis 1975, et ce pour un coût de calcul inférieur à 10 centimes.

Cette performance a une portée qui dépasse le simple exploit technique. Elle suggère qu'un entraînement centré sur la méthode, autrement dit la capacité d'un modèle à s'auto-corriger et à itérer intelligemment, peut compenser un désavantage de taille face à des modèles bien plus lourds à faire tourner. Pour les développeurs et les entreprises, cela ouvre la voie à des outils de codage assisté par IA moins coûteux à déployer et plus faciles à héberger localement, sans sacrifier la qualité des résultats sur des tâches complexes et prolongées.

Ce lancement s'inscrit dans une compétition intense autour des modèles de codage, où plusieurs acteurs cherchent à démontrer qu'une architecture plus frugale peut rivaliser avec les géants du secteur. Le rythme soutenu de Poolside, trois modèles publiés en trois mois, traduit une stratégie d'itération rapide sur l'entraînement agentique, un domaine où la capacité de raisonnement prolongé et l'auto-vérification deviennent des différenciateurs clés face à la simple puissance brute de calcul.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1MarkTechPost 

Poolside dévoile Laguna S 2.1, un modèle de codage à base d'agents à poids ouverts qui surpasse sa catégorie sur SWE-Bench Multilingual

Poolside a dévoilé Laguna S 2.1, un modèle ouvert de 118 milliards de paramètres conçu pour le codage agentique, avec une architecture Mixture-of-Experts qui n'active que 8 milliards de paramètres par token, soit environ 6,8% du total. Le modèle gère un contexte allant jusqu'à un million de tokens, en mode réflexion ou non, et ses poids sont publiés sur Hugging Face sous licence OpenMDW-1.1, en versions BF16, FP8, INT4 et NVFP4, accompagnés de conversions GGUF et MLX. Il est assez compact pour tourner sur une seule carte NVIDIA DGX Spark. L'entraînement a débuté le 22 mai 2026 sur 4096 GPU H200 et le modèle est sorti en moins de neuf semaines, une première pour Poolside qui a aussi exécuté l'apprentissage par renforcement en précision FP8. Sur les benchmarks de codage long, Laguna S 2.1 obtient 70,2% sur Terminal-Bench 2.1 en mode réflexion, ce qui le place premier parmi les modèles ouverts de taille connue, et 78,5% sur SWE-Bench Multilingual, un score qui domine le tableau publié par Poolside toutes catégories confondues. Ce qui rend cette sortie notable, c'est la comparaison avec des modèles bien plus massifs. Laguna S 2.1 tient tête à DeepSeek-V4-Pro-Max (1,6 billion de paramètres), à Nemotron 3 Ultra de NVIDIA (550 milliards) et à Inkling de Thinking Machines (975 milliards), alors qu'il n'active qu'une fraction de leurs paramètres. Sur DeepSWE v1.1, il atteint 40,4% contre seulement 9,0% pour DeepSeek-V4-Pro-Max, avec environ six fois moins de paramètres actifs. Cette efficacité a un coût réel: le mode réflexion maximal, activé par défaut, fait grimper le score DeepSWE de 16,5% à 40,4%, mais multiplie par 2,5 la consommation de tokens, passant de 99 000 à 249 000 tokens de complétion. Pour les entreprises qui déploient des agents de codage, cela signifie un modèle nettement moins coûteux à faire tourner que les géants fermés, sans sacrifier autant de performance qu'attendu, même si des modèles propriétaires comme Claude Fable 5 ou Kimi K3 restent devant sur plusieurs benchmarks. Poolside a aussi publié trois trajectoires complètes et non éditées pour illustrer le comportement du modèle plutôt que ses seuls scores. Dans l'une, Laguna a construit un moteur de rendu HTML/CSS fonctionnel depuis un dossier vide en 181 étapes et 50 minutes, en validant lui-même sa sortie via Chromium en mode headless. Dans une autre, il a optimisé le harnais d'agents de Poolside, gagnant 5,2% de vitesse et réduisant l'allocation mémoire de 71% en remplaçant une concaténation de chaînes en O(n²) par des tampons. Dans la troisième, privé de Python, il a re-dérivé en Perl le problème Erdős numéro 397 en 68 minutes, une redécouverte indépendante puisque son entraînement s'arrête en novembre 2025, bien avant que GPT-5.2 Pro ne résolve le même problème en janvier 2026. Ces démonstrations s'inscrivent dans une course plus large où les laboratoires misent sur les architectures MoE et l'ouverture des poids pour rivaliser avec les modèles fermés sur l'autonomie et la durée des tâches de codage.

LLMsActu
1 source
Poolside lance Laguna XS.2, un modèle ouvert gratuit et performant pour le codage local à base d'agents
2VentureBeat AI 

Poolside lance Laguna XS.2, un modèle ouvert gratuit et performant pour le codage local à base d'agents

La startup américaine Poolside, fondée à San Francisco en 2023, a lancé ce 28 avril 2026 deux nouveaux modèles de langage sous la marque Laguna, conçus spécifiquement pour les tâches de codage agentique. Le premier, Laguna M.1, est un modèle propriétaire de 225 milliards de paramètres au format Mixture of Experts (MoE), avec 23 milliards de paramètres actifs, destiné aux environnements d'entreprise et gouvernementaux à hautes exigences de sécurité. Le second, Laguna XS.2, est un modèle open source sous licence Apache 2.0 de 33 milliards de paramètres (3 milliards actifs), téléchargeable et exécutable localement sur un simple GPU de bureau ou d'ordinateur portable, sans connexion internet. Poolside accompagne ces deux modèles d'un agent de codage en ligne de commande baptisé "pool" et d'un environnement de développement web mobile appelé "shimmer". Temporairement, même le plus grand modèle M.1 est accessible gratuitement via l'API Poolside et des partenaires comme OpenRouter, Ollama et Baseten. L'arrivée de Laguna XS.2 en open source représente un signal fort dans un secteur dominé soit par des modèles propriétaires coûteux comme Claude d'Anthropic ou GPT-5.5 d'OpenAI, soit par des modèles chinois à licence ouverte comme ceux de DeepSeek. Poolside offre ici une alternative américaine, exécutable entièrement hors ligne, ce qui répond à un besoin critique pour les agences gouvernementales et les entreprises opérant dans des environnements ultra-sécurisés. L'ingénieur post-entraînement George Grigorev a précisé que Poolside peut "livrer des poids dans des environnements totalement isolés on-premises, sans connexion réseau", un avantage décisif face aux solutions cloud d'Anthropic ou Google. Par ailleurs, les deux modèles Laguna ont été entraînés intégralement from scratch, contrairement à plusieurs laboratoires américains qui s'appuient sur les modèles de base Qwen d'Alibaba, ce qui leur confère une indépendance technique notable. Poolside s'est jusqu'ici concentrée sur des contrats gouvernementaux et de défense, construisant ses modèles dans un environnement interne appelé "Model Factory", dont le moteur central est un logiciel maison nommé Titan. L'entreprise utilise également un optimiseur d'entraînement appelé Muon, qui accélère l'apprentissage d'environ 15% par rapport aux méthodes standards, un avantage compétitif non négligeable en termes de coûts et de délais. En s'ouvrant maintenant à la communauté des développeurs et à la recherche publique, Poolside change de stratégie et entre de plein pied dans la bataille de l'open source agentique, à un moment où les entreprises tech cherchent à réduire leur dépendance aux API propriétaires pour des raisons de coût, de confidentialité et de souveraineté technologique.

UELes organisations européennes en environnement isolé (défense, administration) peuvent déployer localement un modèle de codage agentique open source américain sans dépendance cloud, renforçant leur autonomie technologique.

LLMsActu
1 source
Poolside AI présente Laguna XS.2 et M.1, des modèles de codage à base d'agents atteignant 68,2 % et 72,5 % sur SWE-bench Verified
3MarkTechPost 

Poolside AI présente Laguna XS.2 et M.1, des modèles de codage à base d'agents atteignant 68,2 % et 72,5 % sur SWE-bench Verified

Poolside AI a dévoilé mardi les deux premiers modèles de sa famille Laguna : Laguna M.1 et Laguna XS.2, accompagnés d'un agent de codage en ligne de commande baptisé "pool". Laguna M.1 est un modèle de type Mixture-of-Experts (MoE) totalisant 225 milliards de paramètres, dont seulement 23 milliards activés à chaque inférence, entraîné sur 30 000 milliards de tokens à l'aide de 6 144 GPU NVIDIA Hopper interconnectés. Il atteint 72,5 % sur le benchmark SWE-bench Verified, référence du secteur pour évaluer la résolution autonome de bugs réels. Laguna XS.2, le premier modèle en accès ouvert de Poolside, est beaucoup plus compact : 33 milliards de paramètres au total, seulement 3 milliards activés par token. Il score 68,2 % sur SWE-bench Verified et peut tourner en local sur un Mac équipé de 36 Go de RAM via Ollama, ce qui est rare pour ce niveau de performance. Une version de base pour le fine-tuning, XS.2-base, sera publiée prochainement. Ces résultats positionnent Poolside parmi les acteurs sérieux du codage agentique, un segment en pleine effervescence où l'objectif est de faire résoudre des tâches de développement complexes et longues par des modèles de manière autonome. La capacité de XS.2 à fonctionner en local change la donne pour les développeurs soucieux de confidentialité ou travaillant sans accès cloud stable : avec une fenêtre de contexte de 131 072 tokens et un support natif du raisonnement intercalé entre les appels d'outils, le modèle est conçu pour des workflows réels de programmation sur plusieurs heures. Le fait que Laguna XS.2 soit open-weight le rend aussi accessible aux équipes qui souhaitent l'adapter à leurs propres bases de code, sans dépendre d'une API propriétaire. Poolside AI, fondée en 2023 par des vétérans de DeepMind et du monde de la recherche, a levé plus de 500 millions de dollars avec la conviction que l'IA spécialisée dans le code nécessite une infrastructure d'entraînement entièrement repensée. Pour Laguna, l'entreprise a développé en interne son pipeline de données, son framework d'entraînement (Titan) et une infrastructure de reinforcement learning agentique. L'une des innovations les plus notables est "AutoMixer", un système qui entraîne simultanément environ 60 modèles-proxy sur des mélanges de données différents pour optimiser automatiquement la composition du jeu d'entraînement, plutôt que de s'appuyer sur des heuristiques manuelles. Cette approche, inspirée de travaux comme RegMix ou OLMix, aurait permis de doubler la diversité effective des données tout en préservant l'équilibre entre code, mathématiques et raisonnement général. La prochaine étape pour Poolside sera probablement d'élargir la famille Laguna et d'affiner son agent "pool" pour concurrencer directement des outils comme Claude Code ou Cursor sur le marché des assistants de développement autonomes.

UELaguna XS.2 étant open-weight et exécutable en local via Ollama, les équipes européennes soucieuses de souveraineté des données peuvent l'adopter sans dépendre d'une API cloud américaine.

💬 68,2 % sur SWE-bench avec un modèle qui tourne sur Mac, c'est pas rien. Ce qui change vraiment la donne, c'est le côté open-weight : on peut l'adapter à sa propre base de code, sans dépendre d'une API tierce, et ça c'est rare pour ce niveau de performance. Reste à voir si l'agent "pool" suit.

LLMsActu
1 source
Modèles ouverts, labs de modèles vs labs d'agents : ce qui résiste à l'entraînement (Sarah Guo)
4Latent Space 

Modèles ouverts, labs de modèles vs labs d'agents : ce qui résiste à l'entraînement (Sarah Guo)

Sarah Guo, investisseuse vedette connue pour son fonds Conviction et son positionnement précoce sur des startups comme Cognition, a publié un article remarqué sur son Substack dans lequel elle développe un cadre pour distinguer ce qui peut être reproduit par l'entraînement de ce qui ne le peut pas. Son analyse arrive dans un contexte agité : Anthropic vient de déployer ses modèles Fable et Mythos, accompagnés d'une polémique qui domine le fil Twitter tech depuis le 9 juin 2026. Des chercheurs et développeurs influents, parmi lesquels Nathan Lambert, Martin Casado, Fei-Fei Li, Salvatore Sanfilippo (antirez) et Clement Delangue, accusent Anthropic de dégrader silencieusement les performances de ses modèles sur les prompts liés à la recherche en IA, sans refus explicite ni communication transparente. Par ailleurs, Fable et Mythos embarquent une rétention des prompts et données sur 30 jours, sans option de désactivation dans certaines configurations, ce qui exclut de fait les environnements à zéro rétention et pose des problèmes immédiats de conformité en Europe. L'enjeu central est celui de la confiance. Quand un modèle dégrade ses réponses sans le signaler, il devient impossible de distinguer ce que le modèle sait faire de ce qu'il choisit de faire, ce qui compromet la reproductibilité des résultats et sape la valeur des évaluations internes. Plusieurs praticiens, dont David Bréunig et Omar Sanseviero, en tirent la même conclusion : les APIs frontier doivent être traitées comme des dépendances instables, et les équipes qui ne maintiennent pas une portabilité entre modèles et des harnesses d'évaluation continue prennent un risque stratégique. Sur le plan commercial, la rétention des données à 30 jours sans opt-out exclut immédiatement une partie significative des clients enterprise européens soumis au RGPD. Gergely Orosz et d'autres ont souligné l'opacité des changements de modèle comme vecteur de désengagement. Le cadre de Guo éclaire ces tensions avec précision. Elle distingue les "Model Labs", qui produisent les capacités brutes, des "Agent Labs", dont la valeur réside dans ce qu'elle appelle la "traduction" : l'intégration dans la réalité opérationnelle d'un client, l'outillage spécialisé, la maintenance continue, tout ce qui ne peut pas être répliqué par un simple nouvel entraînement. En 2024, les modèles open source étaient encore largement sous-estimés par l'industrie, une position que le podcast Latent Space défendait ; d'ici 2026, avec des pods consacrés à Cursor et Notion, la dynamique s'est inversée. Anthropic a d'ailleurs intégré FrontierCode comme benchmark officiel pour le lancement de Fable, illustration de la course aux métriques que Guo elle-même relativise : le score le plus cité de l'année, écrit-elle, est une carte d'un territoire sur le point de devenir obsolète. Ce qui reste irréductible, selon elle, c'est l'intention, la capacité à identifier ce qui vaut la peine d'être construit avant que les autres ne le voient, quelque chose qu'aucun modèle ne peut évaluer ni entraîner.

UELa rétention des données à 30 jours sans option de désactivation dans Fable et Mythos exclut de facto les entreprises européennes soumises au RGPD, créant un problème de conformité immédiat pour les équipes utilisant ces modèles en production.

💬 La polémique Anthropic valide exactement le cadre de Guo : quand un modèle dégrade ses réponses en silence, tu ne peux plus distinguer ce qu'il sait faire de ce qu'il refuse de faire, et là tu perds tout. Ajoute la rétention 30 jours sans opt-out, et c'est la moitié de tes clients enterprise européens qui partent chercher ailleurs. Ce qui me frappe, c'est que la valeur différenciante n'est plus dans le modèle lui-même, c'est dans la confiance qu'il inspire, et Anthropic vient de la brûler.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic