Aller au contenu principal
Unsloth AI lance Unsloth Studio : une interface locale sans code pour l'affinage haute performance des LLM avec 70 % de VRAM en moins
OutilsMarkTechPost · 1 min de lecture

Unsloth AI lance Unsloth Studio : une interface locale sans code pour l'affinage haute performance des LLM avec 70 % de VRAM en moins

Source originale ↗·

Unsloth AI vient de franchir un cap décisif dans la démocratisation de l'affinage de modèles de langage avec le lancement d'Unsloth Studio, une interface locale sans code entièrement open-source. Conçue pour les ingénieurs et professionnels de l'IA, cette solution intègre l'ensemble du cycle d'affinage, préparation des données, entraînement, déploiement, dans un environnement Web unifié, sans nécessiter de configuration CUDA complexe ni de cluster multi-GPU.

L'enjeu est considérable pour le secteur : l'affinage de grands modèles reste aujourd'hui l'apanage d'équipes disposant d'infrastructures coûteuses. En rendant cette opération accessible sur du matériel grand public, Unsloth Studio ouvre la porte à une nouvelle génération de développeurs indépendants, de chercheurs et de PME qui souhaitent personnaliser des modèles sans dépendre de services cloud facturés à l'usage.

Au cœur de la solution se trouvent des kernels de rétropropagation écrits à la main en Triton, le langage de compilation GPU d'OpenAI, permettant un entraînement 2x plus rapide et une réduction de 70 % de l'utilisation de VRAM par rapport aux frameworks standards. Concrètement, des modèles de 8 à 70 milliards de paramètres, comme Llama 3.1, Llama 3.3 ou DeepSeek-R1, peuvent désormais être affinés sur un unique GPU de type RTX 4090 ou 5090, grâce aux techniques LoRA et QLoRA en quantification 4 ou 8 bits. La préparation des données est elle aussi automatisée via les Data Recipes, un workflow visuel à nœuds s'appuyant sur NVIDIA DataDesigner pour générer des jeux de données structurés depuis des fichiers bruts (PDF, DOCX, CSV). L'outil supporte également GRPO (Group Relative Policy Optimization), la technique de reinforcement learning popularisée par DeepSeek-R1, sans nécessiter de modèle Critic séparé.

Le Studio prend en charge les architectures les plus récentes de début 2026, dont la série Llama 4 et Qwen 2.5/3.5, et propose un export en un clic vers les formats GGUF (inférence locale) et vLLM (serving haute performance), supprimant ainsi le dernier verrou entre l'entraînement et la mise en production.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

« Lancement d'une interface pour les recommandations d'inférence en IA générative sur Amazon SageMaker AI »
1AWS ML Blog 

« Lancement d'une interface pour les recommandations d'inférence en IA générative sur Amazon SageMaker AI »

Amazon vient d'ajouter une interface graphique dans Amazon SageMaker AI Studio pour ses recommandations d'inférence dédiées à l'intelligence artificielle générative, un outil sans code qui s'appuie sur une API lancée en avril 2026. Cette fonctionnalité, accessible depuis le menu Jobs puis Inference optimization, guide les équipes à travers un parcours complet : configuration de la charge de travail, optimisation, sélection du modèle et déploiement. Quatre profils prédéfinis couvrent les cas d'usage courants : Interact pour les échanges de type conversationnel avec des entrées courtes, Generate pour la génération de contenu long, Summarize pour le résumé de documents avec un fort ratio entrée/sortie, et un profil Custom pour importer son propre jeu de données. Les utilisateurs choisissent aussi un objectif d'optimisation parmi trois options : minimiser la latence pour les applications interactives, maximiser le débit de tokens par seconde pour les traitements par lots, ou minimiser le coût pour les charges de production à grande échelle. Les modèles peuvent provenir du catalogue SageMaker JumpStart, d'un fichier stocké sur Amazon S3, d'un registre de modèles existant ou d'un déploiement antérieur. Cette évolution s'attaque à un problème concret pour les équipes qui mettent des modèles génératifs en production : trouver la bonne combinaison entre type d'instance, conteneur de service et stratégie d'optimisation exigeait jusqu'ici un long cycle d'essais et de benchmarks manuels, souvent réservé à des ingénieurs spécialisés en infrastructure. Avec cette interface, ce processus se réduit à quelques minutes pour les charges de travail courantes et à quelques heures pour les configurations sur mesure. Les ingénieurs en machine learning peuvent désormais valider un déploiement sans écrire une ligne de code, tandis que les responsables techniques disposent d'une vue comparative directe des compromis entre coût et performance, ce qui accélère la prise de décision côté produit comme côté infrastructure. L'API sous-jacente, lancée quelques mois plus tôt, offrait déjà un accès programmatique à ces recommandations, mais elle supposait que l'utilisateur sache quels paramètres régler et comment interpréter des résultats de benchmark bruts. L'interface graphique supprime cette barrière technique en s'appuyant sur des profils d'usage préconfigurés et des comparaisons visuelles des résultats, ouvrant l'accès à des équipes moins expertes en infrastructure cloud. Les utilisateurs avancés conservent la possibilité de passer par l'API pour des réglages fins. Ce choix s'inscrit dans une tendance plus large chez les fournisseurs de cloud à simplifier le déploiement de modèles d'IA générative, à mesure que la demande d'infrastructures optimisées en coût et en performance s'intensifie face à la multiplication des modèles disponibles.

💬 Reste à voir qui va vraiment configurer ces quatre profils correctement, parce qu'un mauvais choix entre Interact et Generate te fait payer le prix fort sans t'en rendre compte. Sur le papier c'est malin : AWS transforme un benchmark qui demandait un ingénieur infra en un menu déroulant de trois minutes. Mais l'histoire se répète, chaque cloud simplifie sa couche d'inférence dès que la concurrence sur les coûts devient trop visible, et Amazon arrive après Azure et GCP sur ce terrain-là.

OutilsOutil
1 source
Sans Claude Fable 5 : Sakana atteint les performances de pointe avec son système multi-modèles Fugu
2VentureBeat AI 

Sans Claude Fable 5 : Sakana atteint les performances de pointe avec son système multi-modèles Fugu

Sakana AI a lancé Fugu, un système d'orchestration multi-agents accessible via une API compatible OpenAI, conçu pour égaler les performances des modèles d'IA les plus avancés sans dépendre d'un fournisseur unique. Fondée par David Ha, ancien directeur de recherche chez Google Brain, la startup propose deux déclinaisons : Fugu, optimisé pour les tâches courantes à faible latence et intégrable directement dans des environnements de développement comme Codex, et Fugu Ultra, destiné aux travaux complexes tels que la recherche en IA, l'analyse en cybersécurité ou les investigations de brevets, facturé 5 dollars le million de tokens en entrée et 30 dollars en sortie. Le système fonctionne comme un chef d'orchestre : face à une requête, il la décompose en sous-tâches, les délègue à un ensemble de modèles spécialisés, vérifie leurs résultats, puis synthétise la réponse finale. Fugu est lui-même un LLM entraîné à appeler d'autres LLMs, y compris des instances de lui-même de façon récursive, selon les équipes de Sakana. Le lancement intervient dans un contexte précis : le 12 juin 2026, Anthropic a révoqué l'accès public à ses deux modèles les plus puissants, Claude Mythos 5 et Claude Fable 5, sous la pression d'un décret américain de contrôle des exportations. Pour Ha, cet événement illustre un risque systémique majeur pour les entreprises et les gouvernements qui s'appuient sur un seul fournisseur d'IA. "L'accès aux meilleurs modèles peut disparaître du jour au lendemain", a-t-il écrit sur X. Fugu répond à ce problème en s'appuyant sur un pool de modèles entièrement interchangeable, dont la composition exacte reste propriétaire, rendant le système résilient face aux restrictions géopolitiques ou commerciales soudaines. Ce projet s'inscrit dans une tendance plus large qui fait de l'orchestration intelligente de modèles la prochaine frontière de l'IA, au-delà de la seule course à la taille des paramètres. Fugu repose sur deux travaux de recherche publiés par Sakana en 2026, TRINITY et Conductor, qui formalisent des stratégies de coordination apprises plutôt que des workflows codés à la main. En affichant des performances comparables ou supérieures à Fable et Mythos sur des benchmarks d'agents tiers, Sakana cherche à convaincre entreprises et États que la résilience collective vaut mieux que la dépendance à un modèle monolithique. Dans un contexte géopolitique de plus en plus fragmenté, la startup, désormais clairement tournée vers le marché entreprise, pourrait s'imposer comme un acteur clé de l'infrastructure IA critique mondiale.

UELes entreprises et institutions européennes exposées aux restrictions d'exportation américaines sur les modèles IA disposent avec Fugu d'une alternative d'orchestration multi-modèles résiliente, réduisant leur dépendance à un fournisseur unique.

💬 La révocation de l'accès à Fable et Mythos sur décret américain le 12 juin dernier, c'est le genre d'événement qui transforme un argument de vente en argument de survie. Ne jamais dépendre d'un seul fournisseur d'IA pour des usages critiques, c'est désormais moins une recommandation qu'une évidence industrielle. Fugu arrive exactement au bon moment, reste à voir si les perfs en prod tiennent la promesse des benchmarks.

OutilsOpinion
1 source
[Tuto] Utiliser des IA génératives en local et influence du GPU sur les performances
3Next INpact 

[Tuto] Utiliser des IA génératives en local et influence du GPU sur les performances

Faire tourner un grand modèle de langage sur sa propre machine est désormais accessible à quiconque dispose d'un ordinateur suffisamment puissant. Des outils comme Ollama permettent d'installer et d'utiliser localement des LLM tels que Mistral, LLaMA ou Qwen, sans connexion internet et sans envoyer la moindre donnée à un serveur tiers. L'article propose un tutoriel pas à pas pour configurer cet environnement en local, accompagné d'un comparatif de performances entre deux configurations : un serveur équipé de 24 cœurs CPU sans GPU, et un autre disposant d'une carte graphique dédiée. Le résultat est sans appel : l'écart de vitesse d'inférence entre les deux setups est énorme, le GPU surclassant massivement le CPU seul pour ce type de charge de travail. L'enjeu central est la confidentialité des données. Utiliser ChatGPT, Claude ou Le Chat implique d'envoyer ses requêtes sur les serveurs d'OpenAI, Anthropic ou Mistral, où elles peuvent potentiellement servir à l'entraînement ou à l'amélioration des modèles. Pour les professionnels manipulant des données sensibles, documents juridiques, médicaux, financiers, code propriétaire, cette dépendance aux infrastructures cloud représente un risque réel. L'exécution locale supprime complètement ce vecteur : le modèle tourne sur la machine de l'utilisateur, les données n'en sortent jamais. C'est aussi une question d'autonomie : pas de quota d'API, pas d'abonnement mensuel, pas de coupure de service. Deux contraintes techniques conditionnent la faisabilité de cette approche. D'abord la mémoire : les poids d'un modèle de 7 milliards de paramètres occupent environ 4 à 8 Go selon le niveau de quantisation, tandis qu'un modèle de 70 milliards en requiert facilement 40 Go ou plus. Ensuite la puissance de calcul : un GPU accélère les opérations matricielles qui constituent le cœur de l'inférence, là où un CPU seul produit des réponses lentes et difficilement utilisables en pratique. Cette architecture locale n'est pas nouvelle, la communauté open source travaille dessus depuis la publication de LLaMA par Meta en 2023, mais elle est devenue beaucoup plus accessible grâce à des outils comme Ollama, LM Studio ou llama.cpp, qui abstraient la complexité technique. L'essor des modèles compacts et quantisés (3B, 7B, 14B paramètres) rend aujourd'hui possible une expérience satisfaisante même sur du matériel grand public, à condition de disposer d'une carte graphique avec suffisamment de VRAM.

UELes professionnels européens soumis au RGPD peuvent éliminer le risque d'envoi de données sensibles vers des serveurs américains en exécutant leurs modèles en local.

OutilsTuto
1 source
Nous Research publie Hermes Desktop : une interface native multiplateforme pour Hermes Agent v0.15.2 avec sortie en streaming
4MarkTechPost 

Nous Research publie Hermes Desktop : une interface native multiplateforme pour Hermes Agent v0.15.2 avec sortie en streaming

Nous Research a lancé en prévisualisation publique Hermes Desktop, une application native disponible sur macOS, Windows et Linux, qui offre pour la première fois une interface graphique à son agent IA open source Hermes. Jusqu'ici limité à une interface en ligne de commande et à des passerelles de messagerie, Hermes Agent v0.15.2 dispose désormais d'une fenêtre native avec affichage en streaming des réponses, prévisualisation en temps réel des pages web, fichiers et sorties d'outils, un navigateur de fichiers, ainsi que des entrées et sorties vocales. L'application partage entièrement son cœur avec le CLI existant : configuration, clés API, sessions, compétences et mémoire sont communs à toutes les surfaces. Une conversation démarrée dans le bureau peut reprendre dans le terminal, et inversement, sans duplication d'état. Hermes Desktop a été démontré pour la première fois lors du keynote GTC de Jensen Huang avant d'être rendu disponible le 2 juin 2026. Ce lancement marque une étape importante dans l'accessibilité des agents IA autonomes pour le grand public. Hermes n'est pas un simple assistant de chat : c'est un agent qui planifie, exécute des actions et maintient un état persistant entre les sessions. La boucle d'apprentissage fermée le distingue des outils classiques : après une tâche complexe, l'agent génère des compétences réutilisables qui s'améliorent d'elles-mêmes lors des usages ultérieurs. La mémoire est gérée par l'agent lui-même, avec rappel inter-sessions via recherche FTS5 et résumé par LLM. En supprimant le prérequis du terminal, Nous Research ouvre Hermes à une population bien plus large d'utilisateurs non techniques, ce qui pourrait accélérer l'adoption des agents IA dans des flux de travail professionnels quotidiens. Nous Research s'inscrit dans une compétition croissante autour des agents IA autonomes et multiplateformes, face à des acteurs comme Anthropic avec Claude Code ou OpenAI avec ses capacités agentiques. Hermes se connecte à Telegram, Discord, Slack, WhatsApp, Signal, Email et CLI depuis une seule passerelle, avec un planificateur cron intégré et une délégation à des sous-agents isolés. L'exécution est sandboxée via cinq backends : local, Docker, SSH, Singularity et Modal. L'interopérabilité avec le Model Context Protocol (MCP) permet d'intégrer des outils externes. Pour les API, Nous Portal propose quatre niveaux d'abonnement (Free, Plus, Super, Ultra) donnant accès à plus de 300 modèles et à un Tool Gateway unifié qui route la recherche web via Firecrawl, la génération d'images via FAL et la synthèse vocale via OpenAI. Les prochaines questions porteront sur la stabilité hors prévisualisation et sur la capacité de la startup à tenir face aux ressources des géants du secteur.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic