Aller au contenu principal
Améliorez vos LLMs avec les serveurs MCP Gradio
LLMsHuggingFace Blog · 1 min de lecture

Améliorez vos LLMs avec les serveurs MCP Gradio

Source originale ↗·

Cet article propose des méthodes pour améliorer les compétences des modèles de langage grand (LLMs) grâce aux serveurs Gradio MCP. Il explique comment utiliser ces outils pour affiner et évaluer efficacement les LLMs.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Améliorez la précision des appels d'outils de vos agents avec SFT et DPO sur Amazon SageMaker AI
1AWS ML Blog 

Améliorez la précision des appels d'outils de vos agents avec SFT et DPO sur Amazon SageMaker AI

Amazon Web Services publie un guide technique détaillant comment améliorer la précision des appels d'outils dans les agents IA, en combinant deux techniques d'entraînement, le Supervised Fine-Tuning (SFT) et le Direct Preference Optimization (DPO), sur sa plateforme Amazon SageMaker AI. L'exemple concret porte sur Qwen3 1.7B, un petit modèle de langage, entraîné via des jobs SageMaker AI, un service entièrement géré prenant en charge les configurations multi-GPU et multi-nœuds à la demande. L'objectif est d'apprendre à un modèle à sélectionner le bon outil, dans le bon format, sans briser la chaîne d'actions d'un workflow automatisé. Quand un agent IA appelle le mauvais outil ou formate incorrectement ses paramètres, les conséquences sont directes : délais de traitement allongés, taux d'erreurs en hausse, coûts de support accrus et expérience utilisateur dégradée. Pour les organisations qui font passer leurs applications agentiques du pilote à la production, fiabiliser cette couche d'interaction avec les outils externes est devenu un prérequis non négociable. Le SFT permet d'enseigner au modèle le vocabulaire et les contraintes propres à chaque outil via des exemples explicites. Le DPO, lui, raffine ce comportement en intégrant des préférences directement dans la boucle d'entraînement, sous la forme de paires "réponse préférée / réponse rejetée", sans avoir besoin de fonctions de récompense ni de modèles de récompense distincts, ce qui réduit significativement les ressources et le temps d'entraînement par rapport au reinforcement learning classique. Le DPO s'appuie sur des travaux publiés en 2023 (arXiv:2305.18290) et s'intègre notamment via la bibliothèque HuggingFace TRL, qui prend en entrée des triplets prompt / réponse choisie / réponse rejetée. SageMaker AI ajoute une couche d'infrastructure managée : les clusters haute performance se lancent à la demande, s'arrêtent automatiquement en fin de job, et les métriques d'entraînement remontent vers MLflow intégré à SageMaker pour analyse ultérieure. Cette approche en deux temps, SFT pour la connaissance des outils, DPO pour l'alignement fin sur les comportements souhaités, trace une voie praticable pour les équipes qui veulent construire des agents robustes sans gérer elles-mêmes l'infrastructure d'entraînement. À mesure que les modèles plus petits gagnent en précision grâce à ces techniques, la frontière entre un LLM généraliste et un agent spécialisé fiable en production continue de se réduire.

LLMsTuto
1 source
2The Decoder 

OpenAI améliore GPT-5.6 Sol dans ChatGPT et limite les utilisateurs gratuits à son modèle le plus faible

OpenAI a mis à jour GPT-5.6 Sol dans ChatGPT, avec des réponses plus ciblées et un curseur de raisonnement permettant aux utilisateurs de régler la profondeur de réflexion du modèle selon leurs besoins. Dès la semaine prochaine, les utilisateurs de la version gratuite de ChatGPT auront accès à des conversations textuelles illimitées avec GPT-5.6 Luna, un modèle plus léger, accompagné d'un bouton pour prolonger son temps de raisonnement sur les questions complexes. Malgré cette amélioration, Luna reste nettement en retrait face à Sol et aux autres modèles plus puissants de la gamme GPT-5.6, qui demeurent réservés aux abonnés payants. Cette évolution illustre la stratégie de segmentation d'OpenAI entre offre gratuite et payante, à un moment où la pression concurrentielle sur les coûts d'inférence pousse les grands acteurs de l'IA à affiner leurs modèles les moins chers plutôt qu'à les abandonner. Pour les utilisateurs gratuits, l'accès illimité au texte représente une avancée réelle, même si les capacités de raisonnement approfondi restent hors de portée sans abonnement. Pour OpenAI, c'est un moyen de fidéliser une base d'utilisateurs massive tout en réservant ses modèles les plus performants comme argument commercial. Cette annonce s'inscrit dans la compétition permanente entre OpenAI, Google avec Gemini et Anthropic avec Claude, où chaque acteur ajuste régulièrement ses niveaux de service gratuits pour retenir les utilisateurs sans cannibaliser ses revenus d'abonnement. Le curseur de raisonnement, en particulier, reflète une tendance plus large du secteur à donner aux utilisateurs un contrôle explicite sur le compromis entre vitesse de réponse et qualité du raisonnement.

LLMsOpinion
1 source
Google constitue une équipe spécialisée pour améliorer ses modèles de code
3The Information AI 

Google constitue une équipe spécialisée pour améliorer ses modèles de code

Google a constitué une équipe spéciale de chercheurs et ingénieurs au sein de DeepMind, dédiée à l'amélioration de ses modèles d'IA pour la génération de code. Cette initiative, révélée par trois sources internes, vise à automatiser davantage le développement logiciel en interne, et à terme, à accélérer la recherche en intelligence artificielle elle-même. L'opération a été lancée en réponse directe aux récentes sorties de modèles d'Anthropic, selon deux des personnes interrogées. L'enjeu est considérable : les chercheurs de Google DeepMind estiment que les outils de codage d'Anthropic surpassent actuellement les capacités de Gemini dans ce domaine. Pour une entreprise dont l'infrastructure logicielle est l'une des plus complexes au monde, perdre du terrain sur la génération de code représente un désavantage compétitif majeur, aussi bien en productivité interne qu'en attractivité commerciale face aux développeurs. Cette mobilisation s'inscrit dans une course effrénée entre les grands laboratoires d'IA autour du codage autonome. Anthropic a fait de Claude un outil de référence pour les développeurs, notamment via des agents capables de modifier des bases de code entières. Google, malgré ses ressources considérables et ses modèles Gemini, se retrouve en position de rattrapage sur ce créneau stratégique. La capacité à automatiser sa propre recherche en IA constitue potentiellement un avantage décisif dans la compétition à long terme.

UELes développeurs et entreprises européens utilisant des outils de génération de code IA pourraient bénéficier à terme d'une amélioration des capacités de Gemini dans ce domaine concurrentiel.

LLMsActu
1 source
DeepSeek améliore DeepSeek-V4-Flash-0731 avec de gros progrès en codage et en agents autonomes
4MarkTechPost 

DeepSeek améliore DeepSeek-V4-Flash-0731 avec de gros progrès en codage et en agents autonomes

DeepSeek a publié le 31 juillet 2026 la version DeepSeek-V4-Flash-0731 sur Hugging Face, tout en faisant passer l'API officielle V4-Flash en bêta publique. La fiche du modèle précise qu'il s'agit de la version officielle qui remplace la préversion, avec une architecture et une taille inchangées : les progrès viennent d'un réentraînement post-training, pas d'une nouvelle conception. Le point de contrôle intègre le module de décodage spéculatif DSpark, comme la variante DeepSeek-V4-Flash-DSpark. Hugging Face indique 304 milliards de paramètres pour le dépôt, ce chiffre incluant ce module de brouillon ajouté à la base de 284 milliards de paramètres. Côté API, deepseek-v4-flash prend désormais nativement en charge le format Responses API et a été adapté pour Codex. En revanche, l'API V4-Pro ainsi que les modèles de l'application et du site web n'ont pas été mis à jour. Sur le plan tarifaire, DeepSeek affiche 0,14 dollar par million de tokens en entrée en cas d'échec de cache, 0,0028 dollar en cas de succès de cache, et 0,28 dollar par million de tokens en sortie, avec une limite de concurrence fixée à 2 500 requêtes simultanées. C'est environ un tiers du tarif de sortie de deepseek-v4-pro, fixé à 0,87 dollar. Ce niveau de prix ouvre l'exécution de boucles d'agents à des startups en amorçage, des développeurs indépendants et des équipes de plateforme interne sans budget GPU dédié. L'auto-hébergement reste en revanche réservé aux acteurs disposant d'une infrastructure conséquente : les poids sont publiés sous licence MIT sans verrou d'accès, mais chaque expert du mélange reste chargé en mémoire même si seuls 13 milliards de paramètres s'activent par token. L'exemple vLLM de DeepSeek fait tourner le modèle sur un unique nœud à quatre GPU GB300, et les versions GGUF dynamiques d'Unsloth demandent environ 162 Go en 8 bits sans perte ou 103 Go en 3 bits, pour un total d'environ 110 Go de mémoire vive et vidéo combinées. Sur les benchmarks internes publiés par DeepSeek, les gains sont nets face à la préversion : le score Terminal Bench 2.1 passe de 61,8 à 82,7, NL2Repo de 39,4 à 54,2, et Cybergym de 38,7 à 76,7, dépassant même V4-Pro Preview et GLM-5.2 sur plusieurs tests, tout en restant en retrait face à Opus-4.8. Le modèle repose sur une architecture MoE de 284 milliards de paramètres avec 13 milliards activés par token et une fenêtre de contexte d'un million de tokens, combinant attention compressée et hyper-connexions à contrainte de variété, entraînée sur plus de 32 000 milliards de tokens avec l'optimiseur Muon. DeepSeek précise que ces scores d'agents dépendent d'un harnais de test en mode minimal, non encore rendu public, ce qui laisse une marge d'incertitude pour des évaluations menées de façon indépendante.

💬 DeepSeek continue de faire baisser le prix de l'agent autonome, et c'est ça la vraie histoire, pas le score Terminal Bench. À 0,28 dollar la sortie, un tiers du tarif V4-Pro, on ouvre les boucles d'agents à des devs seuls et des petites équipes qui n'ont jamais eu de budget GPU. Reste que l'auto-hébergement demande quand même 110 Go de RAM/VRAM cumulées, donc le MIT c'est sympa sur le papier mais la licence n'a jamais nourri un serveur.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic