Aller au contenu principal
GLM-5.2 : guide pratique de l'API compatible OpenAI, raisonnement, appels de fonctions et récupération longue durée
LLMsMarkTechPost2sem· 2 min de lecture

GLM-5.2 : guide pratique de l'API compatible OpenAI, raisonnement, appels de fonctions et récupération longue durée

Source originale ↗·

Zhipu AI a mis à disposition une API hébergée pour son modèle GLM-5.2, entièrement compatible avec les clients OpenAI, permettant aux développeurs d'accéder au modèle sans avoir à l'exécuter localement. L'API est disponible via cinq fournisseurs distincts : la plateforme native z.ai, OpenRouter, Together AI, Requesty et HuggingFace, tous accessibles avec la bibliothèque Python openai standard. La tarification s'établit à 1,40 dollar par million de tokens en entrée et 4,40 dollars par million de tokens en sortie. Le modèle propose un contrôle fin du niveau de raisonnement via un paramètre reasoning_effort avec trois niveaux (désactivé, high, max), ainsi qu'un mode "thinking" qui expose la trace de raisonnement interne du modèle avant la réponse finale. Le tutoriel couvre l'ensemble du spectre fonctionnel : chat de base, raisonnement en streaming, appel de fonctions, agent à outils, sortie JSON structurée, récupération longue-contexte et estimation de coût à la volée.

La compatibilité OpenAI de GLM-5.2 est sa proposition de valeur centrale : un développeur qui utilise déjà GPT-4o ou Claude via l'API d'Anthropic peut basculer vers GLM-5.2 en changeant uniquement l'URL de base et la clé API, sans réécrire son code. Le contrôle du niveau de raisonnement représente un avantage concret par rapport aux modèles qui imposent un mode de réflexion unique : les tâches simples peuvent être traitées rapidement et à moindre coût avec le mode désactivé, tandis que les problèmes complexes mobilisent la pleine capacité de raisonnement. L'exposition de la trace de pensée (reasoning_content) dans la réponse est également utile pour le débogage ou pour construire des interfaces qui montrent le raisonnement du modèle à l'utilisateur final.

GLM-5.2 s'inscrit dans la vague de modèles chinois à raisonnement avancé qui rivalisent désormais frontalement avec les offres américaines, notamment DeepSeek-R1 et Qwen de Alibaba, sur les benchmarks de raisonnement mathématique et logique. La décision de Zhipu AI de proposer une API compatible OpenAI reflète une stratégie d'adoption agressive : plutôt que de demander aux développeurs d'apprendre une nouvelle interface, le modèle s'intègre dans les outils existants. La disponibilité sur des agrégateurs comme OpenRouter et HuggingFace élargit encore l'accès, particulièrement en dehors de la Chine. À mesure que la concurrence entre fournisseurs de modèles s'intensifie, la compatibilité d'API et la transparence du raisonnement deviennent des critères de sélection aussi importants que les performances brutes sur les benchmarks.

💬 L'analyse de Mathieu

La vraie astuce de Zhipu, c'est pas le modèle lui-même, c'est la stratégie d'adoption. Un dev qui tourne sur GPT-4o ou Claude change deux lignes de code et c'est parti, sans réapprendre quoi que ce soit. On est en train de voir les modèles chinois prendre des parts de marché non pas sur les benchmarks, mais sur le confort de migration, et ça, c'est beaucoup plus redoutable que n'importe quel score MMLU.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Construire des systèmes à base d'agents prêts pour la production avec Z.AI GLM-5 : raisonnement, appel d'outils et streaming
1MarkTechPost 

Construire des systèmes à base d'agents prêts pour la production avec Z.AI GLM-5 : raisonnement, appel d'outils et streaming

Z.AI a publié un tutoriel complet présentant les capacités avancées de son modèle GLM-5, conçu pour construire des systèmes agentiques prêts pour la production. Le guide couvre l'intégralité du cycle de développement : configuration via le SDK Z.AI (compatible avec l'interface OpenAI), réponses en streaming, mode de raisonnement approfondi (dit "thinking mode"), conversations multi-tours, appels de fonctions, sorties structurées, et construction d'un agent multi-outils complet. L'installation se fait via pip avec les paquets zai-sdk et openai, et l'authentification repose sur une clé API obtenue gratuitement sur z.ai. Dès les premières lignes de code, GLM-5 répond à des questions techniques — comme expliquer l'architecture Mixture-of-Experts en trois phrases — avec une consommation de tokens détaillée et un contrôle fin via les paramètres temperature et max_tokens. Ce qui distingue GLM-5 des modèles classiques est son mode de raisonnement enchaîné (chain-of-thought), qui expose le processus interne du modèle avant de fournir une réponse finale. Sur des problèmes logiques ou mathématiques — l'exemple du fermier avec 17 moutons dont "tous sauf 9 s'enfuient" illustre le piège classique de la lecture rapide — le modèle affiche séparément son raisonnement intermédiaire et sa conclusion. Cette transparence est particulièrement précieuse pour les équipes qui déploient des agents autonomes dans des contextes critiques : débogage plus facile, auditabilité améliorée, et meilleure confiance dans les décisions du modèle. Le streaming en temps réel des tokens, géré chunk par chunk, rend l'expérience utilisateur fluide même pour des réponses longues et complexes. GLM-5 s'inscrit dans la dynamique actuelle d'ouverture des modèles chinois à l'écosystème international. Z.AI, filiale de Zhipu AI — laboratoire issu de l'Université Tsinghua — positionne GLM-5 comme un concurrent direct aux modèles d'OpenAI et Anthropic, avec une compatibilité API volontairement calquée sur le standard OpenAI pour faciliter la migration. La prise en charge native du function calling et des sorties structurées permet d'intégrer GLM-5 dans des pipelines d'automatisation complexes sans couche d'adaptation. Alors que les entreprises cherchent à diversifier leurs dépendances vis-à-vis des fournisseurs américains, ce type de modèle — accessible, documenté, et compatible avec les outils existants — représente une alternative crédible pour les développeurs européens et asiatiques construisant des applications d'IA en production.

UEGLM-5 offre aux développeurs européens une alternative compatible OpenAI pour diversifier leurs dépendances vis-à-vis des fournisseurs américains, accessible gratuitement via une clé API.

LLMsTuto
1 source
Guide pratique : affiner un LLM avec TRL, du supervised fine-tuning au raisonnement DPO et GRPO
2MarkTechPost 

Guide pratique : affiner un LLM avec TRL, du supervised fine-tuning au raisonnement DPO et GRPO

Un guide complet consacré à l'entraînement post-initialisation des grands modèles de langage vient d'être publié, proposant une progression pédagogique couvrant quatre techniques clés : le réglage fin supervisé (SFT), la modélisation de récompense (RM), l'optimisation directe des préférences (DPO) et l'optimisation de politique par groupe relatif (GRPO). Le tutoriel s'appuie sur la bibliothèque TRL (Transformer Reinforcement Learning), développée et maintenue par Hugging Face, combinée à des outils comme PEFT et LoRA, qui permettent de réduire drastiquement la mémoire nécessaire. Point notable : l'ensemble du pipeline peut tourner sur un GPU T4 de Google Colab, soit environ 15 Go de VRAM, rendant ces techniques accessibles à quiconque dispose d'un compte Google. Le modèle de base utilisé est Qwen2.5-0.5B-Instruct, un modèle léger de 500 millions de paramètres développé par Alibaba, qui sert de point de départ à chacune des quatre étapes d'alignement. Ce guide se distingue par sa complétude : peu de tutoriels enchaînent l'intégralité du pipeline d'alignement, du SFT jusqu'au raisonnement par GRPO, avec du code fonctionnel et des explications progressives. Pour les équipes techniques cherchant à adapter un modèle open-weight à des usages métiers spécifiques, ou à reproduire les techniques d'alignement des grands laboratoires, ce type de ressource pratique est précieux. Le GRPO notamment, popularisé par DeepSeek-R1 en janvier 2025, est désormais intégré nativement dans TRL, ce qui permet d'entraîner des modèles à raisonner par étapes vérifiables sans les coûts prohibitifs d'un pipeline RLHF classique avec modèle de récompense séparé. L'alignement des LLMs s'est imposé comme l'un des sujets centraux de l'IA depuis qu'InstructGPT d'OpenAI a montré qu'un volume relativement faible de données de préférence pouvait radicalement améliorer le comportement d'un modèle. TRL est devenu la référence open source pour implémenter ces méthodes, avec des mises à jour qui intègrent régulièrement les dernières avancées de la recherche. La tendance est aujourd'hui aux approches qui n'exigent pas de modèle de récompense distinct, comme DPO et GRPO, car elles simplifient le pipeline tout en atteignant des résultats comparables. Ce contexte explique l'intérêt croissant pour le fine-tuning de modèles open-weight comme Qwen, Llama ou Mistral, que des startups et des équipes internes cherchent à spécialiser sans dépendre d'API propriétaires.

UEHuggingFace, entreprise française éditrice de la bibliothèque TRL au cœur de ce guide, positionne l'écosystème open source européen comme référence pour l'alignement des LLMs face aux pipelines propriétaires américains.

LLMsTuto
1 source
« OpenAI lance GPT-Live et GPT-Live-1 mini, des modèles vocaux full-duplex qui délèguent le raisonnement complexe à GPT-5.5 »
3MarkTechPost 

« OpenAI lance GPT-Live et GPT-Live-1 mini, des modèles vocaux full-duplex qui délèguent le raisonnement complexe à GPT-5.5 »

OpenAI a lancé aujourd'hui GPT-Live, une nouvelle génération de modèles vocaux qui alimente désormais l'expérience ChatGPT Voice. Deux versions sont disponibles dès le premier jour, GPT-Live-1 et GPT-Live-1 mini, déployées globalement pour tous les utilisateurs de ChatGPT, avec une arrivée prévue prochainement sur l'API. La particularité technique de GPT-Live tient à son architecture full duplex : contrairement aux systèmes précédents, le modèle écoute et parle simultanément, prenant des décisions d'interaction plusieurs fois par seconde (parler, se taire, interrompre, reprendre ou invoquer un outil). Il peut ainsi glisser de courtes relances comme des acquiescements pendant que l'utilisateur parle, et rester silencieux lorsque celui-ci réfléchit. Pour les tâches plus complexes, comme la recherche web ou un raisonnement approfondi, GPT-Live délègue le travail en arrière-plan à GPT-5.5, tout en maintenant la fluidité de la conversation en attendant la réponse. Dans des évaluations humaines menées par OpenAI sur des conversations de cinq à dix minutes, GPT-Live-1 et sa version mini ont été nettement préférés au précédent Advanced Voice Mode. Cette évolution change concrètement la manière dont les utilisateurs interagissent avec l'IA à l'oral, en supprimant les silences artificiels et les interruptions malvenues qui caractérisaient les modes vocaux précédents. Pour l'industrie, cela représente un signal fort : la voix devient une modalité à part entière, pensée pour la conversation naturelle plutôt que comme une simple couche ajoutée au-dessus d'un modèle de texte. La séparation entre l'interaction conversationnelle, gérée par GPT-Live, et le raisonnement profond, délégué à un modèle frontière comme GPT-5.5, permet à OpenAI de faire évoluer ses capacités de raisonnement sans devoir reconstruire l'ensemble de la pile vocale à chaque nouvelle génération de modèle. Cela ouvre aussi la voie à des usages comme la traduction simultanée en direct, rendue possible par le traitement continu du flux audio. Reste que le lancement est encore limité : ni le partage d'écran, ni la vidéo, ni une parité multilingue complète ne sont disponibles pour l'instant. Ce lancement s'inscrit dans une trajectoire technique bien identifiable. Les premiers systèmes vocaux de ChatGPT reposaient sur une architecture en cascade, enchaînant un modèle de reconnaissance vocale, un grand modèle de langage puis un modèle de synthèse vocale, ce qui provoquait des pertes d'information et des réponses lentes et artificielles. L'Advanced Voice Mode avait ensuite unifié le traitement audio dans un seul modèle, réduisant la latence, mais restait organisé en tours de parole discrets basés sur la détection de silence, un système facilement perturbé par une simple pause ou un bruit de fond. GPT-Live répond directement à cette limite en abandonnant la logique de tours au profit d'un traitement continu. L'enjeu pour OpenAI est de conserver son avance face à des concurrents comme Google ou Meta sur l'IA conversationnelle vocale, un terrain jugé stratégique pour les usages grand public comme les assistants personnels, l'éducation ou le support client, où la fluidité de l'échange oral compte souvent davantage que la seule qualité du raisonnement sous-jacent.

UELe déploiement global de GPT-Live rend la fonctionnalité disponible aux utilisateurs français de ChatGPT, mais sans annonce ni adaptation spécifique au marché européen.

💬 L'archi full-duplex c'est le vrai move ici, on arrête enfin de couper la parole aux gens ou de les laisser parler dans le vide en attendant que le modèle réagisse. Séparer la conversation, gérée par GPT-Live, du raisonnement profond délégué à GPT-5.5, ça permet à OpenAI de faire évoluer sa voix sans reconstruire toute la pile à chaque nouveau modèle, et c'est ce découplage qui va faire la différence face à Google et Meta sur l'assistant vocal. Reste que sans partage d'écran ni parité multilingue, le produit est encore à moitié fini, mais le signal est clair : la voix devient un canal à part entière, plus une couche posée sur du texte.

LLMsOpinion
1 source
Démonstration Qwen 3.6-35B-A3B : inférence multimodale, raisonnement, appel d'outils, MoE, RAG et persistance de session
4MarkTechPost 

Démonstration Qwen 3.6-35B-A3B : inférence multimodale, raisonnement, appel d'outils, MoE, RAG et persistance de session

Alibaba a publié Qwen 3.6-35B-A3B, un modèle de langage multimodal à architecture MoE (Mixture of Experts) de 35 milliards de paramètres, dont seulement 3,6 milliards sont activés par inférence. Un tutoriel complet, publié en avril 2026, détaille comment déployer ce modèle de bout en bout dans un environnement Google Colab équipé d'un GPU A100 ou L4. L'implémentation couvre un spectre large de fonctionnalités : inférence multimodale avec traitement d'images, contrôle du budget de raisonnement, génération en streaming avec séparation des traces de réflexion et des réponses finales, appel d'outils externes, génération JSON structurée, inspection du routage MoE, benchmarking, génération augmentée par récupération (RAG) et persistance de session. Le code charge le modèle de manière adaptative selon la VRAM disponible : en précision complète bfloat16 au-delà de 75 Go, en quantification int8 entre 40 et 75 Go, et en int4 en dessous, réduisant ainsi les besoins matériels d'un modèle qui pèse environ 70 Go à télécharger. Ce type d'implémentation représente un tournant concret pour les développeurs et chercheurs qui souhaitent expérimenter avec des modèles de frontier-level sans infrastructure cloud dédiée. La capacité à contrôler explicitement le budget de raisonnement, c'est-à-dire la profondeur de réflexion que le modèle alloue avant de répondre, ouvre des usages précis : réduire la latence pour des tâches simples, ou au contraire laisser le modèle « penser » longuement sur des problèmes complexes de code ou de raisonnement logique. L'intégration native du RAG permet de connecter le modèle à des bases de connaissances externes sans fine-tuning, tandis que la persistance de session autorise des conversations longues et cohérentes sur plusieurs échanges. Pour les équipes produit, cela signifie qu'un prototype d'assistant multimodal capable d'appeler des API, d'analyser des images et de maintenir un contexte conversationnel peut être construit sur une seule machine GPU en quelques heures. Qwen 3.6-35B-A3B s'inscrit dans la série Qwen 3 d'Alibaba Cloud, dont plusieurs variantes ont été publiées en open-source début 2025, positionnant le groupe chinois comme concurrent direct d'OpenAI, Google DeepMind et Meta sur le segment des grands modèles accessibles. L'architecture MoE est au coeur de cette stratégie : en n'activant qu'une fraction des paramètres à chaque inférence, elle permet de combiner la capacité d'un très grand modèle avec un coût de calcul réduit. Le tutoriel en question s'adresse aux praticiens qui veulent dépasser l'usage via API et comprendre les mécanismes internes, notamment le routage des experts, observable directement dans le code fourni. La prochaine étape naturelle pour la communauté sera d'évaluer ces capacités sur des benchmarks standardisés et d'intégrer ces modèles dans des pipelines de production, un domaine où la persistance de session et l'appel d'outils deviennent des critères de sélection aussi importants que les scores académiques.

UELes développeurs et équipes produit européens peuvent déployer ce modèle open-source de niveau frontier sur une seule machine GPU, réduisant la dépendance aux APIs cloud propriétaires pour des prototypes multimodaux.

LLMsTuto
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic