Aller au contenu principal
Ernie 5.1 de Baidu réduit de 94 % les coûts de pré-entraînement tout en rivalisant avec les meilleurs modèles
LLMsThe Decoder · 1 min de lecture

Ernie 5.1 de Baidu réduit de 94 % les coûts de pré-entraînement tout en rivalisant avec les meilleurs modèles

Source originale ↗·

Baidu a dévoilé Ernie 5.1, une nouvelle version de son modèle d'intelligence artificielle phare qui représente une avancée significative en matière d'efficacité de développement. Le modèle n'utilise qu'un tiers des paramètres de son prédécesseur et n'aurait coûté que 6 % du budget de pré-entraînement habituellement nécessaire pour des modèles de performance comparable, soit une réduction de 94 % des coûts. Sur le classement Search Arena, référence internationale pour évaluer les LLMs dans les tâches de recherche, Ernie 5.1 se positionne 4e au niveau mondial, derrière deux variantes de Claude Opus d'Anthropic et GPT-5.5 Search d'OpenAI.

Cette performance économique repose sur une architecture baptisée "Once-For-All" : plutôt que d'entraîner plusieurs modèles distincts selon leur taille, cette approche permet d'extraire des sous-modèles plus compacts depuis un unique cycle d'entraînement. Le résultat est un modèle de niveau mondial obtenu à une fraction du coût habituel, ce qui pourrait radicalement abaisser la barrière financière à l'entrée pour les acteurs qui souhaitent développer des LLMs compétitifs.

Cette annonce s'inscrit dans un contexte de course à l'efficacité qui redéfinit le secteur depuis la publication de DeepSeek R1 début 2025, laquelle avait démontré qu'il était possible d'obtenir des performances de premier rang sans budgets astronomiques. Baidu, acteur historique de l'IA en Chine et concurrent direct de géants comme Alibaba et Tencent sur le marché local, renforce ainsi sa position internationale à un moment où la compétition avec les laboratoires américains s'intensifie sur tous les fronts.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

GLM-5.2 de Zhipu AI rivalise avec les meilleurs modeles propriétaires sur les benchmarks de codage
1The Decoder 

GLM-5.2 de Zhipu AI rivalise avec les meilleurs modeles propriétaires sur les benchmarks de codage

Le laboratoire chinois Zhipu AI a publié GLM-5.2, un nouveau modèle de langage open source distribué sous licence MIT. Le modèle supporte une fenêtre de contexte stable d'un million de tokens, ce qui lui permet de traiter des projets logiciels entiers en une seule session. Sur le benchmark FrontierSWE, conçu pour évaluer les performances sur des tâches de programmation longues de plusieurs heures, GLM-5.2 n'affiche qu'un point de pourcentage de retard sur Claude Opus 4.8 d'Anthropic, l'un des modèles fermés les plus performants du moment dans cette catégorie. C'est un résultat significatif pour l'écosystème open source : un modèle librement accessible et modifiable parvient à rivaliser avec les systèmes propriétaires sur des tâches de développement logiciel complexes et de longue durée. Pour les entreprises et développeurs indépendants, cela signifie un accès à des capacités de codage avancées sans dépendance à des API payantes ni contraintes de confidentialité des données. Le fait que GLM-5.2 soit sous licence MIT le rend également librement utilisable dans des produits commerciaux. Les limites restent réelles : en raisonnement général, GLM-5.2 accuse encore un retard notable face aux modèles fermés comme GPT-4o ou Claude Opus. Zhipu AI s'inscrit dans une vague de laboratoires chinois, aux côtés de DeepSeek, Qwen ou Baichuan, qui rattrapent progressivement les leaders occidentaux sur des domaines ciblés. L'enjeu est désormais de savoir si cette convergence sur le code va s'étendre aux capacités cognitives plus larges, et à quel rythme.

UELes entreprises et développeurs européens peuvent accéder à des capacités de codage avancées sans dépendance à des API payantes ni contraintes de confidentialité des données, grâce à la licence MIT de GLM-5.2.

LLMsOpinion
1 source
Faire tourner les modèles de raisonnement Qwen3.5 distillés façon Claude en GGUF avec quantification 4 bits
2MarkTechPost 

Faire tourner les modèles de raisonnement Qwen3.5 distillés façon Claude en GGUF avec quantification 4 bits

Des développeurs ont publié un tutoriel détaillé expliquant comment déployer les modèles Qwen3.5 distillés avec le style de raisonnement de Claude, notamment les variantes 27B en format GGUF et 2B en quantification 4 bits, directement dans Google Colab. Le pipeline proposé permet de basculer entre les deux variantes via un simple indicateur booléen, offrant ainsi une flexibilité rare entre puissance de raisonnement et contraintes matérielles. Le modèle 27B, hébergé sur Hugging Face sous l'identifiant Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-GGUF, pèse environ 16,5 Go une fois compressé en Q4KM, tandis que la version 2B s'appuie sur les librairies transformers et bitsandbytes pour une empreinte mémoire bien plus légère. Les deux chemins d'exécution sont unifiés derrière des interfaces communes generatefn et streamfn, auxquelles s'ajoute une classe ChatSession gérant les conversations multi-tours et un parseur de traces ` pour séparer explicitement le raisonnement intermédiaire de la réponse finale. Ce type d'implémentation ouvre concrètement l'accès à des modèles de raisonnement avancés à des développeurs qui ne disposent pas d'infrastructure dédiée. La quantification 4 bits permet de faire tourner un modèle de 27 milliards de paramètres sur un simple GPU T4 de Colab, ce qui était inaccessible il y a encore deux ans. La possibilité d'inspecter les traces de raisonnement, les chaînes de pensée encapsulées dans les balises `, est particulièrement précieuse pour le débogage, l'évaluation et la recherche sur les comportements des LLM. Pour les équipes souhaitant intégrer du raisonnement structuré dans leurs applications sans dépendre d'API propriétaires, cette approche locale représente une alternative sérieuse. Ce tutoriel s'inscrit dans une tendance de fond : la distillation de comportements propres aux grands modèles commerciaux vers des modèles open source plus petits et autonomes. Qwen3.5, développé par Alibaba, fait partie des modèles open weight les plus performants du moment, et sa distillation avec le style de raisonnement de Claude 4.6 Opus illustre comment les techniques d'entraînement des laboratoires de pointe, Anthropic en tête, se diffusent rapidement dans l'écosystème ouvert. La quantification GGUF via llama.cpp, couplée aux outils Hugging Face, est désormais la voie standard pour démocratiser ces modèles. La prochaine étape naturelle sera l'intégration de ces pipelines dans des agents autonomes capables de raisonner en plusieurs étapes sur des tâches complexes, sans appel à des services cloud.

LLMsTuto
1 source
ByteDance entraîne un modèle d'IA massif pour rivaliser avec Anthropic
3Ars Technica AI 

ByteDance entraîne un modèle d'IA massif pour rivaliser avec Anthropic

ByteDance entraîne un modèle d'intelligence artificielle dont la taille pourrait approcher celle de Mythos, le système le plus avancé d'Anthropic, selon trois personnes proches du dossier. Le groupe chinois, maison mère de TikTok, en est aux premières étapes d'un entraînement visant jusqu'à 10 000 milliards de paramètres, soit environ trois fois la taille de Kimi K3 de Moonshot, le plus grand modèle chinois publié à ce jour. Cette phase de pré-entraînement dure généralement trois à six mois, avant un affinage puis une éventuelle publication ; la taille finale du modèle ne sera fixée qu'à un stade ultérieur. Cette initiative illustre la réduction rapide de l'écart entre les laboratoires chinois et les leaders américains de l'IA générative, à commencer par Anthropic, OpenAI ou Google. Un modèle de cette ampleur confirmerait que les entreprises chinoises disposent désormais de la puissance de calcul et des données nécessaires pour rivaliser avec les systèmes les plus avancés au monde. Pour l'industrie, cela intensifie la concurrence et la course aux infrastructures de calcul, tandis que pour la Chine, disposer d'un modèle domestique de pointe réduirait sa dépendance aux technologies américaines, dans un contexte de restrictions sur l'exportation de semi-conducteurs avancés. ByteDance, également propriétaire de Douyin, a multiplié les investissements dans l'IA au sein d'un secteur chinois très concurrentiel, face à Alibaba, Moonshot AI, DeepSeek ou Zhipu AI. Le lancement de Kimi K3 avait déjà été perçu comme une démonstration de force des laboratoires chinois. Le succès du projet de ByteDance dépendra de son accès à des puces suffisamment puissantes malgré les restrictions américaines, et de sa capacité à transformer ce modèle géant en produit fiable. Les résultats de cet entraînement ne seront connus que dans plusieurs mois.

LLMsActu
1 source
Le stack de Trunk Tools réduit la révision de documents de 60 à 10 jours en abandonnant les modèles généralistes
4VentureBeat AI 

Le stack de Trunk Tools réduit la révision de documents de 60 à 10 jours en abandonnant les modèles généralistes

Trunk Tools, entreprise de gestion de projets de construction, a réduit son cycle de révision de documents de 60 jours à seulement 10 jours en abandonnant les modèles d'IA généralistes au profit d'une architecture propriétaire en trois couches : perception, sémantique et agents. Sarah Buchner, fondatrice et PDG de Trunk Tools et ancienne charpentière, explique que l'entreprise a entrepris de prendre les données dispersées de multiples systèmes, de les prétraiter, de les structurer via une ontologie dans un graphe de connaissances, puis d'entraîner des modèles d'IA sur cette base. Amrish Kapoor, directeur technique de Trunk, souligne que les documents de construction posent un problème particulier : la plupart des transformeurs sont des modèles probabilistes qui identifient un élément comme "probablement" ceci ou cela, une approche insuffisante pour l'interprétation symbolique de haute précision qu'exigent ces plans, où un symbole de 2 millimètres peut avoir une signification radicalement différente selon son emplacement. Cette approche pourrait servir de modèle pour d'autres secteurs confrontés au même problème : les modèles génériques, entraînés pour être compétents sur tout, restent faibles sur les données spécialisées. Kriti Faujdar, cheffe de produit senior en infrastructure IA, note que les termes rares, le raisonnement propre à un domaine et le contexte implicite que tout professionnel connaît intuitivement échappent aux modèles généralistes. Le développeur Sébastien De Bollivier ajoute qu'un modèle de type GPT-4 comprend un contrat juridique français mais échoue à citer précisément les articles de loi requis par les praticiens. Par ailleurs, les données les plus précieuses des entreprises n'ont jamais figuré dans les corpus d'entraînement initiaux : elles restent enfermées dans des systèmes internes et des formats propriétaires, ce qui limite l'efficacité du RAG (génération augmentée par récupération), qui ne fait que fournir de meilleurs faits à un modèle incapable de raisonner correctement dans le domaine concerné. Pour Faujdar, la solution passe par un pré-entraînement sur des données spécifiques au secteur, suivi d'un ajustement fin sur des exemples de tâches réelles et de l'élaboration d'évaluations maison, quelques milliers d'exemples issus de praticiens valant mieux que des millions de données brutes glanées en ligne. Les architectures hybrides combinant un modèle généraliste pour le raisonnement et l'orchestration avec un modèle plus petit et spécialisé pour l'extraction sectorielle représentent une piste prometteuse, tout comme les modèles à mélange d'experts qui permettent une spécialisation sans explosion des coûts d'inférence. Le bâtiment, le droit et la santé sont cités comme les secteurs où ce type de technique gagne le plus de terrain, en raison de l'enjeu élevé des erreurs combiné à des formats de documents standardisés. Un bémol toutefois : ces modèles spécialisés perdent souvent leur efficacité en dehors de leur domaine d'expertise, sauf à être ré-entraînés.

💬 Bon, sur le papier, c'est logique : un plan de construction avec un symbole de 2mm mal interprété, ça coûte des mois de retard sur chantier, pas juste une réponse approximative. Ce que ça dit, en fait, c'est que le RAG a atteint ses limites dès qu'on sort du texte générique, il rend juste les mêmes lacunes de raisonnement mieux documentées. Selon Le Fil IA, la vraie bataille des prochains mois se joue sur les données propriétaires jamais vues par les modèles, pas sur la taille des contextes ou le nombre de paramètres.

LLMsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic