Aller au contenu principal
LLMs · Actu ·

Fireworks AI lance Ember-1, une version post-entraînée de Kimi K3 qui utilise environ 40% de tokens en moins

Fireworks AI a dévoilé Ember-1, un modèle développé par sa division Fireworks Research à partir d'un post-entraînement du modèle ouvert Kimi K3 de Moonshot AI. L'objectif est de conserver la qualité de raisonnement de Kimi K3 tout en réduisant d'environ 40% le nombre de tokens générés, sans se contenter de baisser le curseur d'effort de raisonnement au moment de l'inférence. Le modèle a été entraîné via plus de 50 expériences et 200 évaluations sur la plateforme Fireworks Serverless Training, en utilisant les données propres de l'entreprise et non celles de ses clients. Sur les benchmarks publiés par Fireworks, Ember-1 dépasse Kimi K3 en mode maximal sur Terminal Bench 2.1 (82,0% contre 80,9%, pour un coût réduit de 51,9%) et sur DeepSWE 1.1 (75,2% contre 66,4%, coût réduit de 23,7%), tout en restant légèrement en retrait sur SWE-bench Verified (92,2% contre 93,2%) et SWE-Interact (20,0% contre 21,3%). Des tests en conditions réelles menés avec deux clients sur des tâches de codage montrent une réduction moyenne de 35% des tokens consommés à qualité équivalente, avec dans un cas les tokens de sortie passant de 49 300 à 29 900 et le score de tâche restant stable (0,753 contre 0,751). Un des deux clients utilise désormais Ember-1 en production. Le modèle est accessible uniquement via l'API serverless de Fireworks, en version preview de recherche, au même tarif que Kimi K3 (3 dollars par million de tokens en entrée, 15 dollars en sortie), sans que les poids, le code d'entraînement ou les algorithmes utilisés n'aient été rendus publics.

2 min de lecturePertinence 50

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette avancée répond à un problème concret pour les entreprises qui déploient des modèles de raisonnement dans des workflows agentiques: ces modèles consacrent parfois plus de 90% de leurs tokens générés au raisonnement interne, et ce coût s'accumule fortement dans les échanges à plusieurs tours, où le contexte croît de façon quasi quadratique puisque chaque nouvel appel refacture les raisonnements précédents déjà produits. Réduire l'effort de raisonnement dégradait jusqu'ici trop la qualité pour être une option viable. En apprenant au modèle à raisonner plus efficacement plutôt qu'à raisonner moins, Fireworks propose une solution qui abaisse directement la facture des applications de codage et d'agents autonomes sans sacrifier la fiabilité, un enjeu central pour les équipes techniques qui opèrent ces systèmes à grande échelle. Le modèle a aussi établi une nouvelle frontière de Pareto coût-performance sur le Bedside Bench de Doximity, un ensemble de 500 cas cliniques validés par des médecins.

Ember-1 s'inscrit dans une tendance plus large où les fournisseurs d'infrastructure IA misent sur le post-entraînement spécialisé de modèles ouverts existants plutôt que sur l'entraînement de nouveaux modèles depuis zéro, afin d'optimiser des critères précis comme le coût par tâche. Fireworks conserve toutefois le contrôle exclusif de la méthode, sans publier les poids ni les algorithmes développés en interne, ce qui limite l'usage du modèle à sa propre infrastructure. Reste à voir si cette approche, validée pour l'instant sur un nombre restreint de clients, se généralisera au-delà du statut de preview et si Moonshot AI ou d'autres fournisseurs de modèles ouverts adopteront des stratégies similaires pour répondre à la pression croissante sur les coûts des déploiements agentiques.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Harvey lance Harvey Tenet, un modèle Kimi K3 post-entraîné avec Fireworks pour les tâches juridiques longues34MarkTechPostLLMs 02Cognition lance SWE-2, un modèle de code basé sur Kimi K3 qui égale Fable 5.1 sur FrontierCode pour 64% moins cher43MarkTechPostLLMs 03Meta AI lance Muse Spark 1.3, un modèle de code à base d'agents plus économe en appels d'outils et en tokens que 1.242MarkTechPostLLMs 
Dossier · Moonshot AISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.