Aller au contenu principal
LLMs · Opinion ·

Writer réduit les coûts des agents IA de 52% avec son nouveau modèle Palmyra X6

Writer, la plateforme d'agents IA d'entreprise utilisée par des groupes du Fortune 500 comme Accenture, Uber et Vanguard, a dévoilé son nouveau modèle phare Palmyra X6, accompagné d'un moteur d'orchestration d'agents repensé et de nouveaux outils de gouvernance destinés à aider les directions informatiques à maîtriser l'explosion des dépenses en tokens. L'entreprise affirme que son produit d'agents fonctionne désormais avec un coût moyen réduit de 52%, une vitesse améliorée de 48% et une qualité en hausse de 10% grâce à Palmyra X6. Ce modèle de 744 milliards de paramètres, avec environ 40 milliards de paramètres actifs par token, n'a pas été entraîné à partir de zéro : il s'agit d'une version post-entraînée de GLM-5.2, le modèle ouvert à mélange d'experts développé par la société pékinoise Z.ai, anciennement Zhipu AI. Writer assume cette filiation dans son rapport technique. Matan-Paul Shetrit, directeur produit chez Writer, a précisé que le modèle tourne entièrement sur l'infrastructure américaine de l'entreprise, tandis que Dan Bikel, responsable de la recherche IA, a décrit Palmyra X6 comme "un modèle Palmyra à part entière", dont seuls les poids de départ proviennent de GLM-5.2.

2 min de lecturePertinence 61
Source

Résumé et traduction réalisés par Le Fil IA à partir de VentureBeat AI. Lire l'article original →

Cette annonce intervient alors que le coût des agents IA devient le principal frein à leur adoption en entreprise, davantage que les capacités des modèles elles-mêmes. Contrairement à un chatbot qui produit une réponse par requête, un agent enchaîne plusieurs cycles de planification, de recherche, d'appels d'outils et de vérifications, chacun consommant des tokens facturés à l'entreprise. Goldman Sachs prévoit une multiplication par 24 de la consommation de tokens entre 2026 et 2030, pour atteindre 120 quadrillions de tokens par mois, portée par des agents fonctionnant en continu plutôt que par davantage d'utilisateurs. La banque souligne que la baisse du prix unitaire des tokens ne garantit pas une baisse des factures : si une tâche agentique consomme vingt fois plus de tokens alors que le prix chute de 75%, la facture totale peut malgré tout quintupler. Waseem AlShikh, cofondateur et directeur technique de Writer, résume l'enjeu en expliquant que les entreprises veulent voir leur consommation de tokens croître, signe d'adoption, mais ont besoin que les coûts se stabilisent.

Le choix de Writer de bâtir sur une fondation open-weight chinoise relance un débat sensible dans l'industrie américaine de l'IA, entre recherche d'efficacité économique et questions de souveraineté technologique. L'entreprise revendique une contribution ciblée, avec un post-entraînement construit à partir d'un nombre restreint d'exemples pour spécialiser le modèle sur les tâches agentiques d'entreprise. Shetrit rejette l'idée que réduire la consommation de tokens des clients nuirait aux revenus de Writer, estimant au contraire que des coûts plus bas élargissent le marché total adressable en rendant rentables des flux de travail jusqu'ici jugés trop coûteux à automatiser, un pari qui reproduit la dynamique observée dans le cloud, où la baisse des prix unitaires s'est accompagnée d'une hausse des dépenses globales.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Pinterest réduit ses coûts IA de 90 % en allégeant la couche vision d'un modèle frontier45VentureBeat AILLMs 02DeepSeek réduit ses prix d'API et établit un nouveau plancher pour les grands modèles52PandailyLLMs 03Ernie 5.1 de Baidu réduit de 94 % les coûts de pré-entraînement tout en rivalisant avec les meilleurs modèles49The DecoderLLMs 
Dossier · Agents IASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.