Aller au contenu principal
Le nouveau modèle affiné Fin Apex 1.0 d'Intercom surpasse GPT-5.4 et Claude Sonnet 4.6 en support client
LLMsVentureBeat AI · 2 min de lecture

Le nouveau modèle affiné Fin Apex 1.0 d'Intercom surpasse GPT-5.4 et Claude Sonnet 4.6 en support client

Source originale ↗·

Intercom, la plateforme de service client fondée il y a quinze ans, a annoncé jeudi le lancement de Fin Apex 1.0, un modèle d'intelligence artificielle développé en interne et spécifiquement conçu pour la résolution de demandes clients. Selon les benchmarks partagés avec VentureBeat, ce modèle atteint un taux de résolution de 73,1 %, la proportion de problèmes résolus sans intervention humaine, contre 71,1 % pour GPT-5.4 et Claude Opus 4.5, et 69,6 % pour Claude Sonnet 4.6. Fin Apex répond en 3,7 secondes, soit 0,6 seconde plus vite que ses concurrents directs, affiche une réduction de 65 % des hallucinations par rapport à Claude Sonnet 4.6, et coûte environ cinq fois moins cher que les grands modèles frontières utilisés directement. Il est inclus dans les plans tarifaires existants d'Intercom, basés sur un modèle « par résolution ». Le modèle alimente déjà Fin, l'agent IA d'Intercom qui traite plus de deux millions de conversations clients par semaine.

Un écart de 2 points de pourcentage peut sembler anecdotique, mais pour les entreprises gérant des millions d'interactions, l'impact financier est considérable. « Si vous gérez de grandes opérations de service à l'échelle, avec 10 millions de clients ou un milliard de dollars de chiffre d'affaires, un delta de 2 ou 3 % représente une quantité énorme de clients, d'interactions et de revenus », a déclaré le PDG Eoghan McCabe. Au-delà des chiffres, Fin Apex illustre une stratégie de plus en plus viable pour les éditeurs de logiciels verticaux : plutôt que de se reposer sur des API génériques de OpenAI ou Anthropic, ils peuvent construire des modèles spécialisés plus rapides, moins coûteux et plus précis dans leur domaine, en capitalisant sur leurs données propriétaires accumulées au fil des années.

Ce lancement s'inscrit dans une tendance de fond : le post-entraînement devient le véritable champ de bataille de l'IA, la pré-formation des grands modèles étant désormais considérée comme une commodité. Intercom a affiné son modèle de base, un modèle open-weights dont la société refuse de révéler l'identité « pour des raisons concurrentielles », avec des années de données de service client issues de Fin, en intégrant des systèmes d'apprentissage par renforcement ancrés sur des résolutions réelles. Cette opacité partielle rappelle la controverse qu'a connue Cursor, accusé d'avoir dissimulé que son modèle Composer 2 était basé sur un modèle open source affiné. Intercom reconnaît utiliser une base open-weights, mais refuse d'en préciser la source, une posture qui soulèvera sans doute des questions sur la réalité de sa « transparence ». La société indique vouloir changer de modèle de base à l'avenir, ce qui suggère que Fin Apex est moins un modèle figé qu'une infrastructure d'optimisation continue, et potentiellement un modèle que d'autres plateformes verticales pourraient chercher à reproduire.

Impact France/UE

Les entreprises françaises et européennes utilisant Intercom pour leur support client bénéficient directement des gains de résolution automatique et de la réduction des coûts apportés par Fin Apex 1.0.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Grok 4.5 : l’IA qui veut dépasser GPT-5.5 et Claude sur le code
1Le Big Data 

Grok 4.5 : l’IA qui veut dépasser GPT-5.5 et Claude sur le code

Grok 4.5 est le nouveau modèle d'intelligence artificielle de xAI, lancé le 8 juillet 2026 et spécialisé dans le code et le raisonnement complexe. Avec cette version, la firme d'Elon Musk vise directement le segment entreprise dominé par OpenAI et Anthropic, en opposant Grok 4.5 à GPT-5.5 et Claude Opus. Le modèle repose sur une architecture baptisée V9, annoncée avec près de 1,5 trillion de paramètres, et propose une fenêtre de contexte pouvant atteindre 500 000 tokens, ce qui lui permet de conserver une grande quantité d'informations au fil d'une conversation ou d'un projet. xAI met en avant une vitesse d'inférence d'environ 80 tokens par seconde ainsi qu'un moteur optimisé pour maintenir ses performances même sur de gros volumes de données, le tout à un coût d'exploitation présenté comme inférieur à celui de plusieurs concurrents. Pour les entreprises et les développeurs, l'enjeu dépasse la simple génération de code. Grok 4.5 a été conçu pour appréhender des projets logiciels entiers, expliquer du code existant et assister le débogage sur des bases complexes, plutôt que de se limiter à produire des extraits isolés. Il intègre nativement l'exécution de code, la recherche d'informations et l'analyse de contenus, évitant aux équipes de jongler entre plusieurs outils externes. Son raisonnement est configurable : le modèle privilégie la rapidité pour une requête simple, mais mobilise davantage de ressources de calcul pour les problèmes complexes, un compromis pensé pour optimiser à la fois le temps de réponse et la précision selon les besoins métier. Cette flexibilité, combinée à une vision multimodale capable d'analyser images et schémas techniques, vise à automatiser des workflows d'ingénierie entiers et à accélérer la production de documentation, des usages qui parlent directement aux équipes techniques des entreprises. Ce lancement s'inscrit dans une course effrénée entre laboratoires d'IA pour capter le marché professionnel du code, où OpenAI et Anthropic ont jusqu'ici concentré l'essentiel de l'attention avec leurs modèles Codex et Claude. xAI cherche à se différencier par l'échelle de son architecture, la taille de sa fenêtre de contexte et un positionnement tarifaire agressif, tout en misant sur l'intégration d'outils natifs plutôt que sur un écosystème de plug-ins tiers. La capacité multimodale du modèle, capable d'assister l'inspection visuelle de schémas industriels, laisse entrevoir des usages au-delà du seul développement logiciel, dans l'ingénierie ou la recherche. Reste à voir si ces annonces se traduiront par une adoption réelle face à des concurrents déjà bien implantés dans les environnements de développement professionnels, et si les promesses de performance et de coût de Grok 4.5 se vérifieront à l'usage sur des charges de production.

LLMsActu
1 source
Claude Sonnet 5 arrive sur AWS : le modèle Sonnet le plus performant d'Anthropic
2AWS ML Blog 

Claude Sonnet 5 arrive sur AWS : le modèle Sonnet le plus performant d'Anthropic

Anthropic a annoncé le déploiement de Claude Sonnet 5 sur Amazon Bedrock et sur la Claude Platform disponible via AWS. Il s'agit du premier modèle Sonnet de la dernière génération d'Anthropic, conçu pour offrir une intelligence de premier plan au tarif Sonnet, destiné au code, aux agents autonomes et aux tâches professionnelles courantes à grande échelle. Sur Amazon Bedrock, les entreprises peuvent l'intégrer directement dans leur environnement AWS existant, en conservant la sécurité de niveau entreprise et la résidence régionale des données. Le modèle est également accessible via la Claude Platform sur AWS, ce qui permet d'utiliser les mêmes API et fonctionnalités que la plateforme native d'Anthropic, mais avec une facturation et une authentification unifiées sous AWS. Pour démarrer, les développeurs peuvent passer par la console Amazon Bedrock, sélectionner Claude Sonnet 5 dans l'espace de test Playground, ou y accéder par programmation via l'API Messages d'Anthropic, les points d'accès bedrock-runtime ou bedrock-mantle, ou encore les API Invoke et Converse via la ligne de commande AWS ou le SDK AWS. Cette annonce marque un changement concret pour les équipes techniques qui développent des produits d'intelligence artificielle à grande échelle. Claude Sonnet 5 vise à offrir une intelligence proche de celle d'Opus tout en conservant l'équilibre coût-performance propre à la gamme Sonnet, ce qui en fait une option par défaut pour les usages quotidiens, là où Opus reste réservé aux tâches qui justifient un coût plus élevé. Le modèle est présenté comme capable de suivre un plan sur plusieurs étapes, de garder la trace de ce qui a déjà été fait et de corriger ses erreurs avec moins d'allers-retours, ce qui se traduit par un comportement plus prévisible en production. Pour le code, Anthropic met en avant sa capacité à naviguer dans des bases de code réelles, à appliquer des modifications sur plusieurs fichiers et à mener à bien des tâches longues de débogage ou de refactorisation. Pour les agents autonomes, il sert de socle plus fiable pour gérer des chaînes de dépendances complexes et des usages d'outils en plusieurs étapes, aussi bien pour des agents internes que pour des agents en contact avec les clients. Anthropic cite plusieurs secteurs où ce nouveau modèle devrait avoir un impact direct. Dans la finance, Sonnet 5 est positionné pour la modélisation de tableurs, l'analyse financière et des agents de reporting capables de vérifier eux-mêmes leurs calculs tout au long du flux de travail, de l'ingestion des données jusqu'à la validation des résultats. Pour la productivité de bureau, il est annoncé pour la rédaction de rapports, leur audit, la rédaction de documents et l'analyse structurée, avec en complément des capacités d'utilisation d'ordinateur permettant d'automatiser des tâches de navigateur ou de bureau auparavant réalisées manuellement. Le modèle est présenté comme une mise à niveau directe par rapport à Sonnet 4.6, dans un contexte où la concurrence entre fournisseurs de cloud pour héberger les meilleurs modèles de langage s'intensifie, chaque acteur cherchant à attirer les entreprises qui veulent déployer de l'intelligence artificielle générative sans quitter leur infrastructure cloud existante.

UELes entreprises européennes utilisant Amazon Bedrock pourront déployer Claude Sonnet 5 en conservant la résidence des données dans l'UE, sans impact réglementaire direct mentionne.

LLMsActu
1 source
Sakana entraîne un modèle 7B à orchestrer GPT-5, Claude Sonnet 4 et Gemini 2.5 Pro
3VentureBeat AI 

Sakana entraîne un modèle 7B à orchestrer GPT-5, Claude Sonnet 4 et Gemini 2.5 Pro

Sakana AI, laboratoire fondé par d'anciens chercheurs de Google DeepMind, a présenté le « RL Conductor », un modèle de langage de 7 milliards de paramètres entraîné par apprentissage par renforcement pour orchestrer automatiquement un ensemble de grands modèles de langage comme GPT-5, Claude Sonnet 4 et Gemini 2.5 Pro. Contrairement aux pipelines traditionnels à code fixe, le Conductor analyse chaque requête entrante, décompose le problème en sous-tâches, sélectionne dynamiquement les modèles les mieux adaptés et définit en langage naturel les instructions et les topologies de communication entre agents. Sur les benchmarks de raisonnement avancé et de génération de code, ce système dépasse non seulement les meilleurs modèles frontières pris individuellement, mais aussi les pipelines multi-agents conçus à la main par des ingénieurs humains, tout en nécessitant moins d'appels API et un coût d'inférence sensiblement réduit. Le RL Conductor constitue le coeur technique de Fugu, le service commercial d'orchestration multi-agents que Sakana AI a mis sur le marché. L'enjeu est considérable pour l'industrie : la quasi-totalité des systèmes agentiques en production reposent aujourd'hui sur des frameworks comme LangChain avec des routes câblées à la main. Or, comme l'explique Yujin Tang, co-auteur de la recherche, ces architectures rigides s'effondrent dès que la distribution des requêtes évolue, ce qui est inévitable à l'échelle avec des bases d'utilisateurs aux besoins hétérogènes. Le Conductor résout ce problème en apprenant lui-même, par essai-erreur, quelles combinaisons de modèles et de structures de communication maximisent la qualité des réponses, sans qu'un humain ait besoin de prédire ou d'encoder ces combinaisons à l'avance. Pour les équipes qui déploient des applications IA en production, cela représente un gain opérationnel direct : moins de maintenance sur les pipelines, une meilleure généralisation hors distribution, et une réduction des coûts API. Sakana AI s'inscrit dans un courant de recherche plus large sur l'orchestration automatique d'agents, une discipline qui gagne rapidement en importance à mesure que les modèles frontières se spécialisent dans des domaines distincts, code, raisonnement scientifique, planification de haut niveau, rendant impossible toute sélection manuelle optimale pour chaque tâche. L'approche par renforcement, où aucune règle n'est codée en dur et où la stratégie émerge de l'expérience, représente une rupture méthodologique avec les frameworks actuels. Le fait qu'un modèle de 7 milliards de paramètres suffise à coordonner des systèmes bien plus grands comme GPT-5 soulève des questions sur l'architecture future des stacks IA en entreprise, et ouvre la voie à des orchestrateurs spécialisés, légers et entraînables, capables de s'adapter continuellement aux besoins réels des utilisateurs.

UELes équipes européennes déployant des systèmes multi-agents en production pourraient réduire leurs coûts d'inférence et leur charge de maintenance pipeline, mais aucun impact direct sur la France ou l'UE n'est identifié.

💬 Un 7B qui pilote GPT-5 et Claude, c'est le genre de résultat qui retourne un peu nos intuitions sur ce que "plus grand = meilleur" veut dire. Ce que Sakana prouve, c'est que la valeur dans un système agentique tient à l'orchestration, pas à la taille des modèles individuels, et que cette couche-là peut s'apprendre par renforcement plutôt que se câbler à la main. Reste à voir si Fugu tient avec de vraies distributions en prod.

LLMsPaper
1 source
Quelqu'un a affiné MiniCPM5-1B d'OpenBMB sur des traces de Claude Fable 5 pour un modèle de raisonnement local de 657 Mo
4MarkTechPost 

Quelqu'un a affiné MiniCPM5-1B d'OpenBMB sur des traces de Claude Fable 5 pour un modèle de raisonnement local de 657 Mo

Un développeur communautaire connu sous le pseudonyme GnLOLot a publié un modèle de langage d'un milliard de paramètres capable de fonctionner entièrement en local, sans clé API ni appel vers le cloud. Baptisé MiniCPM5-1B-Claude-Opus-Fable5-Thinking, il est distribué au format GGUF pour les moteurs compatibles llama.cpp. Il s'appuie sur MiniCPM5-1B, un modèle de base publié par le laboratoire chinois OpenBMB, doté de 1,08 milliard de paramètres, d'une architecture LlamaForCausalLM classique à 24 couches avec attention par groupes de requêtes, et d'une fenêtre de contexte de 131 072 tokens. OpenBMB revendique déjà le meilleur score open source de sa catégorie sur ce modèle de base, qui intègre nativement un mode de raisonnement activable via le paramètre enablethinking, offrant un choix entre mode "Think" et mode "No Think". GnLOLot a ensuite affiné ce socle sur des données issues de Fable 5, le modèle Claude d'Anthropic, dans le but d'améliorer les capacités de codage et de suivi d'instructions. Le paquet GGUF propose quatre niveaux de quantification : Q4KM autour de 657 Mo, Q5KM autour de 751 Mo, Q80 autour de 1,1 Go recommandé par défaut, et F16 autour de 2,1 Go. Le modèle s'installe directement via Ollama, llama.cpp, LM Studio, Jan ou KoboldCpp, avec une commande d'une ligne pour Ollama et des réglages d'échantillonnage suggérés de température 0,9 et top_p 0,95 en mode réflexion. L'enjeu de cette publication tient moins à ses performances qu'à ce qu'elle révèle sur les limites du fine-tuning léger appliqué à des traces générées par un grand modèle propriétaire. La méthode employée n'est pas une distillation classique au sens technique du terme, puisque personne n'a accès aux poids ni aux logits internes de Claude. Il s'agit en réalité d'un ajustement supervisé effectué sur des conversations et des raisonnements produits en sortie par le modèle Anthropic, puis utilisés comme données d'entraînement pour le petit modèle. Cette distinction compte : un modèle d'un milliard de paramètres ne peut pas absorber la capacité de raisonnement d'un modèle frontière, il ne peut qu'imiter son style de réponse et son format d'expression. Pour les utilisateurs et développeurs qui cherchent des outils légers et embarquables, cela signifie que le modèle peut sembler produire des réponses au ton proche de Claude, sans pour autant en égaler la fiabilité ou la profondeur de raisonnement. Cette initiative s'inscrit dans une tendance plus large de la communauté open source consistant à capturer le style de sortie des grands modèles fermés pour l'injecter dans des architectures compactes et gratuites. OpenBMB, de son côté, utilise une véritable distillation par politique entre ses propres modèles enseignant et élève, une approche méthodologiquement différente et documentée. Aucun benchmark ni jeu de données d'entraînement n'a été publié pour ce dérivé, ce qui rend les affirmations de performance actuellement invérifiables. La question reste également ouverte sur le plan juridique : la licence Apache 2.0 couvre les poids du modèle de base, mais l'entraînement sur des sorties générées par Claude soulève une interrogation sur les conditions d'utilisation qu'Anthropic impose à ses propres résultats, un point que la fiche du modèle laisse sans réponse.

💬 C'est pas de la distillation, c'est du copiage de style. Personne n'a accès aux poids ni aux logits de Claude, donc GnLOLot a juste entraîné son 1,08 milliard de paramètres à imiter le ton de Fable 5, pas sa capacité de raisonnement, et c'est toute la nuance que le nom du modèle fait oublier. Reste la question qu'on esquive à chaque fois dans ce genre de projet: entraîner un modèle sur les sorties d'un labo propriétaire sans base claire dans ses conditions d'utilisation, c'est un pari juridique déguisé en projet open source.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic