Grok 4.7 est désormais disponible sur Amazon Bedrock
xAI vient de rendre Grok 4.7 disponible sur Amazon Bedrock, le catalogue de modèles d'Amazon Web Services. Ce modèle, présenté par xAI comme son plus performant pour le code et le travail de connaissance, offre une fenêtre de contexte de 500 000 tokens et un niveau de raisonnement réglable sur quatre paliers : low, medium, high et xhigh. Il est servi sur le point d'accès bedrock-runtime via des profils d'inférence inter-régions et prend en charge les API Responses, Chat Completions et Converse. Selon xAI, dont l'annonce date du 21 septembre 2026, le modèle repose sur une base plus grande et sur un entraînement par renforcement plus long, pondéré vers des problèmes qui demandent de nombreuses heures de travail. Il travaille plus longtemps sur les tâches difficiles et vérifie davantage ses propres résultats avant de poursuivre. xAI met aussi en avant de meilleures capacités de génération de documents et de présentations, ainsi que des progrès sur des métiers comme juriste, infirmier ou analyste financier.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Les évaluations indépendantes d'Artificial Analysis confirment une progression par rapport à Grok 4.6. L'indice d'intelligence passe de 44 à 46 et l'indice des agents de code de 47 à 56. Sur le travail de connaissance de longue durée (AA-Briefcase), le score Elo monte de 1 546 à 1 657, et sur les livrables professionnels (GDPval-AA) de 1 605 à 1 695. Le taux d'hallucination recule de 34 % à 29 %. Ces gains ont un coût : le modèle, mesuré au niveau xhigh, produit environ 81 000 tokens de sortie par tâche de l'indice, contre 38 000 environ pour son prédécesseur, soit à peu près le double. Pour les équipes qui développent des agents, la vérification de ses propres sorties est le point le plus utile, car sur de longues séquences, une erreur précoce se répercute sur toutes les étapes suivantes. Il faut donc choisir délibérément le niveau de raisonnement plutôt que de garder la valeur par défaut, afin de maîtriser la consommation de tokens.
Cette arrivée s'inscrit dans la course des fournisseurs de cloud à proposer les modèles de pointe de plusieurs laboratoires au sein d'une même plateforme, ce qui évite aux entreprises de multiplier les contrats et les intégrations. xAI met en avant des résultats sur des bancs d'essai variés : CursorBench et DeepSWE pour le génie logiciel, Terminal-Bench pour le travail en terminal, EEBench pour l'ingénierie électrique, le Harvey Legal Agent Benchmark pour le droit et HealthBench Professional pour le raisonnement clinique. L'entreprise affirme aussi avoir doté ce modèle d'une pile de sécurité entièrement nouvelle et le présente comme le plus solide qu'elle ait testé en matière de refus et de résistance aux tentatives de contournement. Le modèle a par ailleurs été entraîné à comprendre nativement l'environnement Grok Bot, ce qui, selon xAI, améliore les tâches conversationnelles et le travail de connaissance général.
Pas d'impact direct sur la France/UE