Aller au contenu principal
Progresser dans les sciences et les mathématiques avec GPT-5.2
LLMsOpenAI Blog · 1 min de lecture

Progresser dans les sciences et les mathématiques avec GPT-5.2

Source originale ↗·

GPT-5.2, le modèle le plus performant d'OpenAI pour les mathématiques et les sciences, établit de nouveaux records sur des benchmarks comme GPQA Diamond et FrontierMath. Il a permis de résoudre un problème théorique ouvert et de générer des preuves mathématiques fiables, illustrant des avancées concrètes dans la recherche.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Anthropic lance Claude Fable 5 et Mythos 5, avec des progrès majeurs en programmation et en science
1The Decoder 

Anthropic lance Claude Fable 5 et Mythos 5, avec des progrès majeurs en programmation et en science

Anthropic a dévoilé deux nouveaux modèles d'intelligence artificielle, Claude Fable 5 et Mythos 5, qui surpassent significativement la génération Opus actuelle, notamment en programmation et en recherche scientifique. Fable 5 s'est illustré de manière spectaculaire en réalisant en une seule journée une migration de code pour l'entreprise de paiements Stripe, une tâche qui aurait nécessité deux mois de travail à une équipe entière de développeurs. Mythos 5, de son côté, a démontré une capacité autonome à concevoir des candidats médicamenteux, mais reste pour l'instant inaccessible au public en raison de ses aptitudes jugées dangereuses en cybersécurité offensive. Ces deux modèles redéfinissent ce que l'on entend par agent autonome dans le secteur technologique. La performance de Fable 5 sur la migration Stripe représente un changement de paradigme pour les équipes d'ingénierie : des tâches autrefois réservées à des équipes entières pendant des semaines peuvent désormais être déléguées à un système IA en quelques heures, avec des implications directes sur les coûts et l'organisation du travail. Pour l'industrie pharmaceutique, les capacités de Mythos 5 ouvrent des perspectives considérables dans la découverte de médicaments, en accélérant des processus de recherche qui prennent habituellement des années. Ces annonces s'inscrivent dans une course intense entre les grands laboratoires d'IA, où Anthropic cherche à rivaliser avec OpenAI et Google DeepMind sur le terrain des modèles dits frontier. La décision de restreindre l'accès à Mythos 5 illustre une tension croissante entre la puissance des nouveaux modèles et les risques qu'ils engendrent : même leurs créateurs hésitent désormais à les rendre publics. Cette prudence d'Anthropic, laboratoire historiquement centré sur la sécurité, signale que les capacités des modèles les plus avancés franchissent des seuils préoccupants, et que la question de leur déploiement responsable va s'imposer comme enjeu central de l'industrie dans les mois à venir.

UELes équipes tech européennes peuvent dès maintenant tester Fable 5 pour automatiser des tâches d'ingénierie complexes, tandis que la restriction de Mythos 5 pour risques cybersécurité offensifs va alimenter les débats européens sur l'AI Act et l'encadrement des modèles frontier.

💬 La migration Stripe en une journée, bon, faut voir ce que donne le code en prod. Mais Mythos 5 bloqué par Anthropic eux-mêmes pour risques cyber offensifs, c'est le vrai signal : on a franchi un seuil que même ses créateurs ne savent plus comment tenir. Reste à voir combien de temps cette prudence va durer.

LLMsOpinion
1 source
SpaceX progresse dans l'IA, avec un coup de main de Cursor
2The Information AI 

SpaceX progresse dans l'IA, avec un coup de main de Cursor

SpaceXAI, la division intelligence artificielle de l'entreprise d'Elon Musk, a annoncé mercredi le lancement de Grok 4.5 en partenariat avec Cursor, société d'édition de logiciels dont SpaceX doit prochainement devenir actionnaire majoritaire. Ce nouveau modèle est présenté comme conçu spécifiquement pour la programmation, les tâches agentiques et le travail de connaissance. Une semaine plus tôt, SpaceX avait déjà dévoilé un "Voice Agent Builder", un outil permettant aux petites entreprises de créer des agents vocaux capables de répondre au téléphone et de gérer le service client. Elon Musk a comparé les performances de Grok 4.5 à celles d'Opus 4.7 d'Anthropic, affirmant que son modèle est "à peu près comparable, mais beaucoup plus rapide". Ces annonces confirment que SpaceXAI ne se contente pas de louer sa capacité de calcul cloud à d'autres entreprises, mais cherche activement à bâtir une véritable activité commerciale autour de l'intelligence artificielle grand public et professionnel. Pour les petites structures, l'arrivée d'un agent vocal accessible pourrait simplifier la gestion du service client sans recourir à du personnel supplémentaire. Pour les développeurs, un modèle optimisé pour le code et les tâches complexes ouvre une alternative de plus dans un marché déjà saturé d'options. L'enjeu pour SpaceX est de prouver que sa branche IA peut generer des revenus propres, indépendamment de son activité spatiale historique. Ces lancements interviennent cependant dans un contexte où SpaceX arrive après la bataille sur les deux segments visés. Les agents vocaux IA existent déjà chez des acteurs comme Sierra, tandis que les modèles spécialisés dans le code et l'automatisation de tâches sont devenus monnaie courante face à des concurrents comme Anthropic, OpenAI ou Google. Le rapprochement avec Cursor, plateforme prisée des développeurs pour l'assistance au codage, illustre la stratégie de SpaceX consistant à s'appuyer sur des partenariats stratégiques plutôt que sur une croissance entièrement interne pour rattraper son retard face aux géants établis de l'intelligence artificielle.

💬 SpaceX arrive après tout le monde sur les deux fronts, agents vocaux et code assisté, et compte sur des partenariats comme Cursor pour rattraper le retard plutôt que de tout construire en interne. Bon, sur le papier Grok 4.5 "à peu près comparable" à Opus mais plus rapide, c'est vendeur, mais Musk vend toujours ses modèles comme ça avant qu'on les teste vraiment. Le vrai signal ici, c'est que SpaceXAI cherche à prouver qu'elle peut générer du revenu indépendant du spatial, pas juste louer du calcul.

LLMsOpinion
1 source
Nouvelles façons d'apprendre les mathématiques et les sciences avec ChatGPT
3OpenAI Blog 

Nouvelles façons d'apprendre les mathématiques et les sciences avec ChatGPT

ChatGPT introduit des explications visuelles interactives pour les mathématiques et les sciences, permettant aux élèves d'explorer formules, variables et concepts en temps réel. Cette nouvelle fonctionnalité facilite l'apprentissage en rendant les notions abstraites plus accessibles et dynamiques.

OutilsOutil
1 source
OpenAI lance GPT-5.6 (Sol, Terra, Luna), une famille de trois modèles avec appel d'outils programmatique dans l'API Responses
4MarkTechPost 

OpenAI lance GPT-5.6 (Sol, Terra, Luna), une famille de trois modèles avec appel d'outils programmatique dans l'API Responses

OpenAI a fait passer sa famille GPT-5.6 en disponibilité générale après une période de test limitée, avec trois modèles distincts plutôt qu'un seul. Sol est le modèle phare, Terra la version équilibrée pour un usage quotidien, et Luna la variante la plus économique. Les prix par million de tokens s'échelonnent de 1 dollar en entrée et 6 dollars en sortie pour Luna, à 2,50 et 15 dollars pour Terra, jusqu'à 5 et 30 dollars pour Sol. L'accès varie selon les plateformes : dans ChatGPT, les abonnés Plus, Pro, Business et Enterprise obtiennent Sol en effort moyen ou supérieur, les comptes Pro et Enterprise pouvant aussi choisir une version Sol Pro. Sur Codex et ChatGPT Work, les utilisateurs gratuits accèdent à Terra tandis que les payants choisissent librement entre les trois modèles. Les trois tiers sont également disponibles via l'API, qui introduit une fonctionnalité baptisée Programmatic Tool Calling permettant au modèle d'exécuter du code JavaScript qu'il a lui-même écrit, dans un environnement V8 isolé sans accès réseau. La mise en cache des prompts évolue aussi, avec une durée de vie minimale de 30 minutes, une facturation des écritures en cache à 1,25 fois le tarif standard, et une remise de 90% conservée pour les lectures. Sur le plan des performances, Sol s'impose avec un score de 80 sur l'indice de codage agentique d'Artificial Analysis, soit 2,8 points de plus que Claude Fable 5, tout en consommant moins de la moitié des tokens de sortie et du temps nécessaires. En activant un mode appelé ultra, qui fait tourner quatre agents en parallèle, Sol grimpe à 91,9% sur Terminal-Bench 2.1, contre 88,8% en configuration standard. Le modèle atteint aussi 92,2% sur BrowseComp et dépasse Claude Opus 4.8 sur OSWorld 2.0 avec 85% de tokens en moins. Ces gains concrets touchent directement les développeurs et les équipes qui automatisent des tâches complexes via des agents, en réduisant coûts et temps d'exécution. Mais Sol accuse un retard net sur SWE-Bench Pro, où il plafonne à 64,6% contre 80,3% pour Claude Mythos 5, un écart de quinze points sur un benchmark de codage très suivi. Claude Fable 5 garde aussi l'avantage sur l'indice d'intelligence générale d'Artificial Analysis et sur l'usage d'outils via Toolathlon. Cette sortie s'inscrit dans une compétition serrée entre OpenAI, Anthropic et Google autour des agents autonomes capables de mener des tâches professionnelles longues et complexes, mesurées notamment par le test Agents' Last Exam couvrant 55 métiers, où Sol revendique un score de 53,6, largement devant Fable 5. La stratégie de tarification par paliers et la diversification des surfaces d'accès traduisent une volonté de capter aussi bien les usages grand public que les déploiements d'agents en entreprise, un terrain où la bataille des benchmarks continue de s'intensifier.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic