Aller au contenu principal
LLMs · Outil ·

Google met à jour Android Bench avec de nouveaux LLM, mais Gemini reste à la traîne

Google a mis à jour Android Bench, son benchmark dédié à l'évaluation des grands modèles de langage sur des tâches de développement Android, lancé en mars. La nouvelle version intègre huit modèles supplémentaires parmi les plus récents du marché : Claude Fable 5, Claude Sonnet 5 et Claude Opus 4.8 d'Anthropic, GLM 5.2, Kimi K2.7 Code, MiniMax M3, ainsi que Qwen 3.7 Plus et Qwen 3.7 Max. Le classement repose sur une suite de 100 tâches de développement Android et adopte désormais un nouveau cadre de test présenté comme plus simple à utiliser. Google a également ajouté de nouvelles métriques, notamment le coût et l'efficacité des modèles, en plus d'intégrer des modèles à poids ouverts, qui n'étaient pas couverts jusqu'ici.

1 min de lecturePertinence 41
Source

Résumé et traduction réalisés par Le Fil IA à partir de Ars Technica AI. Lire l'article original →

Ce type de benchmark répond à un besoin concret pour les développeurs Android : la génération de code par IA s'est imposée comme l'un des usages les plus populaires des LLM, mais tous les modèles ne se valent pas selon les tâches. Distinguer les suggestions réellement utiles des résultats approximatifs suppose de savoir quel outil choisir pour quel contexte. En publiant des résultats comparatifs sur le coût, l'efficacité et la qualité du code produit, Google donne aux équipes de développement des repères concrets pour arbitrer entre les différents modèles disponibles, plutôt que de se fier uniquement à la réputation générale d'un LLM.

Cette mise à jour s'inscrit dans une compétition de plus en plus dense entre fournisseurs de modèles, où Anthropic, la Chine avec GLM, Kimi et Qwen, et d'autres acteurs multiplient les versions spécialisées pour le code. Google invite désormais les développeurs à exécuter eux-mêmes ces tests sur leurs propres projets et à transmettre leurs retours, dans l'idée de faire évoluer Android Bench de façon continue. Reste à voir comment les modèles propres à Google, notamment Gemini, se positionneront face à cette concurrence croissante dans les prochaines itérations du benchmark.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Google lance trois nouveaux modèles Gemini Flash, mais son modèle phare 3.5 Pro reste toujours en entraînement48The DecoderLLMs 02Google lance trois nouveaux modèles Gemini… mais le plus attendu manque à l’appel44Le Big DataLLMs 03Google Research : Gemini-SQL2 domine les benchmarks text-to-SQL avec une large avance49The DecoderLLMs 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.