Aller au contenu principal
Recherche · Paper ·

Un nouveau modèle d'IA baptisé "Count Anything" compte tout ce qu'on lui montre, et c'est plus difficile qu'il n'y paraît

Un nouveau modèle d'intelligence artificielle baptisé « Count Anything » vient d'être présenté comme le premier système capable de dénombrer des objets dans n'importe quel type d'image, qu'il s'agisse de foules humaines, de cellules observées au microscope ou de tout autre sujet visuel. Son fonctionnement repose sur une simple invite textuelle : l'utilisateur décrit ce qu'il souhaite compter, et le modèle s'exécute. Lors de tests comparatifs, Count Anything divise par deux le taux d'erreur par rapport aux systèmes précédents, ce qui représente un bond significatif en termes de précision.

1 min de lecturePertinence 42

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Les applications potentielles couvrent des secteurs très différents. En médecine, compter automatiquement des cellules ou des bactéries sur des échantillons accélère le diagnostic et réduit la charge des techniciens de laboratoire. En gestion des foules, les organisateurs d'événements ou les forces de l'ordre pourraient estimer des effectifs en temps réel à partir d'une simple photo. Tout domaine nécessitant un inventaire visuel rapide, de l'agriculture au contrôle qualité industriel en passant par l'écologie, pourrait bénéficier d'un tel outil universel.

Le comptage d'objets en vision par ordinateur est un problème ancien et difficile : les approches traditionnelles nécessitaient des modèles entraînés spécifiquement pour chaque catégorie d'objets. L'ambition de Count Anything est de briser cette fragmentation avec un modèle généraliste piloté par le langage naturel, dans la lignée des grands modèles multimodaux comme GPT-4V ou Gemini. Des limites subsistent néanmoins : le modèle peine encore face à des scènes très denses ou lorsque les termes de la requête restent ambigus, deux points que de futures versions devront améliorer.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Le comptage visuel, c'est le genre de tâche basique que les grands modèles multimodaux gèrent encore mal, et ça bloque des applications médicales ou industrielles pourtant simples à imaginer. Un modèle généraliste piloté par texte qui divise le taux d'erreur par deux, ça mérite mieux qu'un simple communiqué de recherche. J'attends de voir ça tourner sur des images de labo en conditions réelles, pas juste sur des benchmarks.

À lire ensuite

01SilverTorch : l'index comme modèle, un nouveau paradigme de recommandation45Meta Engineering MLRecherche 02Un nouveau framework permet aux agents IA de réécrire leurs propres compétences sans réentraîner le modèle de base44VentureBeat AIRecherche 03L'évaluation des modèles devient encore plus difficile37The Information AIRecherche 
Dossier · GeminiSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.