Aller au contenu principal
Perceptron Mk1 présente un modèle d'analyse vidéo très performant, 80 à 90 % moins cher qu'Anthropic, OpenAI et Google
OutilsVentureBeat AI · 2 min de lecture

Perceptron Mk1 présente un modèle d'analyse vidéo très performant, 80 à 90 % moins cher qu'Anthropic, OpenAI et Google

Source originale ↗·

La startup américaine Perceptron Inc. a lancé ce mois-ci son modèle d'analyse vidéo par intelligence artificielle, baptisé Mk1 (pour "Mark One"), à un prix qui bouleverse les standards du marché : 0,15 dollar par million de tokens en entrée et 1,50 dollar par million en sortie via son API. Ces tarifs représentent une réduction de 80 à 90 % par rapport aux principaux concurrents propriétaires, soit Claude Sonnet 4.5 d'Anthropic, GPT-5 d'OpenAI et Gemini 3.1 Pro de Google, ce dernier étant facturé autour de 3 dollars le million de tokens en coût combiné. Fondée il y a deux ans et pilotée par Armen Aghajanyan, ex-chercheur chez Meta FAIR et Microsoft, l'entreprise a consacré seize mois à développer une architecture multimodale conçue de zéro pour comprendre le monde physique. Sur les benchmarks de référence, Mk1 atteint 85,1 sur EmbSpatialBench, devançant le modèle Robotics-ER 1.5 de Google (78,4), et signe 72,4 sur RefSpatialBench contre seulement 9,0 pour GPT-5m et 2,2 pour Sonnet 4.5. Sur VSI-Bench, dédié au raisonnement temporel vidéo, Mk1 enregistre 88,5, le meilleur score parmi tous les modèles comparés.

Ce positionnement ouvre concrètement l'analyse vidéo avancée à des usages industriels à grande échelle, jusqu'ici freinés par les coûts. Des secteurs comme la sécurité physique, la production de contenu marketing, la recherche comportementale ou le contrôle qualité en fabrication peuvent désormais envisager un déploiement massif sans budget prohibitif. La capacité du modèle à traiter des flux vidéo natifs à 2 images par seconde sur une fenêtre de contexte de 32 000 tokens, tout en maintenant la continuité temporelle des objets entre les frames, représente un bond technique par rapport aux modèles de vision classiques qui traitent la vidéo comme une succession d'images fixes déconnectées.

L'analyse vidéo par IA reste aujourd'hui une niche technique dominée par quelques acteurs disposant de ressources considérables. Perceptron s'inscrit dans une tendance plus large où des startups spécialisées cherchent à attaquer des segments précis du marché des modèles fondamentaux, en ciblant ce que l'entreprise appelle la "frontière d'efficience", soit le rapport optimal entre performance et coût. Face à des géants comme Google, OpenAI et Anthropic qui développent des modèles généralistes onéreux, cette approche verticale centrée sur la compréhension du monde physique, incluant la causalité, la dynamique des objets et les lois de la physique, constitue un pari stratégique distinct. Une démo publique est disponible pour tester le modèle, et l'entreprise vise clairement les contrats enterprise à fort volume plutôt que la recherche exploratoire.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1The Decoder 

Cursor affronte OpenAI et Anthropic avec Composer 2, un modèle dédié au code conçu pour rivaliser avec ses concurrents à une fraction du coût

Cursor franchit une nouvelle étape dans la course aux outils de développement assistés par IA en lançant Composer 2, la deuxième génération de son modèle maison dédié exclusivement à la programmation. L'objectif affiché est clair : rivaliser directement avec les meilleurs modèles de code proposés par OpenAI et Anthropic, tout en proposant des coûts significativement inférieurs. Cette sortie s'inscrit dans un contexte de concurrence féroce sur le segment des assistants de développement. Jusqu'ici, Cursor s'appuyait principalement sur les modèles tiers de ses deux grands concurrents pour alimenter son éditeur de code. En développant sa propre architecture spécialisée, la startup cherche à réduire sa dépendance vis-à-vis de ces fournisseurs tout en offrant à ses utilisateurs un rapport performance/prix plus avantageux, un argument de poids pour les équipes d'ingénierie qui consomment massivement des tokens au quotidien. Composer 2 est conçu comme un modèle code-only, c'est-à-dire optimisé exclusivement pour les tâches de développement logiciel, contrairement aux modèles généralistes d'Anthropic (Claude) ou d'OpenAI (GPT-4o, o3). Cette spécialisation permet théoriquement d'atteindre des performances comparables sur les benchmarks de programmation à une fraction du coût d'inférence. La startup, valorisée à plusieurs milliards de $ après ses dernières levées de fonds, mise ainsi sur une verticalisation de son stack technologique. Si Cursor parvient à tenir ses promesses de parité qualitative à moindre coût, cela pourrait redistribuer les cartes sur un marché dominé par les grands laboratoires. Les développeurs, déjà acquis à l'interface de l'éditeur, auraient alors un incitatif supplémentaire à rester dans l'écosystème, et Anthropic comme OpenAI perdraient un client parmi leurs plus importants consommateurs de modèles de code.

OutilsActu
1 source
Google et Meta s'empressent de développer des agents IA personnels pendant qu'Anthropic et OpenAI creusent l'écart
2The Decoder 

Google et Meta s'empressent de développer des agents IA personnels pendant qu'Anthropic et OpenAI creusent l'écart

Google et Meta testent en interne de nouveaux agents d'IA personnels, baptisés respectivement "Remy" et "Hatch", conçus pour gérer des tâches quotidiennes de manière autonome. Ces projets sont une réponse directe à l'avance prise par Anthropic et OpenAI sur le marché des assistants intelligents. Pour concentrer ses ressources sur cette nouvelle priorité, Google a abandonné Mariner, son projet d'agent navigateur web, qui était pourtant en développement actif. Ce changement de cap illustre une transformation profonde dans la manière dont les géants technologiques conçoivent l'IA utilitaire. L'industrie délaisse les agents qui opèrent via un navigateur pour privilégier des assistants intégrés directement dans les outils du quotidien : messagerie, calendrier, plateformes d'achat. Pour les utilisateurs finaux, cela signifie des assistants capables d'agir dans leur environnement numérique réel, sans friction d'interface. Pour les entreprises, l'enjeu est de capturer un point d'entrée stratégique dans la vie numérique des utilisateurs. La course aux agents personnels s'intensifie dans un contexte où Anthropic, avec Claude, et OpenAI, avec ses offres GPT et Operator, ont pris une longueur d'avance sur l'expérience agentique. Google et Meta, malgré leurs ressources considérables, se retrouvent en position de rattrapage. Les prochains mois seront déterminants : les deux groupes devront décider s'ils misent sur leurs écosystèmes existants (Gmail, Google Agenda, WhatsApp, Instagram) pour différencier leurs agents, ou s'ils cherchent à concurrencer frontalement sur des cas d'usage génériques.

UELes agents personnels de Google et Meta s'appuieront sur des écosystèmes (Gmail, WhatsApp) massivement utilisés en Europe, soulevant des enjeux de conformité RGPD et de dépendance numérique pour les utilisateurs et entreprises européennes.

OutilsOutil
1 source
☕️ Meta ouvre Muse Code et casse les prix face à OpenAI et Anthropic
3Next INpact 

☕️ Meta ouvre Muse Code et casse les prix face à OpenAI et Anthropic

Meta a lancé mercredi la bêta de Muse Code, son agent de programmation en ligne de commande, désormais ouvert à tous les développeurs sur macOS et Linux. Ce lancement suit de près la sortie de Muse Spark 1.2, le modèle qui alimente cet outil, et s'accompagne d'une politique tarifaire particulièrement agressive. La tarification standard s'établit à 1,25 dollar par million de tokens en entrée et 4,25 dollars par million en sortie, avec un tarif réduit à 0,15 dollar pour les entrées mises en cache. Meta propose également un mode « contributeur », qui autorise l'entreprise à exploiter les données des utilisateurs pour entraîner ses futurs modèles en échange de prix nettement plus bas : 0,002 dollar en entrée, 0,20 dollar en sortie et 0,10 dollar en cache, avec des quotas calculés sur une fenêtre glissante de cinq heures plutôt qu'en nombre de requêtes. Pour les entreprises soucieuses de confidentialité, Meta accepte aussi les demandes de « zéro rétention de données ». Alexandr Wang, à la tête du Meta Superintelligence Labs, a présenté cette fonctionnalité au Wall Street Journal comme un argument majeur pour convaincre les entreprises clientes. Cette politique de prix casse littéralement le marché face aux ténors du secteur : Claude Sonnet 5 d'Anthropic facture 2 dollars en entrée et 10 dollars en sortie par million de tokens, tandis que GPT-5.6 Terra d'OpenAI, le modèle auquel Meta compare directement Spark 1.2, coûte 2,50 dollars en entrée et 15 dollars en sortie. L'écart est donc considérable, et Alexandr Wang assume pleinement cette stratégie en la présentant comme « une option extrêmement intéressante » pour de nombreux cas d'usage, notamment du point de vue des coûts. Pour les entreprises qui déploient des agents de code à grande échelle, où les volumes de tokens explosent rapidement, cette différence de prix peut représenter des économies substantielles et pousser certains développeurs à migrer vers l'écosystème Meta malgré des performances brutes inférieures aux meilleurs modèles du marché. Cette bataille des prix a été amorcée dès le 9 juillet avec Spark 1.1, Meta cherchant à compenser son retard technologique par une stratégie commerciale offensive plutôt que par la course aux benchmarks. Meta reconnaît d'ailleurs que Spark 1.2 n'apporte qu'une « amélioration modérée » par rapport à la version précédente, mais insiste sur son optimisation pour les tâches agentiques complexes : refactorisation sur plusieurs fichiers, longues sessions de débogage et gestion de tâches multiples simultanées. Les benchmarks indépendants publiés par Artificial Analysis placent Spark 1.2 au même niveau que Grok 4.5, un autre modèle qui mise sur les prix cassés, les deux se classant derrière Opus 5, Fable 5, Opus 4.8, GPT-5.6 Sol et Kimi K3. Spark 1.2 est également disponible via la plateforme OpenRouter, élargissant encore sa distribution auprès des développeurs.

💬 Meta n'a pas comblé son retard technique, il l'a contourné : Spark 1.2 reste derrière Opus 5 et GPT-5.6 Sol dans les benchmarks, mais il coûte deux fois moins cher que Sonnet 5. C'est la vraie leçon ici, quand on ne peut pas gagner sur la qualité, on vend le volume à perte pour capter les devs avant les autres. Le mode contributeur à 0,002 dollar l'entrée, lui, c'est un marché à peine caché : tes données contre un prix cassé, et je parie que pas mal de monde va cocher la case sans trop réfléchir.

OutilsOutil
1 source
Zhipu AI présente GLM-OCR : un modèle multimodal OCR de 0,9 milliard pour le traitement de documents et l'extraction d'informations clés (KIE)
4MarkTechPost 

Zhipu AI présente GLM-OCR : un modèle multimodal OCR de 0,9 milliard pour le traitement de documents et l'extraction d'informations clés (KIE)

Zhipu AI et l'université Tsinghua présentent GLM-OCR, un modèle multimodal compact de 0,9 milliard de paramètres conçu pour la reconnaissance de documents complexes et l'extraction d'informations structurées. Face aux limites des systèmes OCR traditionnels, efficaces sur du texte simple mais en difficulté dès qu'apparaissent tableaux, formules mathématiques, blocs de code ou sceaux, ce modèle propose une alternative légère aux grands modèles de vision-langage, trop coûteux pour un déploiement en production ou en environnement edge. L'enjeu dépasse la simple reconnaissance de caractères : dans l'industrie, les documents réels mêlent mises en page complexes, données structurées et champs à extraire automatiquement. Les grands modèles multimodaux actuels améliorent la compréhension documentaire, mais leur taille et leur mode de décodage autorégressif classique les rendent prohibitifs à grande échelle. GLM-OCR s'impose donc comme une réponse d'ingénierie pragmatique, pensée dès le départ pour des contraintes de déploiement réelles plutôt qu'adaptée à l'OCR en second plan. Architecturalement, le modèle combine un encodeur visuel CogViT de 0,4 milliard de paramètres, un connecteur cross-modal léger et un décodeur de langage GLM de 0,5 milliard de paramètres. Sa principale innovation technique est l'adoption de la prédiction multi-tokens (MTP) : au lieu de prédire un token à la fois, le modèle est entraîné à en prédire 10 par étape, et génère en pratique 5,2 tokens par étape à l'inférence, soit un gain de débit d'environ 50%. Le pipeline repose sur deux étages distincts : une analyse de mise en page via PP-DocLayout-V3, puis une reconnaissance parallèle des régions détectées. Pour le parsing, les sorties sont en Markdown ou JSON ; pour l'extraction d'informations clés (KIE), l'image complète est soumise au modèle avec un prompt de tâche, produisant directement un JSON structuré. L'entraînement suit quatre étapes successives, allant du préentraînement vision-langage jusqu'à un affinage par apprentissage par renforcement via GRPO. Les récompenses sont adaptées à chaque sous-tâche : distance d'édition normalisée pour la reconnaissance de texte, score CDM pour les formules, score TEDS pour les tableaux, et F1 au niveau des champs pour la KIE. Cette approche modulaire et spécialisée distingue GLM-OCR des modèles généralistes et le positionne comme un outil de production sérieux pour les entreprises traitant de grands volumes de documents.

OutilsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic