Aller au contenu principal

Actualités IA — page 212

7 629 articles au fil, du plus récent au plus ancien.

GPT-5.5 : le modèle à base d'agents le plus puissant d'OpenAI, à deux fois le prix de l'API
4221AI News 

GPT-5.5 : le modèle à base d'agents le plus puissant d'OpenAI, à deux fois le prix de l'API

OpenAI a lancé GPT-5.5 le 23 avril 2026, présenté comme son modèle d'intelligence artificielle agentique le plus capable à ce jour. Conçu dès la base pour planifier, utiliser des outils, vérifier ses propres résultats et exécuter des tâches de façon autonome, il s'agit du premier modèle de base ré-entraîné depuis GPT-4.5, développé en coopération avec les systèmes rack NVIDIA GB200 et GB300 NVL72. Le déploiement a commencé pour les abonnés Plus, Pro, Business et Enterprise dans ChatGPT et Codex, avec un accès API ouvert dès le 24 avril. Sur Terminal-Bench 2.0, un benchmark mesurant les workflows en ligne de commande, GPT-5.5 atteint 82,7 % contre 75,1 % pour GPT-5.4 et 69,4 % pour Claude Opus 4.7. Sur SWE-Bench Pro, qui évalue la résolution de tickets GitHub, il plafonne à 58,6 %, et sur MRCR v2 à un million de tokens, il grimpe à 74,0 % contre seulement 36,6 % pour son prédécesseur. L'API est facturée 5 dollars par million de tokens en entrée et 30 dollars en sortie, soit exactement le double de GPT-5.4. La version Pro, réservée aux abonnements payants, monte à 30 dollars en entrée et 180 dollars en sortie. Ce doublement tarifaire est le principal point de friction, mais OpenAI avance un argument concret : GPT-5.5 accomplit les mêmes tâches Codex avec moins de tokens que son prédécesseur, ce qui ramène le surcoût réel à environ 20 % selon le laboratoire indépendant Artificial Analysis. Pour les entreprises qui déploient des agents automatisés traitant des volumes importants, la différence n'est donc pas nécessairement linéaire avec le prix affiché. En interne, OpenAI affirme que plus de 85 % de ses employés utilisent Codex chaque semaine, y compris les équipes marketing, qui ont notamment utilisé GPT-5.5 pour analyser six mois de demandes de prises de parole et construire un cadre de scoring automatisant les approbations à faible risque. GPT-5.5 s'inscrit dans une course à l'agentique qui structure désormais toute la compétition entre les grands labos d'IA. Le co-fondateur Greg Brockman y voit "un vrai pas vers le type de calcul qu'on attend pour le futur", tandis que le chief scientist Jakub Pachocki concède que les deux dernières années de progrès avaient semblé "étonnamment lentes". Un point reste ouvert : sur MCP Atlas, le benchmark de Scale AI mesurant l'utilisation d'outils via le Model Context Protocol, Claude Opus 4.7 d'Anthropic mène avec 79,1 % et GPT-5.5 n'affiche aucun score, ce qu'OpenAI a néanmoins inclus dans son propre tableau comparatif. Pour les équipes qui construisent des pipelines agentiques en production, les prochaines semaines permettront de déterminer si les performances en benchmark se traduisent en gains réels, notamment pour les agents terminaux non supervisés et l'automatisation DevOps.

LLMsOpinion
1 source
Oxford va concevoir des solutions robotiques de nouvelle génération pour les sites nucléaires avec AtkinsRéalis
4222Interesting Engineering 

Oxford va concevoir des solutions robotiques de nouvelle génération pour les sites nucléaires avec AtkinsRéalis

AtkinsRéalis, groupe d'ingénierie canadien, et l'Oxford Robotics Institute (ORI) ont annoncé un partenariat mondial pour déployer des robots autonomes et des systèmes d'IA physique dans les centrales nucléaires. L'ORI, rattaché à l'Université d'Oxford et dirigé par le professeur Nick Hawes, apporte sa recherche avancée en robotique, tandis qu'AtkinsRéalis fournit l'expertise industrielle nécessaire pour transformer ces travaux en solutions opérationnelles sur le terrain. Le partenariat s'appuie sur une expérience déjà concrète : les systèmes de l'ORI ont été déployés sur le site de Sellafield, en Angleterre, où ils ont cartographié des zones de radiation et navigué dans des environnements encombrés de débris. Le cycle de développement suit une logique en trois étapes, conception en laboratoire, entraînement dans des jumeaux numériques (répliques virtuelles fidèles des installations), puis intégration dans des robots industriels par AtkinsRéalis avant déploiement dans les sites énergétiques à travers le monde. L'enjeu est considérable : dans l'industrie nucléaire, les zones les plus critiques sont précisément celles où la présence humaine doit être réduite au strict minimum en raison des doses de radiation. Ces robots autonomes, plateformes mobiles d'inspection et bras robotisés, peuvent désormais réaliser des contrôles et des réparations qui exigeaient autrefois des équipements de protection lourds et des interventions minutées. Dotés de capteurs avancés, ils interprètent des environnements dégradés, opèrent dans l'obscurité totale et prennent des décisions en temps réel sans script préprogrammé. Résultat : une meilleure collecte de données pour les décisions opérationnelles, une réduction des coûts d'intervention, et surtout une exposition humaine aux rayonnements ramenée à zéro. Sam Stephens, responsable du numérique nucléaire chez AtkinsRéalis, souligne que l'objectif est de "passer rapidement de la recherche au déploiement opérationnel dans des centrales du monde entier". Ce partenariat s'inscrit dans une tendance de fond qui voit l'industrie nucléaire investir massivement dans la robotique pour sécuriser et moderniser ses opérations. AtkinsRéalis construit activement un écosystème technologique en s'associant à des acteurs comme NVIDIA pour le traitement IA et Kinova pour le matériel robotique. Parallèlement, d'autres institutions avancent sur des problématiques connexes : l'Institute of Science Tokyo a récemment annoncé le développement d'un récepteur Wi-Fi résistant aux radiations, capable de fonctionner sous des doses mille fois supérieures aux seuils tolérés par l'électronique standard, ce qui permettrait aux robots de maintenir des communications haut débit jusque dans le coeur des réacteurs. La prochaine génération de gestion du nucléaire se dessine ainsi : des machines qui ne se fatiguent pas, ne craignent pas les rayonnements, et collectent en continu les données dont dépendent les décisions les plus critiques du secteur.

RobotiqueActu
1 source
IA dans la santé : et si le vrai défi était l’organisation des soins
4223Le Big Data 

IA dans la santé : et si le vrai défi était l’organisation des soins

Jordan Cohen, cofondateur et PDG de Tessan, entreprise française de téléconsultation réalisant plus de 3 500 actes médicaux par jour, défend une thèse centrale : le vrai défi de l'intelligence artificielle en santé n'est pas technologique, mais organisationnel. Plutôt que d'ajouter de l'IA à un système existant, il s'agit d'utiliser la donnée pour combler le vide structurel entre les consultations, ce moment où le patient disparaît du radar, sans information, sans orientation, sans suivi. Chez Tessan, les algorithmes interviennent à chaque étape du parcours : ils organisent les symptômes en amont, assurent la transcription automatique pendant la consultation et alimentent des assistants opérationnels chez les partenaires. Des bornes de check-up en pharmacie et des objets connectés captent en temps réel des constantes vitales telles que la tension artérielle, la fréquence cardiaque ou la saturation en oxygène, permettant de détecter des signaux faibles et de déclencher, si nécessaire, une téléconsultation ou un suivi renforcé. Ce changement de paradigme touche directement les patients, les médecins et les pharmacies, appelées à devenir des hubs de détection de proximité. Pour les patients, l'enjeu est de rester intégrés en permanence dans un parcours de soins continu, relancés et réévalués si leur état l'exige. Pour les médecins, l'IA n'ambitionne pas de se substituer au diagnostic : elle améliore la qualité du signal en amont, priorise les cas urgents et réduit la charge administrative. En dermatologie, des modèles internes analysent et hiérarchisent les images avant tout examen médical. D'autres recherches portent sur l'estimation de paramètres physiologiques par vidéo, captant des données que le système actuel ignore. L'impact économique est réel : une détection précoce et une orientation plus rapide réduisent les consultations inutiles et les hospitalisations évitables. Le système de santé français s'est historiquement bâti sur une logique réactive : on consulte lorsque le symptôme apparaît, parfois tardivement, quand la situation s'est déjà dégradée. Cette architecture par actes isolés produit un vide que ni le médecin ni le patient ne comblent aujourd'hui, faute d'outils adaptés. L'essor d'infrastructures de données continues, combiné à des algorithmes capables de les activer au bon moment, ouvre la voie à une médecine d'anticipation. Tessan n'est pas seul sur ce terrain : l'ensemble du secteur health-tech s'oriente vers la donnée comme actif central du parcours de soins, avec des pistes allant de la prévention personnalisée à l'intégration dans les systèmes d'information hospitaliers. Ce que souligne Jordan Cohen, c'est que la valeur future de l'IA en santé ne viendra pas de l'acte médical lui-même, mais de la capacité à organiser une continuité durable autour du patient.

SociétéOutil
1 source
Le grand cirque OpenAI avant son introduction en bourse
4224Next INpact 

Le grand cirque OpenAI avant son introduction en bourse

OpenAI se prépare à une introduction en Bourse prévue pour le quatrième trimestre 2026, sur la base d'une valorisation de 852 milliards de dollars issue de sa dernière levée de fonds de 122 milliards de dollars annoncée le 31 mars. Mais selon des informations du Wall Street Journal, la startup aborderait ce rendez-vous avec des résultats décevants en poche. ChatGPT n'aurait pas franchi le cap symbolique du milliard d'utilisateurs actifs hebdomadaires à la fin 2025, plafonnant à "plus de 900 millions" selon les chiffres officiels. Plus préoccupant encore, l'entreprise n'aurait pas atteint ses objectifs annuels de revenus pour ChatGPT, et les cibles mensuelles de chiffre d'affaires n'auraient pas été honorées à plusieurs reprises depuis le début de l'année, alors que le compteur affiche pourtant 2 milliards de dollars par mois. Ces ratés préoccupent en interne, à commencer par la directrice financière Sarah Friar, qui s'interrogerait sur la capacité d'OpenAI à respecter ses contrats colossaux avec les fournisseurs de capacités de calcul si la croissance des revenus ne s'accélère pas. La CFO et d'autres dirigeants auraient enclenché un effort de maîtrise des coûts et de discipline budgétaire, ce qui les placerait en tension avec les ambitions expansionnistes de Sam Altman. La concurrence a également pesé lourd : Google a intensifié ses efforts avec Gemini, grignotant des parts de marché au point de forcer OpenAI à déclencher une "alerte rouge" pour accélérer la sortie de GPT-5.2. Dans le même temps, l'éparpillement de l'entreprise vers des fonctionnalités comme le "mode adulte" de ChatGPT ou la génération vidéo avec Sora aurait profité à Anthropic, qui a consolidé sa position auprès des développeurs et des entreprises. Face à ces difficultés, OpenAI a opéré un recentrage stratégique en abandonnant les expérimentations jugées périphériques pour revenir aux fondamentaux et travailler à une "superapp" dont les contours commencent à apparaître dans Codex. L'entreprise a réfuté les informations du WSJ, qualifiées d'"appâts à clics", assurant que ses activités grand public et professionnelles progressent, avec une demande en hausse côté entreprises et publicité. Mais l'enjeu reste de taille : une IPO de cette ampleur exige une trajectoire de croissance irréprochable, et chaque trimestre manqué renforce les doutes sur la capacité d'OpenAI à transformer sa domination technologique en un modèle économique durable avant que la concurrence ne réduise encore son avance.

BusinessOpinion
1 source
Meta FAIR publie NeuralSet : un package Python pour la neuro-IA compatible fMRI, M/EEG, signaux neuronaux et embeddings HuggingFace
4225MarkTechPost 

Meta FAIR publie NeuralSet : un package Python pour la neuro-IA compatible fMRI, M/EEG, signaux neuronaux et embeddings HuggingFace

Le laboratoire FAIR de Meta a publié NeuralSet, un framework Python destiné à la recherche en Neuro-IA, dont l'objectif est de résoudre l'un des obstacles les plus tenaces du domaine : l'intégration des données cérébrales dans les pipelines d'apprentissage profond. Le projet s'appuie sur cinq abstractions centrales, Events, Extractors, Segments, Batch Data et une couche Backend, pour représenter toute expérience neuroscientifique sous forme de métadonnées légères et pilotées par événements, entièrement dissociées des signaux bruts, volumineux et coûteux en mémoire. Chaque enregistrement, qu'il s'agisse d'une session fMRI, d'un mot prononcé lors d'une tâche cognitive ou d'un stimulus vidéo, est modélisé comme un dictionnaire Python léger contenant un type, un temps de début, une durée et un identifiant de session. L'ensemble d'une étude est compilé dans un DataFrame pandas unique, ce qui permet de filtrer et de recombiner des jeux de données massifs sans charger un seul octet de signal en mémoire. Au moment du calcul effectif, des Extractors font le lien avec les bibliothèques spécialisées existantes : FmriExtractor délègue à Nilearn, tandis que MegExtractor et EegExtractor s'appuient sur MNE-Python. L'intégration native de l'écosystème HuggingFace permet d'aligner automatiquement les signaux neuronaux avec des embeddings issus de modèles comme DINOv2, CLIP, Wav2Vec, Whisper, GPT-2 ou LLaMA. L'enjeu est considérable pour la communauté scientifique. Jusqu'à présent, les chercheurs en Neuro-IA devaient construire des pipelines ad hoc pour chaque expérience, avec manipulation manuelle des données, mise en cache artisanale et configurations backend complexes. NeuralSet rend ce travail d'infrastructure partageable et reproductible via des objets Chain chaînables et cachables. Pour les laboratoires qui travaillent avec les jeux de données publics d'OpenNeuro, désormais à l'échelle du téraoctet, ou avec des protocoles expérimentaux intégrant de la parole continue et de la vidéo, ce gain de temps représente des semaines de développement économisées par projet. Cela ouvre également la voie à des comparaisons directes entre modalités cérébrales différentes, fMRI, EEG, iEEG, fNIRS, EMG, spikes, en ne changeant qu'un paramètre de configuration. La sortie de NeuralSet s'inscrit dans un mouvement plus large d'industrialisation des outils Neuro-IA, un champ à l'intersection des neurosciences computationnelles et des grands modèles de langage. Les outils historiques comme MNE-Python, Nilearn ou fMRIPrep, conçus avant l'ère du deep learning, n'étaient pas pensés pour l'alignement temporel avec des embeddings haute dimension ni pour le chargement paresseux de datasets massifs. FAIR, qui mène depuis plusieurs années des travaux sur la correspondance entre activité cérébrale et représentations de modèles d'IA, positionne NeuralSet comme une infrastructure commune pour accélérer cette recherche. Le framework est compatible avec les datasets au format BIDS, standard ouvert dominant en neuroimagerie, ce qui facilite son adoption immédiate sur les grandes bases publiques existantes.

RecherchePaper
1 source
Le VPS piloté par l’IA : De la gestion technique au pilotage de l’infrastructure
4226FrenchWeb 

Le VPS piloté par l’IA : De la gestion technique au pilotage de l’infrastructure

L'infrastructure informatique a longtemps été reléguée au rang de préoccupation purement technique, confiée à des équipes spécialisées et invisible dans les organigrammes décisionnels. Elle ne remontait vers les directions qu'en cas de crise : incident majeur, panne prolongée, ou dérapage budgétaire. Pour les organisations numériques modernes, ce modèle de gestion réactive a atteint ses limites, la complexité croissante des environnements cloud, combinée à la multiplication des serveurs privés virtuels (VPS), rend la supervision manuelle à la fois coûteuse et insuffisante. L'intégration de l'intelligence artificielle dans la gestion des VPS change fondamentalement ce paradigme. Là où un administrateur système devait intervenir après détection d'un problème, les outils pilotés par l'IA permettent d'anticiper les surcharges, d'ajuster automatiquement les ressources allouées et de détecter des anomalies avant qu'elles n'impactent les utilisateurs. Pour les PME comme pour les grandes structures, cela se traduit par une réduction des temps d'indisponibilité, une meilleure maîtrise des coûts et une infrastructure qui devient enfin un levier stratégique plutôt qu'un poste de dépense subi. Cette transformation s'inscrit dans la dynamique plus large de l'AIOps, l'application de l'IA aux opérations informatiques, qui s'est accélérée depuis 2023 avec la maturité des modèles de langage et des systèmes d'agents autonomes. Les grands acteurs de l'hébergement comme OVHcloud, Hetzner ou DigitalOcean intègrent progressivement ces capacités dans leurs offres, tandis que les DSI réévaluent leur rapport à l'infrastructure. Le VPS piloté par l'IA n'est plus un gadget : il devient une brique de compétitivité opérationnelle.

InfrastructureOpinion
1 source
Claude, l’IA d’ANTHROPIC, entend redessiner l’architecture de la création en s’intégrant aux outils d’Adobe, Ableton et Autodesk
4227FrenchWeb 

Claude, l’IA d’ANTHROPIC, entend redessiner l’architecture de la création en s’intégrant aux outils d’Adobe, Ableton et Autodesk

Anthropic a annoncé l'intégration de son assistant Claude dans plusieurs des logiciels les plus utilisés par les professionnels créatifs, notamment Adobe, Ableton et Autodesk. Ces connecteurs, développés via le protocole MCP (Model Context Protocol) qu'Anthropic a ouvert à des partenaires tiers, permettent à Claude d'opérer directement à l'intérieur des interfaces de Photoshop, de Pro Tools ou de Fusion 360, sans que l'utilisateur ait besoin de basculer vers une application externe. L'annonce s'inscrit dans une vague d'intégrations que la société multiplie depuis début 2026 pour ancrer Claude dans des flux de production réels. L'enjeu dépasse la simple assistance à la rédaction : Claude peut désormais lire le contexte d'un projet en cours, suggérer des modifications sur des calques, générer des variations musicales ou proposer des ajustements paramétriques dans des modèles 3D. Pour les studios, agences et indépendants, cela réduit concrètement le nombre d'allers-retours entre outils et accélère les phases d'idéation et de prototypage. C'est un changement de paradigme pour des secteurs où le temps de production est directement lié à la rentabilité. Cette stratégie répond à une pression croissante d'OpenAI, Google et des éditeurs logiciels eux-mêmes, qui développent leurs propres couches d'IA natives. En s'appuyant sur des partenariats avec des plateformes déjà installées plutôt que de construire des outils concurrents, Anthropic mise sur l'intégration profonde comme avantage différenciant. La prochaine étape sera de mesurer si ces connecteurs tiennent leurs promesses dans des environnements de production professionnels exigeants.

Alibaba, ByteDance et Zhipu AI figurent dans le premier classement IA du magazine Time
4228SCMP Tech 

Alibaba, ByteDance et Zhipu AI figurent dans le premier classement IA du magazine Time

Le magazine Time a publié pour la première fois un classement dédié à l'intelligence artificielle, intitulé "10 Most Influential AI Companies of 2026", dans le cadre de son palmarès annuel Time100 Most Influential Companies. Trois entreprises chinoises y figurent : Alibaba Group Holding, ByteDance et Zhipu AI. Les sept autres places sont occupées par six sociétés américaines et par Mistral AI, seule représentante européenne du classement. La présence de trois acteurs chinois dans ce top 10 mondial illustre la montée en puissance de l'écosystème IA de Pékin face à la Silicon Valley. ByteDance, connu pour TikTok, s'est imposé dans la course aux grands modèles de langage avec son modèle Doubao. Alibaba pousse son modèle Qwen, disponible en open source, tandis que Zhipu AI, startup soutenue par des fonds d'État, développe la série GLM. Leur inclusion dans un classement américain aussi emblématique que le Time100 signale que la domination américaine sur l'IA n'est plus une évidence pour les observateurs occidentaux eux-mêmes. Ce classement intervient dans un contexte de compétition technologique intense entre les États-Unis et la Chine, aggravée par les restrictions américaines sur les exportations de puces Nvidia vers Pékin. Malgré ces obstacles, les laboratoires chinois ont continué à publier des modèles compétitifs, notamment après le choc DeepSeek début 2025. L'entrée de Mistral AI dans ce palmarès confirme également que l'Europe cherche à s'imposer comme troisième pôle de l'IA mondiale, même si son poids reste modeste face aux deux géants.

BusinessActu
1 source
SHAREBOT lève plusieurs centaines de millions de yuans pour accélérer son réseau de déploiement de robots
4229Pandaily 

SHAREBOT lève plusieurs centaines de millions de yuans pour accélérer son réseau de déploiement de robots

SHAREBOT, plateforme chinoise de location de robots, a bouclé un nouveau tour de table de pré-série A d'un montant de plusieurs centaines de millions de yuans, son quatrième financement en seulement quatre mois d'existence. Le tour a attiré des investisseurs stratégiques de premier plan, notamment Chia Tai Robot (filiale du conglomérat thaïlandais CP Group), Changxin Shares, ainsi que deux sociétés cotées en bourse, Mecury Intelligent (002881.SZ) et Lens Technology (300433.SZ / 06613.HK). Les investisseurs historiques Mingjia Capital, Zhixing Investment et Ruizi Venture Capital ont pour leur part sursouscrit massivement leurs allocations. À la mi-avril 2026, la plateforme SHAREBOT intégrait plus de 4 000 robots déployables, avec une couverture s'étendant à plus de 100 villes chinoises. Les fonds levés seront principalement affectés au développement d'un réseau national de distribution et de services, à l'amélioration des systèmes de gestion et de dispatch des actifs robotiques, au renforcement des infrastructures d'assurance logistique, et à l'expansion des capacités à l'international. Ce financement illustre la transition en cours dans l'industrie robotique chinoise : la compétition ne se joue plus sur les prouesses techniques ou les démonstrations, mais sur la capacité d'exécution à grande échelle. Le PDG Li Yiyan a déclaré que l'enjeu n'est pas d'augmenter simplement le volume de locations, mais de construire un système intégré couvrant l'approvisionnement en équipements, la mise en relation avec les besoins des entreprises, les services urbains, la garantie de livraison et les réseaux mondiaux. Pour les clients industriels et commerciaux, cela signifie un accès à des robots opérationnels de manière standardisée, sans avoir à gérer la complexité de la maintenance ou du renouvellement du parc. SHAREBOT a également noué un partenariat avec PICC Property & Casualty pour créer un système d'assurance dédié à la robotique, couvrant déjà plus d'un millier de robots et traitant ses premiers sinistres dans le domaine de l'IA incarnée. La montée en puissance de SHAREBOT s'inscrit dans un contexte d'accélération du déploiement commercial des robots en Chine, porté par des investissements massifs dans l'IA embarquée et la robotique humanoïde. L'entrée de CP Group via Chia Tai Robot est particulièrement significative : le conglomérat a précédemment investi dans Zhiyuan Robotics, spécialiste de l'IA incarnée, signalant une stratégie cohérente pour dominer l'écosystème robotique en Asie et au-delà. L'annonce du 17 avril 2026 d'une expansion internationale sous la marque SHAREBOT, combinée à la participation de Lens Technology et Mecury Intelligent, renforce les capacités de la plateforme en connectivité des appareils, gestion à distance, dispatch des commandes et coordination de la chaîne d'approvisionnement mondiale. Alors que le secteur bascule de la phase de prototypage vers le déploiement commercial répété et massif, SHAREBOT entend s'imposer comme la couche applicative incontournable permettant aux robots de quitter les labs pour s'intégrer durablement dans l'économie réelle.

RobotiqueActu
1 source
smol-audio : collection de notebooks Colab pour affiner Whisper, Parakeet, Voxtral, Granite Speech et Audio Flamingo 3
4230MarkTechPost 

smol-audio : collection de notebooks Colab pour affiner Whisper, Parakeet, Voxtral, Granite Speech et Audio Flamingo 3

L'équipe Deep-unlearning a publié smol-audio, une collection de notebooks Jupyter autonomes conçus pour faciliter le fine-tuning des grands modèles audio du moment. Le dépôt, distribué sous licence Apache-2.0, couvre quatre familles de modèles de reconnaissance automatique de la parole : Whisper d'OpenAI, Parakeet de NVIDIA, Voxtral de Mistral et Granite Speech d'IBM, ainsi que des recettes pour la compréhension audio avec Audio Flamingo 3. Chaque notebook est conçu pour s'exécuter directement dans Google Colab avec un runtime de 16 Go, ce qui le rend accessible gratuitement sans installation locale. L'ensemble repose exclusivement sur l'écosystème Hugging Face, notamment les bibliothèques transformers, datasets, peft et accelerate. L'architecture de chaque modèle impose un traitement différent : Whisper utilise une approche séquence-à-séquence classique, Parakeet repose sur le CTC (Connectionist Temporal Classification), plus rapide à l'inférence, tandis que Voxtral est construit sur un backbone de grand modèle de langage, Ministral 3B pour sa version Mini et Mistral Small 3.1 24B pour sa version Small, ce qui nécessite un masquage des tokens de prompt pendant l'entraînement pour éviter des dynamiques dégradées. Ce projet comble un vide réel dans la chaîne de travail des ingénieurs en machine learning. Jusqu'ici, les connaissances pratiques pour adapter ces modèles à un nouveau domaine ou une nouvelle langue étaient dispersées entre des issues GitHub, des billets de blog et des notebooks privés jamais partagés. smol-audio expose chaque étape du pipeline sans abstraire la complexité derrière des fonctions de commodité : la boucle d'entraînement est lisible, le pipeline de données est explicite et la configuration est modifiable directement. Pour un ingénieur débutant, c'est un outil pédagogique ; pour un praticien expérimenté, c'est un point de départ de référence qui évite des heures de débogage. Le support du fine-tuning partiel via LoRA (Low-Rank Adaptation) est particulièrement utile pour les modèles lourds comme Parakeet ou Voxtral, où un fine-tuning complet dépasse souvent les ressources disponibles. Ce lancement s'inscrit dans une année particulièrement dense pour l'audio IA. Les modèles de reconnaissance vocale ont bondi en qualité avec Whisper, Parakeet et Voxtral ; la synthèse vocale conversationnelle a franchi un cap avec Dia-1.6B de Nari Labs ; et Meta a publié le Perception Encoder Audiovisual (PE-AV), un encodeur multimodal capable de construire un espace d'embedding commun entre audio, vidéo et texte. La frontière technique avance vite, mais l'outillage pratique peine à suivre. smol-audio tente de réduire cet écart en standardisant les recettes d'entraînement autour de l'écosystème Hugging Face, qui s'impose progressivement comme infrastructure commune pour l'expérimentation sur ces modèles. Le dépôt devrait s'étoffer à mesure que de nouveaux modèles audio émergent.

OutilsTuto
1 source
Implémentation Python pour le benchmarking de parsing de documents avec LlamaIndex ParseBench
4231MarkTechPost 

Implémentation Python pour le benchmarking de parsing de documents avec LlamaIndex ParseBench

LlamaIndex a publié ParseBench, un jeu de données de référence conçu pour évaluer de manière rigoureuse les systèmes d'analyse de documents. Hébergé sur Hugging Face sous l'identifiant llamaindex/ParseBench, ce benchmark est structuré autour de plusieurs dimensions d'évaluation distinctes : extraction de texte brut, reconnaissance de tableaux, interprétation de graphiques et respect de la mise en page. La procédure d'utilisation s'appuie sur un pipeline Python standardisé mobilisant des bibliothèques open source comme datasets, pandas, PyMuPDF (alias fitz), rapidfuzz et rich. Les données sont distribuées au format JSONL, avec des fichiers PDF associés accessibles directement depuis le dépôt Hugging Face via hfhubdownload. Le pipeline de référence décrit dans le tutoriel officiel construit un extracteur de texte léger basé sur PyMuPDF, compare les sorties aux annotations de référence grâce à des métriques de similarité floue (fuzz), et produit des visualisations de la distribution des exemples par dimension. L'importance de ParseBench réside dans le manque criant de standards objectifs pour comparer les moteurs d'analyse documentaire, qu'il s'agisse de solutions OCR classiques, de modèles de vision-langage ou de parseurs hybrides. Jusqu'ici, les équipes évaluaient leurs systèmes sur des jeux de données internes non reproductibles, rendant toute comparaison inter-organisations impossible. Avec ce benchmark unifié, les développeurs peuvent mesurer la qualité de l'extraction sur chaque dimension séparément, texte, tableaux, graphiques, layout, et identifier précisément où leurs pipelines échouent. Pour les entreprises qui traitent des volumes importants de documents (contrats, rapports financiers, publications scientifiques), disposer d'un tel outil de mesure change concrètement la façon dont on sélectionne et valide un moteur de parsing avant de le passer en production. ParseBench s'inscrit dans une tendance plus large portée par LlamaIndex, qui cherche à standardiser l'outillage autour des pipelines RAG (retrieval-augmented generation). La qualité de l'extraction documentaire est en effet le maillon critique souvent négligé de ces architectures : un PDF mal parsé produit des embeddings bruités, ce qui dégrade directement les réponses des assistants IA en aval. Plusieurs acteurs du secteur, comme Unstructured, LlamaParse ou encore Docling d'IBM, se livrent une concurrence directe sur ce segment. L'arrivée d'un benchmark public et reproductible oblige désormais ces acteurs à rendre des comptes sur des métriques communes. Les prochaines étapes probables incluent l'intégration de modèles de vision-langage comme GPT-4o ou Qwen-VL comme baselines supplémentaires, et l'extension du benchmark à des formats au-delà du PDF.

OutilsOutil
1 source
De Canva à MidJourney : comment les outils IA transforment le design des cartes de visite pour les entrepreneurs
4232Le Big Data 

De Canva à MidJourney : comment les outils IA transforment le design des cartes de visite pour les entrepreneurs

En janvier 2026, Canva a franchi le seuil des 200 millions d'utilisateurs actifs, dont 18 millions en France, confirmant l'entrée massive des outils d'IA générative dans les workflows créatifs. Sa suite Magic Studio permet désormais de générer des mises en page complètes via de simples prompts textuels, tandis que des outils comme MidJourney V6 et Adobe Firefly 3 s'intègrent dans les processus des designers professionnels pour produire des visuels, décliner des chartes graphiques ou créer des variations de logo. Selon Adobe, le temps moyen pour concevoir une identité visuelle serait passé de six heures à moins de 45 minutes. Appliqué à la carte de visite, ce gain se traduit par un coût de production compris entre 15 et 35 euros pour 100 exemplaires avec finition premium, contre plusieurs centaines d'euros en agence. En 2025, le marché français de la carte de visite pesait 310 millions d'euros, en hausse de 8 % sur un an, porté par la personnalisation et les finitions haut de gamme comme le soft-touch ou le vernis sélectif. Signe de la convergence entre digital et physique, 67 % des cartes commandées en ligne intègrent désormais un QR code renvoyant vers un profil LinkedIn ou un portfolio. Cette démocratisation du design représente un changement structurel pour les entrepreneurs et les freelances, qui peuvent désormais produire un visuel professionnel en moins d'une heure, sans maîtriser Illustrator ni mandater une agence. Mais l'IA atteint ses limites précisément là où la chaîne graphique devient technique : gestion des fonds perdus, conversion des profils colorimétriques RVB vers CMJN, cohérence typographique entre formats. Un design impeccable à l'écran peut aboutir à une impression décevante si le fichier n'est pas correctement préparé. La vérification technique du fichier avant production reste donc un maillon critique que les outils génératifs ne remplacent pas encore. La résistance de la carte physique à la dématérialisation s'explique par des données empiriques : selon la Data & Marketing Association, le taux de mémorisation d'une carte papier échangée en événement de networking est 70 % supérieur à celui de coordonnées partagées numériquement. Ce chiffre explique la croissance soutenue du marché malgré l'omniprésence des smartphones et des outils de partage de contacts. Dans ce contexte, l'IA a éliminé la barrière du design, mais elle a simultanément déplacé le curseur de différenciation vers la qualité d'impression. Pour les créateurs de contenus visuels comme pour les imprimeurs en ligne, l'enjeu des prochains mois sera d'intégrer la vérification de fichiers et les conseils techniques directement dans les interfaces de design assisté par IA, pour fermer la boucle entre génération et production physique.

OutilsOutil
1 source
SenseTime lance SenseNova U1, vers une ère de modèles unifiés pour la compréhension et la génération
4233Pandaily 

SenseTime lance SenseNova U1, vers une ère de modèles unifiés pour la compréhension et la génération

SenseTime a officiellement lancé et mis en open source le 29 avril 2026 sa série SenseNova U1, un modèle unifié natif combinant compréhension et génération multimodale. Développé sur l'architecture maison NEO-unify présentée en mars 2026, ce modèle intègre dans un cadre unique la compréhension, le raisonnement et la génération visuelle et textuelle. La série se décline en deux variantes légères : SenseNova-U1-8B-MoT, basé sur une architecture dense, et SenseNova-U1-A3B-MoT, reposant sur un mélange d'experts (MoE). Ce qui distingue fondamentalement SenseNova U1 des approches dominantes, c'est l'abandon des encodeurs visuels séparés (VE) et des autoencodeurs variationnels (VAE) traditionnellement empilés dans les modèles multimodaux. NEO-unify reconstruit à la place un espace de représentation unifié profondément intégré à chaque couche de calcul, traitant le langage et les entrées visuelles comme un ensemble composite cohérent. Ce choix architectural permet d'améliorer simultanément les capacités de compréhension et de génération, en préservant à la fois la richesse sémantique et la fidélité visuelle au niveau pixel. Le modèle affiche également de bonnes performances en raisonnement logique et en intelligence spatiale, notamment pour interpréter des environnements physiques complexes. SenseTime, géant chinois de la vision par ordinateur et de l'intelligence artificielle, positionne SenseNova U1 comme une brique fondatrice pour la robotique incarnée : l'objectif est qu'un seul modèle gère en boucle fermée la perception, le raisonnement et l'exécution de tâches physiques. Ce lancement s'inscrit dans une course mondiale à l'unification des modalités, où des acteurs comme Google DeepMind, Meta ou des startups chinoises cherchent à dépasser les architectures hybrides au profit de modèles natifs plus cohérents. La mise en open source de la version légère signal une stratégie d'adoption communautaire, tout en réservant probablement les versions plus puissantes à un usage commercial ou propriétaire.

LLMsOpinion
1 source
GPT-5.5 devient fou : il insère des gobelins partout dans ses réponses !
4234Le Big Data 

GPT-5.5 devient fou : il insère des gobelins partout dans ses réponses !

GPT-5.5, le dernier modèle d'OpenAI, s'est mis à glisser des gobelins, gremlins, ratons laveurs, trolls, ogres et pigeons dans ses réponses, même lorsque le sujet n'a aucun rapport avec ces créatures. Le phénomène a été documenté publiquement le 28 avril 2026 par Arena.ai, qui a publié un graphique montrant l'évolution de l'utilisation de ces termes par les modèles GPT au fil du temps. La réaction d'OpenAI ne s'est pas fait attendre : des développeurs ont découvert dans Codex une instruction système associée à GPT-5.5 qui interdit explicitement au modèle de mentionner gobelins, gremlins, ratons laveurs, trolls, ogres ou pigeons, sauf si cela est strictement pertinent à la demande de l'utilisateur. Ce comportement, qualifié par plusieurs spécialistes d'« effondrement de mode », serait lié aux données d'entraînement du modèle : GPT-5.5 aurait développé un tic linguistique, répétant certains motifs de façon excessive et incontrôlée. Si quelques utilisateurs y voient une touche d'humour involontaire et presque attachante, la manière dont OpenAI a choisi de réagir suscite davantage de critiques. Sur X, un utilisateur a résumé l'incompréhension générale : face à un comportement aussi inattendu dans un système aussi avancé, la réponse n'a pas été de chercher la cause profonde du problème, mais simplement d'ordonner au modèle de ne plus mentionner ces créatures. D'autres interprètent l'instruction comme une hostilité ciblée envers les pigeons et les ratons laveurs, ce qui n'a fait qu'amplifier les moqueries en ligne. Ce bug illustre un problème fondamental que l'industrie de l'IA peine encore à résoudre : les grands modèles de langage restent des boîtes noires. Comme l'a formulé un utilisateur de Reddit, on peut identifier un comportement anormal et le corriger par instruction directe, mais expliquer précisément pourquoi il est apparu reste hors de portée. OpenAI n'est pas la première entreprise confrontée à des dérives comportementales inattendues dans ses modèles, et chaque incident de ce type relance le débat sur l'interprétabilité des systèmes d'IA et la solidité des processus d'entraînement. Sam Altman a choisi de désamorcer la situation avec humour, partageant une capture d'écran évoquant l'entraînement de GPT-6 avec « encore plus de gobelins », mais cette légèreté n'efface pas la question de fond : à mesure que ces modèles deviennent plus puissants et plus intégrés dans des outils professionnels comme Codex, leur imprévisibilité devient un risque difficile à ignorer.

LLMsOpinion
1 source
Ant Group publie en open source le modèle Ling-2.6-Flash avec plusieurs options de précision
4235Pandaily 

Ant Group publie en open source le modèle Ling-2.6-Flash avec plusieurs options de précision

Ant Group, la filiale fintech d'Alibaba, a officiellement mis en open source son modèle Ling-2.6-Flash le 29 avril 2026, via l'équipe BaiLing spécialisée en grands modèles de langage. Le modèle compte 104 milliards de paramètres au total, dont 7,4 milliards activés à l'inférence, et est proposé en plusieurs formats de précision, BF16, FP8 et INT4, pour s'adapter à différents environnements matériels et contraintes de déploiement. Fait notable : deux semaines avant cette annonce officielle, le modèle avait été discrètement mis en ligne sur la plateforme OpenRouter sous le nom anonyme "Elephant Alpha", permettant à Ant Group de collecter des retours développeurs et d'effectuer plusieurs cycles d'optimisation, notamment sur la commutation bilingue chinois-anglais et la compatibilité avec les principaux frameworks de développement. Les performances techniques de Ling-2.6-Flash le positionnent comme un concurrent sérieux dans le segment des modèles efficaces à grande échelle. Son architecture linéaire hybride lui permet d'atteindre 340 tokens par seconde sur une configuration 4x GPU H20, avec un débit de prefill 2,2 fois supérieur à celui du Nemotron-3-Super de NVIDIA. Sur les benchmarks Artificial Analysis, il n'a consommé que 15 millions de tokens pour accomplir ses tâches, soit environ un dixième de ce que nécessite Nemotron-3-Super, un ratio coût-performance particulièrement attractif pour les équipes cherchant à déployer des agents IA à l'échelle. Sur des benchmarks spécialisés comme BFCL-V4, TAU2-bench ou SWE-bench Verified, ses résultats rivalisent avec des modèles aux paramètres actifs bien plus importants. Cette publication s'inscrit dans une stratégie d'open source agressive que mènent plusieurs grandes entreprises technologiques chinoises face à la domination américaine dans le domaine des LLM. Ant Group rejoint ainsi DeepSeek, Alibaba (Qwen) et ByteDance (Doubao) dans une course à la transparence et à l'adoption communautaire. Le choix de tester le modèle anonymement avant de le revendiquer reflète une approche plus pragmatique du lancement : valider en conditions réelles avant de s'exposer publiquement. La focalisation sur les cas d'usage agents, planification multi-étapes, utilisation d'outils, exécution de tâches complexes, indique que les prochaines batailles de l'IA ne se joueront pas sur les chatbots grand public, mais sur l'automatisation des workflows professionnels.

LLMsOpinion
1 source
La Chine sanctionne des plateformes IA pour absence de marquage des contenus générés par IA
4236TechNode 

La Chine sanctionne des plateformes IA pour absence de marquage des contenus générés par IA

La Cyberspace Administration of China (CAC), le régulateur national de l'internet, a annoncé mardi avoir sanctionné trois plateformes numériques pour manquement à l'obligation d'identifier clairement les contenus générés par intelligence artificielle. Les applications visées sont CapCut, l'éditeur de vidéo populaire détenu par ByteDance, Maoxiang (aussi connue sous le nom Cat Box) et Dreamina AI. Selon le CAC, ces plateformes ont enfreint plusieurs textes législatifs, dont la loi sur la cybersécurité, les mesures provisoires sur l'administration des services d'IA générative, et les dispositions spécifiques sur l'identification des contenus synthétiques générés par IA. Les mesures imposées comprennent des entretiens de mise en conformité avec les régulateurs locaux, des ordres de rectification, des avertissements formels et un renforcement de la responsabilité des personnels concernés. Ces sanctions envoient un signal clair sur la volonté de Pékin d'imposer la transparence algorithmique à grande échelle. L'obligation d'étiquetage des contenus IA vise directement les utilisateurs finaux : elle leur permet de distinguer ce qui est authentique de ce qui est généré ou manipulé numériquement, une distinction devenue critique à l'heure où les deepfakes et les images synthétiques prolifèrent sur les réseaux sociaux. Pour des plateformes comme CapCut, dont l'audience mondiale dépasse des centaines de millions d'utilisateurs, la mise en conformité représente un défi technique et opérationnel considérable. Un responsable du CAC a déclaré qu'il n'existe "aucune marge de compromis ni de contournement" aux règles en vigueur. Cette action s'inscrit dans un cadre réglementaire que la Chine a construit méthodiquement depuis 2022, anticipant de plusieurs années les efforts législatifs occidentaux comparables. Les mesures provisoires sur l'IA générative, entrées en vigueur en août 2023, font partie d'un dispositif progressif qui couvre désormais aussi bien la recommandation algorithmique que la génération de texte et d'images. Avec des acteurs comme ByteDance, Baidu ou Alibaba qui déploient des fonctionnalités IA à un rythme soutenu, le régulateur cherche à prévenir les dérives avant qu'elles ne s'installent, tout en consolidant son rôle de référence mondiale dans la gouvernance de l'IA.

RégulationReglementation
1 source
Poolside AI présente Laguna XS.2 et M.1, des modèles de codage à base d'agents atteignant 68,2 % et 72,5 % sur SWE-bench Verified
4237MarkTechPost 

Poolside AI présente Laguna XS.2 et M.1, des modèles de codage à base d'agents atteignant 68,2 % et 72,5 % sur SWE-bench Verified

Poolside AI a dévoilé mardi les deux premiers modèles de sa famille Laguna : Laguna M.1 et Laguna XS.2, accompagnés d'un agent de codage en ligne de commande baptisé "pool". Laguna M.1 est un modèle de type Mixture-of-Experts (MoE) totalisant 225 milliards de paramètres, dont seulement 23 milliards activés à chaque inférence, entraîné sur 30 000 milliards de tokens à l'aide de 6 144 GPU NVIDIA Hopper interconnectés. Il atteint 72,5 % sur le benchmark SWE-bench Verified, référence du secteur pour évaluer la résolution autonome de bugs réels. Laguna XS.2, le premier modèle en accès ouvert de Poolside, est beaucoup plus compact : 33 milliards de paramètres au total, seulement 3 milliards activés par token. Il score 68,2 % sur SWE-bench Verified et peut tourner en local sur un Mac équipé de 36 Go de RAM via Ollama, ce qui est rare pour ce niveau de performance. Une version de base pour le fine-tuning, XS.2-base, sera publiée prochainement. Ces résultats positionnent Poolside parmi les acteurs sérieux du codage agentique, un segment en pleine effervescence où l'objectif est de faire résoudre des tâches de développement complexes et longues par des modèles de manière autonome. La capacité de XS.2 à fonctionner en local change la donne pour les développeurs soucieux de confidentialité ou travaillant sans accès cloud stable : avec une fenêtre de contexte de 131 072 tokens et un support natif du raisonnement intercalé entre les appels d'outils, le modèle est conçu pour des workflows réels de programmation sur plusieurs heures. Le fait que Laguna XS.2 soit open-weight le rend aussi accessible aux équipes qui souhaitent l'adapter à leurs propres bases de code, sans dépendre d'une API propriétaire. Poolside AI, fondée en 2023 par des vétérans de DeepMind et du monde de la recherche, a levé plus de 500 millions de dollars avec la conviction que l'IA spécialisée dans le code nécessite une infrastructure d'entraînement entièrement repensée. Pour Laguna, l'entreprise a développé en interne son pipeline de données, son framework d'entraînement (Titan) et une infrastructure de reinforcement learning agentique. L'une des innovations les plus notables est "AutoMixer", un système qui entraîne simultanément environ 60 modèles-proxy sur des mélanges de données différents pour optimiser automatiquement la composition du jeu d'entraînement, plutôt que de s'appuyer sur des heuristiques manuelles. Cette approche, inspirée de travaux comme RegMix ou OLMix, aurait permis de doubler la diversité effective des données tout en préservant l'équilibre entre code, mathématiques et raisonnement général. La prochaine étape pour Poolside sera probablement d'élargir la famille Laguna et d'affiner son agent "pool" pour concurrencer directement des outils comme Claude Code ou Cursor sur le marché des assistants de développement autonomes.

LLMsActu
1 source
BEVal : étude d'évaluation comparative des modèles de segmentation BEV pour la conduite autonome
4238arXiv cs.RO 

BEVal : étude d'évaluation comparative des modèles de segmentation BEV pour la conduite autonome

Une équipe de chercheurs a publié BEVal, une étude comparative sur les modèles de segmentation en vue aérienne (Bird's Eye View, ou BEV) appliqués à la conduite autonome. Contrairement aux travaux habituels, qui entraînent et évaluent les modèles sur un seul jeu de données, généralement nuScenes, les auteurs ont testé les performances de plusieurs modèles de l'état de l'art sur des combinaisons croisées de jeux de données : entraînement sur l'un, évaluation sur un autre. L'étude examine également l'influence du type de capteur utilisé, caméras ou LiDAR, sur la capacité des modèles à s'adapter à des environnements variés et à des catégories sémantiques différentes. Le code de l'étude est disponible en open source sur GitHub. Les résultats mettent en évidence un problème structurel dans la recherche actuelle : les modèles de segmentation BEV, très performants sur leurs données d'entraînement, chutent significativement lorsqu'ils sont confrontés à un nouvel environnement ou à une configuration de capteurs différente, un phénomène connu sous le nom de décalage de domaine. Pour les constructeurs automobiles et les entreprises de conduite autonome, cela signifie que des modèles optimisés en laboratoire peuvent se révéler peu fiables dans des conditions réelles variées. Les expériences d'entraînement sur plusieurs jeux de données menées en parallèle ont toutefois montré des améliorations notables des performances par rapport à l'entraînement sur un seul jeu, ouvrant la voie à des approches plus robustes. La segmentation BEV est une technologie clé pour la conduite autonome : elle permet aux véhicules de construire une représentation plane de leur environnement immédiat à partir de capteurs embarqués, facilitant la détection de routes, véhicules, piétons et obstacles. Le standard quasi universel de la recherche repose aujourd'hui sur nuScenes, un jeu de données développé par Motional, ce qui crée un biais de spécialisation problématique à l'échelle du secteur entier. En exposant cette fragilité et en proposant une méthodologie d'évaluation croisée rigoureuse, BEVal pousse la communauté scientifique vers des pratiques plus exigeantes, une condition indispensable avant tout déploiement massif de véhicules autonomes sur des routes réelles.

RecherchePaper
1 source
Genie Sim 3.0 : une plateforme de simulation haute fidélité pour robots humanoïdes
4239arXiv cs.RO 

Genie Sim 3.0 : une plateforme de simulation haute fidélité pour robots humanoïdes

AgibotTech a publié Genie Sim 3.0, une plateforme de simulation unifiée destinée à l'apprentissage de la manipulation robotique. Son composant central, le Genie Sim Generator, utilise un grand modèle de langage (LLM) pour construire automatiquement des environnements 3D haute fidélité à partir de simples instructions en langage naturel. La plateforme intègre également le premier benchmark de robotique dont l'évaluation est entièrement automatisée par LLM : il génère en masse des scénarios de test, puis s'appuie sur un modèle vision-langage (VLM) pour noter les performances des robots sans intervention humaine. AgibotTech publie simultanément un jeu de données open source de plus de 10 000 heures de données synthétiques couvrant plus de 200 tâches distinctes, accessible sur GitHub. L'enjeu central est le fossé entre simulation et monde réel, le fameux problème du "sim-to-real transfer", qui freine depuis des années le déploiement à grande échelle des robots apprenants. Collecter des données dans le monde physique coûte extrêmement cher et se heurte à des contraintes de passage à l'échelle quasi insurmontables. Genie Sim 3.0 démontre expérimentalement que ses données synthétiques permettent un transfert "zéro-shot" vers le monde réel, c'est-à-dire que des politiques de contrôle entraînées uniquement en simulation fonctionnent directement sur des robots physiques, sans phase d'adaptation supplémentaire. Pour les laboratoires de robotique et les startups du secteur, cela ouvre la possibilité de produire des volumes de données d'entraînement plusieurs ordres de grandeur supérieurs à ce qu'autorise la réalité physique, à une fraction du coût. Cette publication s'inscrit dans une course mondiale à la robotique humanoïde impliquant des acteurs comme Figure AI, Physical Intelligence, Boston Dynamics ou encore Tesla avec Optimus. L'un des goulots d'étranglement communs à tous est précisément la rareté des données d'entraînement de qualité et la fragmentation des benchmarks, chaque laboratoire travaillant dans son propre silo de simulation. En proposant une plateforme ouverte, un dataset massif et une procédure d'évaluation standardisée et automatisée, AgibotTech tente de poser une infrastructure commune au champ. La prochaine étape sera de vérifier si ce transfert zéro-shot tient dans des conditions moins contrôlées, avec des objets, des éclairages et des configurations inédits.

RobotiqueActu
1 source
VISION-SLS : contrôle sûr par représentations visuelles apprises via synthèse système
4240arXiv cs.RO 

VISION-SLS : contrôle sûr par représentations visuelles apprises via synthèse système

Des chercheurs ont publié VISION-SLS, une méthode de contrôle robotique capable de piloter un robot en temps réel à partir d'images RGB haute résolution tout en garantissant formellement la sécurité du comportement. La méthode a été testée sur plusieurs systèmes simulés : une voiture à 4 dimensions d'état, un quadrirotor à 10 dimensions, et un humanoïde à 59 dimensions opérant dans des conditions de visibilité partielle, le tout avec des flux vidéo d'au moins 512 x 512 pixels. Elle a également été validée sur un véritable véhicule terrestre contrôlé uniquement par ses caméras embarquées, surpassant les approches concurrentes en termes de taux de sécurité et de temps de calcul. Le code source est disponible sur GitHub. Ce qui distingue VISION-SLS des approches existantes, c'est sa capacité à combiner apprentissage profond et garanties formelles de sécurité, deux mondes qui s'ignoraient largement jusqu'ici. En robotique autonome, un système peut prendre de bonnes décisions en moyenne tout en échouant catastrophiquement dans des cas limites. VISION-SLS résout ce problème en construisant des bornes d'erreur calibrées empiriquement sur la représentation visuelle apprise, puis en intégrant ces incertitudes directement dans l'optimisation de la politique de contrôle via un cadre appelé System Level Synthesis (SLS). Résultat : le robot adopte un comportement actif de réduction d'incertitude, cherchant à mieux se localiser, tout en restant dans des zones certifiées sûres. Le défi fondamental que cherche à résoudre VISION-SLS est vieux comme la robotique moderne : comment piloter un système physique depuis des capteurs imparfaits, avec des dynamiques non linéaires, sans garanties de collision ? Les méthodes de contrôle classiques exigent un état complet et précis du système ; les méthodes d'apprentissage par renforcement offrent de bonnes performances moyennes mais sans garanties. SLS est un cadre de théorie du contrôle qui permet de concevoir des politiques robustes avec des garanties mathématiques, mais il était jusqu'ici inapplicable à des entrées visuelles haute dimension. VISION-SLS lève cet obstacle en apprenant une représentation compacte des images avec des bornes d'erreur exploitables, et en développant un solveur original basé sur la programmation convexe séquentielle couplée à des récursions de Riccati pour rendre le tout calculable en temps réel.

RobotiqueOpinion
1 source