Aller au contenu principal
Arm et ExecuTorch 0.7 : Apporter l'IA générative au grand public
OutilsHuggingFace Blog · 1 min de lecture

Arm et ExecuTorch 0.7 : Apporter l'IA générative au grand public

Source originale ↗·

Titre: Arm et ExecuTorch 0.7 démocratisent l'IA générative

Arm et ExecuTorch ont publié la version 0.7 de leur outil, visant à rendre l'IA générative accessible au grand public. Ce lancement inclut des améliorations de performances, une meilleure efficacité énergétique et un support accru pour les processeurs Arm. Les utilisateurs peuvent désormais tirer parti des capacités de l'IA générative sur une gamme plus large d'appareils.

Impact France/UE

Arm et ExecuTorch 0.7 rendent l'IA générative accessible au grand public, améliorant les performances, l'efficacité énergétique et le support pour les processeurs Arm, impactant les entreprises et consommateurs européens en démocratisant l'accès à cette technologie.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

IA générative : le RAG par l’exemple, avec 15 000 actus Next et Mistral 7B
1Next INpact 

IA générative : le RAG par l’exemple, avec 15 000 actus Next et Mistral 7B

La rédaction de Next a mis en œuvre une démonstration concrète du RAG (Retrieval-Augmented Generation) en indexant plus de 15 000 articles publiés sur le site au cours des dix dernières années, puis en les connectant à Mistral 7B, un modèle de langage open source à 7,3 milliards de paramètres sorti en 2023 et distribué sous licence Apache 2.0. L'ensemble du traitement a été réalisé entièrement en local, sur un MacBook Pro équipé d'un SoC Apple M2 et de 16 Go de mémoire unifiée, sans aucune connexion à Internet. L'outillage repose sur Ollama (open source, licence MIT) pour faire tourner Mistral 7B, et sur le modèle nomic-embed-text pour transformer les textes en vecteurs numériques. L'indexation initiale des 15 000 articles a pris environ trois heures sur cette machine ; les ajouts ultérieurs ne nécessitent de vectoriser que les nouveaux contenus. À l'exécution, chaque prompt utilisateur est lui-même vectorisé, comparé à l'ensemble de la base, et les dix extraits les plus pertinents sont transmis simultanément à Mistral pour que le modèle construise sa réponse en s'appuyant à la fois sur ses connaissances internes et sur ces morceaux sélectionnés. Cette démonstration illustre une capacité désormais accessible sans infrastructure cloud ni abonnement payant : enrichir un modèle généraliste avec une base de connaissances privée et actualisée, sans réentraînement. Pour les entreprises comme pour les particuliers, le RAG représente une voie pragmatique pour dépasser la date de coupure des modèles et les ancrer dans un corpus maîtrisé, qu'il s'agisse de documentation interne, d'archives éditoriales ou de bases réglementaires. Le fait que l'intégralité du pipeline tourne sur un ordinateur portable grand public, sans données envoyées vers des serveurs tiers, lève en outre les obstacles liés à la confidentialité qui freinent l'adoption en milieu professionnel. Le RAG s'est imposé ces deux dernières années comme l'une des techniques les plus utilisées pour spécialiser les LLM sans passer par le fine-tuning, jugé coûteux et rigide. Mistral 7B, bien que désormais dépassé par des modèles comptant des centaines de milliards de paramètres, reste suffisamment léger pour tourner sur du matériel grand public tout en offrant des résultats exploitables. Ollama, de son côté, a considérablement simplifié le déploiement local de ces modèles depuis son lancement. La démarche de Next souligne que l'expérimentation RAG n'est plus réservée aux équipes disposant de GPU serveur : un Mac récent suffit, et le principal investissement reste le temps de constitution et de maintenance du corpus source.

UELe pipeline entièrement local, basé sur Mistral 7B (Mistral AI, France), élimine tout transfert de données vers des serveurs tiers, levant les obstacles RGPD qui freinent l'adoption de l'IA générative en entreprise en France et dans l'UE.

OutilsTuto
1 source
Autonomes pour l'ère de l'IA : repenser l'architecture des données pour l'IA générative
2InfoQ AI 

Autonomes pour l'ère de l'IA : repenser l'architecture des données pour l'IA générative

Jörg Schad a présenté "Autonomous Data Products for the Autonomous Era", une intervention consacrée à la manière de dompter ce qu'il appelle le "hairball" de la gestion de données, cet enchevêtrement de pipelines, de schémas et de systèmes qui complique la construction d'architectures fiables pour l'intelligence artificielle générative. Il y détaille le concept de produits de données autonomes, conçus comme des conteneurs qui encapsulent à la fois les pipelines de traitement, les schémas et les métadonnées associées à un jeu de données donné, plutôt que de les laisser dispersés dans des systèmes hétérogènes. L'enjeu dépasse la simple organisation technique. À mesure que les agents IA gagnent en autonomie et sollicitent directement les bases de données et les outils d'entreprise, ils ont besoin d'un accès structuré et gouverné, sans exposer toute la complexité brute des systèmes sous-jacents. Schad montre comment la découverte progressive d'outils, via des protocoles comme MCP (Model Context Protocol), permet de limiter le "context rot", cette dégradation des performances d'un modèle lorsque sa fenêtre de contexte est saturée d'informations non pertinentes, tout en appliquant des politiques de gouvernance des données. Cette réflexion s'inscrit dans un mouvement plus large de refonte des architectures de données, historiquement pensées pour des tableaux de bord et des utilisateurs humains, afin de les adapter à des agents autonomes capables d'interroger des sources multiples et hétérogènes. Avec la multiplication des déploiements d'agents IA en entreprise, des protocoles comme MCP s'imposent progressivement comme un standard pour structurer ces interactions, garantissant un accès fiable et multimodal aux données tout en préservant la sécurité et la traçabilité des flux.

OutilsOpinion
1 source
3TechCrunch AI 

Multiverse Computing propulse ses modèles d'IA compressés vers le grand public

Multiverse Computing franchit une nouvelle étape dans la démocratisation de l'intelligence artificielle en rendant accessibles au grand public ses modèles compressés issus des plus grands laboratoires de l'IA mondiale. La société a lancé simultanément une application grand public et une API permettant d'exploiter ces modèles allégés à plus grande échelle. La compression de modèles représente un enjeu stratégique majeur pour le secteur : en réduisant la taille des modèles sans sacrifier leurs performances, elle permet de les déployer sur des infrastructures moins coûteuses, de diminuer la consommation énergétique et d'élargir l'accès à des acteurs qui ne disposent pas de ressources de calcul massives. La démarche de Multiverse Computing s'inscrit ainsi dans une tendance de fond visant à rendre l'IA haute performance plus accessible et plus frugale. Les modèles compressés proposés par la société sont issus de quatre des acteurs les plus influents du domaine : OpenAI, Meta, DeepSeek et Mistral AI. L'application dévoilée permet de démontrer concrètement les capacités de ces versions optimisées, tandis que l'API ouvre la voie à une intégration par des développeurs et des entreprises souhaitant bénéficier de ces modèles sans les contraintes habituelles de déploiement. Cette double mise sur le marché, application et API, suggère que Multiverse Computing mise sur deux segments distincts : les utilisateurs finaux curieux d'évaluer les modèles compressés, et les professionnels cherchant à les intégrer dans leurs propres produits. La stratégie pourrait repositionner la compression de modèles non plus comme un simple outil d'optimisation interne, mais comme une offre commerciale à part entière.

UEMultiverse Computing, entreprise européenne spécialisée dans la compression de modèles IA, rend ses outils accessibles via une API — opportunité directe pour les développeurs et entreprises européennes cherchant à réduire les coûts d'inférence.

OutilsOutil
1 source
4AWS ML Blog 

L'IA générative d'AWS au service du commerce de détail

Amazon Web Services propose une solution complète de commerce en ligne basée sur l'intelligence artificielle générative, permettant aux enseignes de déployer un système d'essayage virtuel et de recommandation de produits. Construite autour d'Amazon Nova Canvas, Amazon Rekognition et Amazon OpenSearch Serverless, l'architecture repose entièrement sur des services sans serveur (serverless) et se déploie via une seule commande grâce au modèle AWS SAM. Cinq fonctions Lambda spécialisées orchestrent les différentes capacités : interface chatbot, traitement de l'essayage virtuel, génération de recommandations, ingestion de données et recherche intelligente. Le stockage s'appuie sur des buckets S3, la recherche vectorielle sur OpenSearch Serverless, et le suivi analytique en temps réel sur DynamoDB. La solution est disponible en open source sur GitHub et peut être déployée directement dans un compte AWS, de préférence en région us-east-1. Cette technologie s'attaque à un problème économique majeur du e-commerce : l'incertitude des acheteurs face à la taille et au rendu visuel des produits, qui génère des taux de retour élevés, des coûts opérationnels importants et une frustration client. En permettant aux consommateurs de visualiser de façon réaliste un vêtement ou un accessoire porté sur eux, le système améliore directement la confiance à l'achat et réduit les retours, avec un impact mesurable sur la rentabilité. Au-delà de l'essayage, la solution intègre une recherche en langage naturel comprenant l'intention client, des recommandations visuellement pertinentes basées sur Amazon Titan Multimodal Embeddings, et un tableau de bord analytique qui aide les retailers à optimiser leur inventaire et leurs décisions merchandising. Le commerce en ligne est sous pression croissante pour reproduire l'expérience sensorielle du magasin physique, un défi que les technologies de réalité augmentée et d'IA générative commencent seulement à résoudre à grande échelle. AWS positionne cette solution autant pour ses partenaires intégrateurs que pour les retailers qui souhaitent accélérer leur transformation numérique sans développer d'infrastructure propriétaire. La conception modulaire permet d'adopter une ou plusieurs fonctionnalités de façon indépendante, abaissant ainsi la barrière à l'entrée pour les enseignes de taille intermédiaire. À mesure que les modèles de fondation d'Amazon Bedrock gagnent en disponibilité régionale et en performance, ce type de solution hybride, combinant vision par ordinateur, embeddings multimodaux et génération d'images, devrait s'imposer comme standard dans les plateformes e-commerce de nouvelle génération.

UELes retailers français et européens peuvent déployer cette solution pour réduire leurs taux de retour e-commerce, mais au prix d'une dépendance totale à l'infrastructure cloud américaine d'AWS.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic