Aller au contenu principal
Règles critiquées : une nouvelle génération de VLM pour automatiser les interfaces graphiques, alimentant l'agent Surfer-H
LLMsHuggingFace Blog · 1 min de lecture

Règles critiquées : une nouvelle génération de VLM pour automatiser les interfaces graphiques, alimentant l'agent Surfer-H

Source originale ↗·

Holo1 est une nouvelle famille de VLM (Virtual Machine for GUI Automation) conçue pour automatiser les interfaces graphiques, soutenant l'agent Surfer-H.

Impact France/UE

La startup française H Company renforce sa position dans l'automatisation d'interfaces graphiques avec Holo1, consolidant l'écosystème européen de l'IA agentique face aux acteurs américains.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Une nouvelle façon d'exprimer son identité : Gemini peut désormais créer de la musique
1Google AI Blog 

Une nouvelle façon d'exprimer son identité : Gemini peut désormais créer de la musique

Lyria 3 est désormais disponible dans l'application Gemini, permettant aux utilisateurs de créer des pistes musicales personnalisées de haute qualité de 30 secondes à partir de textes et d'images. Cette fonctionnalité offre une nouvelle manière d'exprimer la créativité via la génération d'œuvres audio à partir de contenus multimédias.

LLMsOutil
1 source
RAG (Retrieval-Augmented Generation) : une approche pour optimiser l’usage de l’IA
2Le Big Data 

RAG (Retrieval-Augmented Generation) : une approche pour optimiser l’usage de l’IA

La Retrieval-Augmented Generation, ou RAG, est une architecture technique qui associe un modèle de langage à une base documentaire externe, permettant à l'intelligence artificielle de consulter des informations précises avant de formuler une réponse. Concrètement, le processus se déroule en trois temps : les documents de l'entreprise sont d'abord découpés en fragments, puis convertis en représentations mathématiques appelées embeddings, qui transforment le sens d'une phrase en coordonnées numériques. Lorsqu'un utilisateur pose une question, sa requête est elle aussi encodée de cette façon, puis comparée aux vecteurs stockés pour identifier les passages les plus pertinents. Ces extraits sont ensuite injectés dans le prompt envoyé au modèle, qui rédige sa réponse à partir d'un contexte documenté et vérifiable. Contrairement à une recherche par mots-clés classique, le système reconnaît deux phrases sémantiquement proches même si elles n'ont pas de termes en commun. L'intérêt pour les entreprises est considérable. Les modèles de langage traditionnels fonctionnent uniquement à partir de leur corpus d'entraînement : toute information absente ou modifiée depuis génère inévitablement des erreurs, ce que les praticiens appellent les "hallucinations". Le RAG court-circuite ce problème en dotant l'IA d'une mémoire externe dynamique, mise à jour en temps réel. Un service client peut ainsi déployer un assistant conversationnel capable de consulter les procédures internes à jour avant chaque réponse, sans que les données quittent le périmètre de l'organisation. Pour des secteurs manipulant des documents sensibles, comme le juridique, la conformité ou l'ingénierie, cette architecture représente la différence entre un outil expérimental et un outil déployable en production. Le RAG s'est imposé comme l'une des réponses les plus pragmatiques aux limites structurelles des LLM depuis que ces modèles ont commencé à être déployés en entreprise à grande échelle. Les géants du cloud, d'AWS à Microsoft Azure en passant par Google Cloud, proposent désormais des services RAG managés, tandis qu'une constellation de startups comme Pinecone, Weaviate ou Qdrant se sont spécialisées dans les bases vectorielles qui en constituent le socle technique. La question qui reste ouverte est celle de la mise à l'échelle : indexer des dizaines de milliers de documents internes, maintenir la cohérence des embeddings lors des mises à jour, et gérer la latence de récupération sont des défis d'ingénierie non triviaux. Les prochaines évolutions du RAG s'orientent vers des architectures hybrides combinant recherche vectorielle et recherche structurée, ainsi que vers des systèmes capables de raisonner sur plusieurs documents simultanément plutôt que de simplement les concaténer.

LLMsTuto
1 source
3Le Big Data 

Kimi de Moonshot AI : l’outil IA de nouvelle génération

Moonshot AI, startup pékinoise fondée par Yang Zhilin, a lancé fin 2023 un assistant conversationnel nommé Kimi, propulsé par de grands modèles de langage. En 2026, la version Kimi K2.5 s'impose comme une référence dans le domaine de l'IA multimodale : l'outil traite simultanément texte et images, gère des fenêtres contextuelles atteignant 2 millions de caractères, et repose sur une architecture Mixture of Experts (MoE) totalisant environ mille milliards de paramètres. Concrètement, ce modèle n'active qu'une fraction de ses neurones artificiels à chaque requête, ce qui lui permet d'être à la fois massivement capable et relativement efficace en ressources. La version K2.5 marque également l'intégration native d'une dimension visuelle, rendant l'outil capable d'interpréter des images sans module externe. La proposition de valeur centrale de Kimi repose sur sa capacité à traiter des documents de très grande taille sans dégradation de la cohérence : rapports de 200 pages, dossiers juridiques complexes, livres entiers peuvent être analysés en quelques dizaines de secondes, avec extraction de données précises et réponses croisées entre plusieurs fichiers. Là où d'autres modèles perdent le fil ou génèrent des hallucinations sur des contextes longs, Kimi maintient une vision globale stable. Son environnement de développement bilingue chinois-anglais lui confère également une sensibilité culturelle et linguistique que les modèles entraînés principalement sur des corpus anglophones peinent à reproduire, notamment sur les nuances et les références contextuelles non occidentales. Moonshot AI s'inscrit dans la vague des acteurs chinois de l'IA qui défient ouvertement les leaders américains, OpenAI en tête. Si ChatGPT reste la référence pour la polyvalence créative et la notoriété grand public, Kimi se positionne comme concurrent direct sur les tâches techniques avancées, la recherche documentaire approfondie et le codage assisté. Le marché de l'IA générative est désormais structuré autour d'une poignée de modèles ultra-performants issus de plusieurs géographies, avec une compétition intense sur les benchmarks de raisonnement et de traitement long contexte. La montée en puissance de Moonshot AI reflète plus largement l'émergence d'un écosystème IA chinois mature, capable de rivaliser techniquement avec la Silicon Valley, et dont les prochaines versions pourraient intégrer encore davantage de capacités agentiques, notamment l'orchestration de tâches automatisées en parallèle.

LLMsOpinion
1 source
Anthropic n'est pas le meilleur pour le service client, selon de nouvelles données
4The Information AI 

Anthropic n'est pas le meilleur pour le service client, selon de nouvelles données

Les modèles d'Anthropic, réputés pour leurs performances en programmation, se révèlent moins efficaces pour les applications vocales et conversationnelles de service client, selon des données publiées par NiCE, fournisseur de logiciels de service client dont les clients incluent Toyota, Allianz, Nestlé et Frontier Airlines. Neeraj Verma, vice-président de l'activité agents IA chez NiCE, explique que les modèles d'Anthropic affichent un temps de latence relativement long avant de générer leur première réponse, un délai connu sous le nom de "time to first token". Selon lui, un agent vocal ou textuel de service client ne peut marquer une pause que d'environ 2,5 secondes maximum avant de paraître non naturel aux yeux du client. Verma estime que le marché des logiciels d'expérience client propulsés par l'IA pèse aujourd'hui 15 milliards de dollars et connaît une croissance rapide. Cette latence pose un problème concret pour les entreprises qui cherchent à déployer des assistants vocaux fluides et réactifs. Verma résume la situation sans détour: utiliser les modèles d'Anthropic pour du service client rendrait, selon ses mots, le bot "vraiment nul" parce que les modèles seraient "tout simplement trop lents". Pour des secteurs comme l'aérien, l'assurance ou l'automobile, où les clients de NiCE opèrent, chaque milliseconde de délai peut dégrader l'expérience utilisateur et donner l'impression d'une interaction robotique plutôt que naturelle, un enjeu crucial dans un marché aussi concurrentiel. Ce constat illustre une tension plus large dans l'écosystème de l'IA générative: la performance d'un modèle sur une tâche donnée, comme le code pour Anthropic, ne garantit pas son excellence sur d'autres usages comme la génération vocale en temps réel. Les fournisseurs de logiciels comme NiCE doivent ainsi arbitrer entre plusieurs modèles selon les cas d'usage, ce qui pousse des entreprises comme OpenAI, Google ou d'autres acteurs à optimiser spécifiquement la vitesse de leurs modèles pour les applications vocales, un axe de compétition distinct de la seule qualité des réponses générées.

UEImpact indirect: Allianz, assureur européen, figure parmi les clients de NiCE susceptibles d'être concernés par ce choix de modèles IA pour le service client.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic