Stop tout schématiser : quand GraphRAG bat vraiment le RAG vectoriel
Les systèmes de génération augmentée par récupération (RAG), utilisés depuis deux ans pour interroger de grands corpus de documents avec un modèle de langage, montrent leurs limites face aux questions transversales. La méthode classique découpe les documents en fragments, les transforme en vecteurs, puis récupère les passages les plus proches sémantiquement de la question posée. Cette approche fonctionne bien pour une question précise comme "quelle était notre politique de remboursement au troisième trimestre", mais échoue dès qu'il faut identifier des thèmes récurrents sur deux ans de réclamations clients, car aucun fragment isolé ne contient la réponse complète. Microsoft Research a formalisé cette limite en lançant GraphRAG, une alternative qui construit d'abord un graphe de connaissances reliant les entités et leurs relations dans le corpus, avant de l'utiliser comme contexte pour le modèle. Sur des jeux de données atteignant un million de tokens, GraphRAG a remporté entre 72 et 83% des comparaisons de complétude et entre 62 et 82% des comparaisons de diversité face au RAG classique, selon un modèle de langage servant de juge. Ses résumés de plus haut niveau consomment jusqu'à 97% de tokens en moins que le traitement du texte source brut.
Ces résultats ont une portée concrète pour les entreprises qui construisent des systèmes de questions-réponses sur leurs propres données. Sur les benchmarks standards de raisonnement multi-sauts, MuSiQue, HotpotQA et 2WikiMultiHopQA, le taux de rappel à cinq résultats passe de 73,4% avec un RAG classique à 87,8% avec une récupération guidée par graphe, soit un gain de 19,6 points. Concrètement, cela signifie que le bon passage justificatif a beaucoup plus de chances d'être effectivement remonté au modèle, ce qui réduit les réponses incomplètes ou erronées sur les questions complexes nécessitant de croiser plusieurs sources. Mais ce gain n'est pas gratuit: construire et maintenir un graphe de connaissances demande un travail d'indexation supplémentaire par LLM, ce qui alourdit le coût et la complexité du pipeline par rapport à un simple découpage en fragments.
Techniquement, GraphRAG fonctionne en deux temps. Lors de l'indexation, un modèle de langage lit chaque fragment de texte pour en extraire les entités, les relations et les affirmations, qu'il assemble en un graphe pondéré. L'algorithme de Leiden regroupe ensuite ce graphe en une hiérarchie de communautés thématiques, chacune dotée d'un résumé en langage naturel généré à l'avance. Au moment de la requête, chaque communauté pertinente rédige une réponse partielle, ces réponses sont classées et fusionnées, puis le modèle synthétise une réponse finale ancrée dans la structure du corpus plutôt que dans quelques extraits isolés. D'autres variantes comme HippoRAG empruntent une voie différente, combinant le graphe à un algorithme de type PageRank personnalisé pour localiser les passages pertinents, mais l'idée centrale reste la même: laisser les relations entre entités, et non la seule similarité vectorielle, décider du contexte fourni au modèle.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




