GraphRAG : comment relier un graphe de connaissances à un LLM ?

GraphRAG désigne une famille d’architectures combinant :

Un RAG classique retrouve principalement des fragments de documents proches de la question.

GraphRAG cherche également à représenter la structure du corpus :

GraphRAG ajoute une mémoire relationnelle au processus de recherche documentaire.

Cette approche devient utile lorsque la réponse ne se trouve pas dans un seul passage, mais exige de relier plusieurs informations.

Ce que vous allez comprendre

À la fin de cet article, vous saurez :

Rappel : fonctionnement d’un RAG classique

Un système RAG classique suit généralement ce processus :

Documents
  ↓
Découpage en fragments
  ↓
Création des embeddings
  ↓
Index vectoriel
  ↓
Question utilisateur
  ↓
Recherche de fragments proches
  ↓
LLM
  ↓
Réponse

Cette approche est efficace lorsque la réponse se trouve dans quelques passages clairement identifiables.

Exemple simple

Question :

Quelle est la durée de la formation SEO avancée ?

Un fragment contient :

La formation SEO avancée dure 21 heures.

Le RAG retrouve ce fragment et produit la réponse.

GraphRAG n’est pas nécessaire dans ce cas.

Limite du RAG classique

Prenons une question plus complexe :

Quelles entreprises sont indirectement reliées au projet Alpha par leurs collaborateurs, partenaires et contrats ?

La réponse peut être répartie dans :

Une recherche vectorielle peut retrouver certains passages, mais manquer la structure globale.

Principe de GraphRAG

GraphRAG construit une représentation relationnelle à partir des sources.

Documents
  ↓
Extraction des entités
  ↓
Extraction des relations
  ↓
Résolution des identités
  ↓
Construction du graphe
  ↓
Détection de groupes
  ↓
Création de résumés
  ↓
Recherche graphe + documents
  ↓
Réponse du LLM

Le graphe sert de couche intermédiaire entre le corpus et le modèle.

Les entités

Les entités peuvent être :

Exemple :

Marie Dupont
Entreprise Alpha
Projet Orion
Toulouse
Contrat 458

Les relations

Les relations peuvent être :

Marie Dupont → travaille pour → Entreprise Alpha
Entreprise Alpha → participe à → Projet Orion
Projet Orion → est régi par → Contrat 458
Contrat 458 → concerne → Client Beta

Ces relations permettent de suivre des chemins entre plusieurs sources.

Les propriétés

Les entités et relations peuvent contenir :

Exemple :

Marie Dupont → travaille pour → Entreprise Alpha
date_début : 2023-01-01
source : annuaire interne
confiance : élevée

Construction du graphe

1. Collecter les sources

Le corpus peut contenir :

2. Nettoyer les documents

Il faut notamment :

3. Découper les textes

Les documents sont divisés en unités exploitables.

Le découpage doit préserver les relations importantes.

Exemple :

Un nom peut apparaître dans un paragraphe et sa fonction dans le suivant.

Un découpage trop agressif peut séparer ces informations.

4. Extraire les entités

Un modèle ou un système de règles identifie :

Personne : Marie Dupont
Organisation : Entreprise Alpha
Projet : Projet Orion
Ville : Toulouse

5. Extraire les relations

Le système propose :

Marie Dupont → travaille pour → Entreprise Alpha
Entreprise Alpha → gère → Projet Orion
Projet Orion → est situé à → Toulouse

6. Résoudre les identités

Le corpus peut contenir :

Entreprise Alpha
Alpha SAS
Alpha
Société Alpha

Il faut déterminer s’il s’agit de la même entité.

Cette phase est essentielle.

Une mauvaise fusion crée de fausses connexions.

Une absence de fusion crée des doublons.

7. Ajouter les sources

Chaque relation doit être rattachée à son passage d’origine.

Relation :
Entreprise Alpha → gère → Projet Orion

Source :
Rapport annuel 2026, page 12.

8. Valider

Les entités et relations peuvent être :

Graphe local et graphe global

GraphRAG peut répondre à deux types de questions.

Questions locales

Elles portent sur une entité précise.

Exemples :

Le système explore le voisinage de l’entité.

Questions globales

Elles portent sur l’ensemble du corpus.

Exemples :

Une simple recherche de fragments peut être insuffisante.

GraphRAG peut construire des résumés à différents niveaux.

Les communautés du graphe

Une communauté est un groupe d’entités fortement reliées.

Exemple :

Communauté 1
- Projet Orion
- Entreprise Alpha
- Marie Dupont
- Contrat 458
Communauté 2
- Produit X200
- Support réseau
- Incident 784
- Fournisseur Gamma

La détection de communautés aide à identifier la structure globale du corpus.

Les résumés de communautés

Le système peut générer un résumé pour chaque groupe.

Exemple :

La communauté Orion rassemble le projet, son entreprise responsable, ses collaborateurs principaux et les contrats associés.

Ces résumés peuvent être utilisés pour répondre à des questions globales.

Recherche locale

Une recherche locale peut partir d’une entité.

Question :

Quels projets sont reliés à Marie Dupont ?

Le système explore :

Marie Dupont
  → travaille pour → Entreprise Alpha
  → participe à → Projet Orion
  → mentionnée dans → Rapport 2026

Il récupère ensuite les passages documentaires correspondants.

Recherche globale

Question :

Quels sont les principaux enjeux mentionnés dans les rapports du projet ?

Le système peut :

  1. identifier les communautés ;
  2. consulter leurs résumés ;
  3. comparer les thèmes ;
  4. produire une synthèse globale.

Recherche hybride

Une recherche hybride combine :

Cette approche est souvent plus robuste qu’une seule méthode.

Exemple : corpus d’entreprise

Une entreprise possède :

Question simple

Quel est le responsable du projet Orion ?

Une recherche documentaire peut suffire.

Question relationnelle

Quelles personnes liées au projet Orion travaillent également sur des contrats concernant le client Beta ?

Le graphe doit suivre :

Personne
  → participe à → Projet Orion
  → travaille sur → Contrat
  → concerne → Client Beta

Question globale

Quels groupes d’acteurs structurent l’ensemble des projets de l’entreprise ?

La détection de communautés devient pertinente.

Exemple : recherche scientifique

Un corpus contient :

Le graphe peut représenter :

Auteur → écrit → Article
Article → utilise → Méthode
Article → analyse → Jeu de données
Auteur → appartient à → Institution

GraphRAG peut répondre à :

Exemple : conformité

Le graphe peut relier :

Obligation → s’applique à → Activité
Activité → réalisée par → Service
Service → produit → Document
Document → satisfait → Contrôle

Question :

Quels services sont concernés par les obligations non encore couvertes par un document valide ?

Cette question nécessite plusieurs relations.

GraphRAG et ontologie

Une ontologie définit :

Sans modèle, un système peut produire des relations incohérentes :

Toulouse → travaille pour → Marie

L’ontologie peut imposer :

Personne → travaille pour → Organisation

Elle améliore donc la qualité du graphe.

GraphRAG et base de connaissances

GraphRAG peut être une composante d’une base de connaissances.

La base peut contenir :

GraphRAG et règles métier

Le graphe décrit les relations.

Les règles peuvent produire des conclusions.

Exemple :

Produit X200 → couvert par → Contrat Alpha
Contrat Alpha → statut → Expiré

Règle :

SI le contrat est expiré
ALORS la garantie standard ne s’applique pas.

Le moteur symbolique garantit une application plus stable que le LLM seul.

GraphRAG et LLM

Le LLM peut intervenir à plusieurs étapes.

Extraction

Il propose les entités et relations.

Normalisation

Il rapproche les variantes lexicales.

Résumé

Il résume les communautés ou chemins du graphe.

Traduction de requêtes

Il transforme une question en requête structurée.

Génération

Il rédige la réponse finale.

Explication

Il présente les chemins utilisés.

Le LLM ne doit cependant pas être le seul garant de la vérité du graphe.

Limites de GraphRAG

Coût de construction

Extraire et valider les relations demande du temps et des ressources.

Complexité

Le système contient davantage de composants qu’un RAG simple.

Erreurs d’extraction

Une relation incorrecte peut contaminer les réponses.

Résolution d’entités difficile

Les homonymes et variantes créent des erreurs.

Mise à jour

Le graphe doit évoluer avec les documents.

Explosion du volume

Un corpus important peut produire des millions de nœuds et relations.

Résumés imparfaits

Un résumé de communauté peut perdre des nuances.

Fausses relations

Deux entités mentionnées dans le même passage ne sont pas nécessairement reliées.

Coût des requêtes

Une exploration complexe du graphe peut être lente.

Quand GraphRAG est-il pertinent ?

GraphRAG apporte de la valeur lorsque :

Quand GraphRAG est-il inutilement complexe ?

Il peut être excessif lorsque :

Critères de décision

QuestionSi oui
La réponse nécessite-t-elle plusieurs documents ?GraphRAG peut aider
Les entités reviennent-elles souvent ?Le graphe devient pertinent
Les relations doivent-elles être expliquées ?Le graphe apporte de la traçabilité
Les questions portent-elles sur l’ensemble du corpus ?Les communautés peuvent être utiles
Les documents sont-ils simples et indépendants ?Un RAG classique peut suffire
Le budget de maintenance est-il limité ?Commencer plus simplement

Évaluer GraphRAG

Qualité des entités

Les personnes, organisations et concepts sont-ils correctement identifiés ?

Qualité des relations

Les relations sont-elles exactes ?

Résolution des identités

Les doublons et homonymes sont-ils correctement traités ?

Couverture

Le graphe contient-il les informations nécessaires ?

Provenance

Chaque relation est-elle reliée à une source ?

Qualité de la recherche

Le bon sous-graphe est-il récupéré ?

Qualité de la réponse

La réponse est-elle exacte et fidèle aux sources ?

Explication

Le système peut-il montrer le chemin suivi ?

Tests nécessaires

Test d’homonymie

Deux personnes portent le même nom.

Test de version

Une relation ancienne a été remplacée.

Test de contradiction

Deux documents divergent.

Test de chemin long

La réponse nécessite plusieurs relations.

Test de question globale

La réponse concerne plusieurs communautés.

Test d’absence

Le graphe ne contient pas suffisamment d’informations.

Sécurité

Les droits d’accès doivent s’appliquer :

Une relation entre deux entités peut révéler une information confidentielle, même si chaque entité est publique séparément.

Méthode minimale pour commencer

Étape 1

Choisir une question relationnelle précise.

Étape 2

Définir trois à cinq types d’entités.

Étape 3

Définir quelques relations utiles.

Étape 4

Extraire un petit corpus.

Étape 5

Valider manuellement un échantillon.

Étape 6

Tester les questions réelles.

Étape 7

Comparer les résultats avec un RAG simple.

Étape 8

Étendre uniquement si le graphe apporte une amélioration mesurable.

Erreurs fréquentes

Construire un graphe sans cas d’usage

Le résultat devient volumineux mais inutilisable.

Extraire toutes les relations possibles

La majorité ne sera pas utile.

Ne pas définir d’ontologie

Les types et relations deviennent incohérents.

Fusionner automatiquement les entités

Les homonymes peuvent être confondus.

Ne pas conserver les passages sources

Les réponses deviennent difficiles à vérifier.

Utiliser GraphRAG pour une question simple

Le coût n’est pas justifié.

Ne pas comparer avec un RAG classique

Il devient impossible de mesurer la valeur ajoutée.

Considérer les résumés comme des sources primaires

Un résumé peut omettre des détails importants.

À retenir

  1. GraphRAG combine documents, graphe et modèle de langage.
  2. Un RAG classique retrouve principalement des fragments.
  3. GraphRAG représente aussi les entités et leurs relations.
  4. Les triplets forment la structure du graphe.
  5. La résolution d’entités est essentielle.
  6. Les communautés aident à comprendre la structure globale du corpus.
  7. Les recherches locales partent d’une entité précise.
  8. Les recherches globales utilisent souvent des résumés de groupes.
  9. Une ontologie améliore la cohérence du graphe.
  10. GraphRAG est utile lorsque les réponses traversent plusieurs documents.
  11. Il ajoute des coûts de construction et de maintenance.
  12. Sa valeur doit être comparée à celle d’un RAG plus simple.

Vérifiez votre compréhension

Quelle différence existe-t-il entre RAG et GraphRAG ?

Le RAG retrouve principalement des fragments de documents. GraphRAG représente également les entités et leurs relations.

Qu’est-ce qu’une communauté dans un graphe ?

Un groupe d’entités fortement reliées entre elles.

Pourquoi résoudre les identités ?

Pour éviter les doublons et la fusion incorrecte d’entités différentes.

À quoi sert l’ontologie ?

Elle définit les types d’entités, les relations et les contraintes.

Quand GraphRAG apporte-t-il le plus de valeur ?

Lorsque la réponse nécessite plusieurs documents, des relations indirectes ou une vue globale du corpus.

Pourquoi conserver les sources ?

Pour vérifier les relations et justifier les réponses.

Questions fréquentes

GraphRAG remplace-t-il le RAG classique ?

Non. Il peut le compléter.

Faut-il toujours construire un graphe complet ?

Non. Un graphe ciblé sur les relations utiles suffit souvent.

Un LLM peut-il créer automatiquement le graphe ?

Il peut proposer les entités et relations, mais une validation est nécessaire.

GraphRAG est-il adapté aux petits corpus ?

Parfois, mais un RAG simple est souvent suffisant.

Peut-on utiliser une base de données graphe ?

Oui. Elle peut stocker les nœuds, relations et propriétés.

GraphRAG garantit-il des réponses exactes ?

Non. La qualité dépend du corpus, de l’extraction, du graphe, de la recherche et de la génération.

Continuer le parcours

Étape précédente

Knowledge Engineering, RAG et LLM

Étape suivante

La prochaine étape consiste à organiser l’ensemble de ces concepts dans une méthode complète de projet.

➡️ Méthode d’ingénierie des connaissances : les étapes d’un projet

Revenir au sommaire

Voir le parcours complet de Knowledge Engineering