Graphe de connaissances : comment relier les informations d’un domaine ?

Un graphe de connaissances représente des entités et les relations qui les unissent.

Les personnes, les entreprises, les produits, les lieux, les documents, les événements ou les concepts sont représentés sous forme de nœuds. Les liens entre ces éléments sont représentés sous forme de relations.

Exemple :

Marie → travaille pour → Entreprise Alpha
Entreprise Alpha → est située à → Toulouse
Marie → possède → Compétence SEO
Compétence SEO → appartient à → Marketing numérique

Cette structure permet au système de parcourir les relations, de réunir des informations provenant de plusieurs sources et de répondre à des questions qui dépassent la simple recherche par mots-clés.

Un graphe de connaissances transforme une collection d’informations isolées en un réseau d’entités reliées et interprétables.

Ce que vous allez comprendre

À la fin de cet article, vous saurez :

Qu’est-ce qu’un graphe de connaissances ?

Un graphe de connaissances est une structure qui représente :

Il utilise généralement une représentation de type :

Sujet → relation → objet

Cette structure est parfois appelée triplet.

Exemple :

Marie → travaille pour → Entreprise Alpha

Le sujet est :

Marie

La relation est :

travaille pour

L’objet est :

Entreprise Alpha

Un ensemble de triplets forme progressivement un réseau de connaissances.

Exemple simple

Marie → travaille pour → Entreprise Alpha
Entreprise Alpha → est située à → Toulouse
Marie → possède → Compétence SEO
Compétence SEO → est requise par → Formation SEO avancé
Formation SEO avancé → est animée par → Paul

Ce graphe permet de répondre à plusieurs questions :

La réponse ne se trouve pas nécessairement dans un seul document. Elle peut être reconstruite en parcourant plusieurs relations.

Les composants d’un graphe de connaissances

Les nœuds

Un nœud représente généralement une entité ou un concept.

Exemples :

Un nœud doit posséder une identité suffisamment claire.

Les relations

Une relation relie deux nœuds.

Exemples :

travaille pour
est situé à
possède
développe
concerne
est compatible avec

Une relation doit être plus précise que :

est lié à

Une relation vague apporte peu de valeur.

Les propriétés

Les nœuds et les relations peuvent posséder des propriétés.

Exemple :

Entreprise Alpha
├── nom : Entreprise Alpha
├── secteur : Formation
├── ville : Toulouse
└── année de création : 2012

Une relation peut également avoir des propriétés :

Marie → travaille pour → Entreprise Alpha
├── date de début : 2022
├── fonction : Responsable marketing
└── statut : Actif

Ces propriétés permettent de représenter davantage de contexte.

Les types

Les entités peuvent être associées à des types.

Marie
  └── type → Personne
Entreprise Alpha
  └── type → Organisation
Toulouse
  └── type → Ville
Formation SEO
  └── type → Formation

Les types peuvent être définis dans une ontologie informatique.

Le rôle de l’ontologie

L’ontologie définit généralement :

Le graphe contient les entités concrètes.

Ontologie

Une personne travaille pour une organisation.
Une organisation est située dans un lieu.
Une formation développe une compétence.

Graphe

Marie → travaille pour → Entreprise Alpha
Entreprise Alpha → est située à → Toulouse
Formation SEO → développe → Compétence SEO

L’ontologie décrit le modèle.

Le graphe décrit les faits.

Graphe de connaissances et base de données graphe

Ces deux notions sont proches, mais différentes.

Base de données graphe

Une base de données graphe est une technologie permettant de stocker et interroger des données sous forme de nœuds et de relations.

Elle peut contenir :

Graphe de connaissances

Un graphe de connaissances ajoute généralement une dimension sémantique.

Il cherche à représenter :

Une base de données graphe est un outil technique.

Un graphe de connaissances est un modèle organisé du savoir.

Un graphe de connaissances peut être stocké dans une base de données graphe, mais les deux termes ne sont pas synonymes.

Graphe de connaissances et base de connaissances

Une base de connaissances peut prendre plusieurs formes.

Elle peut contenir :

Le graphe de connaissances constitue donc une forme possible de base de connaissances, ou une partie de celle-ci.

Exemple dans la formation

Imaginons un système destiné à recommander des parcours pédagogiques.

Entités

Marie
Compétence SEO
Formation SEO débutant
Formation SEO intermédiaire
Formation SEO avancé
Certification SEO

Relations

Marie → possède → Compétence SEO débutant
Formation SEO intermédiaire → exige → Compétence SEO débutant
Formation SEO intermédiaire → développe → Compétence SEO intermédiaire
Formation SEO avancé → exige → Compétence SEO intermédiaire
Certification SEO → exige → Compétence SEO avancé

Le système peut déduire un parcours :

Marie
  ↓
Formation SEO intermédiaire
  ↓
Formation SEO avancé
  ↓
Certification SEO

Le graphe facilite la recommandation en reliant les compétences, les niveaux, les formations et les certifications.

Exemple dans le support technique

Entités

Incident 458
Routeur X200
Voyant rouge
Perte de synchronisation
Test de ligne
Procédure de réinitialisation
Technicien Paul

Relations

Incident 458 → concerne → Routeur X200
Incident 458 → présente → Voyant rouge
Voyant rouge → peut indiquer → Perte de synchronisation
Perte de synchronisation → est vérifiée par → Test de ligne
Perte de synchronisation → peut être traitée par → Procédure de réinitialisation
Technicien Paul → possède la compétence → Diagnostic réseau

Le système peut recommander :

Comment construire un graphe de connaissances ?

1. Définir les questions

Le graphe doit répondre à des questions précises.

Exemples :

2. Définir le périmètre

Il faut déterminer ce qui sera représenté.

Un graphe de produits n’a pas nécessairement besoin de contenir toute l’histoire de l’entreprise.

3. Identifier les sources

Les données peuvent provenir :

Les méthodes d’acquisition des connaissances permettent de structurer cette phase.

4. Définir le modèle

Le modèle précise :

Cette étape peut s’appuyer sur une ontologie.

5. Extraire les entités

Depuis un texte comme :

Marie Dupont anime la formation SEO avancé organisée par Entreprise Alpha à Toulouse.

Le système peut extraire :

Marie Dupont → Personne
Formation SEO avancé → Formation
Entreprise Alpha → Organisation
Toulouse → Ville

6. Extraire les relations

Marie Dupont → anime → Formation SEO avancé
Formation SEO avancé → est organisée par → Entreprise Alpha
Entreprise Alpha → est située à → Toulouse

7. Résoudre les identités

Une même entité peut apparaître sous plusieurs formes.

Exemple :

Entreprise Alpha
Alpha SAS
Alpha
Société Alpha

Le système doit déterminer s’il s’agit de la même organisation.

Cette opération est appelée résolution d’entités ou réconciliation d’identités.

8. Fusionner les informations

Plusieurs sources peuvent fournir des informations complémentaires.

Source A :

Entreprise Alpha est située à Toulouse.

Source B :

Alpha SAS emploie Marie Dupont.

Si les deux noms correspondent à la même entité, les informations peuvent être réunies.

9. Ajouter les sources

Chaque fait important doit être relié à sa provenance.

Exemple :

Fait :
Marie travaille pour Entreprise Alpha.

Source :
Annuaire interne 2026.

Date :
12 juillet 2026.

Niveau de confiance :
Élevé.

10. Valider le graphe

Il faut tester :

La résolution d’entités

La résolution d’entités constitue l’une des difficultés principales.

Un système peut rencontrer :

Jean Dupont
J. Dupont
Jean P. Dupont
M. Dupont

Il doit déterminer :

Plusieurs critères peuvent être utilisés :

Une fusion incorrecte peut contaminer une grande partie du graphe.

La gestion des synonymes

Plusieurs termes peuvent désigner le même concept.

Exemple :

voiture
automobile
véhicule particulier

Le graphe peut conserver :

Cette gestion facilite la recherche et l’interprétation.

La provenance

Un graphe fiable doit conserver la provenance des connaissances.

Il faut pouvoir répondre à la question :

D’où vient cette information ?

Exemple :

Marie → travaille pour → Entreprise Alpha

peut provenir :

Les sources ne possèdent pas toutes la même fiabilité.

Le temps et la validité

Une relation peut être vraie pendant une période déterminée.

Exemple :

Marie → travaille pour → Entreprise Alpha

avec :

date de début : janvier 2022
date de fin : mars 2026

Sans dimension temporelle, le graphe peut présenter une ancienne relation comme actuelle.

Le temps est particulièrement important pour :

Le niveau de confiance

Certaines connaissances sont certaines.

D’autres sont probables ou contestées.

Exemple :

Voyant rouge → peut indiquer → Perte de synchronisation

Cette relation n’est pas une certitude.

Elle peut posséder :

niveau de confiance : 0,75

ou :

statut : hypothèse

Le graphe doit distinguer :

Les relations contradictoires

Deux sources peuvent affirmer :

Entreprise Alpha est située à Toulouse.

et :

Entreprise Alpha est située à Bordeaux.

Plusieurs explications sont possibles :

Le système ne doit pas supprimer automatiquement la contradiction.

Il doit conserver le contexte et la provenance.

Interroger un graphe

Un graphe peut être interrogé de plusieurs manières.

Navigation directe

Exemple :

Marie
  ↓ travaille pour
Entreprise Alpha
  ↓ située à
Toulouse

Requête relationnelle

Question :

Quelles personnes possèdent une compétence SEO et travaillent pour une entreprise située à Toulouse ?

Le système suit plusieurs relations :

Personne
  → possède → Compétence SEO
  → travaille pour → Entreprise
  → située à → Toulouse

Langage de requête

Selon la technologie utilisée, le graphe peut être interrogé avec :

L’utilisateur n’a pas nécessairement besoin de connaître le langage technique. Un LLM peut convertir une question en requête structurée.

Les principaux usages

Recherche sémantique

Le graphe permet de rechercher par concepts et relations, et pas uniquement par mots.

Recommandation

Il peut recommander :

Détection de relations

Il peut révéler des connexions indirectes entre plusieurs entités.

Intégration de données

Il permet de relier plusieurs bases utilisant des structures ou vocabulaires différents.

Assistance à la décision

Il peut fournir les faits, règles et sources nécessaires à une décision.

Conformité

Il peut relier :

Gestion des compétences

Il peut relier :

Graphe de connaissances et LLM

Un LLM peut interagir avec un graphe de connaissances de plusieurs manières.

Extraire des entités

Le modèle peut identifier les personnes, lieux, organisations et concepts présents dans un texte.

Proposer des relations

Il peut suggérer :

Marie → travaille pour → Entreprise Alpha

Traduire une question en requête

Question :

Quelles formations peuvent conduire à la certification X ?

Le modèle peut construire une requête sur les relations :

Formation → développe → Compétence
Certification X → exige → Compétence

Générer une réponse

Le graphe fournit les faits.

Le LLM les transforme en réponse lisible.

Expliquer une réponse

Le système peut présenter le chemin suivi :

Marie possède Compétence A.
Formation B exige Compétence A.
Formation B développe Compétence C.
Certification X exige Compétence C.

Conclusion :

Formation B constitue une étape pertinente pour Marie.

RAG et graphe de connaissances

Un système RAG classique recherche généralement des fragments de documents.

Exemple :

Question
  ↓
Recherche vectorielle
  ↓
Fragments pertinents
  ↓
Réponse du LLM

Cette méthode est efficace lorsque la réponse se trouve dans quelques passages.

Elle devient moins performante lorsque la question exige de relier :

GraphRAG

GraphRAG ajoute un graphe de connaissances au processus.

Documents
  ↓
Extraction des entités et relations
  ↓
Construction du graphe
  ↓
Recherche dans le graphe et les textes
  ↓
Réponse du LLM

Le graphe aide le système à comprendre la structure générale du corpus.

Cette approche est étudiée dans la page GraphRAG.

Exemple : assistant documentaire

Une entreprise possède :

Un RAG classique peut retrouver les passages proches de la question.

Un graphe peut également relier :

Document → concerne → Produit
Document → mentionne → Incident
Incident → affecte → Client
Produit → est couvert par → Contrat
Contrat → impose → Délai d’intervention

Le système peut alors répondre à une question nécessitant plusieurs sources :

Quel délai d’intervention s’applique à l’incident affectant le produit du client Alpha ?

Qualité d’un graphe de connaissances

Un graphe de qualité doit posséder plusieurs caractéristiques.

Identités fiables

Les doublons et confusions doivent être limités.

Relations précises

Les relations doivent être clairement définies.

Provenance conservée

Chaque information importante doit être reliée à sa source.

Dimension temporelle

Les faits susceptibles d’évoluer doivent posséder des dates.

Cohérence

Le graphe doit respecter les contraintes du modèle.

Couverture suffisante

Il doit contenir les entités et relations nécessaires aux cas d’usage.

Mise à jour

Les données anciennes doivent être corrigées ou marquées comme obsolètes.

Explicabilité

Le système doit pouvoir montrer le chemin conduisant à une réponse.

Erreurs fréquentes

Confondre graphe et simple diagramme

Un schéma visuel n’est pas nécessairement un graphe exploitable par un système.

Utiliser des relations vagues

est lié à

ne précise pas la nature du lien.

Ignorer les identités

Deux noms proches ne désignent pas toujours la même entité.

Fusionner automatiquement les doublons

Une fusion incorrecte peut créer de fausses relations.

Oublier les sources

Un fait sans provenance est difficile à vérifier.

Oublier les dates

Une ancienne information peut être interprétée comme actuelle.

Considérer toutes les relations comme certaines

Certaines relations sont probables ou hypothétiques.

Créer un graphe sans questions précises

Le graphe risque de devenir volumineux mais inutilisable.

Confondre ontologie et graphe

L’ontologie définit le modèle. Le graphe contient les faits.

Laisser un LLM créer le graphe sans validation

Le modèle peut inventer des entités ou des relations.

Méthode minimale pour commencer

Étape 1

Choisir une question précise.

Exemple :

Quelles formations permettent d’acquérir une compétence donnée ?

Étape 2

Identifier les types d’entités.

Formation
Compétence
Participant
Certification

Étape 3

Définir les relations.

développe
possède
exige
valide

Étape 4

Créer quelques triplets.

Formation SEO → développe → Compétence SEO
Certification X → exige → Compétence SEO
Marie → possède → Compétence marketing

Étape 5

Tester des questions réelles.

Étape 6

Ajouter les sources et les dates.

Étape 7

Étendre progressivement le graphe.

Cette approche évite de construire un modèle trop large dès le départ.

À retenir

  1. Un graphe de connaissances représente des entités et leurs relations.
  2. Les connaissances sont souvent exprimées sous forme de triplets.
  3. Les nœuds représentent des entités ou des concepts.
  4. Les relations décrivent les liens entre les nœuds.
  5. Les propriétés ajoutent des informations aux entités et aux relations.
  6. L’ontologie définit souvent le modèle conceptuel du graphe.
  7. Une base de données graphe est une technologie, tandis qu’un graphe de connaissances possède une dimension sémantique.
  8. La résolution d’entités évite les doublons et les confusions.
  9. La provenance, les dates et le niveau de confiance sont essentiels.
  10. Un graphe peut relier des informations provenant de plusieurs documents.
  11. Les LLM peuvent interroger ou enrichir un graphe, mais leurs propositions doivent être validées.
  12. GraphRAG associe les graphes de connaissances aux modèles de langage.

Vérifiez votre compréhension

Qu’est-ce qu’un triplet ?

Un triplet est une affirmation organisée sous la forme sujet, relation, objet.

Qu’est-ce qu’un nœud ?

Un nœud représente une entité ou un concept.

Quelle différence existe-t-il entre ontologie et graphe ?

L’ontologie définit les concepts et relations possibles. Le graphe contient les entités concrètes et les relations observées.

Quelle différence existe-t-il entre base graphe et graphe de connaissances ?

La base graphe est une technologie de stockage. Le graphe de connaissances cherche à représenter explicitement le sens des données.

Pourquoi faut-il résoudre les identités ?

Pour éviter que la même entité soit représentée plusieurs fois ou que deux entités différentes soient fusionnées.

Pourquoi conserver les sources ?

Pour vérifier la fiabilité, l’origine et la date de chaque connaissance.

Quel rôle joue un graphe dans GraphRAG ?

Il permet au système de relier plusieurs entités et documents avant de produire une réponse.

Questions fréquentes

Un graphe de connaissances doit-il contenir une ontologie ?

Non, mais une ontologie améliore généralement la cohérence et la compréhension du graphe.

Un graphe peut-il contenir des documents ?

Il peut représenter les documents comme des entités et les relier à leurs auteurs, sujets, dates et concepts.

Peut-on créer un graphe à partir de textes ?

Oui. Des outils de traitement du langage et des LLM peuvent extraire des entités et relations, sous réserve de validation.

Un graphe de connaissances remplace-t-il une base de données ?

Non. Il peut compléter ou intégrer plusieurs bases de données.

Quelle taille peut avoir un graphe ?

Il peut contenir quelques dizaines ou plusieurs milliards d’entités. La taille dépend du cas d’usage et de l’infrastructure.

Un graphe améliore-t-il toujours un RAG ?

Non. Il apporte surtout de la valeur lorsque les réponses exigent des relations, des parcours ou une compréhension globale du corpus.

Continuer le parcours

Étape précédente

Ontologie informatique : définition et construction

Étape suivante

La prochaine étape consiste à comprendre comment une base de connaissances peut réunir des graphes, des règles, des documents et des sources.

➡️ Base de connaissances : définition, structure et fonctionnement

Revenir au sommaire

Voir le parcours complet de Knowledge Engineering