Base vectorielle vs graphe de connaissances : quelles différences ?
Une base vectorielle et un graphe de connaissances permettent tous les deux de retrouver des informations utiles à un système d’intelligence artificielle.
Ils ne représentent toutefois pas les connaissances de la même manière.
Une base vectorielle représente principalement la proximité sémantique entre des contenus.
Un graphe de connaissances représente explicitement des entités et les relations qui les unissent.
La différence peut être résumée ainsi :
Une base vectorielle indique quels contenus se ressemblent. Un graphe de connaissances indique comment les entités sont reliées.
Ces deux technologies ne sont pas concurrentes dans tous les projets. Elles sont souvent complémentaires.
Ce que vous allez comprendre
À la fin de cette page, vous saurez :
- définir une base vectorielle ;
- définir un graphe de connaissances ;
- distinguer similarité sémantique et relation explicite ;
- reconnaître les requêtes adaptées à chaque technologie ;
- comprendre leurs limites ;
- savoir comment les combiner dans un RAG ;
- choisir une architecture proportionnée au besoin.
Qu’est-ce qu’une base vectorielle ?
Une base vectorielle stocke des vecteurs numériques représentant des contenus.
Ces contenus peuvent être :
- des textes ;
- des images ;
- des documents ;
- des produits ;
- des utilisateurs ;
- des sons ;
- des concepts.
Un modèle transforme chaque contenu en une série de nombres appelée embedding.
Exemple simplifié :
"voiture électrique"
→ [0.12, 0.84, 0.31, ...]
"automobile alimentée par batterie"
→ [0.11, 0.81, 0.35, ...]
Les deux vecteurs sont proches.
Le système considère donc que les deux expressions possèdent un sens similaire.
À quoi sert une base vectorielle ?
Elle sert principalement à :
- rechercher des contenus similaires ;
- effectuer une recherche sémantique ;
- alimenter un RAG ;
- recommander des contenus ;
- détecter des doublons ;
- regrouper des documents ;
- retrouver des passages proches d’une question.
Exemple de recherche vectorielle
Question :
Comment recharger une automobile à batterie ?
La base peut retrouver un document intitulé :
Procédure de recharge des véhicules électriques
Les mots ne sont pas identiques, mais les significations sont proches.
Qu’est-ce qu’un graphe de connaissances ?
Un graphe de connaissances représente des entités et leurs relations.
Exemple :
Véhicule E200 → est un → Véhicule électrique
Véhicule E200 → utilise → Batterie B40
Batterie B40 → compatible avec → Chargeur C10
Chargeur C10 → utilise → Connecteur Type 2
Le graphe permet de parcourir les relations.
À quoi sert un graphe ?
Il sert notamment à :
- relier plusieurs sources ;
- représenter des dépendances ;
- répondre à des questions relationnelles ;
- identifier des chemins ;
- détecter des connexions ;
- recommander selon des règles ;
- expliquer une réponse ;
- intégrer des entités hétérogènes.
Proximité sémantique et relation explicite
La différence fondamentale se trouve ici.
Proximité sémantique
Une base vectorielle peut rapprocher :
formation SEO
cours de référencement naturel
apprentissage du positionnement Google
Elle considère ces contenus comme proches.
Elle ne sait pas automatiquement que :
Formation SEO avancée → exige → Niveau intermédiaire
Relation explicite
Le graphe représente directement :
Formation SEO avancée → exige → Compétence SEO intermédiaire
Formation SEO intermédiaire → développe → Compétence SEO intermédiaire
Le système peut alors construire un parcours.
Tableau comparatif
| Base vectorielle | Graphe de connaissances |
|---|---|
| Représente des vecteurs | Représente des nœuds et relations |
| Recherche la similarité | Recherche les connexions |
| Gère bien les variations lexicales | Gère bien les relations explicites |
| Utilise des embeddings | Utilise des entités et des triplets |
| Adaptée au RAG documentaire | Adaptée aux questions relationnelles |
| Moins explicable | Plus facilement explicable |
| Peut fonctionner sans schéma complexe | Bénéficie d’une ontologie |
| Tolère les formulations variées | Exige une modélisation |
| Fournit des scores de proximité | Fournit des chemins |
| Ne garantit pas la relation métier | Représente la relation métier |
Exemple dans la formation
Base vectorielle
Question :
Comment apprendre le référencement naturel à un niveau avancé ?
La base retrouve :
- formation SEO avancée ;
- guide de référencement ;
- programme de certification ;
- article sur les techniques SEO.
Elle sélectionne les contenus les plus proches.
Graphe de connaissances
Question :
Quel parcours Marie doit-elle suivre avant la certification SEO ?
Le graphe contient :
Marie → possède → Compétence SEO débutant
Formation intermédiaire → exige → Compétence SEO débutant
Formation intermédiaire → développe → Compétence SEO intermédiaire
Formation avancée → exige → Compétence SEO intermédiaire
Certification SEO → exige → Compétence SEO avancée
Le graphe construit le chemin :
Marie
↓
Formation intermédiaire
↓
Formation avancée
↓
Certification
Exemple dans le support technique
Base vectorielle
Question :
Le routeur perd souvent sa connexion.
La base retrouve des documents proches :
- perte de connexion ;
- instabilité réseau ;
- redémarrage du routeur ;
- diagnostic de synchronisation.
Graphe
Le graphe peut suivre :
Routeur X200
→ présente → Voyant rouge
→ peut indiquer → Perte de synchronisation
→ vérifiée par → Test de ligne
→ traitée par → Procédure 4.2
La base vectorielle retrouve les textes.
Le graphe structure le diagnostic.
Requêtes adaptées à une base vectorielle
Une base vectorielle convient bien aux requêtes comme :
- trouver des documents similaires ;
- retrouver un passage expliquant une notion ;
- rechercher avec des synonymes ;
- recommander un article proche ;
- retrouver une image semblable ;
- identifier les questions similaires ;
- rechercher dans un grand corpus textuel.
Requêtes adaptées à un graphe
Un graphe convient davantage aux questions comme :
- quelles personnes travaillent sur ce projet ?
- quels produits sont compatibles avec ce composant ?
- quelles formations précèdent cette certification ?
- quels contrats couvrent les produits de ce client ?
- quels incidents ont la même cause ?
- quelle source justifie cette relation ?
La précision des relations
Une base vectorielle peut rapprocher :
Paris
France
Lyon
Europe
Ces termes appartiennent à un espace sémantique proche.
Elle ne représente pas automatiquement :
Paris → capitale de → France
Lyon → située dans → France
France → située dans → Europe
Le graphe distingue précisément chaque relation.
La gestion des négations
Les embeddings peuvent avoir des difficultés à distinguer certaines phrases proches.
Exemples :
Le produit X est compatible avec le produit Y.
Le produit X n’est pas compatible avec le produit Y.
Les deux phrases partagent presque tous leurs mots.
Leur sens est pourtant opposé.
Un graphe peut représenter explicitement :
Produit X → incompatible avec → Produit Y
La gestion des exceptions
Règle générale :
Les chargeurs USB-C sont compatibles avec les appareils USB-C.
Exception :
Le modèle X100 nécessite un adaptateur spécifique.
Une base vectorielle peut retrouver les deux passages.
Le graphe et un moteur de règles peuvent représenter l’exception explicitement.
La dimension temporelle
Une relation peut évoluer.
Marie → travaille pour → Entreprise Alpha
avec :
date de début : 2022
date de fin : 2026
Le graphe peut représenter la période.
Une base vectorielle peut retrouver une ancienne mention sans comprendre automatiquement qu’elle n’est plus actuelle.
Des métadonnées sont donc nécessaires.
L’explicabilité
Base vectorielle
Le système peut indiquer :
Ce fragment a obtenu un score de similarité élevé.
Ce score n’explique pas nécessairement pourquoi le contenu répond à la question.
Graphe
Le système peut montrer :
Marie possède Compétence A.
Formation B exige Compétence A.
Formation B développe Compétence C.
Certification X exige Compétence C.
Le chemin justifie la recommandation.
La maintenance
Base vectorielle
Lorsqu’un document change, il faut généralement :
- remplacer le contenu ;
- recalculer son embedding ;
- mettre à jour l’index.
Graphe
Lorsqu’une connaissance change, il faut :
- identifier les entités concernées ;
- modifier les relations ;
- gérer les dates ;
- conserver la provenance ;
- vérifier les règles ;
- parfois recalculer les inférences.
Le graphe demande davantage de gouvernance.
Base vectorielle et RAG
Une architecture RAG classique utilise souvent :
Documents
↓
Fragments
↓
Embeddings
↓
Base vectorielle
↓
Recherche
↓
LLM
Cette architecture convient lorsque les réponses se trouvent dans des passages.
Graphe et GraphRAG
GraphRAG peut utiliser :
Documents
↓
Entités et relations
↓
Graphe
↓
Recherche relationnelle
↓
Fragments sources
↓
LLM
Le graphe aide à sélectionner les bonnes entités et les bonnes sources.
Architecture hybride
La combinaison la plus utile peut être :
Question
↓
Analyse
├── Recherche sémantique → Base vectorielle
├── Recherche relationnelle → Graphe
└── Recherche factuelle → Base structurée
↓
Fusion des résultats
↓
LLM
↓
Réponse avec sources
Exemple hybride
Question :
Quelle procédure s’applique au produit du client Alpha dont le contrat est encore valide ?
Le graphe identifie :
Client Alpha
→ possède → Contrat 458
→ couvre → Produit X200
Il vérifie :
Contrat 458 → statut → Actif
La base vectorielle retrouve :
Procédure de maintenance du produit X200
Le LLM formule la réponse.
Base vectorielle et ontologie
Une ontologie peut améliorer la recherche vectorielle.
Elle peut fournir :
- des synonymes ;
- des catégories ;
- des concepts ;
- des filtres ;
- des relations ;
- des types d’entités.
Exemple :
Knowledge graph
est relié à :
Graphe de connaissances
Le système peut utiliser ces termes pour enrichir la requête.
Graphe de connaissances et embeddings
Un graphe peut également utiliser des embeddings.
Les vecteurs peuvent représenter :
- les descriptions des nœuds ;
- les relations ;
- les sous-graphes ;
- les communautés ;
- les documents associés.
Il est donc possible de rechercher par similarité à l’intérieur d’un graphe.
Les limites des bases vectorielles
Résultats proches mais non pertinents
Deux contenus peuvent être sémantiquement proches sans répondre à la question.
Difficulté avec les relations précises
La proximité ne signifie pas :
- appartient à ;
- travaille pour ;
- est compatible avec ;
- précède ;
- cause.
Difficulté avec les contraintes
Une base vectorielle ne vérifie pas automatiquement les règles.
Explicabilité limitée
Un score de distance ne constitue pas une justification métier.
Gestion des versions
Les métadonnées doivent être bien organisées.
Les limites des graphes
Coût de modélisation
Il faut définir les entités et relations.
Extraction difficile
Les relations extraites automatiquement peuvent être fausses.
Résolution d’entités
Les homonymes et variantes doivent être traités.
Maintenance
Le graphe doit évoluer avec les sources.
Moins adapté au langage libre
Une requête mal formulée doit être transformée en requête structurée.
Volume
Un graphe très important peut devenir complexe à interroger.
Quand utiliser principalement une base vectorielle ?
Elle est adaptée lorsque :
- le corpus contient surtout du texte ;
- les utilisateurs posent des questions ouvertes ;
- les synonymes sont fréquents ;
- les réponses se trouvent dans des fragments ;
- le projet doit être rapidement prototypé ;
- les relations sont secondaires.
Quand utiliser principalement un graphe ?
Il est adapté lorsque :
- les relations sont centrales ;
- les entités sont stables ;
- les chemins doivent être expliqués ;
- les contraintes sont importantes ;
- plusieurs bases doivent être reliées ;
- les questions nécessitent plusieurs étapes.
Quand combiner les deux ?
La combinaison est pertinente lorsque :
- le corpus est documentaire et relationnel ;
- un LLM doit répondre à des questions complexes ;
- les utilisateurs formulent librement leurs demandes ;
- le système doit retrouver des textes et vérifier des relations ;
- des citations et explications sont nécessaires.
Matrice de décision
| Besoin | Base vectorielle | Graphe |
|---|---|---|
| Recherche par synonymes | Forte | Moyenne |
| Recherche dans des textes | Forte | Faible à moyenne |
| Relations explicites | Faible | Forte |
| Parcours multi-étapes | Faible | Forte |
| Prototype rapide | Forte | Moyenne |
| Explicabilité | Moyenne | Forte |
| Contraintes métier | Faible | Forte |
| Maintenance simple | Plus simple | Plus complexe |
| Questions globales | Moyenne | Forte |
| RAG documentaire | Forte | Complémentaire |
Méthode progressive
Étape 1 — Structurer les documents
Ajoutez :
- titres ;
- catégories ;
- dates ;
- versions ;
- sources.
Étape 2 — Construire une recherche textuelle
Vérifiez les besoins réels.
Étape 3 — Ajouter les embeddings
Testez la recherche sémantique.
Étape 4 — Identifier les échecs relationnels
Exemples :
- plusieurs documents à relier ;
- personnes à identifier ;
- parcours à reconstruire ;
- contrats à vérifier.
Étape 5 — Ajouter un petit graphe
Commencez par quelques entités et relations.
Étape 6 — Comparer les résultats
Le graphe doit produire une amélioration mesurable.
Erreurs fréquentes
Utiliser uniquement des embeddings pour des règles métier
La proximité sémantique ne remplace pas une règle.
Construire un graphe pour chaque mot
Seules les entités et relations utiles doivent être représentées.
Ignorer les métadonnées
Une base vectorielle sans date ni version peut retrouver des contenus obsolètes.
Confondre similarité et vérité
Un document proche n’est pas nécessairement correct.
Utiliser le graphe sans sources
Les relations deviennent invérifiables.
Opposer systématiquement les deux technologies
Elles sont souvent complémentaires.
À retenir
- Une base vectorielle représente la proximité sémantique.
- Un graphe représente des relations explicites.
- Les embeddings gèrent bien les variantes de langage.
- Les graphes gèrent bien les chemins et les dépendances.
- Une similarité ne constitue pas une relation métier.
- Les graphes offrent une meilleure explicabilité.
- Les bases vectorielles sont plus rapides à prototyper.
- Les graphes demandent davantage de modélisation.
- Un RAG utilise souvent une base vectorielle.
- GraphRAG combine graphes, documents et modèles de langage.
- Une architecture hybride peut utiliser les deux.
- Le choix doit dépendre des questions réelles.
Vérifiez votre compréhension
Quelle est la principale différence ?
La base vectorielle recherche des contenus proches. Le graphe recherche des entités reliées.
Qu’est-ce qu’un embedding ?
Une représentation numérique d’un contenu.
Pourquoi un embedding ne remplace-t-il pas une relation ?
Parce que la proximité sémantique ne précise pas la nature du lien.
Quel outil est adapté à un parcours de prérequis ?
Un graphe de connaissances est généralement plus adapté.
Quel outil est adapté à une recherche documentaire ouverte ?
Une base vectorielle est souvent plus efficace.
Peut-on utiliser les deux ?
Oui. La base vectorielle retrouve les textes et le graphe représente les relations.
Questions fréquentes
Une base vectorielle est-elle une base de connaissances ?
Elle peut en constituer un composant, mais elle ne représente pas automatiquement les règles et relations.
Un graphe peut-il effectuer une recherche sémantique ?
Oui, notamment si les nœuds possèdent des embeddings ou des descriptions indexées.
Une base vectorielle comprend-elle les négations ?
Pas toujours de manière fiable. Les phrases proches lexicalement peuvent recevoir des vecteurs proches malgré un sens opposé.
Faut-il une ontologie pour construire un graphe ?
Elle n’est pas obligatoire, mais elle améliore la cohérence.
Quelle solution coûte le moins cher ?
Une base vectorielle est généralement plus rapide à mettre en œuvre. Le coût dépend ensuite du volume et des requêtes.
Quelle architecture utiliser pour un assistant métier ?
Souvent une architecture hybride associant documents, métadonnées, recherche vectorielle, graphe et règles.
Continuer
Comprendre les graphes de connaissances