Outils de Knowledge Engineering : quelles technologies utiliser ?

Les outils de Knowledge Engineering permettent de recueillir, structurer, représenter, stocker, interroger, valider et exploiter les connaissances.

Ils ne répondent pas tous au même besoin.

Un tableur peut suffire pour construire un premier vocabulaire. Un éditeur d’ontologie devient utile lorsque les concepts et les contraintes doivent être formalisés. Une base graphe permet de stocker des entités fortement reliées. Un moteur de règles applique des décisions explicites. Un index vectoriel facilite la recherche sémantique dans les documents.

Le choix d’un outil doit donc intervenir après la définition :

L’outil ne détermine pas la qualité du système. Il met en œuvre une représentation des connaissances qui doit d’abord être pensée.

Cette page prolonge la méthode d’ingénierie des connaissances.

Ce que vous allez comprendre

À la fin de cet article, vous saurez :

Commencer par les besoins, pas par les logiciels

Avant de choisir un outil, il faut préciser ce que le système devra accomplir.

BesoinOutil ou méthode possible
Recueillir le vocabulaireTableur, document partagé
Construire une taxonomieTableur, outil de taxonomie
Modéliser une ontologieProtégé, WebProtégé
Représenter des tripletsRDF
Définir des classes et contraintes logiquesOWL
Interroger un graphe RDFSPARQL
Valider la structure des données RDFSHACL
Stocker des entités fortement reliéesBase de données graphe
Appliquer des décisions explicitesMoteur de règles
Rechercher dans des documentsMoteur de recherche
Rechercher par similarité sémantiqueIndex vectoriel
Générer des réponses en langage naturelLLM
Relier documents, entités et relationsGraphRAG

Cette table ne constitue pas une correspondance absolue.

Un même projet peut combiner plusieurs technologies.

Les outils d’acquisition des connaissances

L’acquisition des connaissances ne nécessite pas immédiatement un logiciel spécialisé.

Les outils les plus simples sont souvent les plus efficaces pendant les premières étapes.

Le traitement de texte

Un document partagé permet de recueillir :

Il convient particulièrement à la phase d’exploration.

Le tableur

Un tableur permet de construire rapidement :

Exemple :

ConceptDéfinitionSynonymeSourceStatut
FormationProgramme destiné à développer une compétenceParcoursCatalogueValidé
SessionMise en œuvre datée d’une formationStageÉquipe pédagogiqueValidé

Le tableur devient limité lorsque :

Les cartes conceptuelles

Une carte conceptuelle permet de représenter visuellement :

Exemple :

Formation
  ├── développe → Compétence
  ├── exige → Prérequis
  ├── est animée par → Formateur
  └── est mise en œuvre dans → Session

Elle constitue souvent une bonne étape intermédiaire entre les entretiens et l’ontologie formelle.

Les outils d’analyse documentaire

Les outils d’analyse documentaire peuvent aider à :

Les LLM peuvent également proposer :

Le résultat doit rester relié aux documents d’origine et être vérifié.

Les outils de taxonomie

Une taxonomie peut être construite avec :

Les fonctions utiles comprennent :

SKOS

SKOS est un modèle utilisé pour représenter des vocabulaires contrôlés, des thésaurus et des systèmes de concepts.

Il permet notamment de distinguer :

Exemple conceptuel :

Concept : Graphe de connaissances
Terme préféré : Graphe de connaissances
Synonyme : Knowledge graph
Concept plus général : Représentation des connaissances
Concept associé : Ontologie

SKOS est souvent plus adapté qu’OWL lorsque l’objectif principal consiste à organiser un vocabulaire documentaire.

Les éditeurs d’ontologies

Un éditeur d’ontologie permet de définir :

Protégé Desktop

Protégé Desktop est un éditeur d’ontologies utilisé pour construire et gérer des modèles OWL.

Il permet notamment de :

Il convient aux projets nécessitant un contrôle direct et local du modèle.

WebProtégé

WebProtégé propose une interface accessible depuis un navigateur.

Il facilite notamment :

Le choix entre une application locale et une plateforme collaborative dépend de l’organisation du projet.

RDF

RDF, ou Resource Description Framework, est un modèle de représentation de l’information sous forme de graphe.

Il repose sur des affirmations de type :

Sujet → prédicat → objet

Exemple :

Marie → anime → Formation SEO
Formation SEO → développe → Compétence SEO

Les affirmations RDF peuvent être combinées pour former un graphe.

RDF facilite notamment :

RDFS

RDF Schema, ou RDFS, ajoute un vocabulaire permettant de décrire :

Exemple :

Formateur est une sous-classe de Personne.
anime possède pour domaine Formateur.
anime possède pour portée Session.

RDFS apporte une première couche de modélisation au-dessus de RDF.

OWL

OWL est un langage d’ontologie plus expressif.

Il permet notamment de représenter :

Exemple :

Toute formation avancée doit posséder au moins un prérequis.
Personne et Organisation sont des classes disjointes.

OWL devient pertinent lorsque le système doit effectuer des inférences ou contrôler un modèle conceptuel précis.

SPARQL

SPARQL est un langage permettant d’interroger des graphes RDF.

Une requête peut demander :

Exemple conceptuel :

SELECT ?formation
WHERE {
  ?formation :developpe :CompetenceSEO .
}

Le résultat contient les formations reliées à la compétence SEO.

SHACL

SHACL permet de définir des contraintes de validation appliquées à des graphes RDF.

Une forme SHACL peut indiquer :

Une session doit posséder exactement une date de début.
Une formation doit développer au moins une compétence.
Le prix doit être un nombre positif.

SHACL permet ensuite de produire un rapport indiquant :

OWL et SHACL ne remplissent pas exactement la même fonction.

Les raisonneurs

Un raisonneur analyse une ontologie et peut produire des conclusions implicites.

Exemple :

Formateur est une sous-classe de Personne.
Marie est une instance de Formateur.

Le raisonneur peut conclure :

Marie est une Personne.

Il peut également détecter certaines incohérences.

Exemple :

Personne et Organisation sont disjointes.
Entreprise Alpha est une Personne.
Entreprise Alpha est une Organisation.

Le modèle contient alors une contradiction.

Les bibliothèques RDF

Des bibliothèques logicielles permettent de manipuler RDF dans une application.

Elles peuvent fournir :

Exemples de familles d’outils :

Le choix dépend du langage utilisé pour construire l’application.

Les triplestores RDF

Un triplestore est une base conçue pour stocker et interroger des triplets RDF.

Il permet généralement :

Exemples de plateformes de cette famille :

Les bases graphes orientées propriétés

Une base graphe orientée propriétés représente :

Exemple :

Nœud : Marie
type : Personne
Marie -[TRAVAILLE_POUR depuis 2022]-> Entreprise Alpha

Cette approche convient bien aux parcours relationnels et aux applications opérationnelles.

Neo4j constitue un exemple connu de cette famille.

RDF ou graphe de propriétés ?

RDFGraphe de propriétés
Fondé sur des tripletsFondé sur des nœuds et relations
Utilise souvent SPARQLUtilise souvent un langage propre au moteur
Adapté aux standards sémantiquesAdapté aux parcours opérationnels
Facilite l’intégration de vocabulairesFacilite les propriétés sur les relations
Compatible avec OWL et SHACLCompatible avec des schémas spécifiques
Orienté interopérabilitéOrienté développement applicatif

Le choix dépend notamment :

Les moteurs de règles

Un moteur de règles exécute des règles du type :

SI conditions
ALORS conclusion ou action

Exemple :

SI le participant ne possède pas le niveau requis
ALORS recommander une formation préparatoire.

Les fonctions utiles comprennent :

Un moteur de règles peut être associé à une base de connaissances.

Les moteurs de recherche textuelle

Un moteur de recherche textuelle indexe :

Il convient notamment à :

La recherche par mots reste importante, même dans une architecture utilisant des embeddings.

Les bases et index vectoriels

Une base vectorielle stocke les représentations numériques de contenus.

Elle permet de rechercher des fragments proches sémantiquement.

Exemple :

voiture électrique

peut être rapproché de :

automobile alimentée par batterie

La recherche vectorielle est particulièrement utile pour :

Elle ne représente pas automatiquement :

Les outils LLM

Un LLM peut intervenir pour :

Il doit être relié à :

Le rôle des LLM est développé dans Knowledge Engineering, RAG et LLM.

Les outils GraphRAG

Une architecture GraphRAG peut combiner :

Il n’existe pas une seule architecture GraphRAG.

Le choix dépend du corpus et des questions.

Les outils de validation

La validation peut porter sur plusieurs niveaux.

Validation documentaire

Validation sémantique

Validation logique

Validation fonctionnelle

Les outils de test

Un système doit conserver un jeu de questions de référence.

Exemple :

Question :
Marie peut-elle suivre la formation avancée ?

Faits :
Marie possède le niveau débutant.
La formation exige le niveau intermédiaire.

Réponse attendue :
Non. Une formation préparatoire doit être recommandée.

Les tests peuvent être automatisés afin de détecter les régressions.

Les outils de gouvernance

La gouvernance nécessite souvent :

Une connaissance peut suivre :

Brouillon
  ↓
À valider
  ↓
Validée
  ↓
Publiée
  ↓
À réviser
  ↓
Obsolète

Les outils de documentation

Un projet doit documenter :

Le Markdown, les wikis et les générateurs de documentation peuvent suffire.

Construire une pile progressive

Il n’est pas nécessaire de commencer avec une infrastructure complexe.

Niveau 1 — Documentation structurée

Markdown
+
Tableur
+
Navigation
+
Recherche

Adapté à :

Niveau 2 — Base documentaire enrichie

Documents
+
Métadonnées
+
Taxonomie
+
Moteur de recherche

Adapté à :

Niveau 3 — RAG

Documents
+
Index vectoriel
+
Filtres
+
LLM

Adapté à :

Niveau 4 — Connaissances structurées

Ontologie
+
Graphe
+
Règles
+
Documents

Adapté à :

Niveau 5 — Architecture hybride

Documents
+
Index vectoriel
+
Graphe
+
Règles
+
LLM
+
Évaluation
+
Gouvernance

Adapté aux systèmes critiques ou fortement intégrés.

Exemple de choix pour un petit projet

Objectif :

Construire un assistant capable de répondre aux questions sur un catalogue de formations.

Première version :

Deuxième version :

Troisième version :

Cette progression évite la complexité prématurée.

Critères de sélection

Avant de retenir un outil, évaluez :

Le besoin fonctionnel

Que doit faire le système ?

Le niveau de formalisation

Faut-il seulement classer ou également raisonner ?

Le volume

Combien de documents, entités et relations ?

La collaboration

Combien de personnes modifieront le modèle ?

L’interopérabilité

Les connaissances doivent-elles être partagées entre plusieurs systèmes ?

La sécurité

Quels droits d’accès doivent être respectés ?

La maintenance

Qui assurera les mises à jour ?

Les compétences disponibles

L’équipe maîtrise-t-elle les technologies choisies ?

Le coût

Il faut prendre en compte :

Erreurs fréquentes

Choisir un outil avant le besoin

Le projet s’adapte ensuite artificiellement au logiciel.

Utiliser une ontologie pour une simple liste

Une taxonomie ou un tableur aurait suffi.

Utiliser uniquement un index vectoriel

Les règles et relations restent implicites.

Installer trop de composants

Chaque composant ajoute de la maintenance.

Négliger les standards

Le système devient difficile à migrer ou à intégrer.

Négliger l’expérience utilisateur

Une ontologie parfaite peut rester inutilisable.

Ne pas prévoir les tests

Les modifications peuvent dégrader les résultats.

Confier l’extraction entièrement à un LLM

Les erreurs deviennent difficiles à détecter.

À retenir

  1. Les outils doivent être choisis après le cas d’usage.
  2. Un traitement de texte et un tableur suffisent souvent pour commencer.
  3. Protégé et WebProtégé servent à construire des ontologies.
  4. RDF représente l’information sous forme de graphe.
  5. RDFS décrit des classes et des propriétés.
  6. OWL apporte une sémantique et des contraintes plus expressives.
  7. SPARQL permet d’interroger les graphes RDF.
  8. SHACL permet de valider leur structure.
  9. Une base graphe stocke efficacement les entités et leurs relations.
  10. Un index vectoriel permet la recherche sémantique.
  11. Un moteur de règles applique des décisions explicites.
  12. Une architecture hybride combine documents, graphes, règles et LLM.

Vérifiez votre compréhension

Quel outil utiliser pour commencer un glossaire ?

Un tableur peut suffire.

À quoi sert Protégé ?

À construire et modifier des ontologies, notamment en OWL.

Quelle différence existe-t-il entre RDF et OWL ?

RDF représente des affirmations sous forme de graphes. OWL permet de définir des ontologies plus expressives.

À quoi sert SPARQL ?

À interroger des données RDF.

À quoi sert SHACL ?

À vérifier que les données respectent des contraintes définies.

Quelle différence existe-t-il entre un graphe et un index vectoriel ?

Le graphe représente des relations explicites. L’index vectoriel représente principalement des proximités sémantiques.

Questions fréquentes

Faut-il utiliser Protégé pour tout projet ?

Non. Il devient pertinent lorsque le projet nécessite une ontologie explicite.

RDF est-il une base de données ?

Non. RDF est un modèle de représentation. Il peut être stocké dans un triplestore.

Peut-on utiliser Neo4j sans ontologie ?

Oui. Une ontologie améliore toutefois la cohérence d’un knowledge graph complexe.

Une base vectorielle est-elle une base de connaissances ?

Elle peut en constituer un composant, mais elle ne représente pas automatiquement les règles et relations métier.

Peut-on utiliser plusieurs outils ensemble ?

Oui. Les architectures hybrides sont fréquentes.

Quel est le meilleur outil ?

Celui qui répond au besoin avec le niveau de complexité minimal nécessaire.

Continuer le parcours

Étape précédente

Méthode d’ingénierie des connaissances

Étape suivante

La prochaine étape consiste à observer comment ces méthodes et outils sont utilisés dans des situations concrètes.

➡️ Cas d’usage du Knowledge Engineering

Revenir au sommaire

Voir le parcours complet de Knowledge Engineering