Projet 01 / Recherche en cours

Extraction de connaissances par IA pour le désassemblage aéronautique

Une chaîne de traitement de bout en bout qui transforme des manuels de maintenance aéronautique historiques en connaissances structurées et traçables pour accompagner intelligemment les opérations de fin de vie.

  • Python
  • OCR
  • LayoutLMv3
  • Faster R-CNN
  • PostgreSQL
  • Docker
  • OWL
AMM

DOCUMENT → CONNAISSANCE

01 / Le problème

Des connaissances critiques, enfermées dans des documents pensés pour l’humain.

Les aéronefs en fin de vie s’accompagnent d’un riche savoir de maintenance, dont une grande partie reste contenue dans des manuels numérisés. L’AMM du Cessna 206, premier corpus étudié, compte environ 1 390 pages mêlant procédures, figures, tableaux, avertissements et informations structurelles.

La difficulté ne se limite pas à l’OCR. Il faut reconstruire le sens et la traçabilité à partir de la mise en page, de la hiérarchie et du contexte entre les pages.

Comment transformer une documentation de maintenance historique en connaissances structurées, exploitables par des systèmes intelligents de désassemblage ?

02 / Vision système

De la page du manuel à l’assistance au désassemblage.

01Manuel de maintenance
02OCR + coordonnées spatiales
03LayoutLMv3 + Faster R-CNN
04Reconstruction de la hiérarchie documentaire
05Extraction des connaissances
06Ontologie / Graphe de connaissances
07Représentation numérique de l’aéronef
08Assistance au désassemblage

03 / Intelligence documentaire

Une chaîne de lecture multimodale.

L’OCR préserve les mots et leurs coordonnées. LayoutLMv3 classe les régions textuelles tandis que Faster R-CNN détecte les figures et tableaux. Leurs sorties sont fusionnées pour reconstruire la logique du document.

350Pages d’entraînement
80Pages de test
15Classes
4 000+AnnotationsValeur approximative ; jeu de données évolutif

Jeu de données annoté

Une distribution de classes à longue traîne.

Le déséquilibre fait partie du problème d’ingénierie : les opérations fréquentes coexistent avec des avertissements, tableaux et titres de section rares.

Sous-information842
Opération801
Information322
En-tête de section252
Numéro de page218
Note180
Sous-titre du sommaire157
Étape148
Titre de page83
Attention72
Figure52
Titre du sommaire44
Avertissement32
Tableau27
Titre de section16

Résultats d’entraînement

Le score F1 de détection des atteint 0,922.

Mesuré à 2000 étapes d’entraînement, contre 0,046 à 100 étapes. C’est une progression, pas encore un benchmark final.

10,40,0
100 étapes3005002000 étapes

04 / Éléments visuels

Faster R-CNN, adapté à la géométrie des AMM.

Les figures et tableaux nécessitent un détecteur visuel dédié. Les tailles d’ancres sont ajustées à partir des statistiques des boîtes englobantes : dimensions, rapports d’aspect et positions récurrentes dans les pages.

  • Dimensionnement des ancres propre au jeu de données
  • Analyse de la géométrie des pages
  • Détection des figures et tableaux
  • Fusion avec les régions textuelles
TITRE DE PAGEAVERTISSEMENTFIGUREOPÉRATION
Vue illustrative du système — aucun document propriétaire

05 / Reconstruction de la structure

La détection n’est qu’un début.

Les blocs détectés sont réordonnés et rattachés à leurs parents sémantiques, transformant des régions de page à plat en connaissances opérationnelles.

Procédure
InformationAvertissementÉtape 01
OpérationOpérationNote
Étape 02
Opération

06 / Ontologie & aéronef numérique

Des connaissances structurées, pas seulement du texte extrait.

Protégé / WebProtégé modélise la structure physique, la connaissance des processus, les outils, les emplacements et les risques. B1 capture le savoir générique de la documentation ; B2 ajoutera l’état observé propre à chaque aéronef.

STRUCTURE PHYSIQUEAéronefSystèmeSous-systèmeComposant
+
CONNAISSANCE DU PROCESSUSProcédureÉtapeOpérationOutils · Risques · Emplacement
REPRÉSENTATION NUMÉRIQUEB1 + B2Connaissances prêtes à éclairer la décision

07 / Plateforme logicielle

Une architecture reproductible autour des modèles.

  • Laravel
  • PostgreSQL
  • Python
  • Docker
  • GitHub
  • OWL
01Interface web / Laravel
02Couche de données PostgreSQL
03Services IA Python
04Couche ontologique

Limites

Ce qui reste à résoudre.

  • Un seul corpus AMM
  • Jeu de données annoté limité
  • Perte de contexte entre les fenêtres de tokens
  • Limite de 512 tokens et coût du recouvrement
  • Extraction des relations sémantiques incomplète
  • Pas de jeu de données complet sur l’état réel d’un aéronef
  • Comparaison limitée avec des modèles VLM de référence

Suite

Vers la validation industrielle.

  • Jeu de données multi-AMM
  • Comparaison d’architectures VLM
  • Extraction automatique des relations
  • Intégration de l’état de l’aéronef
  • Instanciation complète de l’ontologie
  • Assistance à l’opérateur
  • Évaluation industrielle
Projet suivant / 02Sisyfbots