Projet 01 / Recherche en cours
Extraction de connaissances par IA pour le désassemblage aéronautique
Une chaîne de traitement de bout en bout qui transforme des manuels de maintenance aéronautique historiques en connaissances structurées et traçables pour accompagner intelligemment les opérations de fin de vie.
- Python
- OCR
- LayoutLMv3
- Faster R-CNN
- PostgreSQL
- Docker
- OWL
DOCUMENT → CONNAISSANCE
01 / Le problème
Des connaissances critiques, enfermées dans des documents pensés pour l’humain.
Les aéronefs en fin de vie s’accompagnent d’un riche savoir de maintenance, dont une grande partie reste contenue dans des manuels numérisés. L’AMM du Cessna 206, premier corpus étudié, compte environ 1 390 pages mêlant procédures, figures, tableaux, avertissements et informations structurelles.
La difficulté ne se limite pas à l’OCR. Il faut reconstruire le sens et la traçabilité à partir de la mise en page, de la hiérarchie et du contexte entre les pages.
Comment transformer une documentation de maintenance historique en connaissances structurées, exploitables par des systèmes intelligents de désassemblage ?
02 / Vision système
De la page du manuel à l’assistance au désassemblage.
03 / Intelligence documentaire
Une chaîne de lecture multimodale.
L’OCR préserve les mots et leurs coordonnées. LayoutLMv3 classe les régions textuelles tandis que Faster R-CNN détecte les figures et tableaux. Leurs sorties sont fusionnées pour reconstruire la logique du document.
Jeu de données annoté
Une distribution de classes à longue traîne.
Le déséquilibre fait partie du problème d’ingénierie : les opérations fréquentes coexistent avec des avertissements, tableaux et titres de section rares.
Résultats d’entraînement
Le score F1 de détection des atteint 0,922.
Mesuré à 2000 étapes d’entraînement, contre 0,046 à 100 étapes. C’est une progression, pas encore un benchmark final.
04 / Éléments visuels
Faster R-CNN, adapté à la géométrie des AMM.
Les figures et tableaux nécessitent un détecteur visuel dédié. Les tailles d’ancres sont ajustées à partir des statistiques des boîtes englobantes : dimensions, rapports d’aspect et positions récurrentes dans les pages.
- Dimensionnement des ancres propre au jeu de données
- Analyse de la géométrie des pages
- Détection des figures et tableaux
- Fusion avec les régions textuelles
05 / Reconstruction de la structure
La détection n’est qu’un début.
Les blocs détectés sont réordonnés et rattachés à leurs parents sémantiques, transformant des régions de page à plat en connaissances opérationnelles.
06 / Ontologie & aéronef numérique
Des connaissances structurées, pas seulement du texte extrait.
Protégé / WebProtégé modélise la structure physique, la connaissance des processus, les outils, les emplacements et les risques. B1 capture le savoir générique de la documentation ; B2 ajoutera l’état observé propre à chaque aéronef.
07 / Plateforme logicielle
Une architecture reproductible autour des modèles.
- Laravel
- PostgreSQL
- Python
- Docker
- GitHub
- OWL
Limites
Ce qui reste à résoudre.
- Un seul corpus AMM
- Jeu de données annoté limité
- Perte de contexte entre les fenêtres de tokens
- Limite de 512 tokens et coût du recouvrement
- Extraction des relations sémantiques incomplète
- Pas de jeu de données complet sur l’état réel d’un aéronef
- Comparaison limitée avec des modèles VLM de référence
Suite
Vers la validation industrielle.
- Jeu de données multi-AMM
- Comparaison d’architectures VLM
- Extraction automatique des relations
- Intégration de l’état de l’aéronef
- Instanciation complète de l’ontologie
- Assistance à l’opérateur
- Évaluation industrielle