Résumé
IMGT® est, à ce jour, la référence internationale dans le domaine de l’immunoinformatique intégrant les connaissances immunogénétiques du gène à la protéine. Il propose ainsi l’accès à sept bases de données relationnelles, de 17 outils d'analyse et de très nombreuses ressources en pages web. Compte tenu de la complexité et de la nature connectée des entités immunogénétiques, un besoin d’intégrer les différentes bases de données d’IMGT afin de répondre à des questions biologiques complexes impliquant différentes bases de données, mais également pour découvrir de nouvelles connaissances ou des connaissances insoupçonnées. Les graphes de connaissance (GC) sont des modèles ontologiques qui décrivent les entités d'intérêt dans un domaine et les relations entre elles. Ils permettent l’intégration et la fédération des connaissances de diverses sources de données. Aujourd'hui, ces graphes sont les clés pour obtenir un Web structuré avec données et connaissances interopérables, réutilisables et accessibles, concept nommé FAIR.Cette thèse a permis la mise en place d’IMGT-KG, le premier GC FAIR en immunogénétique intégrant cinq bases de données d’IMGT : celle de séquences nucléotidiques, de gène, des structures 2D et 3D et celle dédiée aux anticorps monoclonaux thérapeutiques (mAbs). En plus ce GC est lié à d’autres référentiels du domaine biomédical tel que NCIT, NCBITaxon, PharmgKB, IEDB etc. Par la suite, ce GC a été exploité afin de mettre en place des applications de machine learning comme la génération d’hypothèses scientifiques dans le domaine des mAbs afin de réutiliser des mAbs dans nouvelles indications cliniques. Ces hypothèses devront être validées in vitro ou in vivo par les spécialistes.