Résumé
Le sujet de ma thèse concerne l’étude des structures d’indexation et les méthodes de compression de données pour palier au problème d’indexation d’une collection de génomes similaires.Le but ultime est d’appliquer ces méthodes à l’indexation des génomes du riz afin de faciliter l’analyse de l’ensemble des études et activités du projet GenomeHarvest. Comme par exemple l’impact de leurs variations structurelles sur les taux de recombinaison, les études des fréquences allèliques, les études GWAS, etc.L’indexation de génomes complets est une étape importante dans l’exploration et la compréhension des données d’organismes vivants. Un index devrait fournir une réponse rapide aux questions suivantes :- Combien de fois un motif donné apparaît dans une collection de génomes ?- Quelles sont les positions et les génomes porteurs d’un motif donné ?- Quelle est la longueur du motif à la position i pour un génome donné ?C’est ce que nous avons réalisé grâce à cette thèse, nous avons réfléchi, proposés un algorithme. Une fois l’algorithme trouvé, nous avons implémenté cet algorithme sous forme d’un logiciel qui permet l’indexation d’une large collection de génome et son requêtage.