Résumé
Le séquençage à haut débit a fourni un vaste jeu de données génomiques présentant des opportunités et des défis pour les scientifiques. À mesure que les données augmentent, l’analyse de ces informations concernant la structure et la fonction des protéines devient plus complexe et importante et aident à une compréhension plus complète des processus biologiques. Il existe un besoin urgent de développer des méthodes bio-informatiques pour analyser à grande échelle ces données.Jusqu'à récemment, les annotations structurales et fonctionnelles utilisant des outils bio-informatiques se sont concentrées sur des séquences protéiques de référence appelées canoniques.Néanmoins, une partie importante des protéomes sont caractérisés comme «sombres» ou «gris», signifiant des états structuraux inconnus ou partiellement connus respectivement.En outre, les variants protéiques, qui sont dérivés de divers mécanismes biologiques alternatifs, tels que l'épissage alternatif et le décalage de cadre de lecture (frameshift) sont également négligées et leurs états structuraux restent «sombre» ou «gris». La recherche sur ces protéomes alternatifs suscite un intérêt croissant et nécessite des méthodes informatiques à grande échelle.L'objectif principal de ma thèse consistait à développer des pipelines et des protocoles informatiques afin d'effectuer une analyse détaillée à grande échelle des états structuraux des protéines issues de protéomes alternatifs.La structure 3D des protéines dérivées de l'épissage alternatif, appelées isoformes ont été négligées dans les analyses à grande échelle, ce qui laisse la partie principale de leur protéome «gris». Nous avons d'abord sélectionné 58 eucaryotes et développé un pipeline identifiant les protéines canoniques et leurs isoformes permettant ensuite l’analyse des différences structurales entre les paires des protéines canonique–isoforme.Nous avons constaté que les isoformes diffèrent souvent de leurs protéines canoniques par des changements potentiels dans la localisation subcellulaire.Nous avons proposé une classification des modèles AlphaFold en se basant sur les différences structurales entre les protéines canoniques et leurs isoformes, montrant que les isoformes peuvent toujours former des structures similaires aux protéines canoniques malgré leurs différences dans les séquences. Nous avons suggéré que de nombreuses isoformes peuvent également jouer des rôles à la fois essentiels et conservés au cours de l'évolution. Les structures des protéines avec frameshift sont encore «sombres» car ignorés dans les annotations structurales à grande échelle.Le frameshift peut provoquer des changements drastiques dans la séquence d'acides aminés et parfois conduire à l'expression de protéines fonctionnelles. Mais, il existe un manque d'analyse à grande échelle des protéines avec frameshift. Nous avons développé un pipeline pour analyser tous les frameshifts de protéines avec des régions répétées en tandem dans 50 espèces.Nos analyses ont montré que les propriétés physicochimiques des protéines canoniques dans les régions à répétitions plus courtes diffèrent de celles obtenues à partir des séquences avec un frameshift.Ces dernières sont plus hydrophobes, sujettes à l'agrégation et moins intrinsèquement désordonnées.Elles contiennent aussi une forte teneur en arginine qui joue un rôle crucial dans le fonctionnement de diverses protéines VIessentielles.Nos résultats nous ont permis de mieux comprendre l'impact du frameshift sur la fonction et l'évolution des protéines.Nous avons également effectué une analyse à grande échelle de 76 protéomes, représentant les 3 règnes de la vie afin d'obtenir un paysage plus précis de l'agrégation des protéines et d'établir un recensement de leurs occurrences. Une corrélation significative a été trouvée dans l'expression cellulaire, la longueur de la protéine et la localisation cellulaire. Cette étude a contribué à améliorer notre compréhension de l'évolution et de l'agrégation des protéines.