28 juin 2018
Séquençage en profondeur des populations de levures sélectionnées pour les interactions 2-hybride de levure positive potentiellement donne une mine de renseignements sur les protéines qui interagissent de partenaire. Nous décrivons ici l’exploitation d’outils bioinformatiques précis et à jour de logiciels sur mesure pour analyser les données de séquençage de ces écrans.
Cette méthode peut aider à répondre à des questions clés sur la nature des interactomes protéiques. Le principal avantage de cette technique est que tout le traitement bioinformatique est opéré par une interface facile à utiliser. Ce logiciel utilise une interface utilisateur graphique conviviale que les biologistes moléculaires, les biologistes cellulaires et les biochimistes qui n’ont pas beaucoup d’expertise en bioinformatique peuvent utiliser pour effectuer facilement leur analyse.
En général, les personnes qui débutent dans le traitement des données de séquence ont des difficultés parce que les programmes informatiques sont déroutants et lourds. Nous avons pensé que rendre l’informatique facile rendrait l’ensemble de la technique beaucoup plus accessible et utile. La première étape de cette procédure consiste à télécharger et à installer le logiciel MAPster comme décrit dans le protocole texte.
Ensuite, entrez les fichiers et les paramètres requis via l’onglet Principal. Sélectionnez le bouton Pairwise approprié pour entrer les fichiers pour l’analyse DEEPN. Désactivez l’option Par paires pour exécuter au format lecture unique.
Chargez les fichiers dans MAPster par glisser-déposer dans la fenêtre appropriée. Parmi les génomes indexés répertoriés dans la zone Génome, sélectionnez une source de génome d’ADN de référence qui correspond à la source des inserts de la bibliothèque de proies Y2H. Étant donné que HISAT2 prend en charge le multithreading, sous la case Threads, indiquez le nombre de processus informatiques à consacrer au programme de mappage.
Il est recommandé de spécifier un nom de fichier de sortie, un nom court mais descriptif sans espace ni caractères spéciaux car ce nom de fichier sera utilisé tout au long du processus DEEPN. À l’aide du bouton Ouvrir le répertoire de sortie, spécifiez un dossier pour afficher les fichiers mappés. Une fois que les fichiers et paramètres appropriés ont été sélectionnés, utilisez le bouton Ajouter à la file d’attente pour ajouter la tâche de mappage à la file d’attente des tâches.
Une fois que toutes les tâches sont entrées dans la file d’attente des tâches, cliquez sur le bouton Exécuter la file d’attente. Commencez cette analyse en ouvrant le logiciel DEEPN. Dans la fenêtre principale, sélectionnez les informations de la bibliothèque de proies correspondante dans la boîte de sélection supérieure.
Sélectionnez un dossier dans lequel les fichiers traités peuvent être placés en cliquant sur le bouton Dossier de travail et en accédant au répertoire des dossiers. Une fois qu’un dossier de travail est sélectionné, DEEPN crée trois sous-dossiers avec les noms indiqués. Pour une analyse réussie, assurez-vous de placer les fichiers SAM corrects dans les dossiers appropriés et de savoir quels fichiers ont des lectures mappées et non mappées.
Si vous utilisez des fichiers sam contenant à la fois des lectures mappées et non mappées, comme ceux produits avec les paramètres par défaut du programme MAPster, placez-les dans le dossier sam_files. Lancez le traitement en cliquant sur le bouton Nombre de gènes plus création de jonctions. Le temps de traitement dépend de la taille et du nombre de fichiers de données de séquence et de la vitesse de traitement de l’ordinateur utilisé.
Une fois que DEEPN aura traité les données, un ensemble complet de dossiers sera créé. L’étape suivante consiste à effectuer une analyse dans Stat Maker. Ouvrez Stat_Maker, puis cliquez sur le bouton Vérifier l’installation.
Si vous exécutez pour la première fois, Stat_Maker installerez automatiquement R, JAGS et Bioconductor en extrayant ces ressources d’Internet. Une fois que R, JAGS et Bioconductor sont détectés, Stat_Maker deviennent actifs et permettent à l’utilisateur de procéder à d’autres entrées. Cliquez sur le bouton Choisir un dossier pour accéder au dossier de travail traité par DEEPN.
Stat_Maker trouvera et listera automatiquement les fichiers pour l’analyse statistique dans la fenêtre. Faites glisser et déposez les fichiers appropriés de la fenêtre de liste de fichiers ci-dessus dans les fenêtres de fichiers ci-dessous pour chaque ensemble de données de vecteurs et d’appâts et pour chaque condition de croissance, non sélectionnée et sélectionnée. Il est important de noter que Stat_Maker nécessite des ensembles de données dupliqués pour le vecteur vide seul, deux échantillons de populations non sélectionnées et deux échantillons de populations sélectionnées.
Cela donne une estimation de la variabilité au sein de l’expérience. Cliquez sur le bouton Exécuter. Selon la vitesse de l’ordinateur, le calcul prendra entre cinq et 15 minutes.
Les résultats de la sortie Stat_Maker sont placés dans un nouveau sous-dossier du dossier de travail principal intitulé Stat_Maker Résultats. Examinez les résultats. Pour examiner les données de chaque candidat potentiel, ouvrez le logiciel DEEPN, sélectionnez les informations correspondantes sur la bibliothèque de proies, puis sélectionnez le bon dossier de travail à l’aide du dossier de travail.
Cliquez sur le bouton Blast Query pour charger une nouvelle fenêtre. Dans la zone de texte supérieure, tapez le nom du gène ou le numéro GenBank NM pour sélectionner le gène candidat qui vous intéresse. Le nom du gène correspond au nom indiqué dans le fichier de sortie de Stat Maker.
Tapez Enter ou Return, qui lance la récupération du gène d’intérêt. Sélectionnez les jeux de données qui seront utilisés pour l’analyse à l’aide des menus Sélectionner un jeu de données. En règle générale, il s’agit des échantillons de vecteur seulement et d’appâts cultivés dans des conditions non sélectives et de l’échantillon d’appât cultivé dans des conditions de sélection.
Au départ, le chargement des données et du nom du gène peut prendre un certain temps avec le programme Blast Query, mais une fois l’ensemble de données chargé, cela ira beaucoup plus vite. Blast_Query afficherons les points de fusion le long de la séquence d’intérêt et l’abondance de chaque point de fusion. Il peut être affiché à la fois sous forme de tableau à l’aide de l’onglet Résultats ou de format graphique à l’aide de l’onglet Tracé.
Pour exporter ces résultats dans un fichier csv, cliquez sur le bouton Enregistrer csv en haut à droite. Dans la fenêtre DEEPN, cliquez sur le bouton Profondeur de lecture sous Analyser les données. Une fois la fenêtre Profondeur de lecture ouverte, tapez le numéro NM dans la zone de texte supérieure.
Utilisez le menu déroulant pour sélectionner l’ensemble de données pertinent qui contient le gène enrichi d’intérêt. Utilisez le tableau de gauche et l’affichage graphique de droite pour déterminer combien de lectures ont été trouvées dans les données qui correspondent au gène d’intérêt. Le programme Stat Maker produit un fichier consultable par Excel qui résume les informations pertinentes nécessaires pour identifier les protéines candidates en interaction.
L’analyse correspondante visant à déterminer si les plasmides correspondant à la proie candidate contiennent le cadre de lecture ouvert approprié est également présentée. La requête Blast évalue chaque gène et ordonne les différentes positions en fonction de leur abondance dans l’ensemble de données quantifiée par le ppm du nombre total de jonctions trouvées dans la base de données. Dans cet exemple, la position la plus abondante qui est In ORF et In Frame est la position 867, indiquant que le nucléotide 867 de la séquence de référence GenBank NCBI NM_019648 est le début du fragment de proie.
Ce graphique montre une séquence hypothétique et comment concevoir l’oligo à cinq premiers pour capturer le cadre et le point de fusion corrects entre le domaine d’activation de Gal4 et la séquence d’intérêt de la proie. Cette fenêtre de profondeur de lecture indique le nombre de séquences trouvées dans les données qui correspondent aux positions nucléotidiques de la séquence d’intérêt. Une fois maîtrisés, le traitement des données peut se faire en 10 à 20 heures, la plupart du temps sans surveillance.
Les écrans DEEPN et l’analyse informatique correspondante ouvriront la voie aux chercheurs d’un large éventail de domaines pour explorer les réseaux d’interaction avec la protéine qui les intéresse. Le programme MAPster est conçu pour faciliter la cartographie des fichiers de séquences des expériences DEEPN. Il fournit également une méthode conviviale pour cartographier les fichiers de séquence afin de référencer l’ADN pour une variété d’applications, telles que RNA-Seq ou ChIP-Seq.
Bien que le logiciel DEEPN soit spécialement conçu pour traiter des données de levure bi-hybride en lot, il peut également être utilisé pour traiter des données de séquençage d’ARN. Le programme Stat Maker prédit non seulement quels gènes donnent une interaction authentique entre deux hybrides de levure, mais il rassemble également un certain nombre d’autres paramètres, tels que la lecture des informations de cadre, ce qui permet aux chercheurs de filtrer rapidement leurs résultats candidats. Une fois que les protéines candidates en interaction sont identifiées, il est important de valider les interactions à l’aide d’essais standard à deux hybrides de levure, d’essais biochimiques ou de méthodes connexes.
Consultez la transcription complète et accédez à des milliers de vidéos scientifiques
Cet article traite d'une méthode d'analyse des interactomes protéiques par séquençage profond de populations de levures sélectionnées pour des interactions positives dans un système de double hybride chez la levure. Il met l'accent sur l'utilisation d'outils bioinformatiques conviviaux qui simplifient le processus d'analyse pour les chercheurs ne possédant pas une expertise approfondie en bioinformatique.
Cette méthode permet l'identification à haut débit d'interactions entre protéines par des criblages double hybride chez la levure couplés à un séquençage profond, fournissant des données quantitatives d'enrichissement qui soutiennent la validation des cibles et la réduction des risques mécanistiques en phase de découverte précoce. Le flux de travail bioinformatique intégré réduit la dépendance vis-à-vis d'expertises spécialisées, accélérant ainsi le passage du « hit » au « lead » en produisant des cartes d'interactions reproductibles et résolues au niveau du cadre de lecture. Cette approche renforce la confiance prédictive dans le choix des cibles et permet la mise en œuvre de campagnes de criblage évolutives dans divers domaines thérapeutiques.
La méthode s'inscrit dans le continuum de la découverte précoce, en appuyant l'identification de cibles par le profilage des interactions et en alimentant l'identification de composés promoteurs via des réseaux d'interactions validés.