April 8th, 2017
Galaxy et David sont apparus comme des outils populaires qui permettent aux enquêteurs sans formation de bio-informatique pour analyser et interpréter les données d'ARN-Seq. Nous décrivons un protocole pour C. elegans aux chercheurs d'effectuer des expériences ARN-Seq, l' accès et de traiter l'ensemble de données en utilisant Galaxy et d' obtenir des informations biologiques significatives à partir des listes de gènes en utilisant DAVID.
L’objectif global de ce protocole est d’aider les chercheurs de C. elegans sans expertise en bioinformatique à mener une expérience de séquençage de l’ARN et à analyser les données à l’aide de la plateforme en libre accès Galaxy. Cette méthode peut aider à analyser des données complexes de séquençage élevé à put pour fournir des informations sur les signatures transcriptomiques derrière les phénotypes chez C. elegans. Le principal avantage de cette technique est qu’elle permet aux scientifiques sans formation préalable en bioinformatique d’analyser les données de séquençage brutes et de produire une liste de gènes exprimés de manière différentielle, ainsi que leurs termes d’ontologie génétique associés.
Bien que cette méthode soit spécifiquement axée sur les nuances des données de séquençage de C. elegans, elle peut également être appliquée à d’autres organismes et contextes biologiques où les changements clés de transcription des génomes doivent être examinés. Cette vidéo traite de l’utilisation Web du pipeline Galaxy. Si possible, exécutez le flux de travail localement.
Téléchargez et installez Galaxy en suivant les instructions sur la page wiki. Après avoir utilisé le tutoriel de démarrage fourni sur la page d’accueil de Galaxy, suivez cette vidéo. Il est essentiel que l’utilisateur se familiarise et s’oriente avec l’interface utilisateur Galaxy et les outils utilisés dans le flux de travail.
Pour commencer, cliquez sur analyser les données dans le panneau d’en-tête pour accéder à la vue d’accueil de l’analyse. La barre de progression en haut à droite surveille l’espace disque utilisé. Ensuite, accédez au menu des outils sur le panneau de gauche et cliquez sur Analyse de l’ARN NGS.
Cela offre la possibilité d’utiliser tous les outils nécessaires à l’analyse des données de séquence d’ARN. Maintenant, commencez un nouvel historique d’analyse. Allez dans le panneau d’historique à droite.
Cliquez sur l’icône d’engrenage et choisissez l’option Créer dans le menu contextuel. Ensuite, indiquez un nom sous l’historique pour identifier l’analyse. Pour continuer, allez dans le menu des outils, et sous Obtenir des données, cliquez sur la fonction de téléchargement de fichier pour télécharger des fichiers bruts de file d’attente rapide.
Une fois la tâche ouverte dans l’interface d’analyse, cliquez sur choisir le fichier local ou choisissez le fichier FTP pour accéder et sélectionner les données de séquence appropriées. Par défaut, Galaxy détectera automatiquement le type de fichier. Sélectionnez ensuite l’organisme dans le menu déroulant qui dans ce cas est C.elegans.
Ensuite, cliquez sur démarrer pour lancer le téléchargement des données. Une fois le fichier téléchargé, l’action est enregistrée dans le panneau d’historique à partir duquel les données peuvent être sélectionnées et accessibles. Maintenant, convertissez les fichiers du format de file d’attente rapide un par un au format de file d’attente rapide en accédant au menu NGS QC et de manipulation, en sélectionnant Toiletteur de file d’attente rapide, en choisissant le fichier sous Fichier à nettoyer.
Sélectionnez le type de scores d’égalité rapide approprié et exécutez l’outil à l’aide des paramètres par défaut. Le fichier de données peut maintenant être analysé. Portez une attention particulière aux formats de fichiers et aux paramètres de test utilisés dans l’ensemble du protocole.
Ces connaissances sont précieuses pour résoudre les échecs de tests et d’autres problèmes. Des tests de contrôle de la qualité peuvent être utilisés avant de continuer. Les détails sur leur exécution sont fournis dans le protocole texte.
Une fois qu’un fichier est prêt à être analysé, cartographiez les données de séquençage en ouvrant d’abord la section d’analyse de l’ARN NGS, puis en cliquant sur l’outil chapeau supérieur. Dans le menu déroulant, remplissez la réponse à la question : s’agit-il de données finales uniques ou appariées ? Ensuite, choisissez le fichier de file d’attente rapide approprié.
Sélectionnez Utiliser un génome intégré dans le menu déroulant suivant et choisissez les données génomiques de référence de C.elegans. Sélectionnez la valeur par défaut pour toutes les autres options de paramètre, puis cliquez sur Exécuter. Pour estimer l’abondance relative des transcrits dans l’ensemble de données, sélectionnez l’outil Cuff Links dans la section Analyse de l’ARN NGS et, dans le premier menu déroulant, choisissez le fichier au format bam des hits acceptés obtenu à partir de l’analyse chapeau haut-de-forme.
Dans le deuxième menu déroulant, définissez l’annotation de référence sur le fichier GTF contenant les données génomiques actuelles. Lorsque l’option Effectuer la correction du biais s’affiche, sélectionnez Oui et exécutez la tâche en utilisant les paramètres par défaut. Ensuite, à partir du menu d’analyse de l’ARN NGS, ouvrez l’outil de fusion du brassard pour fusionner les transcrits assemblés produits pour tous les échantillons de séquences d’ARN.
La première case de l’outil charge tous les fichiers GTF produits à l’aide de boutons de manchette à l’étape précédente. Maintenant, sélectionnez le fichier de transcriptions assemblé pour chacune des souches ou conditions testées, y compris les répétitions biologiques de la même condition de souche. Sélectionnez Oui pour l’annotation de référence utilisateur, puis choisissez le fichier de données du génome de référence.
Ensuite, sélectionnez oui pour l’option Utiliser les données de séquence. Cela détectera et choisira automatiquement le génome de référence approprié. Laissez tous les autres paramètres dans leur paramètre par défaut et cliquez sur Exécuter.
Un seul fichier GTF sera produit. Pour comparer plusieurs souches ou conditions, retournez à la section d’analyse de l’ARN NGS et sélectionnez l’outil de div du brassard. Ensuite, dans le menu des transcriptions de l’outil div de brassard, sélectionnez le fichier de sortie fusionné à partir de la fusion de brassard.
Entrez ensuite des libellés pour les deux conditions. Pour chaque condition, allez dans réplicats et sélectionnez les fichiers de sortie des hits acceptés individuels de top hat qui correspondent aux différentes réplications biologiques de cette condition. Pour sélectionner plusieurs fichiers simultanément, maintenez la touche commande ou contrôle enfoncée.
Après avoir sélectionné les fichiers, utilisez les paramètres par défaut et cliquez sur Exécuter pour exécuter la tâche. Téléchargez les données exprimées de manière différentielle en cliquant sur l’icône d’enregistrement dans la boîte de test différentiel de gène générée dans le panneau d’historique. Pour commencer, accédez à David depuis le site Web.
Dans l’en-tête de la page Web, choisissez Démarrer l’analyse. Copiez la liste des gènes obtenus de Galaxy dans la case A et dans cet exemple, sélectionnez l’identificateur de gène comme ID de gène de base de ver. Ensuite, sous le type de liste à la troisième question, choisissez liste de gènes et cliquez sur l’icône de liste de soumission. Maintenant, la page d’accueil de l’assistant d’analyse s’ouvrira à partir de laquelle les tâches David peuvent être sélectionnées.
Ce segment vidéo décrit quelques-unes de ces options. Tout d’abord, choisissez le clustering d’annotations fonctionnelles pour accéder à la page de résumé. Laissez les catégories d’annotations sur leurs paramètres par défaut et cliquez sur le clustering d’annotations fonctionnelles.
Cette option génère des grappes de termes d’annotation similaires classés en fonction de leur score d’enrichissement. Maintenant, revenez à l’assistant d’analyse et sélectionnez l’option de tableau d’annotation fonctionnelle pour identifier les termes biologiques significativement surreprésentés associés à la liste de gènes. Une fonctionnalité précieuse de David est la possibilité de créer une table d’annotation fonctionnelle.
Celle-ci répertorie toutes les annotations associées aux gènes sans montrer de calculs statistiques. Cela peut être utile pour l’analyse gène par gène et pour trouver des gènes d’intérêt spécifiques. Un autre outil utile de David à examiner est la classification fonctionnelle des gènes.
Cette option sépare les gènes en une liste de groupes fonctionnellement apparentés classés par leur score d’enrichissement. Le protocole décrit a été utilisé pour identifier les gènes dont l’expression est modulée par tcer-1 après la perte de la lignée germinale. Le transcriptome des mutants glp-1 de la liste des lignées germinales à longue durée de vie a été comparé à celui des mutants doubles glp-1 tcer-1 que notre lignée germinale répertorie mais ne présentent pas d’extension de la durée de vie.
Un contrôle de la qualité des séquences n’a révélé aucune lecture de mauvaise qualité, un contenu GC de 48 à 49 % et une longueur de lecture de séquence constante de 51 paires de bases. La couverture génomique des échantillons a été estimée entre sept et 11 fois. Galaxy a permis de combiner les données NGS des deux réplicats de chaque souche et d’effectuer une analyse différentielle pour générer des listes de gènes mettant en évidence le profil d’expression à l’échelle du génome.
Dans l’ensemble, 835 gènes ont été exprimés différemment entre les deux souches en utilisant une valeur P seuil de 0,05. L’analyse fonctionnelle des gènes régulés à la hausse a révélé quatre groupes d’annotations avec des scores d’enrichissement élevés. Les plus élevés comprennent le cytochrome P450 et les gènes de réponse xénobiotique, suivis des gènes impliqués dans les modifications lipidiques.
Le regroupement d’annotations fonctionnelles des cibles régulées à la baisse a également permis d’identifier une variété de groupes d’annotations. Il s’agissait notamment d’amas enrichis pour la fonction cytosquelettique, la régulation positive de la croissance, de la reproduction et du vieillissement. Le pipeline Galaxy a ouvert la voie aux chercheurs d’un large éventail de disciplines biologiques, pour analyser rapidement et efficacement les changements d’expression génique à grande échelle.
Après avoir regardé cette vidéo, vous devriez être en mesure de mener une expérience de recherche d’ARN et d’analyser les données brutes de séquençage à l’aide du pipeline Galaxy. Vous devriez également être en mesure d’extraire des informations biologiquement pertinentes des données Galaxy à l’aide de la plate-forme David.
View the full transcript and gain access to thousands of scientific videos
Ce protocole aide les chercheurs sur C.elegans à mener des expériences de séquençage d'ARN et à analyser les données à l'aide de la plateforme Galaxy. Il permet à ceux qui n'ont pas de formation en bioinformatique d'interpréter efficacement des données de séquençage complexes.
Accessible transcriptomic analysis platforms like Galaxy enable discovery teams to interrogate gene expression changes without requiring deep bioinformatics expertise, accelerating early-stage target validation and mechanistic de-risking. By streamlining RNA-Seq data processing and functional annotation, this workflow supports rapid hypothesis testing and portfolio triage in model systems such as C. elegans. The approach enhances reproducibility and scalability for both novice and experienced R&D teams handling small-scale transcriptomic studies.
This workflow positions RNA-Seq analysis from raw data through differential expression and functional annotation within the early discovery to preclinical continuum, supporting both target validation and mechanistic studies.