4 avril 2018
Séquençage ciblé de nouvelle génération est une approche temps et coût-efficace qui devient de plus en plus populaire en recherche sur les maladies et diagnostic clinique. Le protocole décrit ici présente le flux de travail complexe requis pour le séquençage et le processus de bio-informatique permet d’identifier des variants génétiques qui contribuent à la maladie.
L’objectif global du séquençage ciblé de nouvelle génération est d’élucider les déterminants génétiques de diverses maladies constitutionnelles en se concentrant sur les régions génomiques d’intérêt particulier. Cette méthode peut nous aider à répondre à des questions clés concernant l’idéologie génétique d’une maladie, en particulier lorsqu’il existe des associations génétiques déjà connues. Cette technique est très efficace.
Il produit des millions de lectures en peu de temps, nous les obtenons à un coût relativement faible, il y a une charge de calcul relativement faible, surtout si on le compare à d’autres approches de séquençage de nouvelle génération. Les implications de la technique s’étendent au diagnostic des maladies neurodégénératives, qui sont phénotypiquement et génétiquement hétérogènes, mais qui ont de nombreux loci génétiques associés connus. Bien que cette méthode soit particulièrement orientée vers les maladies neurodégénératives, elle pourrait également être appliquée à diverses autres maladies constitutionnelles avec des régions génomiques d’intérêt préalablement identifiées.
En général, les personnes qui ne connaissent pas cette méthode auront du mal, car le traitement bio-informatique requis pour l’analyse finale des variants rares peut nécessiter beaucoup de calcul et créer de nombreuses sources d’erreur. Dans cette procédure, des échantillons de sang humain sont prélevés dans des tubes EDTA K2 de trois ou quatre millilitres pour fournir un volume total d’environ 12 millilitres. Centrifugez les échantillons de sang à 750 fois la gravité pendant 20 minutes.
Cela divisera chaque échantillon en une phase supérieure de plasma, une phase moyenne mince de leucocytes et une phase inférieure d’érythrocytes. Pipetez le plasma sur le dessus de l’échantillon de sang à l’aide d’une pipette de transfert jetable. Distribuer en plusieurs aliquotes de 500 microlitres et stocker à moins 80 degrés Celsius pour une analyse biochimique future.
Extrayez l’ADN de l’échantillon de sang à l’aide d’un kit d’extraction de sang selon les instructions du fabricant. L’ADN extrait est ensuite utilisé pour préparer une banque de séquençage pour le séquençage de nouvelle génération. Une fois l’exécution du séquençage terminée, sur un ordinateur, recherchez les fichiers dans l’environnement informatique basé sur le cloud en sélectionnant Exécuter dans le panneau de navigation.
Sélectionnez l’exécution de séquencement appropriée pour accéder à la page de résumé de l’exécution. Sélectionnez Télécharger pour obtenir des données à partir du cloud. Dans la boîte de dialogue qui s’affiche, sélectionnez les fichiers FASTQ comme type de fichier à télécharger et cliquez sur Télécharger.
À partir de la page Résumé de l’exécution de l’environnement informatique basé sur le cloud, accédez à Graphiques pour analyser la qualité de l’exécution du séquençage avec les différents chiffres produits par l’environnement informatique. À partir de la page Graphiques d’exécution, recherchez la figure intitulée Données par cycle, sous Graphique, sélectionnez Intensité, et sous Canal, sélectionnez Tous les canaux pour produire le graphique d’intensité du signal. Dans le panneau Exécuter la navigation, sélectionnez l’onglet Contrôle qualité de l’indexation pour trouver l’histogramme du contrôle de la qualité de l’indexation, qui se trouve sur le côté droit de la page.
À partir de la page Résumé de l’exécution de l’environnement informatique basé sur le cloud, cliquez sur Mesures dans le panneau de navigation Exécuter pour accéder aux mesures de qualité. Sous Densité kelvin par millimètre carré, assurez-vous que la densité de cluster de l’exécution de séquençage est dans la plage recommandée par le kit d’enrichissement utilisé. Dans ce cas, 1 200 à 1 400 kelvins par millimètre carré.
Sous le pourcentage total supérieur ou égal à Q30, assurez-vous que la valeur est supérieure ou égale à 85 % et qu’elle reflète la qualité des lectures de séquençage. Sous Aligné, assurez-vous que la valeur est similaire au pourcentage de contrôle positif qui a été inclus dans l’exécution de séquencement. Par exemple, si un témoin positif de 1 % était utilisé, le pourcentage aligné attendu serait d’environ 1 à 5 % et les variations à quelques décimales sont acceptables.
Commencez ce processus en important les lectures de séquençage FASTQ dans le logiciel de traitement des données. Dans la zone de navigation, cliquez avec le bouton droit de la souris et sélectionnez Nouveau dossier. Nommez le dossier de manière à ce que l’exécution du séquençage qui a été effectuée soit claire.
Dans la barre d’outils en haut, sélectionnez Importer et dans la liste déroulante, choisissez la plate-forme avec laquelle le séquençage a été effectué. Aux fins d’ONDRISeq, c’est Ilumina qui est choisi. Dans la boîte de dialogue, recherchez et sélectionnez les fichiers FASTQ de l’exécution de séquençage en cours de traitement.
Dans les options générales de la boîte de dialogue, cliquez sur la case en regard de Lectures appariées si le séquençage a utilisé des chimies d’extrémité appariées. Dans les informations de lecture appariée de la boîte de dialogue, sélectionnez Paired-end si le fichier FASTQ lu en aval apparaît avant la lecture en sens inverse dans la liste des fichiers. Réglez la distance minimale de lecture appariée sur un et la distance maximale sur 1000.
Dans les options Ilumina de la boîte de dialogue, sélectionnez Supprimer les lectures ayant échoué. Dans la liste déroulante Score de qualité, sélectionnez le pipeline NGS utilisé pour le séquençage. Sélectionnez Suivant en bas de la boîte de dialogue.
Sélectionnez Enregistrer et créer des sous-dossiers par unité de lot. Sélectionnez Suivant en bas de la boîte de dialogue. Choisissez le dossier créé précédemment.
C’est là que les fichiers FASTQ seront importés. Sélectionnez Terminer en bas de la boîte de dialogue et attendez que les fichiers FASTQ soient importés. Cliquez sur l’onglet Processus pour voir l’état de l’importation de fichiers.
Ensuite, concevez un flux de travail dans le logiciel pour effectuer le reséquençage et l’appel de variantes selon les instructions du fabricant. La conception du flux de travail de reséquençage et d’appel de variante est l’aspect le plus difficile de cette procédure. Notre équipe a recherché les meilleures pratiques et a utilisé des essais et des erreurs pour trouver le flux de travail le plus robuste pour répondre à nos besoins.
Pour exécuter les fichiers de lecture de séquençage FASTQ importés via le flux de travail bio-informatique personnalisé, commencez par identifier le flux de travail dans la boîte à outils du logiciel et double-cliquez dessus. Dans la boîte de dialogue qui s’affiche, recherchez les dossiers des fichiers FASTQ qui ont été importés dans la zone de navigation. Mettez en surbrillance tous les dossiers en les sélectionnant dans la zone de navigation, puis cliquez sur la case en regard de Lot.
Utilisez la flèche vers la droite pour déplacer les fichiers vers les éléments sélectionnés. Cliquez sur Suivant en bas de la boîte de dialogue. Dans la boîte de dialogue, vérifiez la vue d’ensemble du lot pour vous assurer que les fichiers FASTQ corrects ont été sélectionnés, puis cliquez sur Suivant.
Passez en revue les étapes du flux de travail dans la boîte de dialogue pour vous assurer que les fichiers et les emplacements d’exportation corrects ont été sélectionnés lors de la conception du flux de travail. Ces étapes incluent le mappage des lectures à la séquence de référence, la suppression des lectures mappées en double, la création de statistiques pour les régions cibles, l’exportation de fichiers BAM, l’exportation de texte délimité par des tabulations, le filtrage basé sur le chevauchement et l’exportation de fichiers VCF. Dans la dernière étape de la boîte de dialogue, Gestion des résultats, sélectionnez l’option Enregistrer dans le dossier d’entrée.
Cliquez sur Terminer en bas de la boîte de dialogue. La dernière étape consiste à effectuer l’annotation de variantes sur le fichier VCF de chaque échantillon, comme décrit dans le protocole texte. Les méthodologies démontrées dans cette vidéo ont été appliquées à 528 échantillons d’ADN de participants provenant d’individus inscrits à l’ONDRI.
Les échantillons ont été analysés sur le panel ONDRISeq en 22 analyses de 24 échantillons par analyse. Dans l’ensemble, les données de séquençage ont été jugées de haute qualité, avec une couverture moyenne de l’échantillon de 78 fois. En moyenne, 95,6 % des lectures ont été appariées à la séquence de référence, et toutes les exécutions ONDRISeq avaient plus de 90 % de lectures mappées.
Parmi les lectures mappées, 92,0 % et un score Phred supérieur ou égal à Q30. Pour démontrer l’utilité de ce flux de travail NGS ciblé, l’exemple d’un homme de 68 ans, atteint de la maladie de Parkinson, est présenté, montrant une réduction de la surproduction de N. Les variances annotées sont organisées pour identifier celles qui sont les plus susceptibles d’avoir une signification clinique, comme indiqué par les cases rouges.
Lors de l’exécution de cette procédure, il est important de se rappeler de bien adapter les étapes à la plateforme de séquençage, au kit d’enrichissement utilisé et aux besoins de la recherche. Après son développement, cette technique a ouvert la voie aux chercheurs dans le domaine de la génétique pour obtenir des données de haute qualité, spécifiques à une région, tout en restant moins coûteuse que ses homologues de l’exome entier et du génome entier.
Le séquençage ciblé de nouvelle génération est une méthode rentable pour identifier les variants génétiques associés aux maladies, en particulier les troubles neurodégénératifs. Ce protocole décrit le flux de travail pour le séquençage ainsi que les processus bioinformatiques associés.
Le séquençage ciblé de nouvelle génération (NGS) associé à un pipeline bioinformatique robuste permet une interrogation précise des déterminants génétiques connus dans les maladies constitutionnelles et neurodégénératives. Cette approche assure une identification fiable des variants, soutenant la découverte précoce et la recherche translationnelle tout en optimisant l'allocation des ressources. Son efficacité et sa scalabilité en font un atout stratégique pour les organisations de R&D axées sur des portefeuilles visant à obtenir des données génétiques exploitables.
Ce flux de travail ciblé de séquençage à haut débit (NGS) et de bioinformatique s'intègre de la découverte précoce à la recherche translationnelle, en reliant l'identification des variants à la validation fonctionnelle.